2026年7月,AI模型聚合服务平台OpenRouter正式推出提示词缓存(Prompt Caching)与粘性路由(Sticky Routing)技术组合,通过复用多轮对话中重复的系统指令、工具定义等内容,大幅降低智能体多轮交互的token消耗成本,目前该技术适配Anthropic Claude Sonnet 4.6等主流模型,缓存读取成本最低仅为正常输入的0.1倍,可将多轮Agent整体调用成本最高降至原有水平的1/1.75。

不少开发过长周期Agent应用的团队都有过类似的体验:一个连续运行10轮的客服智能体,仅系统提示词、工具定义等固定内容的token消耗,就占到了整体输入成本的70%以上——这些内容每一轮交互都要重复上传、重复计费,早已是行业公认的成本黑洞。
在智能体的多轮对话逻辑中,系统提示词、工具调用规则、核心策略指令等内容往往贯穿整个会话周期,几乎不会发生变化。但按照传统的大模型计费规则,每一次交互的全量输入内容都会被纳入计费范围,即使唯一变化的只有最新的用户查询或工具返回结果,固定内容依然会按轮次重复收费。
以6轮会话为例,固定内容的计费次数可达6次,轮次越多,无效成本占比越高,这也直接导致了不少需要长期运行的Agent应用难以规模化落地。
此次OpenRouter推出的两项技术,正是瞄准了这一行业痛点设计。
其中提示词缓存(Prompt Caching)的核心逻辑是,服务端将会话中的固定内容存入热缓存,后续轮次调用时仅读取缓存内容,无需重复计算,这部分缓存读取的成本仅为正常输入token价格的0.1到0.5倍,具体比例随接入的模型服务商不同有所差异。
而粘性路由(Sticky Routing)则是缓存机制生效的基础:该技术会将同一会话的所有请求都固定路由到持有对应热缓存的服务节点,避免因跨节点调度导致缓存失效,确保降本效果能够覆盖整个会话周期。
目前在Anthropic Claude Sonnet 4.6模型上,缓存读取价格为每百万token 0.3美元,仅为该模型正常输入价格(每百万token3美元)的0.1倍,按这一比例计算,6轮Agent会话的整体调用成本最高可降至原有水平的1/1.75,降幅超过40%。
在该技术落地之前,长会话Agent的高成本一直是中小团队落地的核心障碍,尤其是To B场景的自动化运维、企业级智能客服、连续代码开发助手等应用,单会话轮次普遍超过10轮,固定内容的计费占比甚至能达到80%。
此次降本技术的普及,将直接拉低Agent应用的运行门槛,预计未来12个月内,面向企业级场景的长周期智能体应用数量将出现明显增长,大模型的落地场景也将从单次查询为主的工具类应用,进一步延伸到连续交互的智能决策类场景。
AI创作导航,创作与探索并重。聚合全球优质AI工具,覆盖短视频、图文、写作、设计等创作场景,以及办公、学习、编程、生活等全品类需求。从创作出发,探索AI的无限可能,为创作者、学生、教师、职场人提供一站式AI工具导航与场景化应用指南。