AI 问小创

你好,我是问小创 AI 助手

告诉我你的需求,我帮你从站内挑最合适的 AI 工具。

推荐结果基于站内收录,仅供参考,请以实际工具信息为准。
猜你想问
推荐一些AI写作工具 有什么AI绘画工具? 推荐视频剪辑AI工具
AI
问小创: 告诉我你的需求,我帮你从站内挑最合适的 AI 工具。

Redis推出LangCache托管语义缓存 最高降LLM成本90%提速15倍

全球内存数据库厂商Redis近日正式推出托管式语义缓存产品LangCache,针对大语言模型(LLM)API调用场景可直接返回已存储的历史响应结果,实测数据显示其最高可削减90%的LLM API调用成本,缓存命中场景下的响应速度最高提升15倍,为当前生成式AI落地的高成本痛点提供了轻量化的成熟解决方案。

随着生成式AI的规模化落地,越来越多的企业选择调用商用LLM API搭建自身的AI应用,但按token计费的模式下,大量重复、相似的用户请求正在吞噬企业的IT预算。某零售品牌内部数据显示,其智能客服场景下,近60%的用户提问都属于高频共性问题,重复调用LLM API产生的成本占总支出的45%以上,同时长链路的API调用也拖慢了用户端的响应速度。

此前行业内也有不少企业尝试自研缓存方案降低LLM调用成本,但绝大多数方案都采用关键词精确匹配逻辑,用户提问的表述稍有变化就无法命中缓存,实用性极低。而如果要实现语义级匹配,企业需要额外搭建向量数据库、维护缓存集群、持续优化匹配算法,对于技术储备不足的中小团队来说门槛过高,不少团队宁愿承担额外的API成本也不愿投入人力做缓存优化。

作为全球高性能缓存领域的龙头企业,Redis本次推出的LangCache是开箱即用的托管服务,用户只需要简单接入API就能直接使用,不需要额外维护基础设施。其核心能力是语义相似度匹配,可以识别不同表述但含义相同的用户请求,自动匹配缓存中已有的LLM响应结果,不需要重新向大模型发送请求。

官方测试数据显示,在高频问答场景下,LangCache最高可降低90%的LLM API调用成本,缓存命中时的响应速度较直接调用API提升15倍,目前已经适配OpenAI、Anthropic、通义千问等主流商用LLM接口,可覆盖智能客服、AI问答机器人、企业内部知识库查询等绝大多数高频LLM应用场景。

2026年以来,大模型本身的性能迭代进入平稳期,产业端的关注重点开始从“大模型好不好用”转向“用大模型能不能赚钱”,围绕LLM落地的配套工具赛道迎来爆发,除了语义缓存之外,LLM网关、成本管控、prompt工程优化、输出内容审核等细分工具的市场需求持续上涨。

有行业分析师指出,LangCache这类产品的推出,本质是降低了大模型的使用门槛,让中小团队也能以较低的成本落地生成式AI应用,未来2-3年,LLM配套基建的市场规模将突破百亿元,成为AI产业中增速最快的细分赛道之一。

本文基于公开信息分析整理,仅供参考。更多AI工具动态与行业解读,请持续关注本站更新。