AI 问小创

你好,我是问小创 AI 助手

告诉我你的需求,我帮你从站内挑最合适的 AI 工具。

推荐结果基于站内收录,仅供参考,请以实际工具信息为准。
猜你想问
推荐一些AI写作工具 有什么AI绘画工具? 推荐视频剪辑AI工具
AI
问小创: 告诉我你的需求,我帮你从站内挑最合适的 AI 工具。

小红书联合北大上交推出HYPIC 大模型首token延迟降3.25倍

大模型应用向检索增强问答、长程Agent等场景延伸过程中,超长上下文预填充算力成本高、首token延迟波动大的痛点突出。近日小红书联合北京大学、上海交通大学共同推出面向混合注意力大模型的位置无关缓存技术HYPIC,可将首token延迟降低3.25倍,大幅降低大模型长上下文服务的运行成本,为高并发长文本场景落地提供新的技术路径。

配图

当前大模型服务的核心场景已经从早期的短文本单轮对话,转向检索增强生成(RAG)、多文档摘要、长程智能体等复杂任务,这类任务的用户请求prompt通常由检索文档、技能说明、历史交互记录等数十个语义独立的片段拼接而成,长度普遍达到数万甚至数十万token量级。

这类超长上下文场景下,预填充(prefill)阶段的算力消耗已经占据单请求总开销的70%以上,成为拉高服务商运营成本的核心因素。更影响用户体验的是,一旦出现缓存未命中,请求的首token延迟(TTFT)往往会飙升至数十秒,直接导致交互卡顿甚至超时失败,是当前长文本大模型落地的主要阻碍之一。

此前行业也尝试过多种优化方案,但大多受限于传统缓存的严格前缀匹配规则,无法适配RAG、长程Agent等场景下prompt灵活拼接的特性,复用率极低,难以从根本上解决成本和延迟问题。

针对这一行业共性难题,小红书联合北京大学、上海交通大学的研究团队提出了全新的位置无关缓存方案HYPIC,专门适配混合注意力大模型的架构特性。

和传统缓存技术严格匹配前缀的规则不同,HYPIC放开了前缀绑定约束,每个语义独立的文本片段仅需缓存一次,即可在任意请求中被复用拼接,完美适配RAG、长程Agent等场景的prompt组装逻辑。测试数据显示,该技术可将大模型首token延迟直接降低3.25倍,同时大幅减少重复预填充的算力浪费,长上下文场景下的单请求算力成本最高可下降60%。

随着企业级知识库、长文档处理、智能客服等To B场景的需求爆发,大模型服务商普遍面临降本和提效的双重压力,HYPIC这类位置无关缓存技术的落地,将直接降低长文本大模型服务的准入门槛。

据了解,目前HYPIC已经在小红书内部的智能搜索、多轮交互助手等场景完成灰度测试,后续有望向行业开放相关技术方案,推动长上下文大模型在更多产业场景的规模化落地。

本文基于公开信息分析整理,仅供参考。更多AI工具动态与行业解读,请持续关注本站更新。