AI 问小创

你好,我是问小创 AI 助手

告诉我你的需求,我帮你从站内挑最合适的 AI 工具。

推荐结果基于站内收录,仅供参考,请以实际工具信息为准。
猜你想问
推荐一些AI写作工具 有什么AI绘画工具? 推荐视频剪辑AI工具
AI
问小创: 告诉我你的需求,我帮你从站内挑最合适的 AI 工具。

Together AI开源OSCAR系统 2位量化技术大幅降低长上下文大模型部署成本

AI基础设施服务商Together AI于近期开源全新注意力感知2位KV缓存量化系统OSCAR,该技术可将大语言模型KV缓存的内存占用降低8倍,同时推理精度接近BF16浮点精度水平,大幅降低长上下文大模型的服务部署成本,为长文本生成、多轮对话、长文档解析等大模型落地场景提供了更具性价比的基础设施解决方案。

随着大语言模型技术迭代,当前头部通用大模型的上下文窗口已经普遍突破10万token,部分专用大模型甚至支持200万以上token的超长上下文输入,可直接覆盖整本书籍解析、全量代码库调试、超长多轮对话等此前无法实现的场景。但随之而来的推理成本高企问题,已经成为长上下文能力落地的核心阻碍,其中KV缓存作为存储已计算token注意力信息的核心模块,内存开销占比最高可达推理总内存的70%,上下文长度每翻一倍,KV缓存的内存占用也会同步翻倍。

OSCAR的核心创新在于突破了传统低比特KV缓存量化的精度损失瓶颈。不同于此前通用的静态量化策略,OSCAR采用注意力感知动态量化机制,会根据每个token的注意力权重分布调整量化分配策略,对影响最终生成效果的关键token保留更高的量化精度优先级,最终在将KV缓存压缩到2位精度、实现8倍内存缩减的同时,整体推理精度几乎和BF16浮点精度的推理结果没有显著差异。

同时OSCAR的适配门槛极低,现有开源大模型无需修改核心架构,仅需接入对应的量化工具链即可快速部署,不会额外增加太多开发成本。

作为聚焦大模型分布式训练与推理基础设施的服务商,Together AI此前已经开源了多个大模型推理优化工具,此次OSCAR的开源再次降低了长上下文大模型的落地门槛。

此前百万token级别的长上下文大模型服务,单条推理的内存成本是短上下文服务的数倍,仅头部科技公司有能力大规模落地,OSCAR普及后,中小开发者和垂直行业厂商也可以低成本部署长上下文大模型服务,有望推动法律、医疗、工业软件等领域的长文本处理场景落地速度明显提升。

本文基于公开信息分析整理,仅供参考。更多AI工具动态与行业解读,请持续关注本站更新。