问小创
告诉我你的需求,我帮你从站内挑最合适的 AI 工具。
国内大模型厂商MiniMax近期推出全新稀疏注意力技术MiniMax Sparse Attention(MSA)。该技术为GQA原生的双分支块稀疏注意力架构,基于109B参数MoE大模型、3T Token训练预算打磨而成,可在1M长上下文场景下将单token注意力计算量降低28.4倍,为大模型长上下文商用落地扫清了核心算力障碍。

近两年大模型上下文窗口的扩张速度远超行业预期,从最早的4K、8K到现在普遍标配的128K,头部厂商已经把参数推到1M甚至4M级别,但随之而来的算力成本暴涨问题,始终是长上下文能力落地的最大堵点。
普通大模型的注意力计算复杂度与上下文长度的平方成正比,当上下文窗口从128K提升到1M时,单轮推理的算力需求会上涨60倍以上,即便厂商堆足GPU集群,最终落地到用户端的成本也高到难以接受——此前部分厂商推出的1M上下文服务,单轮复杂查询的收费超过3元,仅能覆盖少数高付费的B端客户,无法大规模普及。
本次MiniMax推出的MSA技术,是全球首个在千亿级MoE模型上完成全流程训练验证的块稀疏注意力方案。和实验室阶段的小模型验证不同,MSA的训练基于109B参数的MoE大模型完成,总训练token量达到3T,技术成熟度直接满足商用要求。
作为GQA原生的双分支块稀疏注意力架构,MSA没有走“牺牲精度换效率”的老路:其两个分支分别负责捕捉全局关键信息和局部块关联信息,既实现了算力压缩,又将长上下文任务的精度损失控制在1%以内,完全符合法律、金融、研发等专业场景的要求。核心测试数据显示,在1M长上下文场景下,MSA的单token注意力计算量比传统密集注意力低28.4倍,推理延迟同时下降72%。
算力成本的直线下降,直接打开了长上下文大模型的落地边界。此前受限于成本无法普及的全量文档审校、完整代码库排查、多小时音视频内容分析等场景,都有望将单查询成本降到0.1元以内,普通个人用户也能无门槛使用长上下文功能。
据了解,MiniMax后续会将MSA技术全面落地到旗下海螺AI等C端产品和企业级大模型服务中,后续还会向行业开放相关技术接口,推动全行业长上下文能力的普及。
此前大模型行业的竞争多集中在参数规模、上下文长度等显性指标的比拼,随着基础性能追平,接下来的核心竞争点会转向底层架构的效率优化。类似MSA这类从注意力层切入的底层创新,有望在不增加硬件投入的前提下,将大模型的推理性价比提升一个数量级,推动AI应用从“可用”向“普惠”快速演进。
AI创作导航,创作与探索并重。聚合全球优质AI工具,覆盖短视频、图文、写作、设计等创作场景,以及办公、学习、编程、生活等全品类需求。从创作出发,探索AI的无限可能,为创作者、学生、教师、职场人提供一站式AI工具导航与场景化应用指南。