在近期举办的AICon全球人工智能开发大会上,蚂蚁集团副总裁周俊披露了万亿参数大模型当前的核心痛点:单模型连续运行15分钟的算力成本即相当于一辆特斯拉的市场售价。他提出行业需从盲目追求参数规模转向提升Token密度,其团队推出的混合线性注意力架构等技术,可将长上下文处理成本从指数级降至线性级。

2026年以来,大模型行业的参数“军备竞赛”已经进入白热化阶段,千亿、万亿参数级的新产品层出不穷,但越来越多的从业者意识到,居高不下的算力成本正在成为大模型从演示走向商用的最大阻碍。此前已有行业机构测算,头部通用大模型单月的训练成本就可突破亿元,而推理侧的消耗更是随着用户调用量、上下文长度的上涨持续攀升。
周俊在此次AICon大会的演讲中给出的测算数据,让行业对大模型的成本压力有了更具象的认知。他明确指出,当前万亿参数规模的基础大模型,单次连续运行15分钟的算力成本,就相当于一辆普通版特斯拉家用电动车的市场售价。
如果算上训练过程中的试错、调优、数据标注等成本,国内真正具备长期运营万亿级模型能力的厂商屈指可数,此前不少企业跟风发布的万亿参数模型,也因为成本高企仅能作为技术演示项目,根本无法落地到高频的商用场景。
针对这一痛点,周俊及其团队提出了颠覆性的技术路线:放弃过去行业普遍追求的“更多Token”思路,转向攻坚“更高Token密度”,让单位算力能够处理更多有效信息。
他们自研的“7份Lightning Attention加1份MLA”混合线性注意力架构,直接把256K长度上下文的处理成本从指数级降至线性级,相当于过去处理10倍长度的内容需要消耗100倍算力,现在仅需要10倍算力即可完成。同时团队还引入了Kpop算法,精准区分工具调用与自然语言Token,搭配思维链剪枝、自蒸馏等技术,大幅减少了冗余信息的算力消耗,让算力资源能够集中在模型的“有效思考”环节。
在周俊看来,当前AI产业已经从通用大模型的普及阶段,进入到智能体的规模化落地阶段。相比面向C端的单次聊天交互,智能体需要长时间连续运行、处理超长上下文、频繁调用第三方工具,对运行效率的敏感度远高于参数规模。
未来2到3年,大模型行业的竞争核心将不再是参数量的比拼,而是单位算力能够创造的有效价值的比拼,“深耕密度”的技术路线,也会成为更多头部厂商的共同选择。
AI创作导航,创作与探索并重。聚合全球优质AI工具,覆盖短视频、图文、写作、设计等创作场景,以及办公、学习、编程、生活等全品类需求。从创作出发,探索AI的无限可能,为创作者、学生、教师、职场人提供一站式AI工具导航与场景化应用指南。