AI 问小创

你好,我是问小创 AI 助手

告诉我你的需求,我帮你从站内挑最合适的 AI 工具。

推荐结果基于站内收录,仅供参考,请以实际工具信息为准。
猜你想问
推荐一些AI写作工具 有什么AI绘画工具? 推荐视频剪辑AI工具
AI
问小创: 告诉我你的需求,我帮你从站内挑最合适的 AI 工具。

蚂蚁集团开源百灵Ling-2.6-flash大模型 智效比提升超10倍

2026年4月29日,蚂蚁集团正式开源旗下百灵大模型最新迭代版本Ling-2.6-flash,该模型总参数104B、激活参数仅7.4B,同步推出BF16、FP8、INT4多量化版本,H20显卡环境下推理速度最高达每秒340Token,同等任务下智效比较同级别模型提升10倍,大幅降低大模型部署门槛。

就在半个月前,一款参数规模未公开的大模型在MMLU、HumanEval等多个国际主流技术评测榜单冲进同赛道TOP3,彼时不少业内人士猜测其来自国内头部科技企业,谜底直到今日才正式揭晓:这款产品正是蚂蚁集团刚刚开源的百灵Ling-2.6-flash。

过去两年,大模型的性能迭代速度远超行业预期,但落地端的“算力鸿沟”却始终存在:100B级大模型的推理能力足以覆盖绝大多数商用场景,但单卡部署成本高、推理速度慢的问题,让大量中小开发者望而却步。不少团队为了适配硬件只能选择参数更小的模型,却不得不牺牲部分任务表现,效率与性能的平衡成为全行业共同的诉求。

此次开源的Ling-2.6-flash给出了新的解题思路。该模型采用先进的混合线性架构,总参数达到104B的同时,激活参数仅为7.4B,相当于用7B级模型的推理成本,就能获得接近100B级模型的性能表现。

在主流H20显卡环境下,Ling-2.6-flash的推理速度最高可达340Token/秒,吞吐能力远超同级别竞品。针对开发者最关心的部署灵活性问题,蚂蚁同步推出了BF16、FP8、INT4等多个量化版本,不同硬件条件的团队都能找到适配的版本,无需额外做大量量化优化工作。

据了解,该模型此前已经针对中英文双语切换、代码生成两大高频场景完成了多轮迭代优化,在代码生成、多轮对话、跨语言理解等任务上的表现均处于行业第一梯队。此前其以匿名身份参与国际主流评测时,就曾凭借远超同参数级模型的表现引发业内关注。

此次Ling-2.6-flash的全量化版本开源,相当于给全球开发者提供了一个“开箱即用”的高性能大模型底座。中小团队无需投入高昂的算力成本训练大模型,即可基于该版本二次开发智能客服、代码助手、多语言内容生成等各类应用,大幅缩短产品落地周期。

业内人士指出,随着越来越多高智效比的大模型开源,大模型落地的算力门槛将进一步降低,未来两年有望迎来商用落地的爆发期,更多垂直场景的创新应用将会快速涌现。

本文基于公开信息分析整理,仅供参考。更多AI工具动态与行业解读,请持续关注本站更新。