AI 问小创

你好,我是问小创 AI 助手

告诉我你的需求,我帮你从站内挑最合适的 AI 工具。

推荐结果基于站内收录,仅供参考,请以实际工具信息为准。
猜你想问
推荐一些AI写作工具 有什么AI绘画工具? 推荐视频剪辑AI工具
AI
问小创: 告诉我你的需求,我帮你从站内挑最合适的 AI 工具。

蚂蚁开源Ling-3.0-flash-VL 124B参数原生多模态大模型正式发布

2026年9月9日,蚂蚁开源团队正式推出百灵系列首个原生多模态大模型Ling-3.0-flash-VL。该模型基于MoE架构研发,总参数量达124B,单次推理仅激活5.5B参数,原生支持图像、文本、视频三类输入,上下文窗口达256K Token,其原生联合训练机制打破了“多模态训练削弱文本能力”的行业共识,可大幅提升真实场景任务执行效率。

过去两年,多模态大模型已经成为AI落地的核心方向,但多数厂商的多模态产品均采用“纯文本大底座+视觉识别插件”的拼接式架构,这种方案虽然开发速度快,但存在两大核心问题:一是模态之间的语义对齐程度低,复杂跨模态任务准确率不足;二是视觉模块的接入往往会拉低原有文本底座的语义理解能力,导致通用任务表现下降。

不少企业在落地多模态应用时,不得不牺牲部分模态支持能力来保证核心业务的稳定性,这也成为制约多模态大模型规模化普及的核心障碍。

此次发布的Ling-3.0-flash-VL完全规避了拼接式架构的缺陷,其基于成熟的Ling-3.0-flash MoE架构原生拓展而来,124B总参数量仅激活5.5B即可完成推理,兼顾了大模型的能力天花板和推理效率,同时256K Token的上下文窗口也能支持长文档、长视频的一次性完整输入。

针对行业普遍存在的“多模态训练削弱文本能力”的顾虑,蚂蚁开源团队的训练数据给出了相反的结论:原生多模态联合训练过程中,视觉、文本、视频三类数据的语义互相校准,反而进一步强化了模型的语义理解深度,在通用文本基准测试中,该模型的表现甚至优于同参数级别的纯文本大模型。此外,模型还引入了创新的视觉反馈机制,将传统的一次性生成调整为“观察-对比-纠错”的动态闭环,大幅提升了复杂多模态任务的执行可靠性。

此次蚂蚁开源团队选择将Ling-3.0-flash-VL完全开放,面向全行业提供免费商用授权,后续还将配套推出轻量化微调工具、端侧部署优化方案等配套工具。

对中小开发者和企业而言,不需要从零搭建多模态训练体系,就能基于该模型快速适配电商内容审核、智能交互客服、教育内容生成等不同场景的定制化需求,也为整个多模态大模型的技术迭代提供了新的公共底座参考。

本文基于公开信息分析整理,仅供参考。更多AI工具动态与行业解读,请持续关注本站更新。