AI 问小创

你好,我是问小创 AI 助手

告诉我你的需求,我帮你从站内挑最合适的 AI 工具。

推荐结果基于站内收录,仅供参考,请以实际工具信息为准。
猜你想问
推荐一些AI写作工具 有什么AI绘画工具? 推荐视频剪辑AI工具
AI
问小创: 告诉我你的需求,我帮你从站内挑最合适的 AI 工具。

SuperCLUE4月VLM榜单出炉:豆包登顶 国产模型集体反超海外

2026年4月SuperCLUE-VLM视觉语言大模型评测报告正式发布,在对全球17款主流多模态产品的深度横评中,字节跳动旗下Doubao-Seed-2.0-Pro-260215以90.66分力压谷歌Gemini-3.1-Pro-Preview登顶总榜,阿里Qwen3.5、商汤SenseNova、智谱GLM等多款国产模型跻身第一梯队,国产阵营综合得分整体反超海外顶尖产品。

作为国内最具权威性的大模型第三方评测体系之一,SuperCLUE-VLM的季度评测素来以覆盖维度广、测试场景贴近实际落地需求著称,本次榜单的变动也被业内视为中文多模态领域的标志性拐点。

本次评测共覆盖了全球范围内17款最新迭代的主流视觉语言大模型,最终结果打破了过去两年海外模型长期霸榜的格局。字节跳动旗下的Doubao-Seed-2.0-Pro-260215以90.66分的综合得分位列总榜第一,比此前排名榜首的谷歌Gemini-3.1-Pro-Preview高出1.31分。

除了登顶的豆包模型外,阿里Qwen3.5系列、商汤SenseNova、智谱GLM等多款国产模型均进入榜单前六位,整体构成第一梯队。反观海外阵营,OpenAI GPT-5.4、X.AI旗下Grok等知名产品仅位列中游,在中文相关测试项上得分差距明显。

本次评测设置了基础认知、复杂推理、场景落地三大核心维度,其中接近40%的测试项针对中文语境设计,包括本土文化内容识别、中文多轮图文交互、行业场景中文指令响应等。

评测结果显示,国产模型在中文相关测试项上的平均准确率比海外模型高出17个百分点,部分涉及中国民俗、网络热梗、地方方言的图文理解题,海外模型的错误率甚至超过60%。业内人士认为,国产厂商长期深耕本土用户需求,在中文语料和场景训练上的积累正在转化为实打实的能力优势。

视觉语言大模型被视为下一代AI应用的核心基础设施,当前已广泛应用于内容创作、自动驾驶、工业质检、智能客服等多个领域。本次国产VLM阵营的集体突围,意味着国内厂商在本土场景的落地竞争中已经占据了先发优势。

据了解,目前多家登顶榜单的厂商已经在推进相关模型的端侧适配和行业定制化工作,预计今年下半年就会有大量搭载国产VLM能力的C端应用和B端解决方案上线,进一步缩小和海外厂商在通用场景的能力差距,甚至在部分垂直领域实现领跑。

本文基于公开信息分析整理,仅供参考。更多AI工具动态与行业解读,请持续关注本站更新。