问小创
告诉我你的需求,我帮你从站内挑最合适的 AI 工具。
2026年4月29日公开的SuperCLUE-VLM最新中文多模态视觉语言模型测评结果显示,字节跳动旗下Doubao-Seed-2.0-Pro-260215以90.66分的总得分位列17款参测国内外模型榜首,超越谷歌Gemini-3.1-Pro-Preview的89.35分。本次测评覆盖基础认知、视觉推理、视觉应用三大维度25项细分任务,阿里Qwen3.5系列、商汤SenseNova、智谱GLM等国产模型均跻身前列。
过去三年,中文多模态视觉语言模型(VLM)的第三方测评头部位置长期被海外科技厂商垄断,国产模型最好成绩仅能进入前五,而最新出炉的榜单彻底改写了这一行业固有认知。
本次SuperCLUE-VLM测评共纳入17款国内外主流视觉大模型,测试维度覆盖基础认知、视觉推理、视觉应用三大方向,包含通用物体识别、复杂场景推理、医疗影像判读等25项细分任务,是目前国内覆盖场景最全面的中文VLM专项测评之一。
字节跳动旗下Doubao-Seed-2.0-Pro-260215以90.66分的综合得分拿下总榜第一,比排名第二的谷歌Gemini-3.1-Pro-Preview高出1.31分,这也是国产视觉大模型首次在全维度综合测评中超越谷歌旗下的旗舰多模态产品。
除了豆包之外,其余上榜的国产模型表现同样亮眼:阿里巴巴Qwen3.5视觉版、商汤SenseNova多模态模型、智谱GLM-4V分别拿下总榜第三、第五、第六名,而此前被普遍看好的OpenAI GPT-5.4仅排在总榜第八位,落入中游区间。
本次测评中,专门针对中文使用场景设计的任务占比超过60%,包括中文手写文档识别、中式医疗影像判读、中文电商图文理解、国内交通标识推理等多个海外模型训练数据中极少覆盖的场景。
测评报告显示,国产模型在中文专属任务上的平均准确率达到87.2%,比海外模型的平均得分高出11.8个百分点,这也是本次国产模型能够集体实现反超的核心原因。以医疗影像任务为例,国内模型针对CT、X光片的中文标注数据训练量是海外模型的7倍以上,在相关细分任务中的得分比海外头部模型高出近20分。
视觉大模型是目前AI落地场景最广的技术方向之一,在自动驾驶、工业质检、医疗辅助诊断、内容生产等多个领域都有成熟的应用案例。此前国内下游厂商普遍面临“海外模型适配差、国产模型性能不足”的两难问题,本次国产模型的性能突破,将大幅降低下游应用的研发成本。
据了解,目前阿里巴巴Qwen系列视觉模型已经在淘宝、天猫的电商图文生成场景实现大规模应用,商汤SenseNova模型也已经落地工业质检、智慧城市等多个B端场景,字节跳动相关负责人透露,本次登顶的豆包视觉模型将于今年二季度正式对外开放API接口,优先服务抖音生态内的创作者需求。
本文基于公开信息分析整理,仅供参考。更多AI工具动态与行业解读,请持续关注本站更新。