AI 问小创

你好,我是问小创 AI 助手

告诉我你的需求,我帮你从站内挑最合适的 AI 工具。

推荐结果基于站内收录,仅供参考,请以实际工具信息为准。
猜你想问
推荐一些AI写作工具 有什么AI绘画工具? 推荐视频剪辑AI工具
AI
问小创: 告诉我你的需求,我帮你从站内挑最合适的 AI 工具。

通义千问3.5旗舰预览版登LM Arena全球第五 居国内首位

2026年3月20日,阿里云旗下千问大模型家族发布旗舰预览版Qwen3.5-Max-Preview,在全球权威大模型评测平台LMSYS运营的LM Arena中拿下1464分综合得分,位列总榜全球第五、国内大模型首位,其数学能力跻身全球第五,文本处理能力达到专家级,是目前中国大模型在国际盲测中取得的最好成绩。

LM Arena的排名含金量之所以受到全球AI产业认可,核心在于其采用的匿名盲测规则:所有参与评测的模型都会隐去品牌标识,由测试者基于实际体验进行两两对比打分,完全排除品牌认知、宣传营销等非技术因素的干扰,其结果更能反映大模型的真实技术实力。此前全球榜单前五位长期被OpenAI、谷歌DeepMind、Anthropic等海外厂商的产品占据,国产大模型首次跻身前五也被业内视为标志性事件。

此次上榜的Qwen3.5-Max-Preview是阿里千问3.5系列的旗舰预览版本,最终拿下的1464分综合得分不仅创下国产大模型在该评测中的历史最高纪录,也拉开了和其他国内大模型的技术差距。

分项能力榜单显示,该模型的数学推理能力位列全球第五,专家级文本处理能力排名全球第十;在排除风格偏好、回答长度等软因素的绝对性能比拼中,其整体胜率位居全球第六,综合表现已经追上海外第一梯队大模型的平均水平。

作为国内最早布局大模型开源生态的厂商之一,阿里自2026年农历除夕以来,已经密集发布了Qwen3.5系列的8款不同参数规模的模型,参数覆盖从0.8B到397B的全区间,可适配从端侧智能设备、中小厂商轻量化应用到超大规模企业级服务的所有场景需求。

其中定位高端服务的Qwen3.5-Plus采用3970亿总参数量的MoE架构,在保持高推理效率的同时,进一步强化了复杂任务处理能力,和此次发布的旗舰预览版形成了高低搭配的产品矩阵。

此次通义千问的上榜并非偶然,过去一年来国产大模型的迭代速度明显加快,仅2025年就有超过10款国产大模型进入LM Arena全球榜单前20位。业内分析认为,随着底层技术的逐步成熟和开源生态的完善,国产大模型在To B企业服务、智能制造、智能办公等场景的落地速度将会进一步提升,和海外大模型的技术差距也会持续缩小。

本文基于公开信息分析整理,仅供参考。更多AI工具动态与行业解读,请持续关注本站更新。