2026年5月19日,阿里云旗下通义千问大模型正式发布新一代旗舰预览版Qwen3.7-Max-Preview与Qwen3.7-Plus-Preview,目前已上线大模型竞技场Arena AI及官方Qwen Chat。两款模型现阶段仅开放思考模式,主打高难度逻辑推理与深度计算,其中Qwen3.7 Max在通用基准测试中位列全球第13,推动通义千问实验室排名跻身全球前六,正式版将在后续阿里云峰会发布。
5月19日早间,全球大模型性能评测平台Arena AI的实时榜单突然更新两个全新测试条目:阿里通义千问旗下的Qwen3.7两款旗舰预览版直接冲入上游梯队,上线仅2小时就收获了超过3000次用户盲测投票,在推理类问题上的正确率远超同梯队其他模型,很快引发了全球大模型从业者的关注。
和此前通义千问发布的所有版本不同,此次上线的两款预览版仅支持“思考模式”,暂时屏蔽了网页搜索、代码解释器等所有外围辅助工具,用户只能调用模型的原生能力解决问题。
据了解,这一设置是为了最大化还原大模型本身的逻辑推理、深度计算能力,避免工具加成干扰性能评测结果,定向针对高难度数理推演、多步逻辑问题、复杂专业任务求解等场景做测试优化。
目前公开的测试数据显示,Qwen3.7-Max-Preview的纯原生能力综合得分在全球所有公开测试的大模型中位列第13位,这一成绩直接推动通义千问团队的整体实验室排名冲入全球前六,是当前中文大模型厂商在纯推理基准上拿到的最好成绩之一。
在细分的理工科专业问题、中文语境逻辑推理等测试项中,新模型的表现已经接近全球头部闭源大模型的水平。
据了解,此次发布的两款产品仍属于技术预览版本,仅面向Arena AI测试用户和Qwen Chat的核心体验用户开放,暂不支持商用调用。
两款模型的正式版本预计将在今年的阿里云峰会上对外发布,届时将恢复网页搜索、代码解释器、多模态生成等全能力支持,同时开放API接口,面向企业客户和C端用户提供完整服务。
有业内人士指出,当前全球大模型的竞争已经从参数规模比拼转向原生推理能力的较量,通义千问此次率先放出无工具辅助的纯推理预览版,本质是对外释放其在底层模型架构上的技术突破信号,也为下一代大模型的技术竞争划定了新的评判标准。
AI创作导航,创作与探索并重。聚合全球优质AI工具,覆盖短视频、图文、写作、设计等创作场景,以及办公、学习、编程、生活等全品类需求。从创作出发,探索AI的无限可能,为创作者、学生、教师、职场人提供一站式AI工具导航与场景化应用指南。