问小创
告诉我你的需求,我帮你从站内挑最合适的 AI 工具。
AI初创企业MiniMax于2026年6月发布全新旗舰大模型M3,该模型在接近真实软件工程场景的测试中拿下59%的得分,性能超越GPT-5.5、逼近Opus4.7,同时具备百万级上下文处理能力与原生多模态特性。但该产品发布后因评测方式合规性问题引发开发者社区强烈质疑,陷入口碑两极分化的争议漩涡。

2026年的大模型赛道竞争已经从参数规模比拼转向真实场景落地能力的较量,每一款旗舰级模型的发布都会引发全行业的关注,而MiniMax此次的M3发布却走出了一条完全不同的舆论曲线。
从MiniMax官方公布的技术报告来看,M3的硬参数确实足够能打:在公认最贴近企业真实开发需求的软件工程场景测试中,M3取得了59%的得分,这一成绩不仅超过了OpenAI此前发布的GPT-5.5,更是直逼Anthropic的旗舰模型Opus4.7。
除此之外,M3还支持百万级上下文窗口处理能力,同时搭载原生多模态架构,可实现文本、图像、音频、视频的跨模态理解与生成,适配企业级长文档解析、复杂智能体开发等多元场景。仅从纸面参数来看,M3已经具备了和全球头部大模型正面竞争的实力。
和亮眼的官方跑分形成鲜明反差的是,M3发布后仅24小时就遭到了全球开发者社区的集中质疑,中文开发者社区的吐槽声尤为集中。
引发争议的核心是M3代码能力评测的底层逻辑:官方技术细则披露,M3在跑代码相关的智能体评测时,使用了竞品Anthropic推出的Claude Code作为评测脚手架。尽管当前行业内利用现成工具链搭建评测环境属于常规操作,但不少开发者指出,MiniMax在对外宣传时刻意淡化了这一前提,直接将跑分结果和竞品的官方成绩对标,本质上是“借了对手的工具跑出高分,反过来宣传自己比对手更强”。
更有开发者发布了独立复现的测试结果:如果更换为通用的无偏向性评测框架,M3的代码场景测试得分会出现超过10个百分点的下滑,和官方公布的59%存在明显差距,有“应试跑分”的嫌疑。
此次M3的争议本质上是当前大模型行业评测乱象的一个缩影。随着大模型商业化落地加速,“跑分营销”已经成为不少厂商拉抬产品声量的常规手段:要么专门针对公开测试集做定向优化,要么在评测时加入额外辅助工具抬升成绩,最终出现“跑分越来越高,但用户实际体验没有明显提升”的错位。
目前全球AI产业界已经在推动建立统一的、透明的评测标准,要求厂商公布评测的完整环境、工具链和限制条件,避免营销导向的跑分误导产业决策和用户选择。此次争议也可能成为推动国内大模型评测体系走向规范的一个契机。
AI创作导航,创作与探索并重。聚合全球优质AI工具,覆盖短视频、图文、写作、设计等创作场景,以及办公、学习、编程、生活等全品类需求。从创作出发,探索AI的无限可能,为创作者、学生、教师、职场人提供一站式AI工具导航与场景化应用指南。