AI 问小创

你好,我是问小创 AI 助手

告诉我你的需求,我帮你从站内挑最合适的 AI 工具。

推荐结果基于站内收录,仅供参考,请以实际工具信息为准。
猜你想问
推荐一些AI写作工具 有什么AI绘画工具? 推荐视频剪辑AI工具
AI
问小创: 告诉我你的需求,我帮你从站内挑最合适的 AI 工具。

OpenAI质疑SWE-Bench Pro基准 行业权威AI编程评测被指失效

2026年7月,OpenAI发布博文公开质疑由Scale AI推出的AI编程领域权威评测基准SWE-Bench Pro。OpenAI经双重验证确认,该基准731个公开测试任务中约30%存在评测缺陷,前沿大模型在该基准的通过率8个月内从23.3%飙升至80.3%,这一异常增速大概率源于评测系统性问题,而非模型能力实现真实突破。

配图

SWE-Bench Pro自2025年底推出以来,就凭借贴近真实企业开发场景的测试设计、严格的防作弊机制,成为AI软件工程领域的通用评测标尺,包括GPT系列、Claude系列在内的几乎所有头部大模型的编程能力排名,都以该基准的得分为核心参考依据。此次OpenAI的公开质疑,相当于直接动摇了行业衡量大模型编程能力的核心标准。

引发OpenAI警觉的首个信号,是前沿大模型在SWE-Bench Pro上的得分涨幅违背了技术迭代的正常规律。公开数据显示,2025年11月,行业头部模型在该基准上的平均通过率仅为23.3%,而到2026年7月,已有多家厂商宣称旗下模型通过率突破80%,甚至超过了普通中级程序员的平均水平。

OpenAI技术团队在复盘自家模型迭代过程时发现,即使是参数规模、训练数据量提升幅度不大的版本,在SWE-Bench Pro上的得分也出现了大幅上涨,这一现象显然不符合大模型能力演化的基本逻辑,团队随即启动对该基准本身的有效性验证。

为了排除模型自身偶发因素的干扰,OpenAI启动了两条并行的审查路径交叉验证。

第一条路径是邀请12名平均从业年限超过8年的资深后端工程师,对731个公开测试任务逐一复现验收,最终确认有214个任务存在需求描述模糊、验收逻辑矛盾、测试用例错误等问题,占比接近30%,即使是资深人类工程师也无法给出符合要求的答案。

第二条路径则采用控制变量测试,将不同能力等级的模型分别在SWE-Bench Pro和未公开的内部编程测试集上跑分,结果显示模型在SWE-Bench Pro上的得分涨幅,和内部测试集的涨幅相关性不足40%,进一步证明该基准已经无法准确反映模型的真实编程能力。

事实上,静态评测基准被大模型“刷分”刷到失效的情况,在AI行业早已不是新鲜事。此前通用能力评测基准MMLU、数学能力评测基准GSM8K都曾出现过推出半年后,模型得分就接近满分、丧失区分度的问题。

此次作为垂直领域权威基准的SWE-Bench Pro失效,也再次暴露了当前AI评测体系的核心短板:静态测试集很容易被大模型在训练过程中拟合,或者被厂商针对性优化,无法真正衡量模型的通用能力。

据了解,目前OpenAI已经和SWE-Bench Pro的开发方Scale AI展开沟通,双方计划在今年第三季度推出迭代版的评测基准,通过动态更新测试集、引入随机任务生成机制等方式,从根源上避免基准被“刷分”的问题。

本文基于公开信息分析整理,仅供参考。更多AI工具动态与行业解读,请持续关注本站更新。