孤本网
发布于 2026-02-23 / 0 阅读
0
0

OpenAI 称不再评估 SWE-bench Verified,指其受污染且误测前沿编码进展

OpenAI 宣布不再将 SWE-bench Verified 作为评估基准,理由是它正日益受到污染,并无法准确衡量前沿编码能力的进展。

据 OpenAI 发布的说明,其分析显示该基准存在测试本身有缺陷(flawed tests)以及训练数据泄漏(training leakage)两方面问题,因此这一基准已难以反映模型在编码任务上的真实水平。OpenAI 据此建议改用 SWE-bench Pro。

SWE-bench 系列长期被用于衡量大模型解决真实软件工程问题的能力,此次调整针对的是其中的 Verified 版本。OpenAI 未在说明中披露具体的污染样本比例或泄漏范围。

孤本观察:当测试缺陷与训练数据泄漏同时存在时,基准分数与真实编码能力之间的对应关系便难以成立,读者对单一榜单的排名应保持审慎。OpenAI 转而推荐 SWE-bench Pro,也意味着基准的选择与解释权正被纳入各家评测体系自身的叙事之中。

来源:OpenAI News


评论