OpenAI指出AI基准测试存在缺陷:近三分之一的问题有问题
OpenAI将矛头指向了业界最受尊敬的AI评估基准测试之一SWE-Bench Pro,认为其近三分之一的测试问题存在缺陷。在今日发布的博文中,该公司表示,731个公开测试任务中约30%存在评估问题,使得该基准测试无法可靠衡量大型语言模型的真实编程能力。
SWE-Bench Pro由Scale AI开发,旨在测试AI代理处理真实世界软件工程任务的能力。由于与实际企业开发高度相似且具有严格的反作弊措施,它迅速成为该领域的首选标准。但OpenAI的分析表明,该基准测试的得分在短短八个月内从23.3%提升至80.3%,提升速度过快,令人怀疑。
“这种进步速度很可疑,”一位OpenAI发言人表示。“更可能是评估本身存在系统性问题,而不是模型突然在编码方面变好了四倍。”
为验证怀疑,OpenAI进行了两项平行审查。第一项是数据驱动分析,标记了200个失败任务,占总数的27.4%。第二项是人工标注,识别出249个有缺陷的任务,占34.1%。交叉参考两种方法,OpenAI估计SWE-Bench Pro中约30%的任务存在缺陷。这些问题包括测试过于严格、提示不足、测试范围狭窄以及误导性指令。
OpenAI分享的一个例子:一个任务要求模型在将内容转换为Markdown时,在行首添加一个空格。但隐藏测试却期望两个空格。因此,即使模型完全按照问题描述执行,也会被判错。“这种与明确指令相矛盾的隐藏要求直接扭曲了对模型真实能力的评估,”博文解释道。

基于这些发现,OpenAI已正式撤回之前对SWE-Bench Pro的推荐。该公司认为,未来的基准测试应由经验丰富的软件开发者专门为AI评估设计,而不是借用针对人类开发者的测试逻辑。
“当行业基准测试本身可能存在近30%的缺陷时,整个AI评估系统的可信度就受到了质疑,”博文指出。“是时候摆脱追逐分数的竞赛,专注于真正的工程能力评估了。”
这一批评正值AI评估标准受到日益严格审查之际。许多研究人员担心基准测试变得过时或被操纵,导致对AI性能的夸大宣传。OpenAI对SWE-Bench Pro的挑战可能推动行业重新思考如何衡量AI软件工程的进展。
关键点
- OpenAI声称SWE-Bench Pro约30%的任务存在评估缺陷。
- 通过率在八个月内从23.3%跃升至80.3%,表明基准测试存在问题。
- 两项审查路径分别发现27.4%和34.1%的任务有缺陷。
- 问题包括测试过于严格、提示误导以及隐藏要求。
- OpenAI撤回推荐,并呼吁由开发者设计新的基准测试。