DeepSWE 基准测试重塑 AI 编程竞赛,GPT-5.5 夺魁

人工智能体
DeepSWE Benchmark Resets the AI Coding Race, Crowning GPT-5.5
Datacurve 推出的全新评估框架揭示了 AI 编程智能体之间巨大的性能差距,不仅暴露出先前基准测试的缺陷,更凸显了 GPT-5.5 的技术霸主地位。

在过去十八个月的大部分时间里,围绕软件工程领域人工智能的叙事一直是一种“平起平坐”的局面。以 SWE-bench 系列为代表的领先基准测试表明,行业巨头之间正处于激烈的竞争之中。工程领导者和首席技术官们一度认为,OpenAI 的 GPT-4 和 GPT-5 系列、Anthropic 的 Claude 系列以及 Google 的 Gemini,其性能均处于相差无几的狭窄区间内。然而,初创公司 Datacurve 发布的一项全新评估框架正在打破这种平等的幻觉,这表明该行业可能一直是在用一把从根本上就错误的尺子来衡量进展。

这项名为 DeepSWE 的新基准测试对当前的 AI 格局进行了架构审计,结果令人震惊。在排行榜榜首的是 OpenAI 的 GPT-5.5,其成功率达到了 70%,比其最接近的非 OpenAI 竞争对手高出惊人的 16 个百分点。更重要的是,该基准测试的创建者对“基准测试泄露”和技术漏洞提出了警告,这些漏洞使得 Anthropic 的 Claude Opus 等模型在公开排行榜上显得比其在现实世界的新颖编码环境中的表现更为出色。从机械工程的角度来看,这等同于发现一种新合金的系列应力测试是在真空中进行的,而实际应用却要求其在高压、腐蚀性环境中表现出性能。

传统评估基础设施的失效

要理解为何 DeepSWE 在开发者社区引起如此大的震动,首先必须审视现有系统的缺陷。迄今为止,大多数编码基准测试都依赖于对 GitHub 的“挖掘”。这些系统搜寻历史上的漏洞修复或代码合并请求(pull request),将代码库回滚到修复前的状态,并要求 AI 复现该解决方案。虽然这种方法具有可扩展性,但它有一个致命的缺陷:污染。由于这些代码库是公开的,解决方案往往已经存在于用于训练大型语言模型(LLM)的海量数据集中。在许多情况下,AI 并非通过推理来“解决”问题,而仅仅是在回忆它已经见过的答案。

Datacurve 对广受引用的 SWE-bench Pro 进行的审计揭示了一个在任何其他工业领域都不可接受的失败率。研究人员发现,负责判定 AI 是否解决任务的自动化验证器脚本约有 32% 的判定结果是错误的。这包括 8.5% 的假阳性率(将错误的代码判为正确)和 24% 的假阴性率(将完全可行的方案判为拒绝)。对于一家寻求实现软件供应链自动化的企业来说,32% 的质量控制错误率不仅仅是一个微小的失误;它是一个系统性风险,使得该基准测试在进行采购决策时几乎毫无价值。

为何 GPT-5.5 代表了性能层级的提升

GPT-5.5 的表现之所以特别令人印象深刻,是因为 DeepSWE 任务的复杂性有所提高。在传统的 SWE-bench Pro 框架中,平均任务需要在大约五个文件中增加 120 行代码。DeepSWE 显著提高了难度:该新基准测试中的参考解决方案平均需要在七个文件中增加 668 行代码。这是输出量 5.5 倍的增长。矛盾的是,DeepSWE 提供给 AI 的提示词比以往基准测试中的更短、更少描述性。这反映了更真实的工业移交场景:开发者给出简洁的指令,并期望代理程序能自行摸清架构含义、定位必要文件,并在无需被“喂食”接口定义的情况下实现稳健的解决方案。

从经济角度来看,GPT-5.5 处理更大、更模糊任务且无需过多人工干预的能力,代表了软件公司潜在投资回报率(ROI)的重大飞跃。在制造环境中,我们寻找的是那些仅需最少校准量就能执行最复杂任务的机器。在 AI 代理的世界中,GPT-5.5 是目前唯一表现出这种自主可靠性水平的“机器”。54% 和 70% 之间的差距不仅仅是一个数字;它代表了一个需要时刻人工看管的代理与一个可以被信任去执行实质性功能更新的代理之间的区别。

解决 Claude Opus 的漏洞

Datacurve 报告中最具争议的发现之一涉及 Anthropic 的 Claude Opus。几个月来,Claude Opus 一直是开发者社区的宠儿,在公开排行榜上经常优于 OpenAI 的模型。然而,DeepSWE 的分析表明,这种表现的部分原因可能是这些排行榜构建方式的产物。当针对那些不可能出现在其训练数据中的真正新颖问题进行测试时,Claude 相对于 GPT-5.5 的性能显著下降。这表明该模型可能在训练或微调阶段通过利用公共基准测试的解决方案,被无意中优化了——或者用一些更具挑衅性的评论者的话说,是“作弊”了。

在这种情况下,“漏洞”一词指的是模型识别基准测试任务结构并从记忆中提取而非依靠逻辑的能力。这是机器学习中常见的“对基准测试过拟合”的问题。当环境变为 DeepSWE 中未合并的原始任务时,该漏洞便消失了。这凸显了 AI 领域对“动态基准测试”的迫切需求。静态基准测试最终会被训练所破解,而非被智能所破解。为了保持对技术进步的清晰视野,行业必须转向不断更新并处于保密防火墙之后的基准测试,就像航空航天关键部件的测试程序一样。

需要指出的是,这并不一定意味着 AI 实验室存在恶意。当模型在整个开放互联网上进行训练时,几乎不可能确保它们没有接触到后来成为基准测试任务的特定 GitHub 问题。然而,这确实要求基准测试的创建者构建更具韧性的验证工具。DeepSWE 声称已将假阳性率降低到可忽略不计的 0.3%,将假阴性率降低到 1.1%,从而为比较模型架构提供了更稳定的基础。

工业级 AI 代理的未来

DeepSWE 的出现标志着 AI 行业成熟的一个转折点。我们正在告别“聊天机器人”时代——当时的主要衡量标准是响应有多像人类——进入“代理”时代,即唯一重要的指标是任务是否被正确完成。在机械系统中,我们不在乎机械臂看起来是否优雅;我们关心的是它的精度、运行时间和处理装配线上多变性的能力。软件工程代理终于达到了同样的标准。

对于企业买家而言,从 DeepSWE 结果中得出的结论有两点。首先,如果较小规模的模型无法解决其所分配任务的 70%,那么在价格上进行的“逐底竞争”可能只是障眼法。人类工程师修复失败 AI 任务的成本远高于使用 GPT-5.5 这种更强大模型的令牌成本。其次,依赖单一指标排行榜是一种危险的策略。企业必须开始实施基于自身专有代码库的内部私有基准测试(本质上是“迷你 DeepSWE”),以观察这些模型在特定技术环境中的表现。

当我们展望下一代 AI 开发时,重点必须始终放在可靠性和消除数据泄露上。如果我们不能信任用于衡量智能的指标,那么我们基本上就是在盲目飞行。DeepSWE 提供了一次急需的航向修正,证明了虽然模型之间的差距在表面上看起来很小,但引擎盖下的技术现实却截然不同。OpenAI 目前夺回了王座,但真正的赢家是工程界,他们终于拥有了一个更诚实的视角来审视自动化劳动的未来。

Noah Brooks

Noah Brooks

Mapping the interface of robotics and human industry.

Georgia Institute of Technology • Atlanta, GA

Readers

Readers Questions Answered

Q 什么是 DeepSWE 基准测试?它如何改变人工智能评估?
A DeepSWE 是由 Datacurve 创建的一个新的评估框架,旨在测试人工智能编程代理处理新颖、复杂任务的能力。与以往依赖模型训练集中常见的历史 GitHub 数据的基准测试不同,DeepSWE 使用未合并的问题来防止基准测试泄露。它还提高了技术难度,要求解决方案平均达到 600 行代码以上,远超 SWE-bench Pro 等旧框架中平均 120 行的水平。
Q 在 DeepSWE 测试中,GPT-5.5 与其他人工智能模型相比表现如何?
A GPT-5.5 在 DeepSWE 基准测试中脱颖而出,以 70% 的成功率领先。这一表现使其比最接近的非 OpenAI 竞争对手高出 16 个百分点。该模型展现出一种独特的能力,即在执行跨多个文件的复杂架构变更时,能够处理更简短、更模糊的提示词。这种自主可靠性水平表明了一个层级的转变,即从需要人类持续监督的模型转向能够独立进行功能更新的模型。
Q Datacurve 在现有的编程基准测试中发现了哪些技术缺陷?
A Datacurve 的审计显示,传统基准测试的自动验证程序存在 32% 的错误率。这包括 8.5% 的误报率和 24% 的漏报率,导致人工智能解决方案的评分不准确。此外,这些基准测试往往存在污染问题,模型通过回忆训练过程中遇到的解决方案,而非利用逻辑解决现实环境中的新工程问题,从而显得更有能力。
Q DeepSWE 报告中提到的 Claude Opus 漏洞是指什么?
A Claude Opus 漏洞是指当 Anthropic 的模型在 DeepSWE 框架中面对真正新颖的问题时,其性能出现下滑的现象。虽然 Claude Opus 此前在公共排行榜上表现优异,但该报告认为这些结果可能是因为模型对其训练数据中存在的公共基准测试解决方案过度拟合而虚高。当测试环境转变为模型无法记忆的原创任务时,其表现相对于 GPT-5.5 出现了显著下降。

Have a question about this article?

Questions are reviewed before publishing. We'll answer the best ones!

Comments

No comments yet. Be the first!