SWE-Bench Pro V2重磅发布:GPT-5与Claude Opus 4.1得分仅约23%,代码能力评测难度陡增
thinkindev • 2026-09-23
1436 views
SWE-Bench Pro V2基准正式发布,共包含来自11个代码仓库的642项任务。该版本修正了此前任务中的错误,并优化了评估流程,使评测更贴近真实软件工程场景。结果显示,AI模型在该基准上的得分普遍下降,OpenAI GPT-5与Claude Opus 4.1在公开集上的解决率仅约23%,远低于SWE-Bench Verified上的表现,凸显出新基准更高的挑战性与现实性。值得注意的是,顶级模型在不同任务和编程语言上表现较为一致,而小型模型在面对复杂的多文件改动时明显吃力。这一基准有望成为衡量大模型软件工程能力的重要标尺。
核心要点
- SWE-Bench Pro V2发布,包含642项任务并修正错误、优化评估流程
- OpenAI GPT-5与Claude Opus 4.1公开集得分仅约23%,难度显著提升
- 顶级模型跨任务语言表现稳定,小型模型在复杂多文件场景中明显落后