← 工具雷达
devtool

SWE-bench Verified no longer measures frontier coding capabilities

OpenAI放弃的基准测试工具,已不再适合评估前沿编码能力

3.1综合
实用性3
上手速度5
完成度5
不可替代2
生命力1

5 维独立打分,综合分为加权平均。分数只对同一套标准内部可比。

适合谁

仅适合研究历史模型性能的学术用途

不适合谁

任何需要评估当前AI编码能力的场景

项目自述

openai.com

替代品

HumanEvalMBPPCodeContests
访问官网280 · 评测时 Stars评测于 2026-04-27

同类工具