devtool
SWE-bench Verified no longer measures frontier coding capabilities
OpenAI放弃的基准测试工具,已不再适合评估前沿编码能力
3.1综合
实用性3
上手速度5
完成度5
不可替代2
生命力1
5 维独立打分,综合分为加权平均。分数只对同一套标准内部可比。
适合谁
仅适合研究历史模型性能的学术用途
不适合谁
任何需要评估当前AI编码能力的场景
项目自述
openai.com
替代品
HumanEvalMBPPCodeContests