dataset
APIEval-20
API测试基准数据集,但覆盖范围有限且社区活跃度未知
4.8综合
实用性5
上手速度6
完成度5
不可替代4
生命力4
5 维独立打分,综合分为加权平均。分数只对同一套标准内部可比。
适合谁
需要快速评估AI代理API调用能力的研究团队
不适合谁
需要生产级API测试覆盖的企业
项目自述
An open benchmark for AI agents that test APIs Discussion | Link
替代品
Postman CollectionsSwagger/OpenAPI test suites