← 工具雷达
dataset

HermesBench – workflow reliability evals for personal AI agents

一个处于早期研究阶段的基准测试,旨在评估个人AI代理的工作流可靠性,但目前尚不成熟,缺乏实际可用性。

4.3综合
实用性5
上手速度3
完成度4
不可替代6
生命力3

5 维独立打分,综合分为加权平均。分数只对同一套标准内部可比。

适合谁

AI代理研究人员,对评估多步骤AI代理工作流可靠性有理论兴趣的团队。

不适合谁

需要立即投入生产环境的团队,寻求开箱即用解决方案的开发者,对AI代理评估没有深入研究需求的团队。

项目自述

verkyyi.github.io

替代品

AgentBenchGAIA
访问官网1 · 评测时 Stars评测于 2026-05-31

同类工具