dataset
Research on LLM Disagreement on Factual Claims
数据集新颖但文档稀薄,适合研究LLM一致性,实际落地价值有限。
5.3综合
实用性4
上手速度7
完成度4
不可替代6
生命力6
5 维独立打分,综合分为加权平均。分数只对同一套标准内部可比。
适合谁
需要分析LLM在事实陈述上分歧的学术研究者
不适合谁
需要直接部署模型或商业化产品的工程团队
项目自述
zenodo.org
替代品
TruthfulQAOpenAI EvalsMMLU
数据集新颖但文档稀薄,适合研究LLM一致性,实际落地价值有限。
5 维独立打分,综合分为加权平均。分数只对同一套标准内部可比。
需要分析LLM在事实陈述上分歧的学术研究者
需要直接部署模型或商业化产品的工程团队
zenodo.org