一篇新的 Agent 评估研究把问题从“谁得分最高”转向“这个排名到底代表什么”。作者对 Holistic Agent Leaderboard 和 Harbor Index 中的 22 个基准使用贝叶斯方差分解,区分模型差异、任务差异和脚手架带来的噪声。
结果显示,固定模型—脚手架系统的排名可靠性可以达到 0.935—0.994,但如果把结论解释为“底层模型本身谁更强”,可靠性会降到 0.148—0.841。不同 Agent 脚手架可能改变同一组模型的名次。换句话说,榜单测到的经常是模型和执行框架的组合。
作者还估算,若不改变任务类型,即使无限增加相似任务,排名可靠性的改善最多约 0.097;把不同基准组合起来,交叉任务排名的预测可靠性可从 0.44 提高到 0.75,并可能降低评估成本。实践中,团队应先写清要比较的是完整系统还是模型本身,再设计任务和复现实验。