返回快讯列表
大模型前沿

研究提醒 Agent 榜单:增加任务不一定能消除脚手架偏差

论文用贝叶斯方差分解分析 22 个 Agent 基准,发现脚手架选择会改变模型排名,单纯增加同类任务的收益有限。

一篇新的 Agent 评估研究把问题从“谁得分最高”转向“这个排名到底代表什么”。作者对 Holistic Agent Leaderboard 和 Harbor Index 中的 22 个基准使用贝叶斯方差分解,区分模型差异、任务差异和脚手架带来的噪声。

结果显示,固定模型—脚手架系统的排名可靠性可以达到 0.935—0.994,但如果把结论解释为“底层模型本身谁更强”,可靠性会降到 0.148—0.841。不同 Agent 脚手架可能改变同一组模型的名次。换句话说,榜单测到的经常是模型和执行框架的组合。

作者还估算,若不改变任务类型,即使无限增加相似任务,排名可靠性的改善最多约 0.097;把不同基准组合起来,交叉任务排名的预测可靠性可从 0.44 提高到 0.75,并可能降低评估成本。实践中,团队应先写清要比较的是完整系统还是模型本身,再设计任务和复现实验。

更多快讯