返回快讯列表
开源生态

Agent 成功一次还不够:IBM 实验将五次全成功率从 53% 提至 69%

IBM Research 提出用多次运行全部成功的比例补充平均成功率,并将轨迹中的不稳定决策转成可复用指导。

IBM Research 9 月 15 日介绍 ALTK-Evolve 的一致性指导与 Consistency Analyzer。研究关注一个实际问题:Agent 在演示中成功一次,不代表面对相同请求还能稳定完成;单看平均正确率容易掩盖这种差异。

团队在 AppWorld 的特定实验中观察到,GPT-4.1 ReAct Agent 的平均运行成功率为 77.4%,但同一任务五次运行全部成功的比例只有 53%。分析器对已记录轨迹中的决策点重新采样,定位容易改变选择的步骤,再生成推理时可复用的指导,而不是重新执行所有外部操作。

加入指导后,该实验的五次全成功比例升至 69%,一致性差距由 24.4 个百分点缩小到 12 个百分点。结果针对论文给定模型和基准,不能外推为所有 Agent 的普遍收益。相关分析与指导生成能力已进入开源工具,适合与平均准确率一起用于可靠性评估。

更多快讯