返回快讯列表
大模型前沿

Rules to Tools 研究:把科学规则做成可执行检查,Agent 修复更稳

论文比较文字规则与可调用检查工具在科学代码修复中的表现,工具组在部分任务中提高完整修复率并减少模型输出。

Rules to Tools 论文研究科学代码 Agent 如何使用方程、边界条件和输出要求。作者把这些要求整理成可执行检查,让 Agent 在修改程序后调用工具验证,而不是只根据文字说明自己判断。对照实验尽量保持起始程序、模型和预算一致,只改变 Agent 是否能调用准备好的检查实现。

在两组任务中,完整修复数量分别为文字组 26/30、工具组 29/30;另一个 8 个任务的比较中,文字组为 13/16、工具组为 15/16。结果并非所有题目都偏向工具,有任务更适合文字说明,也有多个任务打平。作者还报告,在 PDE 比较中,工具组为 24/24,文字组为 23/24,并少生成 31.2% 的模型输出。

论文同时提醒,工具减少的是 Agent 侧输出,公共 CPU 使用在两组中都上升;不同任务簇的差异也很大。对科学编程团队而言,最有价值的做法是把领域规则转成可复现检查,并记录哪些检查真正影响了修复结果,而不是把“可执行规则”当成所有代码任务的通用答案。

更多快讯