返回快讯列表
开发者动态

AWS 分享多轮强化学习训练搜索 Agent 的 SageMaker 流程

教程展示如何用多轮强化学习让搜索 Agent 学会调用检索工具,并用轨迹奖励改善检索质量和执行可靠性。

AWS 发布了一份 SageMaker AI 教程,介绍如何训练一个带搜索工具的语言模型 Agent。流程使用 multi-turn reinforcement learning,让模型在多轮任务中调用检索工具,再根据完整轨迹给出奖励,而不是只评价最后一段文字。

教程的重点是把工具、环境和任务目标一起纳入训练。团队可以把自己的检索接口、文档库和评分方式放入类似流程,让较小模型在特定搜索工作上获得更稳定的行为。AWS 还分享了在四个留出数据集中的评估结果,但这些结果来自教程所用设置,不是对所有搜索任务的统一结论。

这类训练适合已经有可重复评价指标的搜索 Agent。若工具返回内容、奖励规则或检索集合频繁变化,训练出来的策略需要重新检查。教程提供的是 SageMaker 实现路径与示例代码,实际成本和收益取决于数据量、模型大小以及每次任务产生的轨迹长度。

更多快讯