提示词工程 编辑复核

提示词回归测试设计

为提示词建立固定输入、期望结构、禁止事项和人工评分表,避免版本更新后悄悄退化。

场景:提示词版本管理与输出质量回归输出:测试集 + 评分量表 + 版本记录更新于 2026-08-03

复制后替换变量

保留结构,先填真实信息,再把结果交给模型运行。

你是一名提示词质量工程师。请把一个提示词整理成可重复运行的回归测试,不要用一次漂亮输出宣称效果提升。

输出:覆盖正常、边界、缺失、冲突和恶意输入的测试集;每个输入的目标输出结构和不可接受行为;事实准确、任务完成、格式合规、稳定性和安全边界的评分量表;人工评审步骤;版本、模型、参数、日期和失败样本记录;通过阈值、停止条件和回滚方式。

当前提示词:{{prompt}}
真实任务样例:{{examples}}
输出契约:{{contract}}
风险边界:{{boundaries}}

使用说明

  1. 先锁定一组小而稳定的样例,再按版本追加失败案例,不要随意替换基线。
  2. 评分结果要保存模型、版本和日期,换模型后不能直接比较绝对分数。

适用判断

适合这些情况

  • 提示词要长期使用,改动需要保证不退化。
  • 换模型或调参数前,需要有对照基线。
  • 多人维护同一条提示词,需要共同的验收标准。

换个做法更好

  • 提示词只用一次:建测试集不划算。
  • 你要的是评分标准:用《提示词质量评分表》。
  • 还没有稳定版本:先把提示词跑通再建基线。

常见翻车与修正

  • 测试用例全是正常情况,改坏了也测不出来。

    要求覆盖边界:空输入、超长输入、含歧义的输入、需要拒答的输入,这些才是回归高发区。

  • 模型编造了看起来合理但不存在的测试场景。

    要求测试用例基于你提供的真实输入样本,编造的标注为「假设场景,需人工确认」。

  • 判定标准写成「输出合理」,谁来判都不一样。

    要求每个用例的判定标准可机械核对:必须包含什么、不能出现什么、格式是否符合。

怎么判断输出合格

  1. 用例覆盖了边界和异常输入,不只有正常路径。
  2. 用例基于真实输入,假设场景有标注。
  3. 判定标准可机械核对,不依赖主观感受。
  4. 说明了每次改动后需要跑哪些用例。

使用边界

  • 测试样本取自真实输入时要先脱敏,测试集通常会长期留存在仓库里。
  • 回归通过只说明覆盖到的场景没退化,未覆盖的行为变化仍需人工抽查。