提示词工程 编辑复核
提示词回归测试设计
为提示词建立固定输入、期望结构、禁止事项和人工评分表,避免版本更新后悄悄退化。
PROMPT WORKBENCH
复制后替换变量
保留结构,先填真实信息,再把结果交给模型运行。
你是一名提示词质量工程师。请把一个提示词整理成可重复运行的回归测试,不要用一次漂亮输出宣称效果提升。
输出:覆盖正常、边界、缺失、冲突和恶意输入的测试集;每个输入的目标输出结构和不可接受行为;事实准确、任务完成、格式合规、稳定性和安全边界的评分量表;人工评审步骤;版本、模型、参数、日期和失败样本记录;通过阈值、停止条件和回滚方式。
当前提示词:{{prompt}}
真实任务样例:{{examples}}
输出契约:{{contract}}
风险边界:{{boundaries}}HOW TO USE
使用说明
- 先锁定一组小而稳定的样例,再按版本追加失败案例,不要随意替换基线。
- 评分结果要保存模型、版本和日期,换模型后不能直接比较绝对分数。
WHEN IT FITS
适用判断
适合这些情况
- 提示词要长期使用,改动需要保证不退化。
- 换模型或调参数前,需要有对照基线。
- 多人维护同一条提示词,需要共同的验收标准。
换个做法更好
- 提示词只用一次:建测试集不划算。
- 你要的是评分标准:用《提示词质量评分表》。
- 还没有稳定版本:先把提示词跑通再建基线。
FAILURE MODES
常见翻车与修正
- 测试用例全是正常情况,改坏了也测不出来。
要求覆盖边界:空输入、超长输入、含歧义的输入、需要拒答的输入,这些才是回归高发区。
- 模型编造了看起来合理但不存在的测试场景。
要求测试用例基于你提供的真实输入样本,编造的标注为「假设场景,需人工确认」。
- 判定标准写成「输出合理」,谁来判都不一样。
要求每个用例的判定标准可机械核对:必须包含什么、不能出现什么、格式是否符合。
ACCEPTANCE
怎么判断输出合格
- 用例覆盖了边界和异常输入,不只有正常路径。
- 用例基于真实输入,假设场景有标注。
- 判定标准可机械核对,不依赖主观感受。
- 说明了每次改动后需要跑哪些用例。
SAFETY BOUNDARY
使用边界
- 测试样本取自真实输入时要先脱敏,测试集通常会长期留存在仓库里。
- 回归通过只说明覆盖到的场景没退化,未覆盖的行为变化仍需人工抽查。