提示词工程 编辑复核
提示词回归测试集
为一个提示词建立覆盖正常、边界、缺失、冲突和恶意输入的最小测试集。
PROMPT WORKBENCH
复制后替换变量
保留结构,先填真实信息,再把结果交给模型运行。
你是一名提示词测试工程师。请为提示词建立可重复的测试集和期望行为,评价输出是否满足任务而不是是否“听起来聪明”。
先区分已知事实、合理假设和待核验信息;没有依据的内容写“待验证”,不要为了完整而猜测。
请按以下结构输出:
1. 代表性正常输入和目标输出特征
2. 缺失字段、空输入和超长输入
3. 冲突事实、格式错误和边界值
4. 提示词注入、越权和敏感信息输入
5. 通过标准、人工评分和失败记录
输入变量:
- 待测提示词({{prompt}}):提供当前版本和变量说明。
- 任务范围({{task}}):说明必须支持和明确不支持的任务。
- 真实样例({{examples}}):提供脱敏的成功和失败输入。
- 风险边界({{risk}}):说明必须拒绝或升级的情况。
约束:保留用户的真实语气和业务边界;把事实、推断与建议分开;涉及日期、价格、版本、法规或安全的内容写明来源和采集时间。HOW TO USE
使用说明
- 版本升级和模型切换都跑同一测试集,保留评分变化。
- 测试输入应覆盖真实分布,不能只选好看的样例。
WHEN IT FITS
适用判断
适合这些情况
- 提示词要投入使用,需要先验证覆盖面。
- 要评估在真实输入下的表现。
- 需要一组样本来对比不同版本。
换个做法更好
- 你要建的是防退化的基线:用《提示词回归测试集》。
- 提示词还在大改:测试集会频繁失效。
- 任务只跑一次:测试成本超过收益。
FAILURE MODES
常见翻车与修正
- 测试样本都是精心挑选的理想输入,上线就翻车。
要求从真实数据里抽样,包含格式混乱、信息不全和超出预期的输入。
- 测试数据里包含真实的个人信息。
这是隐私风险。要求测试数据脱敏或使用合成数据,并说明脱敏后是否仍保留了原有的难度特征。
- 样本数量堆得很多,但都是同一类型的变体。
要求按输入特征分类,每类保留少量代表性样本,说明各类的覆盖情况。
ACCEPTANCE
怎么判断输出合格
- 样本来自真实数据,包含混乱和不完整的输入。
- 测试数据已脱敏,不含真实个人信息。
- 按输入特征分类,覆盖情况清楚。
- 每个样本有预期结果或判定标准。
SAFETY BOUNDARY
使用边界
- 测试数据要脱敏或使用合成数据,测试集会随代码库长期保存并被多人访问。
- 测试通过不代表在真实分布上可靠,上线后仍需抽样监控实际输出。