提示词工程 编辑复核

提示词回归测试集

为一个提示词建立覆盖正常、边界、缺失、冲突和恶意输入的最小测试集。

场景:提示词发布、版本升级和模型切换输出:测试用例表 + 期望行为 + 评分字段更新于 2026-08-03

复制后替换变量

保留结构,先填真实信息,再把结果交给模型运行。

你是一名提示词测试工程师。请为提示词建立可重复的测试集和期望行为,评价输出是否满足任务而不是是否“听起来聪明”。

先区分已知事实、合理假设和待核验信息;没有依据的内容写“待验证”,不要为了完整而猜测。

请按以下结构输出:
1. 代表性正常输入和目标输出特征
2. 缺失字段、空输入和超长输入
3. 冲突事实、格式错误和边界值
4. 提示词注入、越权和敏感信息输入
5. 通过标准、人工评分和失败记录

输入变量:
- 待测提示词({{prompt}}):提供当前版本和变量说明。
- 任务范围({{task}}):说明必须支持和明确不支持的任务。
- 真实样例({{examples}}):提供脱敏的成功和失败输入。
- 风险边界({{risk}}):说明必须拒绝或升级的情况。

约束:保留用户的真实语气和业务边界;把事实、推断与建议分开;涉及日期、价格、版本、法规或安全的内容写明来源和采集时间。

使用说明

  1. 版本升级和模型切换都跑同一测试集,保留评分变化。
  2. 测试输入应覆盖真实分布,不能只选好看的样例。

适用判断

适合这些情况

  • 提示词要投入使用,需要先验证覆盖面。
  • 要评估在真实输入下的表现。
  • 需要一组样本来对比不同版本。

换个做法更好

  • 你要建的是防退化的基线:用《提示词回归测试集》。
  • 提示词还在大改:测试集会频繁失效。
  • 任务只跑一次:测试成本超过收益。

常见翻车与修正

  • 测试样本都是精心挑选的理想输入,上线就翻车。

    要求从真实数据里抽样,包含格式混乱、信息不全和超出预期的输入。

  • 测试数据里包含真实的个人信息。

    这是隐私风险。要求测试数据脱敏或使用合成数据,并说明脱敏后是否仍保留了原有的难度特征。

  • 样本数量堆得很多,但都是同一类型的变体。

    要求按输入特征分类,每类保留少量代表性样本,说明各类的覆盖情况。

怎么判断输出合格

  1. 样本来自真实数据,包含混乱和不完整的输入。
  2. 测试数据已脱敏,不含真实个人信息。
  3. 按输入特征分类,覆盖情况清楚。
  4. 每个样本有预期结果或判定标准。

使用边界

  • 测试数据要脱敏或使用合成数据,测试集会随代码库长期保存并被多人访问。
  • 测试通过不代表在真实分布上可靠,上线后仍需抽样监控实际输出。