提示词工程 编辑复核

提示词评测量规设计

把“感觉更好”拆成可重复评分的任务集、维度、失败样例和人工复核流程。

场景:提示词迭代、模型对比和上线前质量评测输出:评测任务集 + 评分量规 + 失败分类 + 复测计划更新于 2026-08-14

复制后替换变量

保留结构,先填真实信息,再把结果交给模型运行。

你是一名模型评测设计师。请为给定任务设计能重复执行的提示词评测量规,区分事实准确性、格式遵循、鲁棒性和成本,不用模型自评替代人工证据。

先把已知事实、合理假设和待核验信息分开;资料不足时写“待验证”,不要为了完整而猜测。

请按以下结构输出:
1. 定义任务目标、用户和不可接受的失败
2. 抽样覆盖正常、边界、对抗和长输入案例
3. 为每个维度写 0-2 或 0-3 分的可观察标准
4. 设计盲评、双评和分歧处理流程
5. 给出基线、实验版本、停止条件和回归记录格式

输入变量:
- 任务定义({{task_definition}}):说明模型要完成的工作和真实使用场景。
- 测试样例({{test_cases}}):提供已脱敏的正常、边界和失败输入。
- 质量优先级({{quality_priorities}}):说明准确性、速度、成本和风格的排序。
- 发布门槛({{release_gate}}):说明最低分数、关键失败和回归要求。

约束:保留原始上下文和限定条件;每个结论都说明依据;涉及个人资料、合同、财务、医疗或安全信息时先提示脱敏和人工复核。

使用说明

  1. 先固定任务集和评分规则,再比较提示词或模型,避免评测过程中改题。
  2. 保留失败输入、原始输出和评审理由,方便复现和回归。

适用判断

适合这些情况

  • 提示词改动需要证明质量是否提升。
  • 要比较多个模型或供应商。
  • 上线后需要持续回归和版本记录。

换个做法更好

  • 任务目标还没定义:先写需求和不可接受结果。
  • 样例太少且没有边界输入:先补数据。
  • 高风险结论要正式认证:使用合规评审流程。

常见翻车与修正

  • 评分维度使用“看起来不错”这类主观词。

    把每个分数改写成可观察、可举反例的行为标准。

  • 测试集只覆盖常见输入,发布后边界问题集中爆发。

    强制加入缺字段、歧义、长输入、越权和格式异常样例。

怎么判断输出合格

  1. 任务集覆盖正常与边界输入。
  2. 每个分数有可观察标准和示例。
  3. 人工复核、分歧处理和回归记录明确。
  4. 发布门槛与安全边界可执行。

使用边界

  • 测试材料必须脱敏,不要把真实客户资料或密钥放进评测集。
  • 安全与合规任务要由领域专家复核,不能只看自动分数。