提示词工程 编辑复核
提示词评测量规设计
把“感觉更好”拆成可重复评分的任务集、维度、失败样例和人工复核流程。
PROMPT WORKBENCH
复制后替换变量
保留结构,先填真实信息,再把结果交给模型运行。
你是一名模型评测设计师。请为给定任务设计能重复执行的提示词评测量规,区分事实准确性、格式遵循、鲁棒性和成本,不用模型自评替代人工证据。
先把已知事实、合理假设和待核验信息分开;资料不足时写“待验证”,不要为了完整而猜测。
请按以下结构输出:
1. 定义任务目标、用户和不可接受的失败
2. 抽样覆盖正常、边界、对抗和长输入案例
3. 为每个维度写 0-2 或 0-3 分的可观察标准
4. 设计盲评、双评和分歧处理流程
5. 给出基线、实验版本、停止条件和回归记录格式
输入变量:
- 任务定义({{task_definition}}):说明模型要完成的工作和真实使用场景。
- 测试样例({{test_cases}}):提供已脱敏的正常、边界和失败输入。
- 质量优先级({{quality_priorities}}):说明准确性、速度、成本和风格的排序。
- 发布门槛({{release_gate}}):说明最低分数、关键失败和回归要求。
约束:保留原始上下文和限定条件;每个结论都说明依据;涉及个人资料、合同、财务、医疗或安全信息时先提示脱敏和人工复核。HOW TO USE
使用说明
- 先固定任务集和评分规则,再比较提示词或模型,避免评测过程中改题。
- 保留失败输入、原始输出和评审理由,方便复现和回归。
WHEN IT FITS
适用判断
适合这些情况
- 提示词改动需要证明质量是否提升。
- 要比较多个模型或供应商。
- 上线后需要持续回归和版本记录。
换个做法更好
- 任务目标还没定义:先写需求和不可接受结果。
- 样例太少且没有边界输入:先补数据。
- 高风险结论要正式认证:使用合规评审流程。
FAILURE MODES
常见翻车与修正
- 评分维度使用“看起来不错”这类主观词。
把每个分数改写成可观察、可举反例的行为标准。
- 测试集只覆盖常见输入,发布后边界问题集中爆发。
强制加入缺字段、歧义、长输入、越权和格式异常样例。
ACCEPTANCE
怎么判断输出合格
- 任务集覆盖正常与边界输入。
- 每个分数有可观察标准和示例。
- 人工复核、分歧处理和回归记录明确。
- 发布门槛与安全边界可执行。
SAFETY BOUNDARY
使用边界
- 测试材料必须脱敏,不要把真实客户资料或密钥放进评测集。
- 安全与合规任务要由领域专家复核,不能只看自动分数。