提示词工程 编辑复核
提示词输出质量评分量表
把提示词质量拆成任务完成、事实、格式、稳定性和安全等维度,支持人工和自动评估,不用单个漂亮例子下结论。
PROMPT WORKBENCH
复制后替换变量
保留结构,先填真实信息,再把结果交给模型运行。
你是一名AI 质量评估工程师。请设计可重复的提示词评估方案,区分输出质量、模型差异、输入难度和人工偏差。
先区分已知事实、合理假设和待核验信息;没有依据的内容写“待验证”,不要为了完整而猜测。
请按以下结构输出:
1. 定义任务成功标准和不可接受行为
2. 设计正常、边界、缺失、冲突和恶意输入样例
3. 为事实、完成、格式、稳定、安全和人工修改成本设评分锚点
4. 确定样本量、评审流程、通过阈值和停止条件
输入变量:
- 提示词({{prompt}}):提供当前版本和变量契约。
- 目标任务({{task}}):说明用户真实要完成的工作。
- 测试集({{test_set}}):提供脱敏样例和历史失败。
- 风险边界({{risk}}):说明隐私、合规、业务和安全要求。
约束:保留用户的真实语气和业务边界;把事实、推断与建议分开;涉及日期、价格、版本、法规或安全的内容写明来源和采集时间。HOW TO USE
使用说明
- 先固定评估集,再比较模型或版本,避免移动目标。
- 评分差异大时记录评审理由,不能只平均数字。
WHEN IT FITS
适用判断
适合这些情况
- 需要一套标准来判断提示词好坏。
- 多人写提示词,需要统一的评审依据。
- 要对比多个版本,需要可量化的维度。
换个做法更好
- 你要的是打分表和结论:用《提示词质量评分表》。
- 只有一条提示词:直接看输出更快。
- 评价标准取决于具体业务:通用维度用不上。
FAILURE MODES
常见翻车与修正
- 维度都是「清晰度」「完整性」这类词,各人理解不同。
要求每个维度给出可核对的判断依据,比如「是否包含输出格式说明」这种能直接回答是否的问题。
- 维度太多,评一次要半小时。
要求维度控制在少数几个,并按重要性排序,先评高权重的,低分直接淘汰不用评完。
- 评分没有分数含义说明,不同人打的分不可比。
要求每个分档写明对应的具体表现,评分者能对照判断而不是凭感觉。
ACCEPTANCE
怎么判断输出合格
- 每个维度有可核对的判断依据。
- 维度数量克制,有重要性排序。
- 分档有具体表现说明,不同人评分可比。
- 说明了什么分数算通过。
SAFETY BOUNDARY
使用边界
- 让模型评价模型的输出会有系统性偏好,高风险场景的评分要有人工复核。
- 量表只能衡量它定义的维度,安全性和合规性需要单独的专项检查。