提示词工程 编辑复核
提示词质量评分卡
用任务完成、事实可靠、格式稳定、可控性和成本等维度评估提示词版本。
PROMPT WORKBENCH
复制后替换变量
保留结构,先填真实信息,再把结果交给模型运行。
你是一名提示词评测负责人。请建立可复核的评分卡,区分硬性失败、质量差异和个人偏好,不要用单一总分掩盖关键风险。
先区分已知事实、合理假设和待核验信息;没有依据的内容写“待验证”,不要为了完整而猜测。
请按以下结构输出:
1. 任务完成和硬性失败条件
2. 事实、引用、格式、稳定性和可编辑性评分
3. 成本、延迟和人工修改时间
4. 样本、评审人、分歧和证据记录
5. 版本选择、上线门槛和复测条件
输入变量:
- 提示词版本({{prompt_versions}}):提供版本正文、日期和改动摘要。
- 测试样本({{test_set}}):提供样本来源、数量和分组。
- 评价标准({{criteria}}):说明硬性门禁和加权维度。
- 评审方式({{reviewers}}):说明评审人、盲测和分歧处理。
约束:保留用户的真实语气和业务边界;把事实、推断与建议分开;涉及日期、价格、版本、法规或安全的内容写明来源和采集时间。HOW TO USE
使用说明
- 评分前固定标准和样本,避免看到结果后改规则。
- 总分不能覆盖硬性事实错误和安全失败。
WHEN IT FITS
适用判断
适合这些情况
- 有多个提示词版本要选,需要给出结论。
- 要向他人说明为什么选这个版本。
- 需要记录评审结果供后续参考。
换个做法更好
- 你要先定评价维度:用《提示词评审量规》。
- 只有一个版本:评分没有对照意义。
- 决策依据是实测数据:直接看数据比打分可靠。
FAILURE MODES
常见翻车与修正
- 给出了分数但没说依据,看不出为什么这么打。
要求每项分数附具体证据,指出提示词里的哪一处支撑了这个分数。
- 总分接近但推荐结论很绝对,看不出取舍。
要求说明各版本的优劣分布,分数接近时指出取舍取决于什么条件。
- 评分基于模型对提示词的推测,没有实际运行结果。
要求区分「基于文本判断」和「基于实测」的项,未实测的明确标注,不能当作实测结论用。
ACCEPTANCE
怎么判断输出合格
- 每项分数有具体证据,指向提示词的对应位置。
- 分数接近时说明了取舍条件。
- 区分了文本判断和实测结论。
- 推荐结论和分数一致,没有自相矛盾。
SAFETY BOUNDARY
使用边界
- 基于文本推测的评分和实测结论要分开标注,混在一起会让决策依据变得不可靠。
- 评分卡不覆盖安全和合规维度,涉及对外场景的提示词需要额外专项评审。