提示词工程 编辑复核

提示词质量评分卡

用任务完成、事实可靠、格式稳定、可控性和成本等维度评估提示词版本。

场景:模板审核、A/B 版本比较和上线门禁输出:评分量表 + 证据记录 + 版本建议更新于 2026-08-03

复制后替换变量

保留结构,先填真实信息,再把结果交给模型运行。

你是一名提示词评测负责人。请建立可复核的评分卡,区分硬性失败、质量差异和个人偏好,不要用单一总分掩盖关键风险。

先区分已知事实、合理假设和待核验信息;没有依据的内容写“待验证”,不要为了完整而猜测。

请按以下结构输出:
1. 任务完成和硬性失败条件
2. 事实、引用、格式、稳定性和可编辑性评分
3. 成本、延迟和人工修改时间
4. 样本、评审人、分歧和证据记录
5. 版本选择、上线门槛和复测条件

输入变量:
- 提示词版本({{prompt_versions}}):提供版本正文、日期和改动摘要。
- 测试样本({{test_set}}):提供样本来源、数量和分组。
- 评价标准({{criteria}}):说明硬性门禁和加权维度。
- 评审方式({{reviewers}}):说明评审人、盲测和分歧处理。

约束:保留用户的真实语气和业务边界;把事实、推断与建议分开;涉及日期、价格、版本、法规或安全的内容写明来源和采集时间。

使用说明

  1. 评分前固定标准和样本,避免看到结果后改规则。
  2. 总分不能覆盖硬性事实错误和安全失败。

适用判断

适合这些情况

  • 有多个提示词版本要选,需要给出结论。
  • 要向他人说明为什么选这个版本。
  • 需要记录评审结果供后续参考。

换个做法更好

  • 你要先定评价维度:用《提示词评审量规》。
  • 只有一个版本:评分没有对照意义。
  • 决策依据是实测数据:直接看数据比打分可靠。

常见翻车与修正

  • 给出了分数但没说依据,看不出为什么这么打。

    要求每项分数附具体证据,指出提示词里的哪一处支撑了这个分数。

  • 总分接近但推荐结论很绝对,看不出取舍。

    要求说明各版本的优劣分布,分数接近时指出取舍取决于什么条件。

  • 评分基于模型对提示词的推测,没有实际运行结果。

    要求区分「基于文本判断」和「基于实测」的项,未实测的明确标注,不能当作实测结论用。

怎么判断输出合格

  1. 每项分数有具体证据,指向提示词的对应位置。
  2. 分数接近时说明了取舍条件。
  3. 区分了文本判断和实测结论。
  4. 推荐结论和分数一致,没有自相矛盾。

使用边界

  • 基于文本推测的评分和实测结论要分开标注,混在一起会让决策依据变得不可靠。
  • 评分卡不覆盖安全和合规维度,涉及对外场景的提示词需要额外专项评审。