提示词工程 编辑复核

提示词输出质量评分量表

把提示词质量拆成任务完成、事实、格式、稳定性和安全等维度,支持人工和自动评估,不用单个漂亮例子下结论。

场景:提示词版本评估、模型对比和质量门禁输出:评分维度 + 样例集 + 通过门槛更新于 2026-08-03

复制后替换变量

保留结构,先填真实信息,再把结果交给模型运行。

你是一名AI 质量评估工程师。请设计可重复的提示词评估方案,区分输出质量、模型差异、输入难度和人工偏差。

先区分已知事实、合理假设和待核验信息;没有依据的内容写“待验证”,不要为了完整而猜测。

请按以下结构输出:
1. 定义任务成功标准和不可接受行为
2. 设计正常、边界、缺失、冲突和恶意输入样例
3. 为事实、完成、格式、稳定、安全和人工修改成本设评分锚点
4. 确定样本量、评审流程、通过阈值和停止条件

输入变量:
- 提示词({{prompt}}):提供当前版本和变量契约。
- 目标任务({{task}}):说明用户真实要完成的工作。
- 测试集({{test_set}}):提供脱敏样例和历史失败。
- 风险边界({{risk}}):说明隐私、合规、业务和安全要求。

约束:保留用户的真实语气和业务边界;把事实、推断与建议分开;涉及日期、价格、版本、法规或安全的内容写明来源和采集时间。

使用说明

  1. 先固定评估集,再比较模型或版本,避免移动目标。
  2. 评分差异大时记录评审理由,不能只平均数字。

适用判断

适合这些情况

  • 需要一套标准来判断提示词好坏。
  • 多人写提示词,需要统一的评审依据。
  • 要对比多个版本,需要可量化的维度。

换个做法更好

  • 你要的是打分表和结论:用《提示词质量评分表》。
  • 只有一条提示词:直接看输出更快。
  • 评价标准取决于具体业务:通用维度用不上。

常见翻车与修正

  • 维度都是「清晰度」「完整性」这类词,各人理解不同。

    要求每个维度给出可核对的判断依据,比如「是否包含输出格式说明」这种能直接回答是否的问题。

  • 维度太多,评一次要半小时。

    要求维度控制在少数几个,并按重要性排序,先评高权重的,低分直接淘汰不用评完。

  • 评分没有分数含义说明,不同人打的分不可比。

    要求每个分档写明对应的具体表现,评分者能对照判断而不是凭感觉。

怎么判断输出合格

  1. 每个维度有可核对的判断依据。
  2. 维度数量克制,有重要性排序。
  3. 分档有具体表现说明,不同人评分可比。
  4. 说明了什么分数算通过。

使用边界

  • 让模型评价模型的输出会有系统性偏好,高风险场景的评分要有人工复核。
  • 量表只能衡量它定义的维度,安全性和合规性需要单独的专项检查。