提示词工程 编辑复核

评委模型的偏差审计与校准

用对照实验检查评委模型的位置、长度和同源偏好,再与人工标注对齐,判断这套评分能否用作上线门禁。

场景:用模型给模型打分的自动评测和发布前质量门禁输出:偏差测试设计 + 一致性结果 + 修正后的评委提示词更新于 2026-09-01

复制后替换变量

保留结构,先填真实信息,再把结果交给模型运行。

你是一名模型评测方法设计者。请设计能量化评委模型偏差的对照实验,并给出与人工标注的一致性判断,不要用单轮打分结果直接下结论。

先把已知事实、合理假设和待核验信息分开;资料不足时写“待验证”,不要为了完整而猜测。

请按以下结构输出:
1. 抽取一批真实样本,覆盖易判、边界和有争议三类难度
2. 设计交换顺序、控制长度和隐藏模型来源的对照条件
3. 让两到三名标注者独立标注同一批样本并计算标注者之间的一致性
4. 比较评委得分与人工标注的一致性,列出分歧样本
5. 按结果修正评分维度、分档说明和锚点示例,并给出复测计划

输入变量:
- 评委提示词({{judge_prompt}}):提供当前使用的评分提示词和评分区间。
- 样本来源({{sample_pool}}):说明样本从哪来、数量和难度分布。
- 人工标注({{human_labels}}):给出已有的人工标注结果或标注规则。
- 评分用途({{decision_use}}):说明这个分数要用来做什么决策。

约束:保留原始上下文和限定条件;每个结论都说明依据;涉及个人资料、合同、财务、医疗或安全信息时先提示脱敏和人工复核。

使用说明

  1. 成对比较通常比绝对打分稳定,需要绝对分时给每个分档配锚点示例。
  2. 换评委模型要当成一次评测迁移重新校准,不能只当作配置改动。

适用判断

适合这些情况

  • 自动评分和人工感受经常对不上。
  • 要把模型评分接入发布门禁,需要先证明它可靠。
  • 更换评委模型后需要重新确认可比性。

换个做法更好

  • 还没有评分维度:先设计评测量规再谈偏差。
  • 只是想比较两个提示词版本的行为差异:用回归测试集更直接。
  • 样本不足几十条:先补样本,小样本上的一致性没有意义。

常见翻车与修正

  • 交换候选顺序后结论翻转。

    对每对样本做正反两次评分,只保留两次一致的结果,其余转人工裁定。

  • 分数集中在中间档,区分不出好坏。

    收窄分档数量并为每一档提供正反锚点示例,要求先给判断依据再给分。

怎么判断输出合格

  1. 偏差测试覆盖顺序、长度和来源三类条件。
  2. 报告标注者之间与评委对人工的一致性数值。
  3. 分歧样本可回溯到具体样本和评分理由。
  4. 修正后的评委提示词附带复测计划。

使用边界

  • 不要用被测模型给自己打分,同源偏好会系统性抬高分数。
  • 标注样本可能含用户真实内容,进入评测集前先脱敏并确认使用授权。