提示词工程 编辑复核
评委模型的偏差审计与校准
用对照实验检查评委模型的位置、长度和同源偏好,再与人工标注对齐,判断这套评分能否用作上线门禁。
PROMPT WORKBENCH
复制后替换变量
保留结构,先填真实信息,再把结果交给模型运行。
你是一名模型评测方法设计者。请设计能量化评委模型偏差的对照实验,并给出与人工标注的一致性判断,不要用单轮打分结果直接下结论。
先把已知事实、合理假设和待核验信息分开;资料不足时写“待验证”,不要为了完整而猜测。
请按以下结构输出:
1. 抽取一批真实样本,覆盖易判、边界和有争议三类难度
2. 设计交换顺序、控制长度和隐藏模型来源的对照条件
3. 让两到三名标注者独立标注同一批样本并计算标注者之间的一致性
4. 比较评委得分与人工标注的一致性,列出分歧样本
5. 按结果修正评分维度、分档说明和锚点示例,并给出复测计划
输入变量:
- 评委提示词({{judge_prompt}}):提供当前使用的评分提示词和评分区间。
- 样本来源({{sample_pool}}):说明样本从哪来、数量和难度分布。
- 人工标注({{human_labels}}):给出已有的人工标注结果或标注规则。
- 评分用途({{decision_use}}):说明这个分数要用来做什么决策。
约束:保留原始上下文和限定条件;每个结论都说明依据;涉及个人资料、合同、财务、医疗或安全信息时先提示脱敏和人工复核。HOW TO USE
使用说明
- 成对比较通常比绝对打分稳定,需要绝对分时给每个分档配锚点示例。
- 换评委模型要当成一次评测迁移重新校准,不能只当作配置改动。
WHEN IT FITS
适用判断
适合这些情况
- 自动评分和人工感受经常对不上。
- 要把模型评分接入发布门禁,需要先证明它可靠。
- 更换评委模型后需要重新确认可比性。
换个做法更好
- 还没有评分维度:先设计评测量规再谈偏差。
- 只是想比较两个提示词版本的行为差异:用回归测试集更直接。
- 样本不足几十条:先补样本,小样本上的一致性没有意义。
FAILURE MODES
常见翻车与修正
- 交换候选顺序后结论翻转。
对每对样本做正反两次评分,只保留两次一致的结果,其余转人工裁定。
- 分数集中在中间档,区分不出好坏。
收窄分档数量并为每一档提供正反锚点示例,要求先给判断依据再给分。
ACCEPTANCE
怎么判断输出合格
- 偏差测试覆盖顺序、长度和来源三类条件。
- 报告标注者之间与评委对人工的一致性数值。
- 分歧样本可回溯到具体样本和评分理由。
- 修正后的评委提示词附带复测计划。
SAFETY BOUNDARY
使用边界
- 不要用被测模型给自己打分,同源偏好会系统性抬高分数。
- 标注样本可能含用户真实内容,进入评测集前先脱敏并确认使用授权。