编程开发 编辑复核
LLM 应用评测集与回归基线
把真实用例和线上失败样本整理成可复跑的评测集,定义评分口径和回归阈值,让提示词与模型改动有据可比。
PROMPT WORKBENCH
复制后替换变量
保留结构,先填真实信息,再把结果交给模型运行。
你是一名LLM 应用质量评测负责人。请把给定的功能目标和真实用例整理成可重复执行的评测集,并给出评分口径与回归门槛。
先把已知事实、合理假设和待核验信息分开;资料不足时写“待验证”,不要为了完整而猜测。
请按以下结构输出:
1. 按任务类型、难度和已知失败模式给样本分组,并标注每组的来源
2. 为每条样本写出输入、期望行为和判定要点,区分可自动判分与需人工判分
3. 定义评分规则,说明确定性检查、模型评分和人工抽检各覆盖哪些维度
4. 给出当前基线分数、阈值和判定为回归的判据
5. 输出回归执行方案,包括跑批频率、抽样比例和结果记录方式
6. 列出样本集的已知盲区和后续补充计划
输入变量:
- 应用范围({{app_scope}}):说明这个 LLM 功能的输入、输出和使用场景。
- 真实用例({{real_cases}}):粘贴脱敏后的真实请求、期望结果和线上失败样本。
- 质量标准({{quality_bar}}):说明什么算通过,什么算严重错误。
约束:保留原始上下文和限定条件;每个结论都说明依据;涉及个人资料、合同、财务、医疗或安全信息时先提示脱敏和人工复核。HOW TO USE
使用说明
- 样本要按真实分布取,不要只挑模型已经答对的容易案例。
- 每次改动只动提示词、模型或检索中的一项,否则分数变化无法归因。
WHEN IT FITS
适用判断
适合这些情况
- 功能已上线但每次改提示词都靠人工感觉判断好坏。
- 要升级模型或更换供应商,需要一份可比较的基准。
- 线上出现过失败样本,希望固化成不再复发的检查。
换个做法更好
- 还没有任何真实用例:先收集线上请求和人工标注,再建评测集。
- 只想验证一次改写效果:直接做小规模人工对比即可。
- 需要评估模型本身的通用能力:用公开基准,不要用业务样本代替。
FAILURE MODES
常见翻车与修正
- 评测集只覆盖顺利路径,线上仍然频繁出错。
按线上失败模式补齐对抗样本、越权请求和空数据输入,并单独统计这些分组的通过率。
- 分数每次都在波动,看不出是否发生回归。
固定随机种子、温度和样本顺序,并用多次运行的中位数与波动区间代替单次分数。
ACCEPTANCE
怎么判断输出合格
- 每条样本都有输入、期望行为和判定方式。
- 自动判分与人工判分的边界写清楚了。
- 基线分数和回归阈值可以直接用于发布卡点。
- 样本来源已脱敏,并标注了已知盲区。
SAFETY BOUNDARY
使用边界
- 真实用例入库前移除姓名、手机号、订单号和内部密钥。
- 评分模型给出的结论只作参考,安全、合规和金额相关样本必须人工复核。