提示词工程 编辑复核
推理模型的提示词适配改写
把为普通模型写的逐步思考和多示例提示词改成适合推理模型的写法,改用目标描述、输出格式和思考预算。
PROMPT WORKBENCH
复制后替换变量
保留结构,先填真实信息,再把结果交给模型运行。
你是一名提示词迁移工程师。请把面向普通模型的提示词改写成适合推理模型的版本,删掉多余的思维引导,并说明每处改动的理由和验证方式。
先把已知事实、合理假设和待核验信息分开;资料不足时写“待验证”,不要为了完整而猜测。
请按以下结构输出:
1. 标出逐步思考、先分析再回答一类的过程指令并评估是否还需要
2. 判断每个示例是在传递格式还是在传递解法,只保留格式类示例
3. 把过程描述改写成目标、约束和验收标准
4. 给出思考预算或推理强度的取值建议和调整依据
5. 设计同题对比测试,比较改写前后的正确率、长度和成本
输入变量:
- 原提示词({{source_prompt}}):提供当前提示词全文,包含示例和过程指令。
- 目标模型({{target_model}}):说明要迁移到哪个模型以及思考模式如何设置。
- 任务类型({{task_type}}):说明任务是推理、抽取、生成还是格式转换。
- 质量标准({{quality_bar}}):给出可判定对错的验收标准和当前基线。
约束:保留原始上下文和限定条件;每个结论都说明依据;涉及个人资料、合同、财务、医疗或安全信息时先提示脱敏和人工复核。HOW TO USE
使用说明
- 先只删过程指令跑一轮,再动示例,这样能定位到底是哪一项影响了结果。
- 推理模型在结构化输出上更容易跑偏,格式要求写在末尾并给出空值和拒答的写法。
WHEN IT FITS
适用判断
适合这些情况
- 把老提示词搬到带思考模式的模型上,效果反而下降。
- 想弄清楚示例和逐步指令是不是拖累了推理模型。
- 需要在准确率和推理成本之间选一个档位。
换个做法更好
- 目标是横向比较多家模型的兼容性:用跨模型迁移评审。
- 只是示例选得不好:用示例集设计模板重做示例。
- 没有可判定对错的验收标准:先建测试集,否则无法比较。
FAILURE MODES
常见翻车与修正
- 删掉过程指令后输出变短,但格式也一起丢了。
把格式要求单独放在提示词末尾,并保留一个只演示格式的最小示例。
- 提高推理强度后延迟和成本翻倍,正确率没变。
按强度分档做对比测试,选择正确率不再提升的最低档位。
ACCEPTANCE
怎么判断输出合格
- 每处删改都有理由和对应的验证项。
- 保留的示例只承担格式作用。
- 思考预算建议附带对比数据。
- 改写前后在同一测试集上可比较。
SAFETY BOUNDARY
使用边界
- 不要要求模型把完整思考过程输出给终端用户,思考内容可能包含未经核实的中间猜测。
- 迁移后重跑安全与拒答用例,思考模式可能改变原有的边界判断。