提示词工程 编辑复核
提示词跨模型迁移评审
比较同一提示词在不同模型上的输入限制、格式遵循、工具能力和输出差异。
PROMPT WORKBENCH
复制后替换变量
保留结构,先填真实信息,再把结果交给模型运行。
你是一名模型迁移评审员。请根据真实测试和官方限制比较提示词的跨模型表现,不要只凭模型名或网上评价判断。
先区分已知事实、合理假设和待核验信息;没有依据的内容写“待验证”,不要为了完整而猜测。
请按以下结构输出:
1. 任务、输入、输出和工具依赖
2. 上下文、文件、图像和结构化输出差异
3. 同一测试集的质量、稳定性、成本和延迟
4. 需要模型专属适配的部分
5. 默认模型、降级路线和复测条件
输入变量:
- 提示词模板({{prompt}}):提供当前版本、变量和输出契约。
- 候选模型({{models}}):列出模型、版本、地区和调用方式。
- 测试集({{tests}}):提供真实脱敏样本和评分方法。
- 运行限制({{limits}}):说明预算、延迟、隐私和地区要求。
约束:保留用户的真实语气和业务边界;把事实、推断与建议分开;涉及日期、价格、版本、法规或安全的内容写明来源和采集时间。HOW TO USE
使用说明
- 模型版本、价格和限制需要以官方资料和实际调用为准。
- 迁移前保留原模型作为可回退路径。
WHEN IT FITS
适用判断
适合这些情况
- 提示词要在多个模型上运行。
- 考虑更换模型,要评估迁移成本。
- 要减少对特定模型特性的依赖。
换个做法更好
- 只用一个模型且不打算换:可移植性没有价值。
- 你要诊断的是效果下降的原因:用《提示词失效诊断》。
- 模型能力差距太大:可移植性解决不了能力问题。
FAILURE MODES
常见翻车与修正
- 评审基于模型对其他模型能力的推测,结论不可靠。
模型对同类产品的了解常常过时或不准。要求只指出提示词中依赖特定能力的位置,具体是否支持由你实测确认。
- 只检查了功能是否能跑,忽略了输出风格的差异。
要求同时检查格式遵循度、长度倾向和拒答边界的差异,这些换模型后变化最明显。
- 为了兼容所有模型,把提示词降到最低公分母,强模型的效果被浪费。
要求区分核心部分和增强部分,核心保证通用,增强部分按模型能力条件启用。
ACCEPTANCE
怎么判断输出合格
- 只标出依赖点,不臆断各模型的具体支持情况。
- 检查了格式、长度和拒答边界的差异。
- 核心与增强部分分离,不为兼容牺牲效果。
- 给出了迁移后需要实测验证的清单。
SAFETY BOUNDARY
使用边界
- 模型对同类产品能力的描述常常过时或不准,具体是否支持要以实测为准。
- 迁移后的拒答边界和安全行为可能变化,涉及敏感场景的提示词要重新做安全验证。