OpenAI 9 月 22 日公布 GPT-6 提示词缓存更新,重点解决长会话 Agent 反复携带相同指令、工具定义和上下文时的延迟与成本问题。官方称,符合条件的共享前缀可在 30 分钟窗口内继续复用,缓存输入 token 最高可获得 90% 的折扣;具体费用仍以模型、账户和实际缓存命中情况为准。
新的 Prompt Caching Dashboard 可以按时间查看缓存命中率,并把已缓存和未缓存的 token 组成放在一起比较。遇到异常未命中时,诊断工具会对比最近请求,提示模型、工具、设置或输入发生了哪些变化,并估算受影响的 token 数量。开发者还可以设置显式缓存断点、预热稳定上下文,并在不破坏缓存的情况下调整 GPT-6 的推理强度。
对需要长时间运行的 Agent、代码助手和多轮研究应用来说,缓存监控比单纯追求更大的上下文更接近成本控制的实际问题。OpenAI 引用的命中率和成本改善来自合作方的生产案例,不能直接当作所有应用的保证;工具定义顺序、请求内容和模型版本变化仍可能导致缓存失效。