Vercel 7 月 31 日宣布 AI Gateway 的统一 fast mode 进入 beta。开发者可以在 providerOptions.gateway 中把 speed 设为 fast,让网关在模型存在快速服务层时自动路由过去;如果当前模型没有 fast tier,请求会按标准速度执行。也可以直接使用带 fast 后缀的模型 slug,把快速变体明确写入模型或回退列表。
这一抽象的价值是用同一个配置表达低延迟或高吞吐诉求,不必为每个提供方维护独立参数。官方同时提醒,快速变体通常比基础模型更贵,且请求 fast mode 并不保证一定进入快速层;调用方应读取 gateway 路由元数据并结合价格表确认实际服务路径,不能只以客户端配置推断结果。
对生产系统而言,fast mode 应当被当作延迟与成本策略,而不是模型能力升级。上线前应分别记录首 Token 延迟、总耗时、回退比例、任务成功率和单次成功成本,并为费用敏感或必须稳定延迟的路径设置明确告警。该能力仍为 beta,接口和支持模型范围也需要随官方文档复核。