Vercel 9 月 18 日宣布 GLM-5.3 FlashX 接入 AI Gateway,模型标识为 zai/glm-5.3-flashx。它定位为 Z.ai 多模态编程模型的高速服务版本,面向代码 Agent、工具调用循环和需要持续流式输出的交互应用。
Vercel 称该服务的流式推理速度约为每秒 200 token,并提供统一 API、用量和成本追踪、重试、故障转移以及路由配置。支持的编程 Agent 可以通过 Vercel 的网关配置命令接入该模型。
约 200 token/s 是平台公布的服务速度,不代表所有地区、上下文长度和并发条件下都能达到。模型的实时价格、配额和供应商限制仍应以网关页面为准,生产切换前还需要用自己的提示词和工具链测试准确率。