返回快讯列表
开发者动态

SageMaker 推出 GPU 感知推理网关,AWS 称首 Token 延迟最高降低 82%

HyperPod Inference Gateway 根据 GPU 缓存、队列和 LoRA 驻留状态选择 Pod,减少推理排队与空闲。

AWS 9 月 18 日推出 Amazon SageMaker HyperPod Inference Gateway。它以 EKS 托管插件部署,在每次请求时读取 GPU 相关信号,而不是只用轮询或最少连接数,把请求发送到更适合的模型服务 Pod。

路由因素包括 KV Cache 使用率、队列深度、LoRA 适配器是否已驻留、前缀缓存命中率和正在运行的请求数量。网关兼容 vLLM、SGLang、TGI 等 OpenAI 兼容服务,AWS 表示无需修改模型服务器或客户端调用方式。

AWS 示例把首 Token 等待从 4.4 秒降到 800ms 以下,并给出最高 82% 的降幅;这些结果属于特定场景,不是所有负载的保证。目前发布的是单集群 Tier 1,跨集群和跨区域的全局路由仍在计划中。

更多快讯