vLLM 0.31.0 在 10 月 5 日发布,包含 717 个提交和 307 位贡献者的工作。版本重点之一是 DeepSeek-V4.1 Flash:在 SM100 上启用 FlashMLA 和 NVFP4 压缩 KV 缓存,并优化稀疏 MQA、专家门控和多 token 预测路径。
新加入的 vllm preload 命令可以让权重缓存守护进程在引擎重启之间保留已经量化的权重,另有 health 接口和 readiness 等待。Model Runner V2 也加入草稿模型推测解码、可自定义 logits processor 等能力。
安全相关变更包括限制每请求传入多模态处理参数,除非明确启用信任开关;前缀缓存对来源和 LoRA 路径做更严格的区分,避免不同请求碰撞。对生产推理服务,升级不只是换一个 Python 包,还涉及 CUDA、量化参数和启动开关,应先在同一批模型与请求上回归延迟、显存和输出。