SGLang 发布 0.5.21,合并了来自 227 位贡献者的 779 个 PR。新增支持同时覆盖语言和图像模型,包括 DeepSeek-V4.1 Flash、MiMo-V2.6 系列、Ling-3.0-flash-VL、Qwen-Image 2.1、Anima Base 与 FLUX 3 Action,项目为主要模型提供了对应部署说明。
推理服务的一项变化是,预填充与解码实例可以在运行过程中切换角色,不必重启。前缀缓存默认使用 Rust 核心,针对 DeepSeek 长提示词、Kimi K3 的预填充分离部署也做了性能优化。官方列出的提升数字依赖具体配置,不能直接当作所有显卡上的统一加速比例。
硬件支持继续向 AMD 延伸,GLM-5.3-Flash 在 MI355X 上加入 FP8、MXFP4 混合专家以及多 token 预测推测解码路径。对自建模型服务的团队,这次更新同时涉及模型加载、缓存和请求处理,升级时应先对照所用模型的 Cookbook 与既有启动参数。已经稳定运行的实例可以挑与自身模型相关的改动安排升级。