返回快讯列表
开源生态

vLLM v0.28.0 发布,默认批处理 token 数翻倍,bitsandbytes 移出主仓

vLLM 8 月 26 日发布 v0.28.0,含 584 个提交和 270 位贡献者,max_num_batched_tokens 默认值从 8192 提到 16384,bitsandbytes 支持改为仓外插件。

vLLM 8 月 26 日发布 v0.28.0,含 584 个提交、270 位贡献者,其中 76 位是第一次提交。

默认值动了几处。max_num_batched_tokens 从 8192 提到 16384,Blackwell 平台的 CUDA graph capture 默认值提到 1024,Mamba 类模型默认开启前缀缓存。

破坏性变更有两条要注意。bitsandbytes 支持从主仓移出,改成仓外插件。calculate_kv_scales 和 override_attention_dtype 两个参数被删除。依赖上升到 Transformers 5.15.0 和 huggingface-hub 1.27.0,ROCm 侧走 torch 2.12 加 triton 3.7,默认 Docker 镜像换成 CUDA 13.0,运行时基础镜像升到 Ubuntu 24.04。

性能改动集中在 Kimi-K3。合并 all-gather 带来 kernel 级 1.5 到 3 倍加速,自适应投机 token 预算让 DSpark 的首 token 时间改善约 60%,可选的共享专家分片每卡省约 17 GiB 显存。另有两条安全修复,一条是音频采样率伪造绕过解码时长限制造成的拒绝服务,一条给 _load_ov2_processor 加了远程代码信任的护栏。文档新增一条警告,--api-key 并不能保护全部端点。

这份说明没有给 v0.27 到 v0.28 的端到端吞吐或延迟对比,性能数字都是单点 kernel 级或单模型场景,默认批处理 token 数翻倍之后显存占用怎么变也没有实测数据。

更多快讯