通义千问 8 月 26 日开源了 Qwen3.8-Flash-Next。README 的 News 段落把它定位成 Qwen4 所用架构的早期预览,理由是让社区在完整的 Qwen4 家族建起来之前先检视这些改动,参照的是当年 Qwen3-Next 预告 Qwen3.5 的做法。
参数拆成两块,主模型 1250 亿,另有独立的 510 亿 N-gram 嵌入表,每个 token 激活 60 亿。架构上列了四处改动。注意力是 GDN 加 QSA 的混合,Gated DeltaNet 压缩历史,Qwen Sparse Attention 用轻量索引器在微块粒度上挑重要上下文。残差流拓成四条分支,由动态门控管读写。N-gram 嵌入表做基于上下文的查表来廉价加容量,可以放在主机内存里异步预取。优化器换成 Muon,并为新架构重新拟合了 scaling law。
成本口径写得很直接,相比 Qwen3.7-Plus,训练开销只有约九分之一,同时编码和办公任务上表现更好。
部署门槛不低。vLLM 官方 recipes 页面标注 8 月 26 日更新,要求 vLLM 0.28.0 以上,而且必须用专用容器镜像,页面明写这套配方不支持 PyPI 安装。FP8 权重 172.78 GiB,BF16 是 335.28 GiB,开 N-gram 卸载还要至少 51 GB 主机内存,且目前只在 NVIDIA 设备上可用。八张 H200 要走 TEP8 配 Triton MoE 后端,页面提示普通 TP8 与 FP8 权重不兼容,原因是权重用了 128 宽的量化块。上下文原生 262144,可用静态 YaRN 往一百万扩。
官方还没有公开这一版的跑分。README 没有列基准成绩,只说评测结果发在 qwen.ai 的博客上。