llama.cpp 在 8 月 31 日切出预览版 b10707,改动只有一处循环,对应 PR #28011,标题写的是让 KV cell 的序列扫描在所有序列都被看到之后就停下来。
改之前,for_each_token_in 每处理一个已用 cell,都要把 LLAMA_MAX_SEQ 个序列位挨个检查一遍,而实际情况是一个 cell 几乎总是只属于一个序列。新版本在该 cell 自己的序列都出现过之后立刻退出。发布说明写明访问顺序和回调参数都没变,行为保持一致,get_prev_tokens 又是这段代码唯一的调用方,所以受影响的只有 n-gram 那条路径。
官方给的实测环境是 RTX PRO 6000 配 Qwen3.8-Flash-Next 的 UD-Q4_K_XL 量化,开启 FA 的热运行。55k 上下文下生成速度从 56.3 t/s 涨到 74.3 t/s,132k 上下文从 33.6 t/s 涨到 50.9 t/s。prompt processing 那一侧没有变化,扫描在那里被摊薄进了 ubatch。收益随已用 cell 数量增长,上下文越长越明显,短提示词上根本看不出来。
这个 tag 标着 pre-release,附了 29 个构建产物,覆盖 macOS、Linux、Android 和 Windows,其中 macOS arm64 的 KleidiAI 版本和全部 openEuler 版本标为 DISABLED。