Hugging Face 在 9 月 1 日发布 @huggingface/kernels,一个从 Hub 取用并执行优化过的 WebGPU 内核的 JavaScript 库,同时放出配套的内核仓库。
出发点是 WebGPU 只保证 API 可移植,速度并不跟着可移植。同一个算子的两份着色器输出一致,在不同加速器上的表现却可能差很远,最优选择随输入形状、设备、浏览器和特性支持而变。把内核做成可发现、可测试、可基准、可版本化的单位之后,底层能持续改进而上层 API 不动。
规模是 207 个内核,每个自成一个仓库,挂在 webgpu-kernels 组织下,覆盖矩阵乘、归一化、卷积、注意力原语、量化和布局变换。每个仓库带算子契约、标识与来源、正确性用例、基准用例,以及参数化的 WGSL 着色器模板,全部按 Apache 2.0 授权。安装是 npm install @huggingface/kernels@preview,取用靠 getKernel 传仓库 ID 和契约版本。
基准跑在 Apple M4 GPU 上,对手是 ONNX Runtime Web 的一个 2026 年 8 月 26 日构建。1756 个初始用例里,809 个输出一致且计时可靠,几何平均加速 2.57 倍,中位数 1.90 倍,629 胜 176 负 4 平。Add 是 3.52 倍,Softmax 2.11 倍,LayerNormalization 2.22 倍,MatMul 只有 1.14 倍。官方标明计时只算 GPU 计算,不含内核加载、会话创建、输入上传、着色器编译和回读,也只覆盖单算子而非整模型。