返回快讯列表
大模型前沿

智谱开源 GLM-5.3-Flash,官方确认它就是匿名霸榜的 ox-alpha

智谱开源 GLM-5.3-Flash,3200 亿总参数、180 亿激活、45 层,官方文档确认它此前以匿名代号 ox-alpha 在 OpenCode 和 OpenRouter 上做过预发布测试,权重以 MIT 许可放出。

智谱把 GLM-5.3-Flash 的权重放到了 Hugging Face 上,许可证 MIT。规格是 3200 亿总参数、180 亿激活、45 层,官方文档拿 GLM-4.5 做对比,那一代是 3550 亿参数、320 亿激活、92 层。

架构是稀疏注意力加线性注意力的混合,文档称这是首个采用该组合的开源前沿模型。线性注意力靠状态建模处理局部依赖,稀疏注意力用轻量索引器取全局上下文,另外有 IndexPool 把四个索引器 key 向量加权池化成一个,以及 Manifold-Constrained Hyper-Connections。相对 GLM-5.3,注意力计算量降 3.01 倍,KV cache 降 4.44 倍。预训练语料 30T token,原生多模态,支持文本、图片、视频和文件,上下文 100 万 token。思考模式关不掉,thinking.type 只接受 enabled。

文档里主动写明了一件事,这个模型此前以匿名代号 ox-alpha 在 OpenCodeOpenRouter 上做预发布测试,当周成了最受欢迎的模型,推理服务跑在国产 AI 芯片上,用的是基于 SGLang 的编码、预填充、解码分离架构加 W8A8 量化,端到端性能相对初始基线提升三倍。

跑分方面,DeepSWE v1.1 拿 63.4,GLM-5.2 是 46.2;AutomationBench 48.8 对 26.2;Z.ai Code Bench v1.0 在 max 档 29.0,Claude Opus 4.8 是 29.5。Artificial Analysis 的智能指数 v4.1.1 给 57 分,官方标注每任务 0.045 美元,为折后价。

有两处官方没给。一是发布日期,文档页面没有标注,8 月 26 日是按 Hugging Face 上的权重提交时间和 GitHub 仓库的合并时间推算的。二是 API 定价,官方只给了每任务成本,没有公布每百万 token 的价目。

更多快讯