Z.ai 于 9 月 27 日发布 GLM-5.3-Flash,并称这是 GLM-5 系列首个原生多模态模型。模型总参数量为 320B、每次推理激活 18B 参数,支持文本、图片、视频和文件输入;官方列出的上下文长度最高为 100 万 token。
Z.ai 表示,模型权重已按 MIT License 开放,并列出 SGLang、vLLM 和 TokenSpeed 等推理框架。厂商称新架构结合稀疏注意力与线性注意力,目标是在复杂任务、工具调用和视觉理解中降低推理开销。
GLM-5.3-Flash 的榜单分数、计算量和服务性能来自 Z.ai 自己公布的评测与部署数据,不是第三方横向测试。实际结果仍取决于显卡、量化方式、推理框架和任务提示;团队下载前应核对模型仓库中的许可、显存需求和支持状态。