MLCommons 9 月 16 日公布 MLPerf Inference v6.1 结果。本轮加入两个反映新型部署方式的测试:数据中心的 End-to-End RAG,以及边缘侧的 Agentic Edge Inference。整套结果覆盖数据中心和边缘推理,让采购方可以比较多步骤 Agent 和检索增强流程中的系统表现。
MLCommons 称,本轮共有 30 家提交方、120 套系统,最高性能相较一年前提升 5.7 倍。该组织把 MLPerf 定义为架构中立、可复现的系统性能基准,结果可用于理解硬件、软件和能源效率之间的取舍。
这些数字描述的是特定测试集、模型、精度和系统配置,不能直接换算成任意 Agent 的业务速度。对于真实部署,企业仍应同时测量首 token 延迟、端到端成功率、检索质量、工具调用失败、能耗和单位任务成本。