返回快讯列表
开发者动态

MLPerf Inference v6.1 首次加入 Agentic 与端到端 RAG 工作负载

MLCommons 发布 Inference v6.1 结果,新增 End-to-End RAG 和 Agentic Edge Inference,并称本轮最高性能较一年前提升 5.7 倍。

MLCommons 9 月 16 日公布 MLPerf Inference v6.1 结果。本轮加入两个反映新型部署方式的测试:数据中心的 End-to-End RAG,以及边缘侧的 Agentic Edge Inference。整套结果覆盖数据中心和边缘推理,让采购方可以比较多步骤 Agent 和检索增强流程中的系统表现。

MLCommons 称,本轮共有 30 家提交方、120 套系统,最高性能相较一年前提升 5.7 倍。该组织把 MLPerf 定义为架构中立、可复现的系统性能基准,结果可用于理解硬件、软件和能源效率之间的取舍。

这些数字描述的是特定测试集、模型、精度和系统配置,不能直接换算成任意 Agent 的业务速度。对于真实部署,企业仍应同时测量首 token 延迟、端到端成功率、检索质量、工具调用失败、能耗和单位任务成本。

更多快讯