Ai2 在 9 月 1 日发布 BenchMIRT,一套按单题而非总分来审 LLM 基准的方法。它把心理测量学里的项目反应理论扩展到多维,从而把叠在同一道题上的多种能力拆开,同时估计模型在各潜在能力上的水平,以及每道题的难度和区分度。
数据是 100 个 LLM、16 个基准、超过 3.4 万道题,模型都在 2025 年 3 月前发布。基准包含 MMLU-Pro、GPQA、MATH、BBH 等六项推理测试,以及 Olmo 3 安全套件里的十项。能力标签没有事先给定,方法自己收敛出安全和通用推理两个主导维度,重复运行结果稳定。
错位集中在几处。通常归入安全类的 BBQ,实际更贴近通用推理,分数低可能只是题目难懂,与行为是否安全无关。WMDP 同样偏推理,而且关系是反的,推理越强 WMDP 分数越低,因为拒答才算答对。HarmBench 内部,标准题和情境题对齐安全,版权类请求对齐推理。WildJailbreak 的有害题归安全,良性的过度拒绝题归推理,一个平均分把两者糊在一起。
收益的量化有两个数字。只保留 10% 的题目,模型在对应能力上的排名基本不变,保留一半则更贴近全集。预测模型能否答对留出题的准确率是 79%,把每题表现等同于整体表现的基线是 70%。作者把这些归为解释问题而非基准缺陷,技术报告、数据集和代码都已公开。