返回快讯列表
大模型前沿

Ai2 用多维项目反应理论审基准,发现 BBQ 更像在测推理

Ai2 于 9 月 1 日发布 BenchMIRT,覆盖 100 个模型、16 个基准、超过 3.4 万道题,只保留 10% 的题目仍能大致保住能力排名。

Ai2 在 9 月 1 日发布 BenchMIRT,一套按单题而非总分来审 LLM 基准的方法。它把心理测量学里的项目反应理论扩展到多维,从而把叠在同一道题上的多种能力拆开,同时估计模型在各潜在能力上的水平,以及每道题的难度和区分度。

数据是 100 个 LLM、16 个基准、超过 3.4 万道题,模型都在 2025 年 3 月前发布。基准包含 MMLU-Pro、GPQA、MATH、BBH 等六项推理测试,以及 Olmo 3 安全套件里的十项。能力标签没有事先给定,方法自己收敛出安全和通用推理两个主导维度,重复运行结果稳定。

错位集中在几处。通常归入安全类的 BBQ,实际更贴近通用推理,分数低可能只是题目难懂,与行为是否安全无关。WMDP 同样偏推理,而且关系是反的,推理越强 WMDP 分数越低,因为拒答才算答对。HarmBench 内部,标准题和情境题对齐安全,版权类请求对齐推理。WildJailbreak 的有害题归安全,良性的过度拒绝题归推理,一个平均分把两者糊在一起。

收益的量化有两个数字。只保留 10% 的题目,模型在对应能力上的排名基本不变,保留一半则更贴近全集。预测模型能否答对留出题的准确率是 79%,把每题表现等同于整体表现的基线是 70%。作者把这些归为解释问题而非基准缺陷,技术报告、数据集和代码都已公开。

更多快讯