GitHub 在 10 月 5 日发布 ReviewBench,专门评估 AI 代码审查 Agent。基准从 1.039 亿个真实 Pull Request 的语言、仓库规模和改动分布中抽样,当前数据集包含 219 个来自 187 个开源仓库的 PR,覆盖 19 种语言。
每条发现都按严重程度和问题类别标记,真值集合来自人工审查、作者后续修复、静态分析和多种前沿模型,再经过语义去重与统一规则判断。除了 grounded precision/recall,ReviewBench 还把没有匹配旧真值、但经评审可能成立的新发现纳入 augmented 指标。独立工程师复标与基准判断的一致率为 96.6%。
GitHub 用它评估 Copilot Code Review,并称一次线上实验与离线方向一致:addressed rate 增长 8.0%、recall 增长 13.6%、评论数增长 61%、单次成本下降 8.0%。这些是 GitHub 自己的实验结果,不是所有审查 Agent 的普遍保证。开发者可以下载数据与评分器,对自己的审查系统做独立对比。