GitHub 官方博客 ReviewBench: An open benchmark for AI code review(2026-10-05)发布 AI 代码审查离线基准(research preview)。它从 1.039 亿 个 GitHub PR 的分布中抽样,选出 187 个开源仓库、19 种语言的 219 个 PR,golden set 汇集人类评审、多家前沿 LLM 和静态分析三类来源,由 Claude Sonnet 5 担任评审裁判,资深工程师复核一致率 96.6%。排行榜上 Copilot Code Review Balanced 的 grounded recall 为 26.0%,Devin 23.8%,Qodo 22.1%,Cursor 9.6%。数据集、裁判 prompt 和 runner 以 MIT 协议开源在 GitHub。
核心要点速览
- ✓规模:219 个 PR,来自 187 个开源仓库、19 种语言,按 1.039 亿个 GitHub PR 的分布抽样,见 官方博客
- ✓可信度:资深工程师独立复标所有 golden 真阳性,与基准标签一致率 96.6%;裁判模型为 Claude Sonnet 5
- ✓排行榜 grounded recall:Copilot Balanced 26.0%(precision 87.8%)> Devin 23.8% > Qodo 22.1% > Codex GPT-5.6 Sol Ultra 19.9% > Cursor 9.6%
- ✓离线与线上一致:多模型集成审查实验中,线上 A/B 结果为 precision +8.0%、recall +13.6%、单次成本 −8.0%;关键评论数离线预测 +227%,线上实测 +262%
- ✓提交流程:自带容器镜像和模型 key,先跑 25 PR 测试集,再跑全量 219 PR(3 轮);仓库 review-bench/ReviewBench 为 MIT 协议

开发者 3 秒速决决策指标
把技术选型换算成你的开发预算
40 款主流编程套餐横向比价,支持输入/输出 Token 真实账单模拟
相关资源与官方项目出处
免代理直达深度技术解析与实战评估
核心背景与行业痛点
AI 代码审查已经常见:Copilot、Claude Code、Devin、Qodo、Greptile 等都在 PR 上自动留评论。但各家都只公布自己的指标,很难回答「哪个审查器在我的仓库里漏得少、噪音少」。GitHub 在 官方博客 中指出,现有基准往往要在标注质量、覆盖面和真实代表性之间取舍,因此推出 ReviewBench(research preview)。
架构亮点与底层机制
- 语料取样:分析 1.039 亿个 GitHub PR 的分布后,选出 187 个开源仓库、19 种语言的 219 个 PR。PR 规模刻意向中大型多文件改动倾斜,减少单文件小改动的占比。
- golden set 来源:人类评审意见、作者后续修复提交中推断出的问题、静态分析、多家前沿 LLM。先做语义去重,再按统一 rubric 判定,只有真实、相关、非琐碎的发现才计为真阳性。
- 两类指标:Grounded 指标只对照已有标签,用于横向比较;Augmented 指标会让裁判(Claude Sonnet 5)判断 golden set 之外的新发现,审查器发现新问题也能得分。结果可按严重度、类别切分,也能调 Fβ 中的 β 来偏重召回或精度。
权威 Benchmark 与实测跑分对比
review-bench.ai 排行榜(grounded):Copilot Code Review Balanced 召回 26.0%、精度 87.8%;Devin 召回 23.8%;Qodo 召回 22.1%;Codex GPT-5.6 Sol Ultra 召回 19.9%;Cursor 召回 9.6%、精度 87.7%。可见各家精度都在 84–90%,差距主要在召回。需要注意:基准由 GitHub 自己构建,自家 Copilot 排第一,第三方复现之前应保持审慎。GitHub 自报离线与线上方向一致,多模型集成实验线上 recall +13.6%,单次成本 −8.0%。
开发者实战落地与开箱指南
- 用 GitHub 登录 review-bench.ai,注册审查器:提供容器镜像(按 digest 引用)、配置和你自己的模型 key,裁判由官方提供。
- 参考仓库里的 ONBOARDING.md 和
examples/codex-cli示例,先跑 25 PR 测试集调参,再跑全量 219 PR(3 轮)。 - 成绩经维护者审核后才上榜,且只有超过该审查器当前成绩时才会更新。
即刻查看该技术对应模型与主流工具的实测差异,或一键测算团队 API 调用与 $20/月套餐盈亏平衡点。
讨论与评论
0登录后即可参与深度讨论
与广大 AI 开发者、工程师交流评测心得与前沿洞察