AI 代码审查有多准(2026):我们埋了 9 个缺陷——四个工具找到、漏掉和编造了什么
10分钟阅读已审核
我们当前公开的是两个完成的本地 CLI 结果,不是排行榜。在固定的九缺陷 PR 上,Claude Code 找到 8/9,GitHub Copilot CLI 找到 5/9。两份响应各有一条发现被 fixture 台账判定为误报。
直接答案:准确率至少有两个维度——种子缺陷召回率与经判定的误报。团队把 AI 发现变成改动前,两个维度都必须对照代码检查。
固定 fixture 上的完成结果
| 完成的评审器 | 种子缺陷检出 | 经判定的误报 |
|---|---|---|
| Claude Code 2.1.117 | 8/9 | 1 |
| GitHub Copilot CLI 1.0.70 | 5/9 | 1 |
如何处理可能的误报
貌似合理的解释并不够。检查被报告的行,明确它会破坏的产品行为,并在改代码前写出复现测试。两个完成运行中的误报都涉及 fixture 有意保留的批量大小行为;标准答案台账解释了它为什么不是缺陷。
范围与限制
Codex CLI 与 Cursor Agent 在只读非交互尝试中没有生成审查输出,因此这里没有它们的公开分数。我们没有测试 PR 集成的 SaaS 审查产品,而且每个 CLI 工具一次运行不能预测生产表现。用于采购或合并策略前,请在自己的仓库重跑该协议。
来源核验 2026-07-11:固定种子 PR fixture、运行前标准答案台账和两份完成运行记录(Claude Code 2.1.117 与 GitHub Copilot CLI 1.0.70)。下次复检 2026-08-09。
来源与证据
来源
- Claude Code 文档核验 2026-07-11中等变化
仅用于 Claude Code 产品定位;评测结果来自已归档运行记录。
- GitHub Copilot 计划核验 2026-07-11高变化
仅用于 Copilot 套餐和产品背景;评测结果来自已归档运行记录。
证据
- 基准测试核验 2026-07-11
两个完成的本地 CLI 运行,使用同一份含九个缺陷的固定 fixture。它不是 PR 集成审查产品排名,也不是通用性能结论。
方法论
方法论下次复检: 2026-08-09