AI 代码审查有多准(2026):我们埋了 9 个缺陷——四个工具找到、漏掉和编造了什么

AI 编程2026-07-11YixScout 编辑团队最近审核: 2026-07-11 YixScout 编辑团队
10分钟阅读已审核

我们当前公开的是两个完成的本地 CLI 结果,不是排行榜。在固定的九缺陷 PR 上,Claude Code 找到 8/9,GitHub Copilot CLI 找到 5/9。两份响应各有一条发现被 fixture 台账判定为误报。

直接答案:准确率至少有两个维度——种子缺陷召回率与经判定的误报。团队把 AI 发现变成改动前,两个维度都必须对照代码检查。

固定 fixture 上的完成结果

完成的评审器种子缺陷检出经判定的误报
Claude Code 2.1.1178/91
GitHub Copilot CLI 1.0.705/91
每个列出的 CLI 工具各一次完成运行,核验日为 2026-07-11。这是可复现 fixture 的观察,不是产品排名。

如何处理可能的误报

貌似合理的解释并不够。检查被报告的行,明确它会破坏的产品行为,并在改代码前写出复现测试。两个完成运行中的误报都涉及 fixture 有意保留的批量大小行为;标准答案台账解释了它为什么不是缺陷。

范围与限制

Codex CLI 与 Cursor Agent 在只读非交互尝试中没有生成审查输出,因此这里没有它们的公开分数。我们没有测试 PR 集成的 SaaS 审查产品,而且每个 CLI 工具一次运行不能预测生产表现。用于采购或合并策略前,请在自己的仓库重跑该协议。

来源核验 2026-07-11:固定种子 PR fixture、运行前标准答案台账和两份完成运行记录(Claude Code 2.1.117 与 GitHub Copilot CLI 1.0.70)。下次复检 2026-08-09。

来源与证据

来源

  • Claude Code 文档
    核验 2026-07-11中等变化

    仅用于 Claude Code 产品定位;评测结果来自已归档运行记录。

  • GitHub Copilot 计划
    核验 2026-07-11高变化

    仅用于 Copilot 套餐和产品背景;评测结果来自已归档运行记录。

证据

  • 基准测试核验 2026-07-11

    两个完成的本地 CLI 运行,使用同一份含九个缺陷的固定 fixture。它不是 PR 集成审查产品排名,也不是通用性能结论。

    方法论
方法论下次复检: 2026-08-09

相关资源指南