GPT-5.6 Luna 和 GPT-6 Astra 做 Code Review 选哪个
Entelligence 与 HN 2026 年 9 月讨论:Luna 约 $1.20/次 review 准确率 74%,Astra 约 96% 但贵 2.5 倍。本文帮团队算 false positive 成本与流水线怎么搭。

「便宜模型做 review 够不够?」2026 年 9 月 HN 转 Entelligence 实验:GPT-5.6 Luna 单次 review 约 $1.20,finding 准确率约 74%;GPT-6 Astra 约 2.5× 价格,准确率约 96%。差的不只是账单,而是 false positive 会吃掉工程师读 comment 的时间。线程里也有团队用 Claude Fable 5.1 / Opus 5 多 agent 流水线,称 signal-to-noise 经半年迭代后「incredible」。
怎么算「贵 2.5 倍仍值」
设一个 medium PR 人工读 review comment 成本 15 分钟($50/h 工程师 ≈ $12.5)。
Luna:$1.20 + 26% false positive 带来的额外 15min × 0.26 ≈ $3.2 → 约 $4.4 总期望。
Astra:$3.0 + 4% FP × 15min ≈ $3.45 → 约 $6.45,但漏报(FN)成本未计入。安全/支付类 PR 漏报代价远高于多读几条 FP comment。
结论:非关键路径、量大 churn 的 PR → Luna 或 Sonnet 档足够。Auth、crypto、infra → Astra 或 Fable 5.1 high/xhigh。
比单模型更重要的是流水线
HN 高赞描述的生产 review 栈(可迁移到 Cursor Bugbot / CI):
Pre-script gather context(git diff、依赖、历史 incident)
Domain subagent(OWASP、内部 RFC)
Adversarial validator 二次挑刺
Orchestrator 合并 dedupe
这与 Armature 工具选择实验 一致:Agent 选型 42% 一致,review 栈应写进 rules 而非靠默认 prior。
和 Claude / Codex 怎么配
Claude Fable 5.1:线程称 critical domain 用 fable high/xhigh design review。9/14 周 cap 收紧 后,把 review 放 CI 批处理、开发 session 用 Sonnet 更省。
Codex + Astra:OpenAI 内部软件工厂几乎全 Codex(2026 年 9 月 Pragmatic Engineer 探访),外部团队可 API 化同样结构。
Cursor:review 用 Cloud Agent 或 Bugbot 时选模型池,见 定价双池。OpenAI 11 月断供后 review 若依赖 GPT,需 Override Base URL 或 Codex 扩展。
避免 scope creep 拖垮 review
Astra 做 review 也可能 over-comment。规则里加「只报 severity ≥ medium 且可复现的问题,最多 10 条」。与 GPT-6 Astra 要点 中的 Agent 行为讨论同源。