为什么很多人觉得 Opus 5 反而不好用

围绕 HN 热帖:Opus 5 基准更强却更爱瞎猜,从「不问清就改计划」解释手感落差,并给出工作流上的应对。

为什么很多人觉得 Opus 5 反而不好用

2026-08-14 前后,一篇 Why does Opus 5 feel worse to work with? 冲上 HN 热榜。作者不否认 Opus 5 更强,甚至能在部分基准上逼近 Fable,但和同事体感一致:相对 Opus 4.7 / 4.8 乃至 Fable,日常写代码时更累。核心抱怨不是「写不出来」,而是「不问就猜、不问就改计划」。

作者CodePass 技术编辑

手感差在协作,不在裸能力

文中把「好用的 coding agent」写成三件事:意图不清时停下提问;不擅自假设;不偷偷改写你的计划。Opus 5 被指在这三点上更弱,于是需要更多 babysitting。基准分数可以同时上升:榜上任务大多自包含、有可打分答案,奖励的是「面对歧义大胆做通常正确的假设」;真实工程却充满未写进仓库的业务约束与预算。选模型时若只看榜,就会和手感打架。版本参数差异是另一篇文章的话题;本文只谈「为什么更强却更烦」。

作者的两条猜测(标明是推测)

作者自己写了 Baseless speculation:实验室既想要能自我迭代的 agent,又要在基准上好看;RLVR / 榜上任务天然惩罚「停下来问人」。这不是 Anthropic 官方复盘,但解释了为何社区会同时喊「更强」和「更差用」。HN 评论区大量共鸣也落在「别替我做产品决策」上。

工作流上怎么缓冲

  • 计划阶段强制 Plan / 先输出方案再改代码,歧义处写成 checklist 让模型勾选而不是默默实现。
  • 关键明「不确定就问,禁止擅自改目录结构 / 依赖 / API」。
  • 低歧义苦力活可以继续用 Opus 5 吃能力;高歧义产品改动,回退到你团队手感更好的 4.8 / Fable 并不丢人。
  • 中途换模型会冲掉 prompt cache,官方会话省钱文已警告;换模放在新会话或 /clear 后更便宜,详见同日相关话题。

基准与体感分裂会越来越常见。采购或个人选模时,留一天真实 PR 试驾,比多看一张雷达图管用。