Claude Opus 5.5 的编程跑分要分清努力档

发布页上 Terminal-Bench 4.0 的 66.4% 是 xhigh,CursorBench 表内 57.8% 按页注是 max,同页另写默认 medium 为 52.5%。引用时写明努力档,不要把这三格当成同一次设置。

Claude Opus 5.5 的编程跑分要分清努力档

Anthropic 发布页把 Claude Opus 5.5 放在编程榜的第一列。claude opus 5.5 跑分 如果只摘一个百分比,很容易把最高档和默认档接在一起。页注写明:除非另有说明,表内 Opus 5.5 用的是自适应思考的 max;Terminal-Bench 4.0 那一格单独是 xhigh。后文又给了默认档 medium 的另一组数。

作者CodePass 技术编辑

表内最高档

发布页主表(Opus 5.5 / Fable 5.1 / Opus 5 / GPT-6 Astra / GPT-5.6 Sol):

  • Terminal-Bench 4.0:66.4%、55.8%、52.3%、57.9%、37.3%。Opus 5.5 是 xhigh,Astra 是 OpenAI 报告的 high,两边都是各自的最高分。标准误:Opus 5.5 约 ±2.6,其他 Claude 约 ±1.6 到 2。公开榜上 Opus 5 是 51.8%(5 次试验、Claude Code harness),他们复现为 52.3%。
  • FrontierCode v1.1 主集:54.4%、50.3%、48.0%、53.3%、47.5%。
  • CursorBench 4.0:57.8%、51.8%、46.6%、Astra 空、Sol 41.7%。
  • 防护打开时,网络安全任务会改由 Opus 4.8 完成,生物与前沿模型开发任务改由 Opus 5 完成。页注说这可能拉低 Opus 5.5 在这些榜上的分数。

默认 medium 是另一行

同一页后文,默认努力档 medium:

  • FrontierCode:54.6%,高于表里 Astra 的 53.3%,单任务成本大约五分之一。表内 max 是 54.4%,和 54.6% 差 0.2,页面没有解释。引用时带上「表内」或「默认档正文」,不要平均成一个数。
  • CursorBench:52.5%,对比 Fable 5.1 的 max 51.8%、Opus 5 的 max 46.6%,并称比 Sol 的最高分 41.7 高 11 分、成本约三分之一。表内那格 57.8% 不是这句的主语。
  • Terminal-Bench:正文说默认档打平 Astra、成本约四成,没有在这句里重复 66.4%。66.4 只属于 xhigh。

CursorBench 测的是从真实 Cursor 会话抽的、含糊的多文件任务。它不是「Cursor 产品已默认改用 Opus 5.5」。怎么读厂商自报的分,和 Grok 4.7 跑分 同一类问题:先看努力档和是谁测的。

个例不要写进榜

68 万行迁移不到一天、20 万行审计三小时对上 Opus 5 的二十小时,是早期测试者或内部实验的叙述,没有公开任务集。HAProxy 从 C 译到 Rust:两边都通过几乎全部回归测试,Opus 5.5 用 9.5 小时,Fable 5.1 用 12 小时,成本低 51%。这是他们的一次内部测试。GitHub、Lovable、Deloitte 的引言同样是客户或合作方的话,不是独立复现。

选型时用默认档的 52.5% 和 54.6% 去估日常 Agent,用 66.4% 和 57.8% 时标明那是拉满思考。再拉高努力档,token 和账单都会离开「便宜 40%」的默认假设。

防护打开时,网络安全任务改由 Opus 4.8 完成,生物与前沿模型开发任务改由 Opus 5 完成。页注写这可能拉低 Opus 5.5 在相关榜上的分数。所以「第一名」只在发布页标明的那一列、那一档努力上成立。换一个 harness、关掉防护或改成默认 medium,名次可以变。Cursor 文档已经给 Opus 5.5 标了价,那是产品可用性,和 CursorBench 的 57.8% 或 52.5% 不是同一句话。

参考资料