Sonnet 5.5 在 AA 上输出 token 很高

Artificial Analysis 写 Claude Sonnet 5.5 智能指数 56 分,只比 Opus 5.5(max)低 2 分。max 努力档每个指数任务约 19.3 万输出 token,任务花费 7.60 美元,约比他们测的 Sonnet 5 高 50%。样本是修复结构化输出问题之前的预发布版本。

Sonnet 5.5 在 AA 上输出 token 很高

Artificial Analysis 在 2026 年 9 月 28 日写:Claude Sonnet 5.5 在他们的智能指数上得 56 分,max 努力档比 Sonnet 5 高 18 分,排在第二,只比 Opus 5.5(max)低 2 分。claude sonnet 5.5 输出 token 在同一测里达到他们见过的最高一档:max 努力档每个智能指数任务大约 19.3 万输出 token,大约比 Opus 5.5(max)或 Sonnet 5(max)高 60%,大约是 GPT-6 Astra(max)的 7 倍。按这个用量,每个指数任务花费 7.60 美元,大约比他们测到的 Sonnet 5 高 50%。

作者:CodePass 技术编辑

和官方「更少 token」不是同一张表

Anthropic 发布页写大多数工作最多便宜 30%,原因是同样的工作通常用更少 token,单价仍是输入 2 美元、输出 10 美元。单价对照见 Sonnet 5.5 多少钱。Artificial Analysis 写的 50% 更高,比较的是他们智能指数任务在 max 努力档上的花费,分母里输出 token 变多。两句可以同时成立:日常短任务更省,把努力档拉到 max 去刷这套指数则更费。不要用 7.60 美元去除以官方的 30%。

他们还写 Terminal-Bench 4.0 上 Sonnet 5.5 是 64%,Opus 5.5 和 GPT-6 Astra 是 60%,并称比 Sonnet 5(max)高 50 个点。Terminal-Bench-Science 是 53%,排在 GPT-6 Astra 和 Opus 5.5 之后,这项目前不进智能指数。AA-Omniscience 事实准确率 54%,Opus 5.5 是 66%;幻觉率 47%,Opus 5.5 是 59%。Humanity's Last Exam 和 SciCode 大约低 6 分。Anthropic 自己公布的 Opus 5.5 Terminal-Bench 数字用的是另一套努力档和样本,不要和这里的 60%、64% 合成一个名次。

这批评测跑在预发布部署上

文章写明:评测用的是预发布部署。Anthropic 发现该部署有一个缺陷,会降低使用结构化输出的请求的回答质量。公开版本已修复。Artificial Analysis 预期分数变化很小,或目前的分数略偏低,并说会重跑相关评测。在重跑出来之前,56 分和 19.3 万输出 token 都带着这个前提。

五个努力档是 low、medium、high、xhigh、max。指数在五档都跑了,并打开了 Anthropic 的默认回退。他们看到大约 0.1% 的指数任务发生回退,主要在 Terminal-Bench 4.0,回退目标都是 Sonnet 5。高努力档在他们的「智能对任务花费」图上更接近前沿;低、中、高三档则落在 GPT-6 Sol 对应努力档后面,Sol 用更少输出 token 拿到更高表现。这是他们图上的相对位置,不是你仓库里的保证。

参考资料