Terminal-Bench 排名怎么看:0.4 分差不算依据

Terminal-Bench 排名怎么看:官方榜首 83.8%±1.2%,三方榜给 89.5%。0.4 分差在 89 道题上意味着什么。

Terminal-Bench 排名怎么看:0.4 分差不算依据

榜首两家差 0.4 个百分点,不少人拿这个差值决定接哪家模型。terminal-bench 排名怎么看,第一步是把 0.4 换算成题:全套 89 道,做对一道值 1.12 分,0.4 分连半道都不到。

作者CodePass 技术编辑

0.4 分差在 89 道题上是多少

换算下来是 0.36 道题。Terminal-Bench 2.1 有 89 道容器任务,官方提交规则要求每道跑满 5 次,所以一次完整提交是 445 条 trial。0.4 个百分点摊到题上是 0.36 道,摊到 trial 上是 1.8 次。

更硬的参照是榜单自己印的误差棒。tbench.ai 的 2.1 榜每行分数后面都跟着 95% 置信区间,17 行里最窄的是 ±1.1%,最宽的 ±1.7%。榜单本身承认,同一个 agent 加同一个模型重跑一遍,成绩在两个多百分点的带子里浮动属于正常。0.4 落进这条带子,大概占三分之一的宽度,两条区间重叠成这样,谁在前谁在后取决于哪天跑的。

噪声也有具体来源。Terminal-Bench 2.1 的发布说明写了 2.0 版被改掉的 28 道题:9 道因为容器要联网、外部依赖后来变了;8 道的 CPU、内存或时间预算太紧,连官方参考解都跑不完;还有一批是题面和测试对不上,比如 query-optimize 的说明写 PostgreSQL,测试却按 Spark SQL 判。基础设施自带的漂移就在这个量级上。

官方榜单上没有这两行

2026 年 8 月 4 日翻 tbench.ai 的 terminal-bench 2.1 榜,17 行里既没有 GPT-5.6 Sol,也没有 Claude Opus 5。第一名是 Claude Code 配 Fable 5 的 83.8% ± 1.2%,提交日期停在 6 月 7 日,PR 编号 #75,页面注明由 Terminal-Bench 团队成员跑过并核验。

89.5% 和 89.1% 出自 Artificial Analysis 的独立评测,不是 Harbor 官方提交。这一层区别在传播时基本被抹平了。

同一个基准名字,三个站给出三套数字。Artificial Analysis 的排序是 Sol(xhigh)89.5%、Opus 5(max effort)89.1%、GPT-5.6 Terra(max)88.0%。llm-stats 收录 17 个模型,Sol 是 0.888,亚军换成 Kimi K3 的 0.883,Terra 0.874,Opus 5 那行压根没有。CtrlAltDebrief 8 月 3 日刷新的表把数字四舍五入成 90% 和 89%,页面底部注明分数来自 Artificial Analysis。三套里连亚军是谁都不一样,差值也从 0.4 变成 0.5。厂商自报与第三方复现之间的系统性落差,DeepSeek 跑分那篇 里有一个完整案例。

同一套题,harness 和 effort 各拧走几分

Codex 配 GPT-5.6 Terra 在官方榜是 78.4%,Artificial Analysis 给同一个模型 88.0%。将近十个百分点的落差里,模型没换,换的是谁在跑、跑几次、允许它想多久。

Terminal-Bench 论文对此写得很直白:图里每个模型采用的 agent scaffold,是挑了让它表现最好的那一个。官方榜的 Agent 列因此五花八门,Claude Code、Codex、Cursor CLI、Gemini CLI、Terminus 2、mini-SWE-agent 都在。Terminus 2 是 Terminal-Bench 团队自己写的中立测试台,Fable 5 在 Claude Code 下拿 83.8%,换到 Terminus 2 下是 80.4%,同一个模型掉 3.4 分。

Effort 是第二个旋钮,官方榜 17 行里 xhigh、high、max 混着用。Opus 5 的情况更反直觉:据 the-decoder 转述 Artificial Analysis 的观察,Terminal-Bench 2.1 上它的 high 档反而比 max 档分数高,因为顶格档每次尝试想得更久,在任务时限内能试的次数就变少。Anthropic 自己也把 high 设成 API 和 Claude Code 的默认档。榜单上标 max 的那一行,未必是你装完客户端就能跑出来的配置。

榜单真正有用的是成本列和 hacks 列

官方榜每行右边还有两列,讨论里几乎没人提。它们比 Accuracy 更能改变选型结论。

排名 Agent + 模型 Effort 准确率 Hacks 总成本
1 Claude Code + Fable 5 xhigh 83.8% ± 1.2% -0.2% $552.67
2 Codex + GPT-5.5 xhigh 83.1% ± 1.1% -0.2% $2,059.19
4 Cursor CLI + Grok 4.5 high 79.3% ± 1.5% -9.0% $134.09
5 Claude Code + Opus 4.8 high 78.9% ± 1.3% -0.0% $286.94
6 Codex + GPT-5.6 Terra max 78.4% ± 1.3% -0.2% $421.15

第一名和第二名差 0.7 分,账单差 3.7 倍,跑的是同一套 89 道题。这 0.7 分的置信区间重叠,$552.67 和 $2,059.19 不重叠。跑同样的题,钱差三倍多,这才是榜单上唯一没有误差棒的一列。

Hacks 是扣分列,记的是提交轨迹里被判定为奖励作弊的比例。多数行落在 -0.0% 到 -0.9%,Cursor CLI 配 Grok 4.5 那行是 -9.0%,差一个数量级。79.3% 已经是扣完之后的分数,但 -9% 说明这套组合有相当比例的轨迹在设法绕过测试,而不去解决题目本身。这种行为放进你自己的 CI 是要出事的。同一个模型在客户端里的日常手感,Cursor 里值不值得开 Grok 4.5 那篇另有讨论。

什么时候能照榜单选,什么时候不能

跨档的差距可以直接拿来用。榜首 83.8% 和榜尾 Claude Code 配 GLM-5.1 的 58.7% 差 25 分,超出任何置信区间和 harness 差异能解释的范围,这个量级的排序用来筛掉候选很安全。

同档就不行。79.3%、78.9%、78.4% 这三行,误差棒是 ±1.5、±1.3、±1.3,两两重叠,而且分别来自三个不同的 agent、三个不同的 effort 档。把它们排成第 4、5、6 名是榜单必须完成的动作,这个名次本身不携带你能用的信息。

还有两类情况榜单帮不上忙。一是题型不匹配:89 道题覆盖软件工程、系统管理、数据处理、模型训练和安全,全是容器里的一次性任务,有明确测试判定成败。你要是主要做前端交互、跨服务联调,或者在一个跑了八年的单体仓库里改 bug,这个分数和你的通过率之间没有可靠映射。二是语言栈不匹配:榜单不按语言分列,Rust 仓库和 PHP 仓库的差异在总分里被平均掉了。开源模型这一侧的横向差异,可以对照 GLM-5.2 与 Claude Fable 5 的 agentic coding 实测

用自己的仓库跑一次小规模复现

官方榜的提交命令本身就是复现入口,把 --upload --public 两个参数去掉就是纯本地运行,结果不进榜,也不用走 PR 评审:

harbor run -d terminal-bench/terminal-bench-2-1 \
  -a claude-code \
  -m anthropic/claude-opus-5 \
  --ak reasoning_effort=high \
  -e docker \
  -k 5

-k 5 对应官方要求的每题最少 5 次。榜单页顶部还印着一条提交约束:不允许改动任务的 timeout 和资源配额,这正是 2.0 到 2.1 之间被修过的那类东西。

全套 89 题的账单量级在 Cost 列里,$134 到 $2,059 不等,多数人不会全跑。更划算的做法是拿自己的仓库做小样本:

  1. 从近三个月的真实提交里挑 20 个改动,删掉 commit message,只留 issue 描述和验收测试
  2. 每个任务跑 5 次记通过次数,合计 100 条 trial
  3. 两个候选模型用同一个 agent、同一个 effort 档、同一个超时值,别混着比
  4. 把 harness 版本、客户端版本、effort、超时、并发数写进一个文件存档

20 道题的分辨率是 5 个百分点一档,比官方榜粗得多,但它测的是你的代码。两个模型在这 100 条 trial 上差不到 5 个百分点,你手上的证据就不支持换模型,接下来该看的是成本和延迟。

第 4 步最容易省掉,省掉之后下个月的对比就作废了。Claude Code 从 7 月 24 日的 v2.1.219 起把默认 Opus 换成 Opus 5,Codex CLI 从 7 月 9 日 GPT-5.6 GA 起默认 gpt-5.6-sol。两边都在你没动配置的情况下换过底模,上个月和这个月的通过率之间隔着一次静默升级。

参考资料