Terminal-Bench 排名怎么看:0.4 分差不算依据
Terminal-Bench 排名怎么看:官方榜首 83.8%±1.2%,三方榜给 89.5%。0.4 分差在 89 道题上意味着什么。

榜首两家差 0.4 个百分点,不少人拿这个差值决定接哪家模型。terminal-bench 排名怎么看,第一步是把 0.4 换算成题:全套 89 道,做对一道值 1.12 分,0.4 分连半道都不到。
0.4 分差在 89 道题上是多少
换算下来是 0.36 道题。Terminal-Bench 2.1 有 89 道容器任务,官方提交规则要求每道跑满 5 次,所以一次完整提交是 445 条 trial。0.4 个百分点摊到题上是 0.36 道,摊到 trial 上是 1.8 次。
更硬的参照是榜单自己印的误差棒。tbench.ai 的 2.1 榜每行分数后面都跟着 95% 置信区间,17 行里最窄的是 ±1.1%,最宽的 ±1.7%。榜单本身承认,同一个 agent 加同一个模型重跑一遍,成绩在两个多百分点的带子里浮动属于正常。0.4 落进这条带子,大概占三分之一的宽度,两条区间重叠成这样,谁在前谁在后取决于哪天跑的。
噪声也有具体来源。Terminal-Bench 2.1 的发布说明写了 2.0 版被改掉的 28 道题:9 道因为容器要联网、外部依赖后来变了;8 道的 CPU、内存或时间预算太紧,连官方参考解都跑不完;还有一批是题面和测试对不上,比如 query-optimize 的说明写 PostgreSQL,测试却按 Spark SQL 判。基础设施自带的漂移就在这个量级上。
官方榜单上没有这两行
2026 年 8 月 4 日翻 tbench.ai 的 terminal-bench 2.1 榜,17 行里既没有 GPT-5.6 Sol,也没有 Claude Opus 5。第一名是 Claude Code 配 Fable 5 的 83.8% ± 1.2%,提交日期停在 6 月 7 日,PR 编号 #75,页面注明由 Terminal-Bench 团队成员跑过并核验。
89.5% 和 89.1% 出自 Artificial Analysis 的独立评测,不是 Harbor 官方提交。这一层区别在传播时基本被抹平了。
同一个基准名字,三个站给出三套数字。Artificial Analysis 的排序是 Sol(xhigh)89.5%、Opus 5(max effort)89.1%、GPT-5.6 Terra(max)88.0%。llm-stats 收录 17 个模型,Sol 是 0.888,亚军换成 Kimi K3 的 0.883,Terra 0.874,Opus 5 那行压根没有。CtrlAltDebrief 8 月 3 日刷新的表把数字四舍五入成 90% 和 89%,页面底部注明分数来自 Artificial Analysis。三套里连亚军是谁都不一样,差值也从 0.4 变成 0.5。厂商自报与第三方复现之间的系统性落差,DeepSeek 跑分那篇 里有一个完整案例。
同一套题,harness 和 effort 各拧走几分
Codex 配 GPT-5.6 Terra 在官方榜是 78.4%,Artificial Analysis 给同一个模型 88.0%。将近十个百分点的落差里,模型没换,换的是谁在跑、跑几次、允许它想多久。
Terminal-Bench 论文对此写得很直白:图里每个模型采用的 agent scaffold,是挑了让它表现最好的那一个。官方榜的 Agent 列因此五花八门,Claude Code、Codex、Cursor CLI、Gemini CLI、Terminus 2、mini-SWE-agent 都在。Terminus 2 是 Terminal-Bench 团队自己写的中立测试台,Fable 5 在 Claude Code 下拿 83.8%,换到 Terminus 2 下是 80.4%,同一个模型掉 3.4 分。
Effort 是第二个旋钮,官方榜 17 行里 xhigh、high、max 混着用。Opus 5 的情况更反直觉:据 the-decoder 转述 Artificial Analysis 的观察,Terminal-Bench 2.1 上它的 high 档反而比 max 档分数高,因为顶格档每次尝试想得更久,在任务时限内能试的次数就变少。Anthropic 自己也把 high 设成 API 和 Claude Code 的默认档。榜单上标 max 的那一行,未必是你装完客户端就能跑出来的配置。
榜单真正有用的是成本列和 hacks 列
官方榜每行右边还有两列,讨论里几乎没人提。它们比 Accuracy 更能改变选型结论。
| 排名 | Agent + 模型 | Effort | 准确率 | Hacks | 总成本 |
|---|---|---|---|---|---|
| 1 | Claude Code + Fable 5 | xhigh | 83.8% ± 1.2% | -0.2% | $552.67 |
| 2 | Codex + GPT-5.5 | xhigh | 83.1% ± 1.1% | -0.2% | $2,059.19 |
| 4 | Cursor CLI + Grok 4.5 | high | 79.3% ± 1.5% | -9.0% | $134.09 |
| 5 | Claude Code + Opus 4.8 | high | 78.9% ± 1.3% | -0.0% | $286.94 |
| 6 | Codex + GPT-5.6 Terra | max | 78.4% ± 1.3% | -0.2% | $421.15 |
第一名和第二名差 0.7 分,账单差 3.7 倍,跑的是同一套 89 道题。这 0.7 分的置信区间重叠,$552.67 和 $2,059.19 不重叠。跑同样的题,钱差三倍多,这才是榜单上唯一没有误差棒的一列。
Hacks 是扣分列,记的是提交轨迹里被判定为奖励作弊的比例。多数行落在 -0.0% 到 -0.9%,Cursor CLI 配 Grok 4.5 那行是 -9.0%,差一个数量级。79.3% 已经是扣完之后的分数,但 -9% 说明这套组合有相当比例的轨迹在设法绕过测试,而不去解决题目本身。这种行为放进你自己的 CI 是要出事的。同一个模型在客户端里的日常手感,Cursor 里值不值得开 Grok 4.5 那篇另有讨论。
什么时候能照榜单选,什么时候不能
跨档的差距可以直接拿来用。榜首 83.8% 和榜尾 Claude Code 配 GLM-5.1 的 58.7% 差 25 分,超出任何置信区间和 harness 差异能解释的范围,这个量级的排序用来筛掉候选很安全。
同档就不行。79.3%、78.9%、78.4% 这三行,误差棒是 ±1.5、±1.3、±1.3,两两重叠,而且分别来自三个不同的 agent、三个不同的 effort 档。把它们排成第 4、5、6 名是榜单必须完成的动作,这个名次本身不携带你能用的信息。
还有两类情况榜单帮不上忙。一是题型不匹配:89 道题覆盖软件工程、系统管理、数据处理、模型训练和安全,全是容器里的一次性任务,有明确测试判定成败。你要是主要做前端交互、跨服务联调,或者在一个跑了八年的单体仓库里改 bug,这个分数和你的通过率之间没有可靠映射。二是语言栈不匹配:榜单不按语言分列,Rust 仓库和 PHP 仓库的差异在总分里被平均掉了。开源模型这一侧的横向差异,可以对照 GLM-5.2 与 Claude Fable 5 的 agentic coding 实测。
用自己的仓库跑一次小规模复现
官方榜的提交命令本身就是复现入口,把 --upload --public 两个参数去掉就是纯本地运行,结果不进榜,也不用走 PR 评审:
harbor run -d terminal-bench/terminal-bench-2-1 \
-a claude-code \
-m anthropic/claude-opus-5 \
--ak reasoning_effort=high \
-e docker \
-k 5
-k 5 对应官方要求的每题最少 5 次。榜单页顶部还印着一条提交约束:不允许改动任务的 timeout 和资源配额,这正是 2.0 到 2.1 之间被修过的那类东西。
全套 89 题的账单量级在 Cost 列里,$134 到 $2,059 不等,多数人不会全跑。更划算的做法是拿自己的仓库做小样本:
- 从近三个月的真实提交里挑 20 个改动,删掉 commit message,只留 issue 描述和验收测试
- 每个任务跑 5 次记通过次数,合计 100 条 trial
- 两个候选模型用同一个 agent、同一个 effort 档、同一个超时值,别混着比
- 把 harness 版本、客户端版本、effort、超时、并发数写进一个文件存档
20 道题的分辨率是 5 个百分点一档,比官方榜粗得多,但它测的是你的代码。两个模型在这 100 条 trial 上差不到 5 个百分点,你手上的证据就不支持换模型,接下来该看的是成本和延迟。
第 4 步最容易省掉,省掉之后下个月的对比就作废了。Claude Code 从 7 月 24 日的 v2.1.219 起把默认 Opus 换成 Opus 5,Codex CLI 从 7 月 9 日 GPT-5.6 GA 起默认 gpt-5.6-sol。两边都在你没动配置的情况下换过底模,上个月和这个月的通过率之间隔着一次静默升级。
参考资料
- Terminal-Bench 2.1 官方榜单(tbench.ai,含 Effort / Hacks / Cost 三列,2026-08-04 抓取)
- terminal-bench-2-1 提交说明与 harbor run 命令(GitHub)
- Terminal-Bench v2.1 Benchmark Leaderboard(Artificial Analysis 独立评测,89.5% / 89.1% 出处)
- Terminal-Bench 2.1 基准说明:89 道题改了 28 道(Snorkel AI)
- Terminal-Bench 论文:scaffold 择优与 95% 置信区间(arXiv)
- Terminal-Bench 2.1 Leaderboard(llm-stats,第三套数字)
- Introducing Claude Opus 5(Anthropic 官方,2026-07-24)
- Claude Code model-config:Opus 5 需 v2.1.219 起(官方文档)
- Opus 5 在 Terminal-Bench 2.1 上 high 档反超 max 档(the-decoder)