GLM 5.2 和 Claude Fable 5:编程怎么选

开源 GLM 5.2 对闭源 Claude Fable 5,官方费率 $1.4/$4.4 对 $10/$50。拆解单样本实测的局限,给一套自己仓库能复算的对比方法。

GLM 5.2 和 Claude Fable 5:编程怎么选

GLM 5.2 和 Claude Fable 5 哪个适合编程,眼下很难有权威答案:能查到的对比大多是一个人跑了一两次的记录。这篇先摆官方参数,再说这类样本能推出什么,以及怎么在自己仓库里验一遍。

作者CodePass 技术编辑

官方参数先对齐

$10 / $50 对 $1.4 / $4.4,每百万输入、输出 token,这是两边官网各自挂出来的标准费率。上下文和最大输出反而一模一样。

项目 Claude Fable 5 GLM-5.2
输入 / 输出(每百万 token) $10 / $50 $1.4 / $4.4
缓存输入 $1 $0.26
上下文 / 最大输出 1M / 128K 1M / 128K
权重 闭源 MIT,744B-A40B
SWE-bench Pro 80.0 62.1
Terminal-Bench 2.1 未公布 81.0

Anthropic 文档把 Fable 5 描述为「最强的广泛发布模型」,2026 年 6 月 9 日在 Claude API、Amazon Bedrock、Google Cloud 和 Microsoft Foundry 同步 GA,adaptive thinking 常开且不提供关闭开关,延迟档位官方自己标的是 Slower。这份文档里还有一个容易被跳过的对照:Claude Opus 5 是 $5 / $25,Sonnet 5 是 $3 / $15。想省钱的话,同门就有便宜一半的选项。

Z.ai 这边,GLM-5.2 走 MIT 协议在 Hugging Face 和 ModelScope 放出 BF16 与 FP8 两版权重,vLLM、SGLang、transformers 都已支持,官方开源清单标的规模是 744B-A40B。官方自报的架构改动是 IndexShare,每四层稀疏注意力复用同一个 indexer,在 1M 上下文下把每 token 的 FLOPs 降到原来的三分之一左右;MTP 层的改进让投机解码的接受长度最多提升 20%。上面表里的 benchmark 数字都来自厂商自己的发布材料,两边口径并不统一。

那篇单次对比到底说了什么

约 9 分钟、超过 $10,对约 17 分钟、$2.76。这是一位作者用同一个 plan-and-implement 任务、同一份仓库上下文、同一套 agent harness 分别跑两个模型的记录:把一份半成品项目计划重构掉并开始写代码,作者判断两边产出的计划和首版代码对这个任务而言质量相当。

这组数字有用,但它能支撑的结论比看上去窄得多。样本量是 1,任务类型只有一类,质量评判是作者主观给的、没有 rubric,harness 具体是什么没有公开,重试次数和缓存命中率都没记录。同一篇文章里还有个细节值得当作提醒:作者把 GLM-5.2 的规模写成「约 40B 活跃 / 753B 总参数」,而官方仓库写的是 744B-A40B。一个二手数字的精度大概就是这个量级。

换个说法,这组数据适合当作「值得亲自试一次」的线索,不适合当作路由决策的依据。同类问题在 三家旗舰的横评 里也存在,跨厂商比较只要 harness 不同,结论就很难迁移。

什么任务交给谁

一次跑偏要花一小时清理现场的长程重构,交给 Fable 5 的理由最充分。官方给出的 SWE-bench Pro 是 80.0,GLM-5.2 是 62.1,将近 18 分的差距落在「难重构」这一类任务上,而这类任务的返工成本恰好最高。Fable 5 的 adaptive thinking 常开,在需要跨很多步维持同一个计划时是加分项。

批量的实现型工作走 GLM-5.2 更划算:按已经写清楚的规格改代码、补测试、跑测试、修 lint、迁移 API 调用。Z.ai 文档里推荐的试法就是这一类,先让模型对一个真实业务仓库出一份技术审计(架构图、模块职责、API 契约、调用链、技术债),再交给它一个边界明确的重构任务。这种活的判据是可自动验证的,跑错了重来一次的代价很低。

还有一类只有开源侧能做:合规要求代码不出内网。MIT 权重意味着可以自托管,没有按 token 计费,也没有厂商锁定。代价是 744B-A40B 的部署门槛,授权自由并不等于硬件免费。

两边各自的失败模式

Fable 5 最典型的翻车方式是账单,不是质量。agent 循环天然输出重:读文件、思考、改、再读,token 大头压在输出侧,而输出侧正是 $50 / MTok 这一格。跑一个长循环的时候没人盯着计量,月底才发现问题的情况相当常见。另一个坑是选错了型号:Fable 5 比同门的 Opus 5 贵一倍,如果任务没难到需要顶配,这一倍纯属浪费。

GLM-5.2 的失败模式集中在难度上限和速度。厂商自己的对照里,Terminal-Bench 2.1 是 81.0,Claude Opus 4.8 是 85.0;FrontierSWE 落后 Opus 4.8 约 1%,而这已经是拿它跟上一代旗舰比。SWE-bench Verified 至今没有公布数字。第三方那次运行里 wall-clock 约为对手的两倍,长任务里这会放大成体感差异。开源模型在终端类任务上的表现差异,可以对照 终端任务上的模型对比 一起看。

成本差集中在输出侧

按官方费率算一笔:一个 agent 任务消耗 200 万输入 token 和 40 万输出 token,不计缓存。Fable 5 是 2×$10 + 0.4×$50 = $40。GLM-5.2 是 2×$1.4 + 0.4×$4.4 = $4.56。差约 8.8 倍,其中输出侧贡献了绝大部分。

这个倍数给出一条实用判据:只有当 GLM-5.2 需要多花 8 倍以上的 token 才能完成同一个任务时,价差才会被抹平。就算它多跑一轮、token 涨到 1.5 倍,账单也才 $6.84。所以「便宜模型重试多,其实没省钱」这句话在这个价差下通常站不住,除非失败率高到任务根本完不成。

订阅侧的口径不一样。Anthropic 卖 Claude Code 套餐,Z.ai 有 GLM Coding Plan,公开资料称后者价格约为前者的十分之一。缓存也会改变结论:Fable 5 缓存输入 $1,GLM-5.2 是 $0.26,多轮对话里输入侧大部分会命中缓存,实际差距会比牌价小。另一组开源对闭源的账可以参考 开源编码模型对闭源旗舰的对照

在自己仓库跑一次可比的对比

固定 harness 是第一步,也是二手对比最常缺的一环。Z.ai 的端点兼容 OpenAI 与 Anthropic 的消息格式,换模型只需要改 base_url 和 model:

from openai import OpenAI

client = OpenAI(api_key="your-key", base_url="https://api.z.ai/api/paas/v4/")
r = client.chat.completions.create(
    model="glm-5.2", messages=MSGS, reasoning_effort="max"
)
print(r.usage)  # 用真实 usage 记账,别用估算

任务集至少准备 8 到 10 个,覆盖跨文件重构、补测试、修已知 bug、迁移 API 四类,每个任务配一条能自动判定的验收命令,比如 pytest -qpnpm build 的退出码。每个任务跑 3 次取中位数,agent 任务的单次方差大到能反转结论。

要记的数只有四个:完成率、重试次数、输入输出 token(缓存读写分开记)、以及 wall-clock。前三个是主指标,wall-clock 受服务端排队影响,只当参考。

有一件事无法完全对齐,报告里要写明:GLM-5.2 的 reasoning_effort 可以显式设成 max,而 Fable 5 的 adaptive thinking 常开且没有开关。两边的思考预算注定不等价,任何结论都带着这个前提。同理,闭源模型随时可能悄悄换服务端配置,一个月前跑出来的对比未必还成立,值得每次大版本更新后重跑。

参考资料