GLM-5.3 是什么 开源编程模型又抬了一档
解读 Z.ai 2026-08-14 发布的 GLM-5.3:同基座纯后训练、编程与长程任务跃升、权重两周后开源,以及安全披露账本。

GLM-5.3 是什么?Z.ai 在 2026-08-14 放出的新一代开源权重编程向模型。官方强调:底座与 GLM-5.2 相同,增益几乎全来自后训练 scaling;自家 Z.ai Code Bench 相对 5.2 宣称约 50% 提升,公开榜上 Terminal Bench 3.0、Agents' Last Exam 等也拿到开源侧靠前的位置。权重计划在发布约两周后放出,先做安全评估与加固。
后训练堆出来的编程与长程能力
官方博文把 5.2 已有的 IndexShare、SAO、slime 等栈继续加任务环境与算力。训练环境更像「几天量级的工程师活」:给集群、文档、代码与实验记录,要求端到端找出瓶颈并交付可测加速,而不是拆成一堆被 babysit 的小题。
公开数字里,Terminal Bench 3.0 从 4.6 提到 28.3,DeepSWE v1.1 从 46.2 到 66.9。私有 Z.ai Code Bench 上,Max effort 约 34.5%(约 75K 输出 token/任务),相对 5.2 的 23.4% / 96K,完成率升、输出还更省。相对闭源,High effort 约 31.4% / 50K,文中写超过 Opus 4.8 的 29.5% / 120K,仍落后 Fable 5 的 39.5%。
安全向能力与披露账本
后训练混入漏洞发现环境后,官方称「利用链」相关基准涨幅大于单纯找洞。CyberGym 84.5(5.2 为 77.2);ExploitBench 从 24.4 到 54.4。他们还写:与国内安全团队实战后,经专家复核去重,在 269 个项目里累计 2436 个漏洞发现(含 1097 个中高危),并维护公开的 Z.ai Security Disclosure Ledger。本文只转述产品声明与披露机制,不展开利用步骤。
和你怎么选模型的关系
若你盯开源可自托管、又要 agent 式编程,5.3 是当前叙事最强的一档之一;闭源仍看 Fable / GPT-5.6 Sol 等在部分榜上的余量。权重未放前只能走 Z.ai 推理或等开源包。跑分怎么读、别被单榜绑架,可对照站内 DeepSeek 跑分怎么看 的读法;同系列开源排行话题另见 Qwen3.8 Max 编程排行。