GLM-5.3:同基座纯后训练的开源权重编码旗舰
glm-5-3
Z.ai 在 GLM-5.2 的同一基座上只做后训练,得到 744B-A40B 的 GLM-5.3:自研 Z.ai Code Bench 比 5.2 提升 50%,Terminal Bench 3.0 28.3、Agents' Last Exam 28.5 拿开源权重第一,AutomationBench 48.2 与 GDPVal-AA v2 1769 超过官方图上全部闭源对照;CyberGym 漏洞发现 SOTA,利用链增益为未单独训练的涌现能力。同批的 320B-A18B Flash 换新基座,首次混用稀疏与线性注意力攻长上下文服务成本。权重 FP8 与 BF16 公开,SGLang、vLLM、KTransformers 与昇腾全栈可部署。
- 置信度
- 厂商宣称
- 只有官方模型卡/发布会,无独立复测
- 关键指标
- Terminal Bench 3.0(开源权重第一, 官方图)
- 厂商宣称 · 2026-08
- 成熟度
- 产品
- 研究 → 演示 → 产品 → 生产
我们的判断水位判断:同基座纯后训练把 Terminal Bench 3.0 从 4.6 推到 28.3、AutomationBench 从 26.2 推到 48.2,代差是数量级的,这条斜率本身就是开源阵营后训练配方的最强证据。但六项读数全部来自官方图,DeepSWE 上 Kimi K3 还高 0.6 分,第三方复现未见,故置信度标 C(vendor-claim)。对闭源主力档的水位也清楚:Terminal Bench 3.0 仍差 5-6 分,长程 agentic 与自动化类基准是它打平甚至反超的正面。选型上,要开源权重里最强的编码与长程能力选 5.3,要每 token 成本选 Flash;复现榜单记得 reasoning_effort 保持默认 max,chat 场景显式传 clear_thinking=true。
一句话定位:同基座、纯后训练换出来的开源权重编码旗舰
GLM-5.3 是 Z.ai(智谱)在 GLM-5.2 的同一个基座上只做后训练得到的 744B-A40B MoE,权重以 FP8 与 BF16 两档公开在 HuggingFace 与 ModelScope;同批发布的 GLM-5.3-Flash 是 320B-A18B,换了一个新基座。官方给它的定位只有一句话:开源权重里最能写的模型,自研 Z.ai Code Bench 比 5.2 提升 50%,公开榜 Terminal Bench 3.0 与 Agents' Last Exam 拿开源 SOTA。
「同基座、纯后训练」是这条发布里信息量最大的事实:预训练一个字节没动,全部增益来自后训练阶段的配方与算力。它把「后训练还能榨出多少」变成了一个可测量的问题,也给所有想追闭源主力档的开源团队指了一条不必重训基座的路。
数据面:两档权重、两种基座、一套部署矩阵
| 权重 | 规模 | 精度 | 出处与备注 |
|---|---|---|---|
| GLM-5.3 | 744B-A40B | FP8 | HuggingFace zai-org/GLM-5.3,ModelScope ZhipuAI/GLM-5.3 |
| GLM-5.3-BF16 | 744B-A40B | BF16 | 同上,给需要自定量化的团队 |
| GLM-5.3-Flash | 320B-A18B | FP8 | 新基座,稀疏+线性混合注意力,mHC |
| GLM-5.3-Flash-BF16 | 320B-A18B | BF16 | 同上 |
部署矩阵覆盖 SGLang、vLLM、Transformers(glm_moe_dsa 与 glm5_next)、KTransformers、Unsloth,Flash 另有 TokenSpeed 与昇腾侧的 vLLM-Ascend、xLLM;微调走 slime v0.3.0+ 或 ms-swift v4.4.0+。744B 的 FP8 权重单机放不下,但 40B 激活让吞吐账算得过来——这正是 DSA 稀疏注意力一路下来的设计意图:把长上下文的成本压到服务得起的形状。
六项基准怎么读:官方圈了两项,实际超了四项
| 基准 | GLM-5.3 | GLM-5.2 | Kimi K3 | Fable 5 | GPT-5.6 Sol |
|---|---|---|---|---|---|
| Terminal Bench 3.0 | 28.3 | 4.6 | 17.4 | 33.7 | 34.6 |
| DeepSWE | 66.9 | 46.2 | 67.5 | 69.7 | 72.7 |
| Agents' Last Exam(CLI) | 28.5 | 23.8 | 27.6 | 23.8 | 28.6 |
| AutomationBench | 48.2 | 26.2 | 46.7 | 46.2 | 45.8 |
| HLE w/ Tools | 62.5 | 54.7 | 59.8 | 63.9 | 64.5 |
| GDPVal-AA v2 | 1769 | 1508 | 1682 | 1743 | 1730 |
读法有四条。其一,README 宣称的开源 SOTA 只圈了 Terminal Bench 3.0 与 Agents' Last Exam,这两项图上确实第一(28.3 对 Kimi K3 的 17.4、28.5 对 27.6),宣称与图自洽。其二,DeepSWE 上 Kimi K3 的 67.5 略高于 66.9,所以「开源第一」不能外推到全部六项,本站照图写、不外推。其三,AutomationBench 48.2 与 GDPVal-AA v2 的 1769 超过了图上全部闭源对照(Fable 5 与 GPT-5.6 Sol),这是超出官方宣称的部分,值得单独记一笔。其四,对 GLM-5.2 的代差是数量级的:Terminal Bench 3.0 从 4.6 到 28.3、AutomationBench 从 26.2 到 48.2,同基座纯后训练能走出这个斜率,才是这条发布真正的新闻点。
Flash:攻供给尺子的那一档
| 基准 | GLM-5.3-Flash | GLM-5.2 | DeepSeek-V4-Vision-Exp | Claude Opus 4.8 | GPT-5.6 Terra | Gemini 3.7 Flash |
|---|---|---|---|---|---|---|
| Terminal-Bench 2.1 | 84.3 | 81.0 | 83.9 | 85.0 | 87.4 | 85.8 |
| DeepSWE v1.1 | 63.4 | 46.2 | 59.3 | 58.0 | 69.6 | 65.3 |
| Agents' Last Exam | 26.3 | 20.4 | 27.3 | 27.0 | 28.0 | — |
| AutomationBench v1.0.6 | 48.8 | 26.2 | 38.8 | 41.0 | 37.2 | 52.3 |
| HLE w/ Tools | 55.3 | 54.7 | 55.1 | 57.9 | — | — |
| GDPVal-AA v2 | 1773 | 1504 | 1675 | 1582 | 1571 | 1527 |
Flash 的看点不在榜上第一,而在架构:GLM 系列第一次把稀疏注意力与线性注意力混在同一套架构里,长上下文服务成本显著下降,同时保住精确长上下文能力;再用 mHC(Manifold-Constrained Hyper-Connections)提 scaling 效率,配 30T token 的多模态预训练语料。榜上它拿 Terminal-Bench 2.1 84.3、AutomationBench 48.8、GDPVal-AA v2 1773,对 GLM-5.2 全面领先,对闭源主力档互有胜负。它回答的是另一个问题:同样的智能,每 token 花多少算力与显存。
家谱:三次换基座,两次换尺子
| 版本 | 规模 | 预训练 | 标志性进展 |
|---|---|---|---|
| GLM-4.5 | 355B-A32B | 23T | 立下 MoE 家底 |
| GLM-5 | 744B-A40B | 28.5T | DSA + slime 异步 RL;Vending Bench 2 开源第一(4,432 美元) |
| GLM-5.1 | 同 5 基座 | — | SWE-Bench Pro SOTA;NL2Repo、Terminal-Bench 2.0 领先 |
| GLM-5.2 | 同 5 基座 | — | 1M 上下文(IndexShare);TB2.1 81.0、SWE-bench Pro 62.1 |
| GLM-5.3 | 744B-A40B | 同 5.2 基座 | 纯后训练;Terminal Bench 3.0 28.3,开源权重第一 |
| GLM-5.3-Flash | 320B-A18B | 30T 多模态 | 稀疏+线性混合注意力,mHC,攻服务成本 |
这条线的节奏很清楚:4.5 立家底,5 换基座加 DSA 与异步 RL,5.1 在 SWE-Bench Pro 拿 SOTA,5.2 把 1M 上下文做扎实(IndexShare 每 4 层复用 indexer,1M 下每 token FLOPs 降 2.9 倍,MTP 投机解码接受长度 +20%),5.3 在同基座上纯后训练收编码与长程,Flash 再换一次基座攻供给。技术报告见 arXiv 2602.15763,IndexShare 见 arXiv 2603.12201。
部署与复现:三个会咬人的坑
其一,reasoning_effort 取 low、high、max 三档,不传默认 max(传别的值也落回 max),复现榜单必须保持默认 max;而 GLM-5.2 只接受 high 与 max,两代参数面不一致,跨版本脚本要写分支。其二,chat 模板里 clear_thinking 不传默认 false,多轮对话不显式传 true,会把上一轮的思考链带进上下文,token 账与实际行为都会变。其三,权重与推理栈的版本要配对:5.3 走 glm_moe_dsa,5.3-Flash 走 glm5_next,拿旧配置跑新权重往往是静默出错而不是直接报错。
涌现的 cyber 能力:为什么它同时是 safety 域的一条证据
官方自己承认「cyber 能力的发展比预期快」:后训练规模上去之后,GLM-5.3 在 CyberGym 的漏洞发现上 SOTA,且在利用链越靠后的环节增益越大,利用类基准比 5.2 高一倍以上——而这一项没有单独训过。涌现能力无法靠训练清单预测,也就无法靠训练清单收回;开源权重的攻击面随后训练规模一起长大,评测与披露的节奏必须跟上。这条发布因此同时挂在 safety 域的证据流里。