Z.ai 发布 GLM-5.3:零新参数,纯后训练让编码和网络安全能力暴涨
Z.ai 今天发布 GLM-5.3,最引人注目的是——它没有换基座模型,743B 参数和 GLM-5.2 完全一样,所有提升都来自后训练扩展。结果:长程编码任务得分暴涨 6 倍,网络安全能力更是超出了 Z.ai 自己的预期。这个模型已经帮安全团队找到了 2436 个真实漏洞,其中 1097 个高危。权重约两周后开源。
后训练扩展:不换基座,换训练环境
GLM-5.3 复用 GLM-5.2 的 743B 基座模型,参数量零增长。提升全靠后训练:更多样化的任务环境、更长的训练时间。
这些环境不是简单的编程题,而是模拟真实工作场景。比如把模型放进一个 ML 基础设施工程师的环境里——有计算集群、内部文档、代码库和实验结果——让它诊断瓶颈、实现优化、交付可衡量的端到端加速。有些任务相当于资深工程师好几天的工作量。
为了批量生产这类环境,Z.ai 搭建了自动化流水线:研究 Agent 把真实工作模式转化为可运行的长程任务,裁判 Agent 验证每个任务确实可解,验证器在看不到参考答案的情况下合成。奖励信号部分由机器生成,再用求解轨迹修补捷径。Z.ai 也承认,流水线仍需要不少人工介入。
编码能力:长程任务提升最猛
后训练扩展的效果在长程任务上最为显著:
- Terminal-Bench 3.0:4.6 → 28.3,提升超过 6 倍
- DeepSWE v1.1:46.2 → 66.9
- Agents' Last Exam (CLI):23.8 → 28.5
在 Z.ai 内部 Code Bench 上,GLM-5.3 比 GLM-5.2 提升 50%,用约 5 万输出 token 就拿到 31.4% 的得分,而 Claude Opus 4.8 用 12 万 token 才拿到 29.5%。不过 Claude Fable 5 仍以 39.5% 领先。
在公开评测上,GLM-5.3 在 Terminal-Bench 3.0 和 DeepSWE 等高难度编码评测中仍落后于 GPT-5.6 Sol 和 Claude Fable 5。所有数据均为厂商自报,评测配置详见官方博客。
网络安全:超预期的"意外收获"
这是 Z.ai 自己都没想到的部分。
后训练时加入了漏洞发现数据和环境,本意是让模型更好地发现和推理单个漏洞。结果随着训练规模扩大,能力持续叠加,模型开始跨阶段组织完整的攻击链——不再只是"找到一个 bug",而是"从发现到利用,形成完整的攻击计划"。
数据很能说明问题:
- CyberGym(白盒源码漏洞发现与验证):77.2% → 84.5%,超越 Mythos 5(83.8%)和 GPT-5.6 Sol(83.6%)
- ExploitBench(根因推理+可运行漏洞利用):24.4% → 54.4%,翻倍以上,但仍落后 Mythos 5 的 78.0%
- ExploitGym(限时漏洞利用任务):2 小时完成 105 个任务,6 小时完成 130 个;GLM-5.2 分别只有 29 和 39
规律很清晰:越深入攻击链的评测,GLM-5.3 相比前代的提升越大,但距离闭源前沿模型的差距也越宽。
更实际的影响是:Z.ai 与多个安全团队合作,自 GLM-5.2 以来已在 269 个开源项目中发现 2436 个漏洞,其中 1097 个为高危或严重级别,涉及系统内核、操作系统、浏览器引擎和网络协议。最老的一个漏洞引入于 1981 年。这些发现记录在 Z.ai 的安全披露账本中,发布时已有 53 个公开 CVE,2383 个仍在 embargo。
开源与安全考量
权重暂未公开。Z.ai 明确表示,约两周后完成安全评估和加固才会发布权重,届时任何人都可以下载。
延迟的原因正是网络安全能力的超预期增长——当模型学会的不是发现漏洞而是组织攻击链时,开源节奏必须谨慎。这与本周 OpenAI 红队测试中模型攻破 Hugging Face 的新闻形成对照:同样的能力,一面是发现 1981 年以来未被发现的漏洞,一面是可能被滥用的攻击链。
API 方面,GLM-5.3 已通过 Z.ai API 和 GLM Coding Plan 上线,支持三级思考强度(low/high/max),且不再允许关闭思考——这是一个破坏性变更。
对谁有用
- 开发者工具和云基础设施团队:仓库级重构、长程 CLI Agent、CI 故障排查
- 安全团队和 MSSP:白盒漏洞发现、安全代码审查、崩溃分类
- 内核/浏览器/网络栈厂商:已验证的漏洞发现能力覆盖这些领域
小结
GLM-5.3 证明了一件事:后训练扩展的潜力远未被充分挖掘。同一个基座模型,只是换了训练环境和规模,编码和网络安全能力就实现了质的飞跃。但网络安全能力的"超预期增长"也提醒我们——当模型学会的不是发现漏洞而是组织攻击链时,开源节奏必须谨慎。两周后的权重发布,才是真正的考验。
---
基于 Unite.AI、MarkTechPost 等多家媒体转述整理