随手先关注,不错过每日AI热讯速递
2026 年 8 月 14 日,智谱 AI 发布新一代基座模型GLM-5.3。它与 GLM-5.2 共用同一基座,同为7430 亿参数[1]。
全部能力提升都来自后训练(在预训练完成的大模型上继续强化学习、加练特定任务,以提升能力上限) Scaling。
官方称,GLM-5.3 在编程上是“最强开源权重模型”,内部 Z.ai Code Bench 较前代提升50%,并在 Terminal-Bench 3.0、Agents' Last Exam 等公开基准取得开源第一 [2]。
在 Terminal-Bench 3.0 上,GLM-5.3 从 GLM-5.2 的4.6跃升至28.3;DeepSWE v1.1 从46.2提升至66.9[1]。
三个编程相关基准同步起飞,靠的是智谱自建的 IndexShare(长上下文)、SAO(长程任务强化学习)与新一代 Slime 大规模异步训练框架。
同一块基座没有增加一个参数,能力上限却明显抬高——充分的后训练同样能顶出更高的智能天花板。
图:GLM-5.3 编码性能评测图(LLM Performance Evaluation),对比 Terminal-Bench、DeepSWE 等基准中 GLM-5.3 与 Kimi K3、GPT-5.6 等模型的成绩(来源:Z.ai 官方基准数据,转引自 The Decoder [2])。
后训练规模扩大后,网络安全能力的进步超出了智谱预期。
在 CyberGym(从白盒源代码触发故障、识别并验证漏洞的评测基准) 上,GLM-5.3 从77.2%提升至84.5%,略高于 Mythos 5 的 83.8% 与 GPT-5.6 Sol 的 83.6% [1]。
ExploitBench 从24.4%翻倍至54.4%[1]。
发布前,智谱联合清华、南开及国内企业与实验室开展红队测试,累计在269 个项目中发现2436 个有效漏洞,其中最早的 bug 已潜伏40 年[2]。智谱同步启动「开源的盾」计划,向开源项目提供持续安全审计。
图:GLM-5.3 网络安全评测图(CyberSecurity Evaluation),展示 CyberGym、ExploitBench 等基准成绩(来源:Z.ai 官方基准数据,转引自 The Decoder [2])。
GLM-5.3 权重将在发布两周后开放 [2]。对最敏感的网络安全能力,智谱推出「可信访问」机制,对敏感能力实施分层授权。
需要说明的是,GLM-5.3 各项基准成绩目前均为官方自报、未经第三方独立复现;在 ExploitBench 等实战利用环节,它仍明显落后于 Mythos 5 [2]。
一个不变基座、靠持续的后训练 Scaling,就把编程顶到开源第一、还意外长出网安能力——国产开源模型追赶关键短板的速度,比榜单数字更值得关注。
欢迎在评论区聊聊,你觉得“不改基座只靠后训练”的路线能走多远?
参考来源:
[1] MarkTechPost:Z.ai Ships GLM-5.3 Without Retraining the Base Model
https://www.marktechpost.com/2026/08/14/z-ai-ships-glm-5-3-without-retraining-the-base-model-better-at-complex-coding-and-long-horizon-tasks
[2] The Decoder:Zhipu AI releases GLM-5.3, claims it's the strongest open-weights coding model
https://the-decoder.com/zhipu-ai-releases-glm-5-3-claims-its-the-strongest-open-weights-coding-model
欢迎分享、点赞、推荐
一起拥抱AI