首页
学习
活动
专区
圈层
工具
发布

智谱发布GLM-5.3:同基座纯后训练,编程开源第一,网络安全能力涌现

随手先关注,不错过每日AI热讯速递

2026 年 8 月 14 日,智谱 AI 发布新一代基座模型GLM-5.3。它与 GLM-5.2 共用同一基座,同为7430 亿参数[1]。

全部能力提升都来自后训练(在预训练完成的大模型上继续强化学习、加练特定任务,以提升能力上限) Scaling。

官方称,GLM-5.3 在编程上是“最强开源权重模型”,内部 Z.ai Code Bench 较前代提升50%,并在 Terminal-Bench 3.0、Agents' Last Exam 等公开基准取得开源第一 [2]。

在 Terminal-Bench 3.0 上,GLM-5.3 从 GLM-5.2 的4.6跃升至28.3;DeepSWE v1.1 从46.2提升至66.9[1]。

三个编程相关基准同步起飞,靠的是智谱自建的 IndexShare(长上下文)、SAO(长程任务强化学习)与新一代 Slime 大规模异步训练框架。

同一块基座没有增加一个参数,能力上限却明显抬高——充分的后训练同样能顶出更高的智能天花板。

图:GLM-5.3 编码性能评测图(LLM Performance Evaluation),对比 Terminal-Bench、DeepSWE 等基准中 GLM-5.3 与 Kimi K3、GPT-5.6 等模型的成绩(来源:Z.ai 官方基准数据,转引自 The Decoder [2])。

后训练规模扩大后,网络安全能力的进步超出了智谱预期。

在 CyberGym(从白盒源代码触发故障、识别并验证漏洞的评测基准) 上,GLM-5.3 从77.2%提升至84.5%,略高于 Mythos 5 的 83.8% 与 GPT-5.6 Sol 的 83.6% [1]。

ExploitBench 从24.4%翻倍至54.4%[1]。

发布前,智谱联合清华、南开及国内企业与实验室开展红队测试,累计在269 个项目中发现2436 个有效漏洞,其中最早的 bug 已潜伏40 年[2]。智谱同步启动「开源的盾」计划,向开源项目提供持续安全审计。

图:GLM-5.3 网络安全评测图(CyberSecurity Evaluation),展示 CyberGym、ExploitBench 等基准成绩(来源:Z.ai 官方基准数据,转引自 The Decoder [2])。

GLM-5.3 权重将在发布两周后开放 [2]。对最敏感的网络安全能力,智谱推出「可信访问」机制,对敏感能力实施分层授权。

需要说明的是,GLM-5.3 各项基准成绩目前均为官方自报、未经第三方独立复现;在 ExploitBench 等实战利用环节,它仍明显落后于 Mythos 5 [2]。

一个不变基座、靠持续的后训练 Scaling,就把编程顶到开源第一、还意外长出网安能力——国产开源模型追赶关键短板的速度,比榜单数字更值得关注。

欢迎在评论区聊聊,你觉得“不改基座只靠后训练”的路线能走多远?

参考来源:

[1] MarkTechPost:Z.ai Ships GLM-5.3 Without Retraining the Base Model

https://www.marktechpost.com/2026/08/14/z-ai-ships-glm-5-3-without-retraining-the-base-model-better-at-complex-coding-and-long-horizon-tasks

[2] The Decoder:Zhipu AI releases GLM-5.3, claims it's the strongest open-weights coding model

https://the-decoder.com/zhipu-ai-releases-glm-5-3-claims-its-the-strongest-open-weights-coding-model

欢迎分享、点赞、推荐

一起拥抱AI

  • 发表于:
  • 原文链接https://page.om.qq.com/page/OqVuDHPGyIpStFGC6m8O8oBg0
  • 腾讯「腾讯云开发者社区」是腾讯内容开放平台帐号(企鹅号)传播渠道之一,根据《腾讯内容开放平台服务协议》转载发布内容。
  • 如有侵权,请联系 cloudcommunity@tencent.com 删除。

相关快讯

领券