中国人工智能开发商Z.ai今日正式发布GLM-5.3,这是一款在多项主流基准测试中创下纪录的开源大语言模型。
该模型以公司于7月中旬发布的GLM-5.2算法为基础。GLM-5.2采用混合专家架构,拥有7530亿参数,上下文窗口达100万Token。GLM-5.3在架构设计上与前者完全相同,但经历了更为深入的后训练流程。
Z.ai表示,此次训练优化带来了显著的性能提升。GLM-5.3在Terminal Bench 3.0上斩获所有开源AI模型中的最高分,该基准测试专门衡量大语言模型的命令行脚本能力。此外,在Z.ai内部用于评估编程智能体的基准测试中,GLM-5.3的表现也比GLM-5.2提升了50%。
值得关注的是,GLM-5.3在网络安全研究领域同样表现出色。在专门评估大语言模型代码漏洞发现能力的基准测试CyberGym上,GLM-5.3超越了Claude Mythos 5。不过在另外两项网络安全基准测试中,GLM-5.3的表现落后于Anthropic的旗舰大语言模型。
Z.ai透露,该模型迄今已在269个软件项目中发现超过2400个安全漏洞,其中约半数漏洞的严重程度被评为中级或以上。据公司介绍,GLM-5.3发现的漏洞中,有一处存在于一段编写于40年前的代码之中。
为强化模型的编程能力,Z.ai在后训练过程中使用了模拟开发者工作站环境的沙盒。公司将GLM-5.3部署在这些沙盒中,并要求其完成复杂的编程任务,部分练习甚至需要数天才能完成,这有效提升了模型处理长周期任务的能力。
这些沙盒由专业智能体自动生成。据Z.ai介绍,智能体参照真实软件项目构建环境,并为每个沙盒定制编程练习。在将任务交给GLM-5.3之前,还会由独立的"评判智能体"对挑战的可解性进行验证。
Z.ai表示,其工程师还对训练流程中的其他环节进行了自动化处理。公司搭建了能够自动生成奖励信号的数据管道,这一数据用于引导大语言模型的学习过程,并为模型提供反馈,帮助其识别优化输出的方向。
Z.ai的训练技术栈基于两项开源技术构建,分别是slime和SAO。其中slime能够简化大语言模型从训练环境迁移至生产推理基础设施的过程;SAO则是一种名为异步强化学习的AI方法的具体实现,可有效加速训练运行。
目前,GLM-5.3已通过Z.ai旗下的GLM编程订阅服务正式上线。公司计划在两周内以开源许可证形式,将该模型的权重文件发布至Hugging Face平台。
Q&A
Q1:GLM-5.3和GLM-5.2有什么区别?
A:GLM-5.3和GLM-5.2在架构上完全相同,都采用混合专家架构,拥有7530亿参数和100万Token的上下文窗口。两者的主要区别在于训练深度:GLM-5.3经历了更为深入的后训练流程,特别是在编程能力上,通过模拟开发者工作站的沙盒环境进行长周期任务训练,最终在编程智能体评测基准上比GLM-5.2提升了50%。
Q2:GLM-5.3在网络安全方面的能力如何?
A:GLM-5.3在网络安全领域表现突出,在专门评估代码漏洞发现能力的CyberGym基准测试上超越了Claude Mythos 5。实际应用中,该模型已在269个软件项目中发现超过2400个安全漏洞,约半数漏洞严重程度为中级或以上,甚至还发现了一处存在于40年前代码中的漏洞。不过在另外两项网络安全基准测试中,GLM-5.3仍落后于Anthropic的旗舰模型。
Q3:GLM-5.3现在怎么用?什么时候开源?
A:GLM-5.3目前已通过Z.ai的GLM编程订阅服务上线,用户可直接订阅使用。如果希望获取完整的开源权重文件,Z.ai计划在两周内以开源许可证的形式将模型权重发布到Hugging Face平台,届时开发者可免费下载和部署。