首页
学习
活动
专区
圈层
工具
发布

编程能力开源SOTA,网络安全提升2倍!智谱发布GLM-5.3

专注AIGC技术的专业社区,关注大语言模型(LLM)的发展和应用落地,聚焦LLM及AI技术的市场研究和开发者生态,欢迎关注!

智谱发布了GLM-5.3,编程能力大幅提升,743B参数模型,在公开基准中则达到开源模型SOTA。

而且,涌现出非常强的网络安全能力,网络安全方面基准得分是GLM-5.2的两倍以上。

底座模型与GLM-5.2完全相同,全部提升来自后训练(post-training)缩放。

在自研Z.ai Code Bench上比GLM-5.2提升50%,Terminal Bench 3.0和Agents' Last Exam等拿下开源SOTA。模型自己学会了规划完整利用链,配合国内安全团队在真实代码库里找出2436个漏洞,最年长的一个生于1981年,睡了45年。

GLLM-5.3沿用GLM-5.2的底座,靠一个月后训练缩放,把coding与长程任务能力抬了一大截,顺带解锁涌现式网络能力。

更接近真实工作的coding

公开基准之外,团队自研了Z.ai Code Bench,专门在真实用户场景里评估coding Agent。

任务覆盖多种类别,把Agent放进复杂的本地开发环境,在不同effort档位下端到端任务完成率和细粒度清单准确率。私有基准还降低了公开测试集带来的污染风险,更贴近真实用户体验。

Z.ai Code Bench上,GLM-5.3在每个档位都用更少的输出token拿到更强成绩。

Max档位,每个任务约75K输出token,完成率34.5%,GLM-5.2用96K token只有23.4%。High档位,约50K token拿到31.4%,超过Claude Opus 4.8用120K token拿到的29.5%。排在GLM-5.3前面的是Claude Fable 5,Max档位39.5%。

5个模型在6项基准上对比如下。

GLM-5.3在6项上全部领先开源对比模型,部分项目越过闭源模型。

AutomationBench拿48.2,压过Fable 5的46.2和GPT-5.6 Sol的45.8。GDPVal-AA v2拿1769分,同样是全场最高。

Agents' Last Exam拿28.5,比GPT-5.6 Sol的28.6低0.1,高于Fable 5的23.8。Terminal Bench 3.0和DeepSWE离两个闭源模型还有距离,相比上一代模型,幅度最大的增益恰恰出在这里。

完整性能对比表如下,编程,网络安全,Agent上,相较于上一代各项基准都有大幅提升。

Terminal Bench 2.1拿88.2,贴着GPT-5.6 Sol的88.8,FrontierSWE拿78.1,SWE-Marathon v1.1拿42.5与GPT-5.6 Sol持平。

agentic项目里,Toolathlon Verified拿73.0,HLE w/ Tools拿62.5,都是开源组最高分。

涌现出的cyber能力

把漏洞发现数据和环境混进后训练时,团队的预期只是让模型更会找漏洞、更会推理漏洞。实际增速超出预期,模型开始跨多个利用阶段做推理,把完整利用链串成连贯计划。

CyberGym从白盒源码出发,考模型能否识别漏洞并触发故障验证,GLM-5.3拿84.5%,高于GLM-5.2的77.2%,是基准上的最好成绩,超越了Fable 5的83.8%和GPT-5.6 Sol的83.6%。

ExploitBench要求对真实漏洞和利用方式做更深推理,GLM-5.3拿54.4%,比GLM-5.2的24.4%翻倍还多,同项Fable 5为78.0%,GPT-5.6 Sol为76.5%。

ExploitGym按时间归一化预算看能完成多少利用任务,预算按各模型吞吐归一,GLM-5.3两小时完成105个任务,6小时完成130个,GLM-5.2只有29和39,Fable 5以181和247保持领先。

基准在利用链上的位置越靠后,GLM-5.3相对GLM-5.2的增益越大,与闭源前沿的差距也越宽。能力增长最快的地方,正是落后最多的地方。

从GLM-5.2开始,团队就与国内几家安全团队合作,把模型放到真实代码库上跑。

经专家审查、筛选、去重后,模型在269个项目里识别出2436个漏洞,其中1097个为中高危。发现遍布系统内核、操作系统、浏览器引擎、开源基础设施、Web应用和网络协议,许多漏洞潜伏数年甚至数十年,最年长的一个引入于1981年,全部发现横跨45年,漏洞平均潜伏26.6年才被发现。

这项工作已经变成一项持续的披露计划。团队建了安全漏洞披露台账(cvd.z.ai),一份公开记录,跟进披露流程,区分已公开和仍在披露中的问题,已公开的问题记录受影响项目、严重等级、CVE编号(如有)、漏洞在代码库中潜伏的时长。

增益全来自后训练

一个月,团队在同一套栈上继续缩放,更多环境,更多样任务,更多算力。

缩放的任务远离编程练习,更靠近真实专家工作。有的任务相当于经验丰富的工程师几天的工作量。

一类ML基础设施任务里,模型拿到与工程师相同的工作环境,能访问计算集群、存储系统、内部文档、代码库和实验结果,要诊断训练栈各层的瓶颈,实现优化,跑实验,在保证正确性的同时交付可测量的端到端提速。

RL策略沿用GLM-5.2的SAO加compaction,保证增益在长程任务上也站得住,不只对短任务有效。

公开基准测试,Terminal-Bench 3.0从4.6到28.3,DeepSWE v1.1从46.2到66.9,Agents' Last Exam从23.8到28.5。

以上全部跑在slime上,一个面向RL缩放的开源后训练框架,训练侧用Megatron,rollout侧用SGLang。设计上把训练、rollout、数据缓冲放在同一条数据流上,数学、代码、沙箱、验证器、长程Agent环境都作为数据生成接入,不改训练循环。

算法侧,slime新增了top-p mask、top-k与全词表OPD,以及提升训练与rollout一致性的配置,含R3式配置和两条路径的完全数值对齐。训练与rollout一致性评测中,logprob(对数概率)平均差异控制在1e-7量级,比此前配置降低99.99%以上。

资源侧,本地存储成为额外缓存层,分层存放模型状态和数据,省下主机内存。受益最大的是多教师OPD,动态切换教师加预取,几位教师共用一套资源,不必每位教师各起一个长驻推理服务。

面向agentic和异步负载,router与slime之间的联合调度和负载均衡做了改进,工作负载感知的启发式方法从各rollout环境特征推导prefill/decode资源比、并发设置等吞吐配置。长程coding RL任务上,系统级优化把端到端RL训练吞吐提升2.3倍以上。

GLM-5.3目前只处理文本模态,上下文窗口1M,最大输出128K token。

思考功能始终开启,分low、high、max三档,不支持关闭。

等安全评估和加固完成,权重将在发布2周后开源。

参考资料:

https://z.ai/blog/glm-5.3

https://docs.bigmodel.cn/cn/guide/models/text/glm-5.3

  • 发表于:
  • 原文链接https://page.om.qq.com/page/ON5TjfnZ1voMfTeniwd_6sJQ0
  • 腾讯「腾讯云开发者社区」是腾讯内容开放平台帐号(企鹅号)传播渠道之一,根据《腾讯内容开放平台服务协议》转载发布内容。
  • 如有侵权,请联系 cloudcommunity@tencent.com 删除。

相关快讯

领券