GLM-5.3发布:智能网络安全获重大突破

中国人工智能企业Z.ai今日正式推出GLM-5.3模型,该模型在长周期编程能力方面取得显著提升,同时网络安全功能实现了跨越式进步,具有潜在的重要意义。
根据Z.ai开发者代表Lou在社交平台上的信息,GLM-5.3的网络安全能力已经发现”Cursor编程工具中一个可能存在的严重漏洞”。Cursor是最近被SpaceX收购的AI编程初创公司。VentureBeat也已联系Cursor进行确认,目前尚在等待回应。
GLM-5.3目前仅通过公司的GLM编程计划和ZCode编程环境提供,API访问和开源权重将在后期推出,”安全评估和强化工作完成后”即可开放。Z.ai表示计划在发布约两周后开放权重。
无基础模型升级,编程能力大幅提升
对于企业开发者而言,此次发布的亮点不仅在于基准测试的又一次提升。Z.ai表示,GLM-5.3使用与GLM-5.2相同的基础模型,所有改进完全来自于在更多环境、更多样化任务和额外强化学习计算上的扩展后训练。
这使得GLM-5.3成为了一次测试:在无需昂贵预训练周期的情况下,前沿规模的基础模型可以被优化到何种程度。
扩展后训练是GLM-5.3的全部改进方式,Z.ai在其技术公告中写道。
结果显示仍有巨大提升空间。但也给开源模型开发者带来了一个特殊问题:据Z.ai称,随着训练规模的扩大,网络安全能力提升速度超预期,特别是在从漏洞识别向构建完整利用链的任务推进过程中。
路透社报道,Z.ai还围绕模型的一些更高级功能引入了控制措施,包括敏感功能的”可信访问”方法。
编码能力显著跃升
GLM-5.3建立在GLM-5.2的7430亿参数规模基础模型之上,而非替代它。Z.ai扩展了已经围绕长周期强化学习建立的后训练系统。
这些环境越来越接近完整的工程项目,而非孤立的编程练习。
Z.ai描述的场景中,智能体能获得代码库、文档、计算集群、存储系统和实验结果的访问权限,然后需要诊断问题、修改系统、运行实验并展示可衡量的改进,同时保持正确性。一些任务被设计为模拟有经验工程师数天的工作量。
这种方法在Z.ai的评估中带来了显著的代际改进。
- 在Terminal-Bench 3.0上,GLM-5.3从4.6提升至28.3
- 在DeepSWE v1.1上,从46.2提升至66.9
- 在AutomationBench上,从26.2提升至48.2
- 在智能体期末考试CLI上,从23.8提升至28.5
该模型并未在所有前沿竞争对手中占据主导地位。根据Z.ai自己的基准测试表,在Terminal-Bench 3.0上,GPT-5.6 Sol得分为34.6,Claude Fable 5为33.7,而GLM-5.3为28.3。在DeepSWE v1.1上,GLM-5.3得分为66.9,低于GPT-5.6 Sol的72.7和Fable 5的69.7。
但Z.ai也强调效率而非单纯的基准排名。
在其私有的Z.ai Code Bench上,GLM-5.3在最大推理设置下达到34.5%的结果,同时每项任务消耗约75,000个输出token。GLM-5.2在消耗约96,000个token的情况下达到23.4%。在高努力设置下,GLM-5.3在约50,000个输出token时达到31.4%,而Z.ai报告称使用120,000个token的Claude Opus 4.8为29.5%。
由于Code Bench是Z.ai的私有评估,这些比较应被视为公司报告的结果而非独立测量。尽管如此,减少token消耗同时提高任务完成率对企业部署编码智能体来说在操作上至关重要,因为长时间运行的循环可能使推理成本和延迟迅速累积。
网络安全能力提升超出预期
更显著的发展是网络安全能力的提升。
Z.ai在GLM-5.3的后训练组合中引入了漏洞发现环境,期望模型能提高发现软件缺陷的能力。然而,公司表示能力开始沿着利用链进一步发展。
随着后训练规模的扩大,网络安全能力发展速度超出了我们的预期,Z.ai写道。
在CyberGym上(测试漏洞发现和验证对源代码的能力),GLM-5.3得分为84.5%,高于GLM-5.2的77.2%,也超过了Z.ai报告的GPT-5.6 Sol的83.6%和Mythos 5的83.8%。
但这种优势并未延伸至整个利用栈。在ExploitBench上,GLM-5.3得分为54.4%,是GLM-5.2的24.4%的两倍多,但仍远低于Z.ai报告的GPT-5.6 Sol的76.5%和Mythos 5的78%。
同样,在ExploitGym上,GLM-5.3在标准化的两小时预算内完成105个任务,六小时内完成130个,而GLM-5.2分别为29和39。Fable 5达到181和247,GPT-5.6 Sol达到216和293。
发展方向可能比排行榜位置更重要。
Z.ai表示,与中国安全团队合作后,经过专家审查、筛选和去重,已在269个项目中发现了2,436个漏洞。其披露清单列出了1,097个严重或高危漏洞,其中53个已公开披露,2,383个在发布时仍处于保密期。
这给前沿模型提供商带来了日益紧张的局面:使模型对软件工程更有用的长周期智能体能力,同时也使它们成为更强大的安全研究人员,甚至可能是更强大的进攻性操作者。
开发者需调整模型调用方式
迁移现有GLM应用的开发者应注意一个破坏性API行为。
GLM-5.3支持三种推理努力级别——低、高和最大,其中最大是默认设置,也是Z.ai推荐的编程设置。但与之前的版本不同,思考功能无法禁用。
当前发送”thinking.type: “disabled””的应用必须将其值更改为”enabled”,并在切换模型标识符为GLM-5.3之前指定推理努力级别。否则,Z.ai表示请求将失败。
这使得GLM-5.3对某些生产应用来说是一次实际迁移,而非简单的模型名称替换。
关注微信号:智享开源 ,及时了解更新信息。


公众号:智享开源
还没有任何评论,你来说两句吧!