智谱GLM-5.3发布:开源编码能力冲到SOTA,还‘意外’练出了网络攻防

· 科技资讯

8 月 14 日,智谱旗下 Z.ai 发布 GLM-5.3。官方博客的开场白很坦诚:”我们只做了一件事——把后训练继续放大。”GLM-5.3 与 5.2 共用同一个基座,所有提升都来自后训练扩展。但结果并不平淡:编码能力开源最强,而且突现了让团队自己都意外的网络攻防能力

智谱GLM-5.3发布:开源编码能力冲到SOTA,还‘意外’练出了网络攻防封面

编码:开源阵营的新标杆

在 Z.ai 自家的 Code Bench 上,GLM-5.3 比 5.2 提升 50%;在公开基准上拿到开源 SOTA,包括 Terminal Bench 3.0 和 Agents’ Last Exam。

几个关键数字:

Terminal Bench 3.0:28.3 分,GLM-5.2 只有 4.6 分,翻了六倍;

– DeepSWE v1.1:66.9 对 46.2,真实软件工程任务明显进步;

– 更值得注意的是 token 效率:Max 档下 5.3 以约 75K 输出 token 达到 34.5% 完成率,而 5.2 要花 96K token 才到 23.4%;High 档甚至超过了 Claude Opus 4.8(31.4%@50K vs 29.5%@120K)。

简单说:同样的任务,GLM-5.3 花更少的 token 干更多的活。对用 API 按 token 付费的开发者,这是实打实的成本下降。

突现的”网络攻防”:是惊喜也是警钟

最引发讨论的是安全能力。Z.ai 在训练中加入了漏洞发现数据,本意是让模型更会”找 bug”,结果能力发展远超预期:模型开始跨阶段推理完整的漏洞利用链。

– CyberGym(白盒漏洞验证):84.5%,开源第一,超过 Mythos 5 和 GPT-5.6 Sol;

– ExploitBench:54.4%,是 5.2(24.4%)的两倍多;

– 与安全团队合作实测:在 269 个真实项目中识别出 2436 个漏洞,其中 1097 个中高危,最老的漏洞可追溯至 1981 年,平均在代码库里潜伏了 26.6 年。

Z.ai 同步上线了公开的 Security Disclosure Ledger 漏洞披露平台,目前 53 个已公开、2383 个处于保密期。模型本身计划在两周后开源权重,先完成安全评估与加固。

双刃剑怎么看

GLM-5.3 的定位很清楚:把最强的开源编码模型和”会渗透测试的 agent”绑定在一起。对防守方(安全团队)这是效率工具——找漏洞、写 PoC、评估攻击面;对监管和开源社区,这提醒所有人:AI 能力的边界正在被后训练快速推高,安全评估必须前置

对中文开发者的建议:

1. 想尝鲜编码能力,等两周权重开源后用本地或 API 方式跑 Terminal Bench 类任务,和 DeepSeek-V4、Qwen3.8 做对比;

2. 安全团队可以关注漏洞披露台账,里面可能就有你依赖的开源项目;

3. 别被”攻防”两个字吓到——模型是工具,用在哪取决于人,关键是生态有没有建立负责任的披露机制。

一个趋势值得记住:国产模型已经不止拼”会不会聊天”,而是拼”能不能干活、能不能打硬仗”。GLM-5.3 把这条线又往前推了一大截。

背后的技术栈更值得关注

GLM-5.3 的进步不是靠换基座,而是靠一套后训练流水线:IndexShare 处理长上下文、SAO 做长任务强化学习、slime 做大规模异步训练。真正的门槛在于任务环境的规模化——团队用合成流水线把真实工程任务变成可执行、可验证的训练环境,再用裁判 agent 验证任务可解,最后把奖励信号闭环。这套”造环境比造模型更难”的打法,说明国产模型在工程化能力上已经进入深水区,也为两周后的开源权重埋下了看点:届时任何人拿到模型,都能在真实环境里复现它的编码与安全能力。

🔥 关注LC智趣厅,第一时间看懂 AI 圈的大新闻。

👇 关注不错过,每一条都帮你算清楚”跟我有什么关系”。


— END —
LC 智趣厅 · 科技与生活的交点
ihygg.cn

Scroll to Top
微信公众号:LC智趣厅

扫码关注微信公众号
LC智趣厅