智谱发布GLM-5.3:编程能力开源最强,多项基准登顶,两周后开源权重
8月14日,智谱正式发布GLM-5.3,这是继GLM-5.2之后的又一次重大迭代。虽然基座模型保持不变,但通过后训练Scaling(规模化扩展)——包括数十倍扩展的长程任务环境、更丰富多样的环境类型及超长后训练时间——显著提升了模型的智能上界。
GLM-5.3在多项公开基准测试中取得开源第一:
- Terminal-Bench 3.0(真实终端环境复杂任务):得分从4.6跃升至28.3
- DeepSWE v1.1(长程软件工程与持续代码修改):从46.2提升至66.9
- Agents' Last Exam(CLI)(跨工具协作与长程任务):从23.8提升至28.5
- GDPval-AA v2(覆盖44种职业的专业知识工作):得分1,769
在智谱自研的Z.ai Code Bench评测中,GLM-5.3在High思考档位下准确率达31.4%,超越Claude Opus 4.8最高档位的29.5%,且每项任务平均输出约5万tokens(Opus 4.8约需12万tokens),用更短的路径完成了任务。
GLM-5.3在白盒代码审查与漏洞发现等安全任务中表现持平Mythos 5,展现了网络安全防御场景的潜力。所有能力提升均来自后训练,智谱基于自研的IndexShare、SAO及新一代Slime框架,在完全相同基座上高效推进强化学习,并称“可能远未开发出这个基座的智能上界”。
GLM-5.3即日起上线智谱官方编程工具ZCode、效率工具AutoClaw,并面向GLM Coding Plan全量用户开放。TraeWork、TraeCode、扣子、CodeBuddy、Qoder、CatPaw、JoyCode、OpenCode等编码平台也已开放抢先体验。API即将上线,完整模型权重将在两周内开源(需先完成安全加固,限制潜在攻击能力并保留防御价值)。今天13:00,GLM Coding Plan全员额度已重置,所有用户可使用额度回满。