GLM-5.3发布:参数不变,性能飙升50%,编程能力逼近Claude Fable5
8月14日,智谱AI正式发布了新一代大模型GLM-5.3。这款模型的基础参数规模依然维持在740亿,与GLM-5.2保持一致,此前传闻的万亿参数升级并未出现——或许这张底牌要留给GLM-5.5。不过,智谱通过后训练技术的精雕细琢,让GLM-5.3的性能相比上一代提升了50%,在多个主流基准测试中刷新了开源模型的最高纪录。其编程和智能体能力已经逼近Claude Fable5,编程体验更是超过了国内其他模型。
数据说话:多项基准测试成绩飙升
GLM-5.3在几项关键基准测试中的表现十分亮眼,极具说服力。
在Terminal-Bench 3.0上,该测试衡量模型在真实终端环境中完成复杂任务的能力,GLM-5.3的得分从4.6跃升至28.3。在DeepSWE v1.1中,该测试聚焦于长程软件工程和连续代码修改能力,得分从46.2提升至66.9。在Agents' Last Exam中,该测试覆盖各种真实专业场景,强调跨工具协作和长程任务,得分从23.8提升至28.5。此外,在覆盖44个职业、考察高价值知识工作的GDPval-AA v2中,GLM-5.3获得了1769分,展现了基于编程技能的专业任务执行能力。
总体来看,GLM-5.3在复杂软件工程、终端操作以及更广泛的真实世界智能体任务上,都取得了显著进步。

效率与效果兼得:更短的执行路径
最能说明问题的是智谱自研的Z.ai Code Bench——这套评测将模型置于真实的本地开发环境中,在不同思维模式下执行端到端任务,尽可能真实地模拟开发者使用Coding Agent时的体验。测试结果显示,GLM-5.3在效果和Token利用之间找到了更好的平衡:在High模式下,准确率达到31.4%,超过了Claude Opus4.8在最大模式下的29.5%,而每个任务平均仅输出约5万Token,Opus4.8则需要约12万Token——这意味着GLM-5.3能用更短的执行路径完成同样的任务。

产品落地与开源计划
在产品层面,GLM-5.3现已上线智谱官方编程工具ZCode和效率工具AutoClaw,同时向GLM Coding Plan的所有用户和订阅用户开放。第三方编程平台如TraeWork、TraeCode、Kousi、WorkBuddy、CodeBuddy、Qoder、QwenWork、CatPaw、JoyCode、OpenCode等也已开启抢先体验。API即将推出,完整模型权重将在必要的安全加固后于两周内开源。智谱的策略是限制模型的潜在攻击能力,同时保留其防御价值。今天下午1点,GLM Coding Plan所有用户的配额已重置,大家可以在后台用量统计中看到配额恢复。
关键要点
- 参数不变,性能大增:GLM-5.3保持740亿参数,通过后训练优化实现50%性能提升。
- 基准测试全面跃升:Terminal-Bench、DeepSWE、Agents' Last Exam等多项测试成绩显著提高。
- 编程效率突出:在Z.ai Code Bench中,GLM-5.3以更少的Token消耗达到更高准确率。
- 产品与开源:已在ZCode、AutoClaw等工具上线,API即将推出,权重两周内开源。