跳转到主要内容

GLM-5.3发布:参数不变,性能飙升50%,编程能力逼近Claude Fable 5

8月14日,智谱AI正式发布了新一代大模型GLM-5.3。令人意外的是,这款模型的参数规模依旧维持在740亿,与GLM-5.2持平,此前传闻的万亿参数并未出现——或许这张底牌要留给GLM-5.5。不过,智谱通过后训练技术的精进,让GLM-5.3的性能较上一代提升了50%,在多个主流基准测试中登顶开源模型榜首,编程和智能体能力直逼Claude Fable 5,编程体验更是超越了国内其他模型。

关键基准测试成绩大幅跃升

GLM-5.3在多个关键基准测试中的表现令人瞩目。在Terminal-Bench3.0上,该测试衡量模型在真实终端环境中完成复杂任务的能力,得分从4.6跃升至28.3;在DeepSWE v1.1上,该测试聚焦于长程软件工程和持续代码修改能力,得分从46.2提升至66.9;在Agents' Last Exam上,该测试覆盖多种真实专业场景,强调跨工具协作和长程任务,得分从23.8提升至28.5。此外,在覆盖44个职业、考察高价值知识工作的GDPval-AA v2测试中,GLM-5.3获得了1769分,展示了其基于编程技能的专业任务执行能力。总体而言,GLM-5.3在复杂软件工程、终端操作以及更广泛的真实世界智能体任务上均取得了显著进步。

Image

效率与效果的平衡

最有力的证据来自智谱自研的Z.ai Code Bench——这套评估将模型置于真实的本地开发环境中,在不同思维模式下执行端到端任务,尽可能真实地模拟开发者使用Coding Agent的体验。测试结果显示,GLM-5.3在效果和Token利用之间找到了更好的平衡:在High模式下,准确率达到31.4%,超过了Claude Opus4.8最大模式的29.5%,而每个任务平均仅输出约5万Token,Opus4.8则需要约12万Token——这意味着GLM-5.3能以更短的执行路径完成相同任务。

Image

产品落地与开放计划

在产品落地方面,GLM-5.3现已上线智谱官方编程工具ZCode和效率工具AutoClaw,同时向GLM Coding Plan的所有用户及订阅用户开放。第三方编程平台如TraeWork、TraeCode、Kousi、WorkBuddy、CodeBuddy、Qoder、QwenWork、CatPaw、JoyCode和OpenCode也已开放抢先体验。API即将推出,完整模型权重将在完成必要的安全加固后于两周内开源。智谱的策略是限制模型的潜在攻击能力,同时保留其防御价值。今天下午1点,GLM Coding Plan所有用户的配额已重置,用户可在后台用量统计中看到配额恢复。

关键要点

  • GLM-5.3参数规模仍为740亿,性能较上代提升50%。
  • 在Terminal-Bench3.0、DeepSWE v1.1等基准测试中创下开源模型新高。
  • 编程与智能体能力接近Claude Fable 5,编程体验超越国内其他模型。
  • 已在官方工具及第三方平台开放,API即将上线,完整权重两周内开源。