Skip to main content

GLM-5.3 发布:基座不变,编程能力却大幅跃升

智谱今天正式发布了 GLM-5.3,这次更新有点特别——基座模型没变,但能力却上了一个台阶。所有提升都来自后训练阶段的扩展,而不是换了个更大的底座。

具体来说,智谱把长任务环境的规模扩大了十倍,环境类型也更多样,后训练时间也拉长了。这些操作听起来挺技术流,但效果很直接:模型在同样基座上的智能上限被明显抬高。内部评测显示,新模型的编程体验比 GLM-5.2 提升了大约 50%,直接坐上了开源模型编程能力的头把交椅。

公开基准测试的成绩也很亮眼。Terminal-Bench 3.0 得分从 4.6 涨到 28.3,DeepSWE v1.1 从 46.2 升到 66.9,Agents' Last Exam 从 23.8 提高到 28.5,GDPval-AA v2 更是拿到了 1769 分。编程和智能体能力已经接近 Claude Fable 5,实际体验也超过了其他国产模型。在 Terminal Bench 3.0 和 Agents' Last Exam(CLI)测试中,它都拿下了开源组第一。

Image

后训练扩展:基座潜力远未挖尽

智谱特别强调,所有这些提升都来自后训练,而不是改模型。基于 IndexShare、SAO 和不断进化的下一代 Slime 框架,团队在 GLM-5.2 的基座上高效推进强化学习,还坦言“可能远未充分探索这个基座的智能上限”。这传递了一个信号:大模型竞争不一定要靠堆参数,把现有基座训练到位,同样能逼近前沿。

Image

安全方面,GLM-5.3 在白盒代码审查、漏洞检测等任务上表现与 Mythos 5 相当,有潜力用于网络防御。不过,智谱会在发布两周后才放出完整模型权重,而且要先完成安全评估和模型加固,限制潜在的攻击能力,保留防御价值。

目前,新模型已经上线官方编程工具 ZCode、AutoClaw 和 GLM Coding Plan,Trae、Kouzi、WorkBuddy/CodeBuddy、Qoder 等平台也提供了抢先体验。开源模型在编程赛道上逐渐逼近闭源旗舰,国产大模型的竞争下半场,正从“谁更会说话”转向“谁更会干活”。

关键要点

  • 基座不变,后训练扩展:GLM-5.3 未更换基座,所有提升来自后训练阶段的规模扩展。
  • 编程能力大幅提升:内部评测显示编程体验提升约 50%,成为最强开源编程模型。
  • 基准测试表现亮眼:Terminal-Bench 3.0 得分从 4.6 升至 28.3,DeepSWE v1.1 从 46.2 升至 66.9。
  • 安全与发布计划:两周后发布完整权重,需先完成安全评估和加固。
  • 生态接入:已上线 ZCode、AutoClaw 等工具,Trae、Qoder 等平台可抢先体验。