Skip to main content

GLM-5.3发布:基座不变,编程能力却跃居开源榜首

智谱今天甩出了一张新牌——GLM-5.3。乍一看,这代模型和上一代GLM-5.2没什么两样,基座模型压根没动。但别急着下结论,真正的变化藏在后训练阶段。智谱这次把后训练的规模拉到了一个新高度:长程任务环境扩大了十倍,环境类型更多样,训练时间也大幅延长。换句话说,他们没换发动机,而是把油门踩到了底,硬生生把同一台机器的性能压榨出了新高度。

内部评估显示,GLM-5.3的编程体验比GLM-5.2提升了大约50%。这可不是小打小闹,直接让它坐上了开源模型编程能力的头把交椅。

公开基准:数字不会说谎

光说不练假把式,看看公开基准测试的成绩单:

  • Terminal-Bench 3.0:从4.6分直接飙到28.3分,翻了六倍多。
  • DeepSWE v1.1:从46.2分涨到66.9分,进步明显。
  • Agents' Last Exam:从23.8分提升到28.5分。
  • GDPval-AA v2:拿到了1769分。

这些数字意味着什么?GLM-5.3的编程和智能体能力已经逼近Claude Fable 5,而且在Terminal Bench 3.0和Agents' Last Exam(CLI)测试中,它都拿下了开源模型的冠军。国内其他模型在体验上已经被它甩开了一截。

Image

后训练扩展:基座的潜力远未挖尽

智谱特别强调,所有这些提升都来自后训练,而不是换模型。他们基于IndexShare、SAO以及不断演进的下一代Slime框架,在GLM-5.2的基座上高效推进强化学习。团队甚至坦言:“可能还远未充分探索这个基座的智能上限。”这话听起来有点谦虚,但传递的信号很明确:大模型竞争不一定要靠堆参数,把现有基座训练到位,同样能逼近前沿。

Image

安全与可用性:兼顾防御与开放

安全方面,GLM-5.3在白盒代码审查和漏洞检测等任务上的表现与Mythos 5不相上下,这意味着它在网络防御场景中也有用武之地。不过,智谱留了个心眼:完整模型权重会在发布两周后放出,但前提是完成安全评估和模型加固,以限制潜在的攻击能力,同时保留防御价值。

目前,GLM-5.3已经上线智谱官方编程工具ZCode、AutoClaw和GLM Coding Plan,同时向Trae、Kouzi、WorkBuddy/CodeBuddy、Qoder等平台开放早期体验。

竞争转向:从“说得好”到“干得好”

开源模型在编程赛道上正逐步逼近闭源旗舰,国内大模型的竞争下半场,已经悄然从“谁更会聊天”转向“谁更能干活”。GLM-5.3的发布,或许正是这一转向的注脚。

Key Points

  • GLM-5.3基座不变,所有提升来自后训练扩展。
  • 编程体验较GLM-5.2提升约50%,成为开源最强。
  • 公开基准大幅跃升,逼近Claude Fable 5。
  • 安全性能与Mythos 5相当,权重两周后发布。
  • 竞争焦点从对话能力转向实际工作能力。