GLM-5.3发布:基础模型未变,编程能力却大幅提升
智谱今天正式发布了GLM-5.3,这次更新有点特别——基础模型没换,但能力却上了一个台阶。所有提升都来自后训练阶段的扩展,而不是重新训练一个更大的底座。
具体来说,智谱把长程任务环境的规模扩大了十倍,环境类型也更多样,后训练时间也拉长了。这些操作听起来可能有点抽象,但效果很直接:在同一个基础模型上,智能上限被明显抬高。内部评测显示,新模型的编程体验比GLM-5.2提升了大约50%,目前是开源模型里编程能力最强的。
公开基准测试的成绩也相当亮眼。Terminal-Bench 3.0的得分从4.6直接跳到28.3,DeepSWE v1.1从46.2涨到66.9,Agents' Last Exam从23.8升到28.5,GDPval-AA v2更是达到了1769分。这些数字背后,是编程和智能体能力的全面进步,已经接近Claude Fable 5的水平,体验上甚至超过了其他国内模型。在Terminal Bench 3.0和Agents' Last Exam(CLI)测试中,GLM-5.3都拿下了开源组的第一名。

后训练扩展:基础模型的潜力远未挖尽
智谱强调,所有这些提升都来自后训练,而不是换模型。基于IndexShare、SAO和不断演进的下一代Slime框架,团队在GLM-5.2的同一个底座上高效推进强化学习,并且坦言“可能还远未充分探索这个基础模型的智能上限”。这句话传递的信号很明确:大模型竞争不一定非要拼参数,把现有底座练透,也能逼近前沿。

安全方面,GLM-5.3在白盒代码审查和漏洞检测等任务上的表现与Mythos 5不相上下,显示出在网络防御场景中的潜力。不过,智谱计划在发布两周后才放出完整模型权重,前提是完成安全评估和模型加固,以限制潜在的攻击能力,同时保留防御价值。
目前,新模型已经可以在官方编程工具ZCode、AutoClaw和GLM Coding Plan中使用,同时也向Trae、Kouzi、WorkBuddy/CodeBuddy和Qoder等编程平台开放了早期访问。随着开源模型在编程赛道上逐渐逼近闭源旗舰,国内大模型的竞争下半场,正在从“谁更会说话”转向“谁更能干活”。
关键要点
- 基础模型未变:GLM-5.3与GLM-5.2使用相同的底座,所有提升来自后训练扩展。
- 编程能力大幅提升:内部评测显示编程体验提升约50%,成为最强开源编程模型。
- 公开基准成绩亮眼:Terminal-Bench 3.0得分从4.6升至28.3,DeepSWE v1.1从46.2升至66.9,Agents' Last Exam从23.8升至28.5,GDPval-AA v2达1769分。
- 安全与可用性:模型权重将在安全评估后两周发布,现已登陆多个编程工具和平台。