Skip to main content

大模型没有秘密:腾讯混元4如何靠开源与人才逆袭?

大模型领域,真的存在所谓的“独门秘籍”吗?腾讯混元4的发布,或许给出了一个耐人寻味的答案。

此前,从OpenAI跳槽至腾讯的姚顺雨曾笑言:“做大模型没什么真正的秘密。”当时,很多人只当是一句玩笑。然而,当混元4(Hy4 preview)带着770B参数、支持百万级上下文的表现亮相时,这句话的分量才真正显现出来。

面对智谱、月之暗面、DeepSeek、通义等强劲对手,腾讯在四个月内完成了混元大语言模型和多模态部门的重组,并推出了混元4。细看其技术配置,你会发现,所谓的大模型“独家秘笈”,早已被开源机制和顶尖人才的快速流动拆解得七零八落。

从底层结构来看,混元4直接对齐了智谱GLM-5(744B)在700B中大规模级别上验证过的工程最优解。其主干网络隐藏维度6144、78层、64个注意力头,这些参数决定了Transformer网络在深度、宽度和注意力并行结构上的统一选择。对于急需突破的腾讯而言,站在前人验证过的共识基础上,无疑少走了许多弯路。

在核心技术迁移上,混元4的注意力模块巧妙地整合了多项开源成果。其主体借鉴了DeepSeek在V3.2中开源的稀疏注意力机制(DSA),通过轻量级索引器在超长上下文中选取Top-K Token,从而避免扫描全部历史。随后,它又吸收了智谱团队在IndexCache中验证的跨层索引复用机制,让相邻Transformer层直接复用已有索引结果,将索引器计算量最高减少75%,实现了端到端的性能提升。此外,在残差优化上,混元4放弃了复杂的mHC,转而采用微软研究员谢天在社交平台公开讨论中提出的恒等超连接(iHC)方案。

技术接力背后,是顶尖人才的深度流动。清华姚班毕业的白玉石,曾担任智谱GLM-5新模型架构和DSA的负责人,几个月前正式加入腾讯混元团队,并出现在混元长上下文稀疏注意力论文的作者列表中。正是通过这些优秀的研究者,那些难以言传的工程经验,从一家公司物理性地迁移到了另一家。

如今,任何能够通过论文、代码和实验数据表达的技术优势,其独占期都在急剧缩短。从顶级会议论文到开源代码,再到社区讨论帖,前沿架构的传播路径已被彻底打通。大模型的行业护城河,正在被开源生态和人才流动迅速填平。

关键要点

  • 混元4的技术配置与智谱GLM-5、DeepSeek V3.2等开源成果高度重合,印证了“大模型没有秘密”的说法。
  • 开源机制和顶尖人才流动,正在加速技术扩散,缩短技术独占期。
  • 腾讯通过吸收开源成果和引进关键人才,在四个月内完成了混元4的研发,实现了快速追赶。
  • 大模型竞争的核心,已从技术壁垒转向工程整合与生态构建能力。