Skip to main content

国产GPU也能跑万亿参数大模型:海光DCU适配Kimi K3,896专家并行不卡顿

国产算力终于站起来了!海光信息近日宣布,其DCU平台已完成对Kimi K3的全栈适配与性能验证。这意味着,那些动辄万亿参数的超级大模型,再也不是海外旗舰芯片的专属玩具了。

零迁移成本,开箱即用

海光DCU这次玩得挺大——从底层算子到推理引擎,全链路优化了一遍。最让人惊喜的是,模型代码完全不需要修改,拿来就能跑。开发者拿到算力后直接部署,兼容性顺滑得让人怀疑是不是还在用国产卡。

对于Kimi K3特有的KDA注意力机制和那个由896个专家组成的MoE架构,海光做了算子级的定制优化。即便896个专家同时并行工作,在百万级上下文的复杂场景下,推理依然高效稳定,一点都不卡顿。

Image

实际场景表现不俗

在实际应用中,K3在海光DCU上能支持远程智能体项目、视觉闭环创作,甚至自研芯片设计等高级应用。国产算力用户终于可以自己跑起万亿参数的开源模型了。

值得一提的是,在K3发布之前,月之暗面就已经与海光、中科院深圳先进院(简称“深先院”)完成了全栈兼容优化。深先院基于海光DCU硬件栈,集成了Kimi MoE架构的分布式训练和多卡并行推理链路;海光DCU则通过软硬件栈的协同优化,在深先院8000集群上实现了稳定的长文本推理。

性能损失仅12%,达到商用门槛

官方测试数据让人安心:国产卡的性能损失控制在12%以内,这已经达到了商业部署的阈值。当万亿参数模型与国产GPU之间的鸿沟被填平,智能时代的算力格局正在悄然改变。

关键要点

  • 海光DCU完成Kimi K3全栈适配,模型代码无需修改即可运行
  • 针对KDA注意力机制和896专家MoE架构进行算子级优化
  • 百万级上下文场景下推理高效稳定,性能损失仅12%
  • 已支持远程智能体、视觉闭环、芯片设计等高级应用
  • 与月之暗面、深先院合作完成全栈兼容优化