Qwen3.8-Flash-Next:Qwen4架构抢先看
开源大模型领域迎来了一位新的领跑者。阿里巴巴通义千问团队悄然发布了Qwen3.8-Flash-Next,这是一款多模态MoE模型,作为即将推出的Qwen4架构的早期预览。它之所以引人注目,原因很简单:在无需通常计算能力的情况下,实现了卓越的性能。
稀疏巨人
乍一看,这些规格可能令人生畏。该模型总共有1250亿个参数,外加510亿用于N-gram嵌入表,以及40亿用于多令牌预测模块。但关键在于:每个令牌仅激活60亿个参数。这就是其高度稀疏的专家混合(MoE)设计的魔力。
可以把它想象成一个巨大的图书馆,你只需随时拿出需要的几本书。该模型有48层,其MoE层集成了512个专家,使用top-10路由机制来决定咨询哪些专家。这种稀疏性在保持高性能的同时降低了成本。
引擎盖下的创新
Qwen3.8-Flash-Next不仅关乎规模,更关乎智能工程。它引入了结合GDN和QSA的混合注意力机制,在高效处理长文本和准确检索信息之间取得了平衡。原始的256K上下文窗口已通过YaRN技术扩展到惊人的1M,因此它可以一次性处理整本书。
最引人入胜的补充之一是510亿参数的N-gram嵌入。这在不增加计算负载的情况下扩展了模型容量,并且可以通过异步预取存储在慢速DRAM中——这是一种巧妙的技巧,既保持了速度,又不会增加成本。
其他升级包括门控残差连接(GR)和具有微块粒度的稀疏注意力设计,用于上下文选择。这些听起来可能像行话,但它们都有助于提高模型的效率和准确性。
性能说明一切
那么,所有这些创新是否转化为实际成果?绝对如此。得益于其极度稀疏性,训练成本仅为上一代Qwen3.7-Plus的九分之一。然而,在代码编写和办公等核心任务中,它表现出显著改进。多项评估和近期报告证实,仅凭60亿个激活参数,它就超越了Claude Opus 4.6 Max等顶级模型。
这是一个大胆的说法,但数字支持它。对于开发者和研究人员来说,这意味着无需超级计算机即可获得最先进的性能。
社区就绪
开源社区无需等待太久就能上手。SGLang在发布当天提供了Day-0支持,因此开发人员可以立即访问模型权重,并在本地或集群环境中部署。这种无缝集成证明了模型的设计和团队对促进创新的承诺。
这对未来意味着什么
Qwen3.8-Flash-Next不仅仅是一次模型发布;它标志着行业的发展方向。通过优先考虑效率和成本效益,阿里巴巴正在推动AI可能性的边界。对于全球开源社区,它提供了丰富的技术见解和一个实用的例子,说明如何构建人人都能使用的高性能模型。
当我们展望Qwen4时,这次发布让我们得以一窥未来。如果这只是预览,那么完整版本必将改变游戏规则。
关键要点
- 模型:Qwen3.8-Flash-Next,来自阿里巴巴通义千问团队的多模态MoE模型。
- 架构:总参数1250亿,每个令牌仅激活60亿,拥有512个专家和top-10路由。
- 创新:混合注意力(GDN + QSA),通过YaRN实现1M上下文,N-gram嵌入,门控残差连接,以及稀疏注意力。
- 性能:训练成本为Qwen3.7-Plus的1/9,但在基准测试中优于Claude Opus 4.6 Max。
- 可用性:开源,并提供Day-0 SGLang支持,便于部署。