跳转到主要内容

Qwen3.8-Flash-Next:性能突破的轻量级巨人

Qwen团队刚刚发布了一款在AI社区引起轰动的新模型。这就是Qwen3.8-Flash,一个多模态MoE(混合专家)模型,尽管设计轻量,却实力强劲。与此同时,他们还开源了下一代架构Qwen3.8-Flash-Next,这基本上是即将推出的Qwen4系列的蓝图。

那么,有什么大不了的?嗯,Qwen3.8-Flash总参数为1250亿,外加额外的510亿N-gram嵌入,但关键在于:每个token仅激活60亿参数。这意味着它非常高效。它原生支持26万token的上下文窗口,借助YaRN技术,可以扩展到惊人的100万token。而且,训练成本仅为前代Qwen3.7-Plus的九分之一。API定价也很实惠——每百万输入token 1元,每百万输出token 3元。它已经在Qwen AI平台上上线,他们还推出了“Qwen Office”功能。

Image

现在,让我们谈谈架构。团队进行了四项重大升级,使其脱颖而出。首先,注意力模块采用混合GDN+QSA设计。GDN压缩历史信息,而QSA挑选关键上下文。在百万token场景下,这实现了高达7.6倍的Prefill加速和4.9倍的Decode加速。其次,他们引入了门控残差机制,将残差流扩展为四个并行分支,使用动态门控改善跨层信息流和训练稳定性。第三,N-gram嵌入使用局部上下文查找表,在不显著增加计算量的情况下增加了510亿参数。最后,他们采用了Muon和AdamW的混合优化策略,这使他们能够重新拟合缩放定律,甚至消除了批量预热过程。

但它的性能真的好吗?当然。尽管只有60亿激活参数,基础模型在14项评估中有8项取得了最佳结果。微调版本在代码、智能体和多模态任务中表现出色。例如,它在SWE-bench Pro上得分62.5,并在CoWorkBench和Toolathlon等智能体排名中领先。

如果你好奇想尝试,Qwen3.8-Flash-Next的权重现已在Hugging Face和ModelScope上开源,完整的技术报告也可获取。Qwen团队显然致力于透明度和社区协作,希望借助全球开发者的帮助来验证他们的创新。这是一个大胆的举措,可能加速Qwen4系列的发展。

关键要点

  • 高效设计:总参数1250亿,仅激活60亿,带来显著成本节省。
  • 长上下文:借助YaRN支持高达100万token,能够处理海量文档。
  • 架构创新:混合注意力、门控残差和N-gram嵌入提升性能和稳定性。
  • 基准测试成功:在许多任务上超越更大模型,尤其是在代码和智能体场景中。
  • 开源:权重和技术报告公开,邀请社区协作。