跳转到主要内容

DeepSeek新闪速模型登陆Qwen,价格低廉

DeepSeek-V4.1-Flash登陆Qwen AI平台

DeepSeek悄然将其最新的轻量级旗舰模型DeepSeek-V4.1-Flash部署到Qwen AI平台。此举同时开放了API访问和Token Plan,为开发者提供了两种使用该模型的方式。你可以通过标准API将其接入自己的系统,或者直接在Qoder、Qwen APP和Codex等工具中使用Token Plan,用于编码、文档处理、视觉理解和代理任务。

Image

内部构造如何?

V4.1-Flash的核心采用混合专家(MoE)架构,总参数量高达5520亿。但关键在于:它仅在输入侧激活约80亿参数,输出侧激活约160亿参数。这种非对称的因果编码器-解码器设计在保持速度的同时不牺牲能力。

该模型原生理解文本和图像,并能处理最大100万token的上下文长度——输出可扩展至约393K token。据DeepSeek称,它在多个代理和代码基准测试中较前代有显著提升,同时凭借适中的激活参数保持了高吞吐量和低延迟。

成本故事:更便宜、更快速、更精简

定价是有趣之处。新一代缓存压缩大幅削减了KV Cache需求——HBM需求降至前代的四分之一,SSD存储仅需八分之一。这意味着长上下文和多轮工具调用不再像以前那样消耗资源。

在Qwen页面上,你可以找到基于时间的定价:

  • 非高峰时段: 每百万输入token 1元,每百万输出token 4元。
  • 高峰时段: 分别为2元和8元。

速率限制为15K RPM和1M TPM,涵盖前缀补全、函数调用、缓存、结构化输出、批处理任务和在线搜索。

部署与生态系统

阿里云百炼已与vLLM开源社区合作完成适配。该模型现已在中国站和国际站上线,覆盖北京、新加坡等地区,以及美国、德国、日本和香港等全球地点。

根据百炼文档,V4.1-Flash支持多轮对话、函数调用、在线搜索、上下文缓存和结构化输出——max_tokens限制约为393,216。这使其非常适合希望将长文档解析、客服知识库、代码仓库问答和多模态订单审核等任务迁移到单一界面的企业。

业界评价

专家认为这是一个明智之举:通过将“大参数、小激活、强缓存”的组合融入Qwen生态系统,V4.1-Flash可以降低长上下文代理的试错成本。对于小型团队来说,低非高峰定价加上Token Plan订阅意味着更灵活的批量推理和原型验证——而无需花费太多。

关键要点

  • DeepSeek-V4.1-Flash现已在Qwen AI平台上线,提供API和Token Plan。
  • MoE架构,总参数5520亿,输入激活约80亿,输出激活约160亿。
  • 100万token上下文,原生文本和图像理解。
  • 缓存压缩将HBM需求降至前代的1/4,SSD降至1/8。
  • 定价: 非高峰时段每百万输入token 1元,输出4元;高峰时段翻倍。
  • 通过阿里云百炼在多个地区可用,并已完成vLLM适配。