DeepSeek新闪速模型登陆Qwen,价格低廉
DeepSeek-V4.1-Flash登陆Qwen AI平台
DeepSeek悄然将其最新的轻量级旗舰模型DeepSeek-V4.1-Flash部署到Qwen AI平台。此举同时开放了API访问和Token Plan,为开发者提供了两种使用该模型的方式。你可以通过标准API将其接入自己的系统,或者直接在Qoder、Qwen APP和Codex等工具中使用Token Plan,用于编码、文档处理、视觉理解和代理任务。

内部构造如何?
V4.1-Flash的核心采用混合专家(MoE)架构,总参数量高达5520亿。但关键在于:它仅在输入侧激活约80亿参数,输出侧激活约160亿参数。这种非对称的因果编码器-解码器设计在保持速度的同时不牺牲能力。
该模型原生理解文本和图像,并能处理最大100万token的上下文长度——输出可扩展至约393K token。据DeepSeek称,它在多个代理和代码基准测试中较前代有显著提升,同时凭借适中的激活参数保持了高吞吐量和低延迟。
成本故事:更便宜、更快速、更精简
定价是有趣之处。新一代缓存压缩大幅削减了KV Cache需求——HBM需求降至前代的四分之一,SSD存储仅需八分之一。这意味着长上下文和多轮工具调用不再像以前那样消耗资源。
在Qwen页面上,你可以找到基于时间的定价:
- 非高峰时段: 每百万输入token 1元,每百万输出token 4元。
- 高峰时段: 分别为2元和8元。
速率限制为15K RPM和1M TPM,涵盖前缀补全、函数调用、缓存、结构化输出、批处理任务和在线搜索。
部署与生态系统
阿里云百炼已与vLLM开源社区合作完成适配。该模型现已在中国站和国际站上线,覆盖北京、新加坡等地区,以及美国、德国、日本和香港等全球地点。
根据百炼文档,V4.1-Flash支持多轮对话、函数调用、在线搜索、上下文缓存和结构化输出——max_tokens限制约为393,216。这使其非常适合希望将长文档解析、客服知识库、代码仓库问答和多模态订单审核等任务迁移到单一界面的企业。
业界评价
专家认为这是一个明智之举:通过将“大参数、小激活、强缓存”的组合融入Qwen生态系统,V4.1-Flash可以降低长上下文代理的试错成本。对于小型团队来说,低非高峰定价加上Token Plan订阅意味着更灵活的批量推理和原型验证——而无需花费太多。
关键要点
- DeepSeek-V4.1-Flash现已在Qwen AI平台上线,提供API和Token Plan。
- MoE架构,总参数5520亿,输入激活约80亿,输出激活约160亿。
- 100万token上下文,原生文本和图像理解。
- 缓存压缩将HBM需求降至前代的1/4,SSD降至1/8。
- 定价: 非高峰时段每百万输入token 1元,输出4元;高峰时段翻倍。
- 通过阿里云百炼在多个地区可用,并已完成vLLM适配。