DeepSeek新Flash模型登陆Qwen,价格实惠
DeepSeek新Flash模型登陆Qwen,价格实惠
如果你一直在寻找一款强大且实惠的AI模型,DeepSeek的最新发布可能正是你的答案。DeepSeek-V4.1-Flash现已在Qwen AI平台上线,并带来了一些严肃的规格。
内部有什么?
这不仅仅是又一次增量更新。V4.1-Flash是DeepSeek新的轻量级旗舰,基于混合专家(MoE)架构构建,总参数量高达5520亿。但巧妙之处在于:它仅激活约80亿参数用于输入,160亿用于输出。这意味着你获得了巨型模型的力量,却没有通常的计算负担。
它还原生处理文本和图像,上下文窗口呢?高达100万token——足以一次性消化整本书或庞大的代码库。输出可扩展至约393,000 token,使其成为长格式生成的猛兽。

成本故事
让我们谈谈钱,因为这才是有趣的地方。DeepSeek将KV Cache需求压缩到上一代HBM的四分之一,SSD存储的八分之一。翻译:长上下文和多轮工具调用不会那么快地耗尽你的资源。
在Qwen平台上,定价基于时间。在非高峰时段,你将支付每百万输入token 1元和每百万输出token 4元。高峰时段翻倍至2元和8元。对于小团队来说,非高峰费率简直是偷窃——尤其是结合Token Plan订阅,让你可以批量推理而不必破费。
准备部署
阿里云的百炼已经与vLLM社区合作,完成了所有适配。你可以在中国站和国际站访问该模型,覆盖从北京到新加坡、美国、德国、日本和香港的地区。它支持多轮对话、函数调用、在线搜索、上下文缓存和结构化输出。max_tokens限制约为393,216。
对于企业来说,这意味着你可以将长文档解析、客服知识库、代码仓库问答和多模态订单审核等任务迁移到一个接口。不再需要为不同工作 juggling 多个模型。
为什么重要
行业观察家表示,通过将这种“大参数、小激活、强缓存”的组合融入Qwen生态系统,V4.1-Flash大幅降低了构建长上下文代理的试错成本。对于小团队来说,低非高峰定价加上Token Plan订阅为灵活的批量推理和快速原型设计打开了大门。
所以,如果你一直在等待一个平衡了力量、速度和价格的模型,现在可能是深入其中的时刻。
关键点
- DeepSeek-V4.1-Flash在Qwen AI平台上线,提供API和Token Plan访问。
- MoE架构,总参数量552B,但仅激活约8B输入和约16B输出。
- 支持文本和图像,具有1M token上下文和约393K token输出。
- 激进的定价:非高峰时段每百万输入token 1元,每百万输出token 4元。
- 在阿里云百炼上可用,覆盖多个全球地区,准备用于企业任务。