DeepSeek的下一场豪赌:3万亿参数挑战GPT-6 Astra
DeepSeek的下一场豪赌:3万亿参数挑战GPT-6 Astra
就在你以为DeepSeek保持低调时,谣言又起。本周,该公司悄然推出了V4.1 Flash,其架构变化之大,完全可以称为V5。然而DeepSeek坚持使用次要版本号——典型的低调作风。与此同时,Pro版本已确认存在,但细节寥寥。鉴于此前V4 Pro的反响褒贬不一,期望充其量只是谨慎乐观。
DeepSeek Code 2.0:代码低语者?
如今,泄露圈的低语暗示一个新的重量级选手即将登场:DeepSeek Code 2.0,可能在九月发布。如果传言准确,它的目标是超越当前的巨头——Mythos 5.1和GPT-6 Astra。考虑到Astra以令人眼花缭乱的计算机使用能力闻名,这是一个大胆的宣言。
Code 2.0有何特别之处?据报道,它的设计考虑了Computer Use——本质上让AI掌控并处理你的计算机任务。可以把它想象成吃了兴奋剂的数字助手。如果它遵循DeepSeek的传统,很可能开源,这可能会在开发者社区引起涟漪。
三万亿参数:数字游戏
让我们谈谈规模。泄露信息指向超过3万亿参数——一个令人瞠目结舌的数字,将使其成为中国最大的模型,且遥遥领先。作为参考,目前国内冠军K3拥有2.8万亿参数,而Qwen 3.8 Max有2.4万亿。DeepSeek自家的V4 Pro则为1.6万亿。
但3万亿只是白日梦吗?考虑一下:V4.1 Flash已经通过新架构将参数翻倍。因此,从1.6万亿跃升至3万亿并非完全不可能。毕竟,要与Mythos 5.1和Astra这样的对手共舞,你需要强大的肌肉。否则,你只是带刀赴枪战。
我们应该相信这些炒作吗?
这里就变得棘手了。DeepSeek在2023年至2024年间发布了三款“Code”模型,它们……还不错。不算惊艳,但扎实。如果该公司现在将一款专注于代码/逻辑的模型定位为旗舰,那将是一次战略转向。这将让V4.1 Pro和Flash处理通用代理任务,形成更清晰的产品线。
但泄露就是泄露。它们经常被夸大或完全错误。AI谣言不断翻涌,而DeepSeek并不以发布前炒作闻名。所以对此持保留态度——或者干脆撒一整罐盐。
下一步是什么?
如果DeepSeek Code 2.0真的在九月带着3万亿参数和Computer Use能力到来,它可能会改变游戏规则。但在那之前,我们只能猜测。它会不负炒作吗?它真能与Astra竞争吗?只有时间能证明。有一点可以肯定:AI军备竞赛正在升温,而DeepSeek不会退缩。
要点:
- DeepSeek可能在九月推出DeepSeek Code 2.0,目标性能超越Mythos 5.1和GPT-6 Astra。
- 该模型可能拥有3万亿参数,成为中国最大的模型,并专注于Computer Use。
- 之前的Code模型较为普通,但旗舰级代码/逻辑模型可能是一次战略转变。
- 泄露信息未经证实;怀疑是合理的。
- 如果属实,它可能重塑竞争格局。