跳转到主要内容

DeepSeek Flash视觉模型意外更新,现已支持多模态

DeepSeek一直在幕后忙碌,8月21日,它对其大模型工具链进行了重大更新。该公司正式将DeepSeek Harness升级至0.1.1-rc.1版本,其亮点功能是一个全新的视觉模型体验:V4Flash Vision-Exp。这建立在现有的DeepSeek V4Flash和V4Pro模型之上,增加了一层新的能力,必将吸引开发者和AI爱好者的目光。

就在前一天,v0.1.0-rc.8版本已经通过使DeepSeek Harness能够利用多模态核心能力奠定了基础。现在,通过原生图像请求支持,像/goal/plan这样的关键命令可以处理文本和图像的混合输入。这是一个改变游戏规则的功能:你现在可以发送工作截图以及特定请求,AI代理可以真正“查看图像”来理解你的需求。这简化了开发和操作过程,感觉几乎太容易了。

虽然DeepSeek已经在网页界面上提供了不错的图像识别模式,但将其深度集成到开发工具链中是另一回事。这就像拼图的最后一块到位——多模态处理现在完全融入了工具链的结构中,而不仅仅是一个独立功能。

对于开发者来说,升级过程非常简单。只需运行一个快速的npm命令,你就完成了。没有复杂的设置,没有冗长的教程。你可以立即开始尝试这个承诺兼具速度和准确性的新视觉模型。这是那种让你想知道“为什么这没有早点发生?”的更新。

但这在实践中意味着什么?想象你在调试一个UI问题。与其输入冗长的描述来说明问题,你可以直接粘贴截图,让代理自己看到问题。或者考虑一个场景,你在规划一个项目——你可以分享一个图表或模型,代理可以将该视觉上下文纳入其规划中。可能性是巨大的,入门门槛刚刚降低了很多。

当然,这只是开始。DeepSeek的快速迭代表明他们致力于推动边界。每次更新,人与机器理解之间的差距都会缩小一点。对于我们这些一直在等待更直观的AI交互方式的人来说,这是一个受欢迎的进步。

所以,如果你是一个希望简化工作流程的开发者,或者只是对AI的发展方向感到好奇的人,这次更新值得一看。工具变得越来越智能,而且每天都在变得更易用。谁知道接下来会发生什么?但有一件事是肯定的:DeepSeek不会放慢脚步。

关键要点

  • DeepSeek Harness升级至0.1.1-rc.1版本,引入了V4Flash Vision-Exp。
  • 多模态能力现在支持在/goal/plan等命令中进行原生图像请求。
  • 用户可以发送带有文本的截图,使AI代理能够直接根据图像工作。
  • 该更新可通过简单的npm命令获取,方便开发者访问。
  • 这标志着DeepSeek多模态集成到其开发工具链的完成。