DeepSeek Flash视觉模型意外更新,现已支持多模态
DeepSeek一直在幕后忙碌,8月21日,它对其大模型工具链进行了重大更新。该公司正式将DeepSeek Harness升级至0.1.1-rc.1版本,其亮点功能是一个全新的视觉模型体验:V4Flash Vision-Exp。这建立在现有的DeepSeek V4Flash和V4Pro模型之上,增加了一层新的能力,必将吸引开发者和AI爱好者的目光。
就在前一天,v0.1.0-rc.8版本已经通过使DeepSeek Harness能够利用多模态核心能力奠定了基础。现在,通过原生图像请求支持,像/goal和/plan这样的关键命令可以处理文本和图像的混合输入。这是一个改变游戏规则的功能:你现在可以发送工作截图以及特定请求,AI代理可以真正“查看图像”来理解你的需求。这简化了开发和操作过程,感觉几乎太容易了。
虽然DeepSeek已经在网页界面上提供了不错的图像识别模式,但将其深度集成到开发工具链中是另一回事。这就像拼图的最后一块到位——多模态处理现在完全融入了工具链的结构中,而不仅仅是一个独立功能。
对于开发者来说,升级过程非常简单。只需运行一个快速的npm命令,你就完成了。没有复杂的设置,没有冗长的教程。你可以立即开始尝试这个承诺兼具速度和准确性的新视觉模型。这是那种让你想知道“为什么这没有早点发生?”的更新。
但这在实践中意味着什么?想象你在调试一个UI问题。与其输入冗长的描述来说明问题,你可以直接粘贴截图,让代理自己看到问题。或者考虑一个场景,你在规划一个项目——你可以分享一个图表或模型,代理可以将该视觉上下文纳入其规划中。可能性是巨大的,入门门槛刚刚降低了很多。
当然,这只是开始。DeepSeek的快速迭代表明他们致力于推动边界。每次更新,人与机器理解之间的差距都会缩小一点。对于我们这些一直在等待更直观的AI交互方式的人来说,这是一个受欢迎的进步。
所以,如果你是一个希望简化工作流程的开发者,或者只是对AI的发展方向感到好奇的人,这次更新值得一看。工具变得越来越智能,而且每天都在变得更易用。谁知道接下来会发生什么?但有一件事是肯定的:DeepSeek不会放慢脚步。
关键要点
- DeepSeek Harness升级至0.1.1-rc.1版本,引入了V4Flash Vision-Exp。
- 多模态能力现在支持在
/goal和/plan等命令中进行原生图像请求。 - 用户可以发送带有文本的截图,使AI代理能够直接根据图像工作。
- 该更新可通过简单的npm命令获取,方便开发者访问。
- 这标志着DeepSeek多模态集成到其开发工具链的完成。