DeepSeek新视觉模型:为智能体而生,而非人类
DeepSeek刚刚发布了一款在AI领域引起轰动的新模型——它并非典型的视觉模型。认识一下DeepSeek-V4-Flash-Vision-Exp,这是V4系列中的首个多模态产品,现已在Hugging Face上以宽松的MIT许可证提供。但关键在于:这个模型的“眼睛”并非为了让人类欣赏精美图片,而是专门为AI智能体观察和行动而构建。
一种不同的视觉
大多数多模态模型都专注于回答关于图像的问题——比如“这张照片里有什么?”或“描述这个场景”。然而,DeepSeek正在开辟一条新道路。官方描述强调了该模型的多模态智能体能力:它允许智能体直接读取视觉信息,如网页截图、软件界面和图表,然后通过调用工具执行任务。换句话说,这只“眼睛”是为智能体服务的,而非供人类观看。
这一重点转变意义重大。该模型不仅理解图像,还旨在帮助智能体在数字环境中导航——点击按钮、读取仪表盘,并根据所见做出决策。这是朝着更自主的AI系统迈出的一步,这些系统可以像我们一样与世界互动。
开源且即用
开源发布相当全面。它包括模型权重、分词器、提示编码参考实现,以及一个极简的PyTorch推理实现。核心模块如视觉编码器、Aligner、DFlash Attention、MoE和Hyper-Connections均已涵盖。社区已经积极响应,提供了适用于llama.cpp、LM Studio和Ollama的七个量化版本。
但这次发布背后有一个有趣的背景故事。8月21日,该模型首次出现在DeepSeek API上,但仅作为封闭API——未提供权重。开发者可以向API发送文本和图像,图像按token计费。十天后,权重终于开放,支持本地部署和进一步开发。这种“先API后开源”的方式揭示了DeepSeek的策略:他们主要将自己定位为API服务提供商,但也热衷于促进社区创新。
性能:接近Opus 4.8,但并非完美
那么该模型的实际表现如何?根据基准测试,添加视觉能力并未损害其纯文本智能体技能。Terminal Bench 2.1从82.7提升至83.9,DeepSWE从54.4跃升至59.3,甚至超过了Claude Opus 4.8的58.0。多模态智能体的改进更为显著:ApexBench Pass@1达到36.5,Agents' Last Exam得分27.3(超过Opus 4.8的25.7),ZeroBench Pass@5达到35.0,略胜竞争对手的34.0。
但DeepSeek并未宣称全面胜利。在NL2Repo项目上,它得分57.7,远低于Opus 4.8的69.7。官方声明措辞谨慎,仅表示“多模态智能体能力接近Claude Opus 4.8”。这是公平的评价——它具有竞争力,但并非在所有方面都占主导地位。
更广阔的图景
纵观DeepSeek近期的举措,很明显他们正在组装一个完整的智能体技术栈。该模型负责推理和工具调用,Harness管理连续任务执行,而现在Vision让智能体直接从计算机读取视觉信息。这次开源发布是这一拼图的关键部分。
对于开发者和AI爱好者来说,这是个令人兴奋的消息。这意味着有更多工具来构建能够观察和行动的智能体,而且全部开源。无论你是热衷于本地部署,还是只是对AI最新进展感到好奇,DeepSeek-V4-Flash-Vision-Exp都值得一看。


关键要点
- DeepSeek-V4-Flash-Vision-Exp是V4系列中的首个多模态模型,采用MIT许可证发布。
- 专为智能体设计,而非人类——专注于读取截图、界面和图表以执行任务。
- 开源发布包括权重、分词器和推理代码,并提供社区量化版本。
- 基准测试显示它在智能体任务上与Claude Opus 4.8媲美,但在某些领域(如NL2Repo)仍有所落后。
- 战略时机:先API后开源,凸显DeepSeek以API为中心的方法。