跳转到主要内容

Cloudflare 的 Clef-omni:现在你的 AI 能看能听

Cloudflare 的 Clef-omni:一个模型实现听、看、决策

Cloudflare 推出了 Clef-omni,这是一个开权重的决策模型,现在支持音频和完整的视频输入。该模型于 10 月 9 日发布,允许开发者通过单次 API 调用处理多模态内容——无需再分别管理转录和分割工具。

Image

从文本和图像到声音和动态

此前,Clef 系列处理文本、图像和按间隔提取的静态帧。Clef-omni 改变了这一点:它原生支持 wav、mp3、mp4 和 webm 文件。这意味着你可以将播客片段或视频剪辑直接输入,并获得结构化的决策结果,而无需预处理带来的麻烦。

在底层,Clef-omni 基于 Qwen3-Omni-30B-A3B-Instruct 构建,并保留了其核心理解能力。但不要指望它写文章——它专为决策任务设计,而非文本生成。速度方面?纯文本请求的中位响应时间约为 130 毫秒;图像大约为 150 毫秒。一段 21 秒带声音的视频大约需要 1.5 秒来评估。这对于近实时应用来说足够快。

更便宜、更精简、为开发者准备

伴随新模型,Cloudflare 大幅降低了 Clef-flash 的价格。每百万输入 token 的成本从 0.09 美元降至 0.038 美元——降幅达 58%。托管版本的上下文窗口从 64k 缩小到 24k,这一权衡与典型的决策任务相符。总体而言,分层定价现在满足了不同预算和性能需求。

那么问题在哪?首先,Clef-omni 不是通用聊天机器人。它是一个用于结构化输出的专用工具,这意味着它不会取代你最喜欢的 LLM 进行创意写作。但如果你正在构建一个需要实时响应音频或视频的系统——比如内容审核、实时字幕或交互式代理——这可能是一个改变游戏规则的产品。

关键要点

  • 多模态支持: Clef-omni 原生处理音频(wav、mp3)和视频(mp4、webm),无需额外预处理。
  • 为决策而建: 基于 Qwen3-Omni-30B-A3B-Instruct,专注于结构化决策任务,而非文本生成。
  • 快速性能: 文本约 130 毫秒,图像约 150 毫秒,21 秒带音频视频约 1.5 秒。
  • 价格下降: Clef-flash 现在每百万输入 token 仅需 0.038 美元,较 0.09 美元下降 58%。
  • 上下文窗口: 托管版本从 64k 减少到 24k token,平衡了成本和能力。

对于厌倦了拼接多个模型的开发者,Clef-omni 提供了一条简化的路径。它并非适用于所有用例,但它是迈向统一多模态处理的坚实一步。请关注社区如何将其投入使用。