Cloudflare的Clef-omni现已能听能看:新开放模型处理音频和视频
Cloudflare的Clef-omni:一个真正能听能看的决策模型
10月9日,Cloudflare悄然推出了一项可能让开发者的生活轻松许多的功能:Clef-omni,一个开放权重的决策模型,现在支持音频和视频输入。不再需要为语音转文本和视频帧提取分别使用不同的API——这个模型一次调用就能处理所有内容。
从文本和图像到全多模态
最初的Clef模型已经适用于文本、图像和按间隔提取的静态帧。但Clef-omni更进一步:它原生支持wav、mp3、mp4和webm格式。这意味着你可以向它输入播客、视频片段或混合媒体,而无需进行通常的预处理麻烦。开发者过去需要花费数小时拼接转录和分割工具;现在只需一个模型、一个请求。

底层技术:基于Qwen3-Omni构建
Clef-omni并非从零开始。它基于Qwen3-Omni-30B-A3B-Instruct构建,这为其理解多模态内容提供了坚实的基础。但关键在于:它并非设计用来写文章或聊天。相反,它专注于结构化决策任务——例如分类、路由或任何需要快速、可靠判断的场景。
速度如何?纯文本请求的中位响应时间约为130毫秒,图像约为150毫秒。对于21秒带声音的视频,评估大约需要1.5秒。这对于接近实时的应用来说足够快,尽管你不会想用它处理一部长片。
Clef-flash降价
除了新模型,Cloudflare还降低了Clef-flash的价格。每百万输入令牌的成本从0.09美元降至0.038美元——降低了58%。托管版本的上下文窗口从64k缩小到24k,这对某些用例可能有影响,但对于许多决策任务来说,这是一个合理的权衡。总体而言,分层定价现在覆盖了更广泛的预算和性能需求。
这对开发者意味着什么
如果你正在构建需要处理音频或视频而无需将所有内容发送到重型LLM的应用,Clef-omni可能是一个理想的选择。它是开放权重的,因此你可以自行托管。而且随着Clef-flash的降价,实验成本更低了。问题在于?它不是通用模型——不要指望它写博客文章。但对于决策制定,它是一个专用工具,可能为你节省大量管道工作。
关键点
- Clef-omni原生支持音频和视频,消除了单独的转录和分割步骤。
- 基于Qwen3-Omni-30B-A3B-Instruct构建,针对结构化决策任务,而非文本生成。
- 响应时间:文本约130毫秒,图像约150毫秒,21秒视频约1.5秒。
- Clef-flash降价58%,至每百万输入令牌0.038美元;上下文窗口减少到24k。
- 开放权重模型允许自托管和定制。