Cloudflare的Clef-omni:现已原生支持音频与视频
Cloudflare的Clef-omni:一个模型统治一切?
还记得处理视频意味着将其切成一百万张静态帧吗?Cloudflare刚刚告别了那个头疼的问题。他们的新Clef-omni模型,现已在Hugging Face上完全开源,原生理解音频和视频——无需预处理体操。
从笨拙到无缝
以前,Cloudflare的Clef系列只能处理文本和图像。视频?你必须将其拆分成帧,单独转录音频,然后将一切重新拼接起来。Clef-omni将那个流程抛到了窗外。它直接接受wav、mp3、mp4和webm文件。开发者现在可以进行一次API调用,同时处理文本、图像、音频和视频。对于任何构建多模态应用的人来说,这是一个巨大的简化。

为速度而生,而非莎士比亚
在底层,Clef-omni运行在Qwen3-Omni-30B-A3B-Instruct架构上。但别指望它写诗——它是一个决策专家。它输出结构化结果,而不是散文。而且它很快:文本的中位响应时间约为130毫秒,图像约为150毫秒,一个21秒的有声视频?只需1.5秒就能评分。这比大多数人眨眼两次还要快。
价格下调和上下文调整
Cloudflare没有止步于模型。他们还大幅降低了Clef-flash的价格:输入成本下降了58%,从每百万token 0.09美元降至0.038美元。托管版本的上下文窗口从64k缩小到24k——这是为了效率的权衡。对于关注云账单的开发者来说,这是个好消息。
这对你意味着什么
如果你正在构建智能工作流或自动化决策系统,Clef-omni提供了一个更精简、更便宜的基础。不再需要将语音转文本和视频分割器拼凑在一起。一个模型,一次调用,原生多模态。开源发布意味着你可以修补、部署和扩展,而不会被供应商锁定。
那么,准备好抛弃管道意大利面了吗?Clef-omni可能就是你新的最爱工具。
关键要点
- 原生音频与视频:Clef-omni直接处理wav、mp3、mp4和webm——无需预先拆分。
- 单次API调用:一次性处理文本、图像、音频和视频。
- 极速:文本约130毫秒,图像约150毫秒,21秒视频1.5秒。
- 开源:权重可在Hugging Face上获取。
- 价格下降:Clef-flash输入成本降低58%,至每百万token 0.038美元。
- 上下文窗口:托管版本从64k减少到24k以提高效率。