Cloudflare 的 Clef-omni:开源多模态模型原生处理音频和视频
Cloudflare 发布 Clef-omni:决策模型的多模态飞跃
Cloudflare 正式发布了 Clef-omni,这是一个新的开放权重决策模型,原生支持文本、图像,并且首次支持音频和完整视频输入。该模型的权重现已在 Hugging Face 上完全开源,标志着对现有 Clef 系列的一次重大升级。
从碎片化管道到统一处理
以前,使用 Clef 处理视频意味着要沿时间线将其拆分为静态帧。这很笨拙。Clef-omni 通过直接支持 wav、mp3、mp4 和 webm 等主流格式改变了游戏规则。开发者不再需要构建单独的语音转录和音视频拆分管道。相反,单个 API 调用即可同时处理文本、图像、音频和视频。这是一种精简的方法,可以节省无数小时的集成工作。

为速度和结构化决策而构建
在底层,Clef-omni 基于 Qwen3-Omni-30B-A3B-Instruct 架构,保留了其核心理解能力。但这不是一个为写文章而设计的模型——它是一个用于结构化决策任务的专用工具。官方基准测试显示,纯文本请求的中位响应时间约为 130 毫秒,图像请求约为 150 毫秒。处理一个带声音的 21 秒视频?只需 1.5 秒即可完成评分。这足够快,可用于实时应用。
降价与上下文调整
除了新模型之外,Cloudflare 还调整了其他产品线的定价。Clef-flash 的输入价格下降了约 58%,从每百万输入 token 0.09 美元降至 0.038 美元。然而,托管版本的上下文窗口从 64k 减少到 24k。对于开发者来说,这意味着更低的成本但更紧的上下文——这是一个值得注意的权衡。
这对开发者意味着什么
随着 Clef-omni 的开源发布和原生多模态能力,Cloudflare 为构建复杂智能工作流和自动化决策系统提供了更高效、更具成本效益的基础。无论你是在进行视频分析、音频转录还是跨模态任务,这个模型都可能简化你的技术栈。开放权重也邀请社区进行实验和微调。
关键要点
- 原生多模态支持:Clef-omni 直接处理文本、图像、音频和视频,无需单独的管道。
- 快速性能:文本约 130 毫秒,图像约 150 毫秒,21 秒视频约 1.5 秒。
- 开源权重:可在 Hugging Face 上供开发者使用和修改。
- 降价:Clef-flash 输入价格下调 58%,但上下文窗口缩小至 24k。
- 基于 Qwen3-Omni 构建:保留核心理解能力,同时专注于结构化决策任务。