跳转到主要内容

Cloudflare 的 Clef-omni:开源多模态模型原生处理音频和视频

Cloudflare 发布 Clef-omni:决策模型的多模态飞跃

Cloudflare 正式发布了 Clef-omni,这是一个新的开放权重决策模型,原生支持文本、图像,并且首次支持音频和完整视频输入。该模型的权重现已在 Hugging Face 上完全开源,标志着对现有 Clef 系列的一次重大升级。

从碎片化管道到统一处理

以前,使用 Clef 处理视频意味着要沿时间线将其拆分为静态帧。这很笨拙。Clef-omni 通过直接支持 wav、mp3、mp4 和 webm 等主流格式改变了游戏规则。开发者不再需要构建单独的语音转录和音视频拆分管道。相反,单个 API 调用即可同时处理文本、图像、音频和视频。这是一种精简的方法,可以节省无数小时的集成工作。

Image

为速度和结构化决策而构建

在底层,Clef-omni 基于 Qwen3-Omni-30B-A3B-Instruct 架构,保留了其核心理解能力。但这不是一个为写文章而设计的模型——它是一个用于结构化决策任务的专用工具。官方基准测试显示,纯文本请求的中位响应时间约为 130 毫秒,图像请求约为 150 毫秒。处理一个带声音的 21 秒视频?只需 1.5 秒即可完成评分。这足够快,可用于实时应用。

降价与上下文调整

除了新模型之外,Cloudflare 还调整了其他产品线的定价。Clef-flash 的输入价格下降了约 58%,从每百万输入 token 0.09 美元降至 0.038 美元。然而,托管版本的上下文窗口从 64k 减少到 24k。对于开发者来说,这意味着更低的成本但更紧的上下文——这是一个值得注意的权衡。

这对开发者意味着什么

随着 Clef-omni 的开源发布和原生多模态能力,Cloudflare 为构建复杂智能工作流和自动化决策系统提供了更高效、更具成本效益的基础。无论你是在进行视频分析、音频转录还是跨模态任务,这个模型都可能简化你的技术栈。开放权重也邀请社区进行实验和微调。

关键要点

  • 原生多模态支持:Clef-omni 直接处理文本、图像、音频和视频,无需单独的管道。
  • 快速性能:文本约 130 毫秒,图像约 150 毫秒,21 秒视频约 1.5 秒。
  • 开源权重:可在 Hugging Face 上供开发者使用和修改。
  • 降价:Clef-flash 输入价格下调 58%,但上下文窗口缩小至 24k。
  • 基于 Qwen3-Omni 构建:保留核心理解能力,同时专注于结构化决策任务。