跳转到主要内容

Black Forest Lab 的 FLUX3:一次性生成 20 秒音频和视频

Black Forest Labs 刚刚发布了 FLUX3,这是一个新的多模态基础模型,现已提供早期访问。与之前专注于单一任务的模型不同,FLUX3 使用统一架构同时学习图像、视频和音频。它建立在 Self-Flow 学习框架之上——可以将其视为一种自监督流匹配系统,同时训练视频、图像和音频。这是从 FLUX.1 和 FLUX.2 系列的一大步,进入了全面的多模态生成和理解。

Image

原生音频,无需唇形同步烦恼

最突出的特点之一?FLUX3 可以在一次生成中输出长达 20 秒的视频,并带有从一开始就同步的原生音频。无需再处理单独的音频轨道或担心唇形不匹配。它支持多种创作模式:文本到视频、图像到视频、视频到视频,甚至关键帧到视频和多语言对话。您还可以输入现有视频和音频以继续场景,或拼接多个镜头。

在对 10 秒 720p 有声视频的人工评估中,FLUX3 对 Grok Imagine Video 的胜率为 69%,对 Seedance 2.0 和 Gemini Omni Flash 的胜率为 52%。这全面领先。

超越视频:图像智能和机器人预测

但 FLUX3 不仅仅是视频。其图像能力也很全面,该模型甚至被应用于机器人行为预测——这表明 Black Forest Labs 的思考超越了娱乐。处理视频和音频的同一统一架构也可以理解和预测物理动作,这对机器人和自主系统可能意义重大。

关键点

  • FLUX3 一次性生成长达 20 秒的视频,并带有原生音频。
  • 它使用统一架构联合学习图像、视频和音频。
  • 在人工评估中优于 Grok Imagine Video(胜率 69%)和 Seedance 2.0(胜率 52%)。
  • 支持多种创作模式:文本到视频、图像到视频、视频到视频等。
  • 扩展到机器人行为预测,显示出更广泛的潜力。