跳转到主要内容

Black Forest Labs 发布 Flux3:AI 可生成带声音的 20 秒视频

德国 AI 初创公司 Black Forest Labs 正式发布了 Flux3,这是一种多模态基础模型,突破了生成式 AI 的边界。与许多仅处理图像或视频的模型不同,Flux3 基于公司的 Self-Flow 架构,集成了针对图像、视频、音频和运动的专用编解码器。这使得它能够以统一的方式理解和生成跨物理和数字环境的内容。

原生音频和视频生成

Flux3 的突出特点之一是能够一次性生成长达 20 秒的同步音频和视频片段。它支持多种功能,包括文本到视频、图像到视频、视频到视频、基于关键帧的转换,甚至多语言对话。在 720p 分辨率、10 秒片段的早期测试中,Flux3 对 Luma Ray3.2 的胜率达到 93%,对 Runway Gen-4.5 的胜率为 77%,并略微领先于 Seedance 2.0 和 Gemini Omni Flash 等顶级模型。

Image

步入现实世界

Black Forest Labs 并未止步于数字内容。该公司与 Mimic Robotics 合作开发了 Flux-mimic,一种用于机器人的视频动作模型。它已在奥迪工厂进行测试,处理生产任务。此举将 AI 能力从纯数字领域扩展到物理制造场景。

分阶段发布策略

BFL 分阶段推出 Flux3。Flux3 Video 现已可用,而 Flux3 Image 和开源权重 "Flux3 Dev" 计划在不久的将来发布。这种方法允许开发者和研究人员立即开始尝试视频功能。

关键点

  • Flux3 可生成长达 20 秒的带有原生同步音频的视频。
  • 早期测试中,它对 Luma Ray3.2(胜率 93%)和 Runway Gen-4.5(胜率 77%)表现更优。
  • 该模型使用 Self-Flow 架构,配备针对多种模态的专用编解码器。
  • 机器人变体 Flux-mimic 正在奥迪工厂进行测试。
  • Flux3 Video 现已可用;图像和开源版本即将推出。