Black Forest Labs 发布 Flux3:AI 可生成 20 秒带声音的视频
德国 AI 初创公司 Black Forest Labs (BFL) 已正式发布 Flux3,这是一个多模态基础模型,突破了 AI 生成媒体的界限。与许多分别处理视频和音频的模型不同,Flux3 可一次性生成长达 20 秒的同步音频-视频片段。

Flux3 有何不同?
Flux3 基于新颖的 Self-Flow 架构构建,该架构集成了用于图像、视频、音频和运动的专用编解码器。这使得模型能够无缝理解和生成跨物理和数字环境的内容。它支持一系列功能:文本到视频、图像到视频、视频到视频、基于关键帧的转换,甚至多语言对话。
超越竞争对手
在 720p 分辨率、10 秒片段的早期基准测试中,Flux3 取得了令人印象深刻的结果。它以 93% 的胜率击败了 Luma 的 Ray3.2,并以 77% 的胜率碾压了 Runway 的 Gen-4.5。它还略微领先于其他顶级模型,如 Seedance 2.0 和 Gemini Omni Flash。这些数字表明 Flux3 是 AI 视频生成领域的有力竞争者。
步入现实世界
BFL 并不止步于数字内容。该公司与 Mimic Robotics 合作开发了 Flux-mimic,这是一种专为机器人设计的视频动作模型。该系统已开始在奥迪工厂进行生产任务测试,标志着从纯 AI 生成到现实世界制造应用的重要一步。
发布策略
BFL 分阶段推出 Flux3。Flux3 Video 组件现已可用,而 Flux3 Image 和开源版本“Flux3 Dev”权重预计将在不久的将来发布。这种分阶段的方法允许开发人员和研究人员逐步探索模型的能力。
要点:
- Flux3 原生生成长达 20 秒的同步音频和视频。
- 基于 Self-Flow 架构构建,具有针对多种模态的专用编解码器。
- 在早期测试中优于 Luma Ray3.2(93% 胜率)和 Runway Gen-4.5(77% 胜率)。
- 支持文本/图像/视频到视频、关键帧转换和多语言对话。
- 机器人变体 Flux-mimic 正在奥迪工厂进行生产任务测试。
- Flux3 Video 现已可用;Image 和开源版本即将推出。