Black Forest Lab的FLUX3:一个模型,20秒音频和视频,超越Grok和Seedance
Black Forest Labs刚刚发布了FLUX3,一个正在引起轰动的新多模态基础模型。该模型已提供早期访问,可以一次性生成长达20秒的视频以及同步音频。这很了不起——大多数模型甚至难以生成几秒连贯的视频,更不用说匹配声音了。
秘诀是什么?一个统一架构,同时从图像、视频和音频中学习。基于名为Self-Flow的自监督流匹配框架,FLUX3将公司早期的FLUX.1和FLUX.2系列扩展到了完整的多模态领域。可以把它看作一个不仅能看或能听的模型——它能同时做到两者,而且效果出奇地好。
在正面测试中,FLUX3以69%的胜率击败了Grok Imagine Video(10秒720p带声音片段)。它还以52%的胜率险胜Seedance 2.0和Gemini Omni Flash。这些数字表明FLUX3不仅跟上了步伐,而且为质量设立了新标杆。
但不仅仅是视频。FLUX3支持多种创作模式:文本到视频、图像到视频、视频到视频,甚至关键帧到视频。你还可以扩展现有视频或音频,创建多语言对话,以及拼接多个镜头。该模型原生处理所有这些,无需单独工具或后期处理。
还有一个转折:FLUX3还被用于机器人行为预测。没错——同一个生成逼真视频的模型可以帮助机器人理解和预测动作。这是一个令人惊讶的跨界,但展示了底层技术的多功能性。

当然,早期访问意味着我们仍处于测试阶段。但如果基准测试保持,FLUX3可能会改变我们对AI生成媒体的看法。不再有尴尬的无声片段或不匹配的音频——只需一个模型,一次生成,潜力无限。
关键点
- FLUX3可一次性生成长达20秒的视频并带有原生音频。
- 使用统一架构和自监督流匹配,联合学习图像、视频和音频。
- 在质量测试中超越Grok Imagine Video(69%胜率)和Seedance 2.0/Gemini Omni Flash(52%胜率)。
- 支持多种创作模式:文本到视频、图像到视频、视频到视频、关键帧到视频等。
- 还应用于机器人行为预测,展示了其多功能性。