Black Forest Labs发布Flux3:能同时看和听的AI
德国AI初创公司Black Forest Labs刚刚发布了一款可能让你眼前一亮的产品。认识一下Flux3,一个多模态基础模型,它不仅能生成图像或视频——还能生成长达20秒的同步音频和视频片段。可以把它想象成一个既能看又能听,并且让它们完美同步的AI。
Flux3有何不同?
如今大多数AI模型都是专家。有图像生成器、视频制作器、音频创作者。Flux3是一个通才。它基于所谓的Self-Flow架构,为图像、视频、音频和运动配备了专用编解码器。结果如何?一个能跨多种感官理解和生成内容的单一模型。
最引人注目的功能是音视频同步。Flux3是第一个原生生成与视觉匹配的音频的多模态模型——无需后期制作唇形同步或手动对齐。它可以处理文本到视频、图像到视频、视频到视频、关键帧转换,甚至多角色对话。

表现如何?
早期基准测试令人印象深刻。在720p分辨率和10秒片段的测试中,Flux3以93%的胜率击败了Luma Ray3.2。它还以77%的优势优于Runway Gen-4.5。即使面对Seedance2.0和Gemini Omni Flash等重量级选手,它也略占优势。
从屏幕到工厂车间
Flux3不仅仅用于娱乐。Black Forest Labs与Mimic Robotics合作创建了Flux-mimic,一个为机器人技术量身定制的版本。它已经在奥迪工厂执行生产任务。没错——多模态AI已经从生成视频发展到引导现实世界的机器。
下一步是什么?
Black Forest Labs正在分阶段推出Flux3。Flux3Video已经可用。Flux3Image和一个名为Flux3Dev的开源版本即将推出。如果你对AI的发展方向感到好奇,这便是一瞥:模型不仅生成内容,还像我们一样通过多种感官同时理解世界。
关键点
- Flux3原生生成长达20秒的同步音视频内容。
- 它使用Self-Flow架构,为不同模态配备专用编解码器。
- 在早期测试中优于Luma Ray3.2(93%胜率)和Runway Gen-4.5(77%优势)。
- 机器人变体Flux-mimic已在奥迪工厂部署。
- Flux3Video已上线;Flux3Image和开源Flux3Dev即将推出。