跳转到主要内容

Black Forest Labs 发布 Flux3:能看会听的 AI

德国 AI 初创公司 Black Forest Labs 正式发布了 Flux3,这是一个多模态基础模型,标志着 AI 在跨媒体理解和生成能力上的重大飞跃。与之前专注于图像或视频的模型不同,Flux3 集成了原生音频生成,能够生成长达 20 秒的同步音视频片段。

该模型基于公司的 Self-Flow 架构,使用专门的编解码器处理图像、视频、音频和运动。这种统一的方法意味着该模型可以在单一框架内处理文本、图像和视频到视频的转换、关键帧过渡,甚至多角色对话。

Image

在早期基准测试中,Flux3 表现令人印象深刻。在 720p 分辨率和 10 秒片段设置下,它以 93% 的胜率击败了 Luma Ray3.2,并以 77% 的优势超越了 Runway Gen-4.5。即使面对 Seedance2.0 和 Gemini Omni Flash 等顶级模型,Flux3 也保持了微弱优势。

但 Black Forest Labs 并未止步于媒体生成。与 Mimic Robotics 合作,该公司开发了专为机器人设计的动作模型 Flux-mimic。该版本已在奥迪工厂的生产任务中进行测试,将多模态 AI 从屏幕带到了工厂车间。

该版本分阶段推出:Flux3Video 现已可用,Flux3Image 和开源版本“Flux3Dev”即将推出。这种分阶段的方法允许开发者和研究人员在等待完整套件的同时开始尝试视频功能。

关键点

  • Flux3 是首个具备原生音频生成能力的多模态基础模型,能够生成长达 20 秒的同步音视频内容。
  • 它使用统一的 Self-Flow 架构,为不同媒体类型配备专门的编解码器。
  • 在基准测试中,Flux3 超越了 Luma Ray3.2、Runway Gen-4.5,并与 Seedance2.0 和 Gemini Omni Flash 不相上下。
  • 专注于机器人技术的版本 Flux-mimic 已在奥迪工厂投入使用。
  • 该模型分阶段发布:Flux3Video 现已推出,Flux3Image 和开源权重即将发布。