Black Forest Labs 的 Flux3:能看、能听、能同步的 AI
德国 AI 初创公司 Black Forest Labs (BFL) 发布了一款引人注目的新模型——Flux3。这是一个多模态基础模型,不仅能生成图像或视频,还能生成最长 20 秒的同步视听片段。可以把它想象成一个能同时“看”和“听”的 AI,将两者融合成无缝输出。
Flux3 有何不同?
Flux3 基于 BFL 所称的 Self-Flow 架构构建。在底层,它使用专用的图像、视频、音频和运动编解码器。这并非多个独立模型的拼凑,而是一个能同时理解和生成多种模态的单一系统。结果是:音频与视觉内容匹配,无论是角色说话、门吱吱作响,还是风吹过树叶的沙沙声。
在早期基准测试中,Flux3 展现了实力。在 720p 分辨率和 10 秒片段下,它以 93% 的胜率击败了 Luma Ray3.2,并以 77% 的胜率优于 Runway Gen-4.5。即使面对 Seedance 2.0 和 Gemini Omni Flash 等重量级选手,它也略占优势。对于新来者来说,这已经相当不错了。
从屏幕到工厂车间
但 BFL 并不止步于娱乐。令人惊讶的是,该公司与 Mimic Robotics 合作开发了 Flux-mimic,这是一个用于机器人的动作模型。这不仅仅是实验室实验——它已经在奥迪工厂执行生产任务。多模态 AI 正在从手机屏幕走向装配线,而且速度比许多人预期的要快。
发布计划
BFL 分阶段发布 Flux3。视频组件 Flux3Video 已经可用。Flux3Image 和开源版本“Flux3Dev”即将推出。这种分阶段的方法让开发者和创作者在完整套件落地之前有时间探索每个部分。
关键点
- Flux3 是首个原生多模态模型,可生成最长 20 秒的同步音视频片段。
- 它使用 Self-Flow 架构,配备专用的图像、视频、音频和运动编解码器。
- 在基准测试中,它击败了 Luma Ray3.2(93% 胜率)和 Runway Gen-4.5(77% 胜率)。
- BFL 与 Mimic Robotics 合作创建了 Flux-mimic,这是一个已在奥迪工厂部署的动作模型。
- 发布分阶段进行:Flux3Video 已上线;Flux3Image 和开源 Flux3Dev 即将推出。
