跳转到主要内容

World Labs发布Atlas:首款支持像素级相机控制的多模态世界模型

World Labs,这家由著名研究员李飞飞创立的AI初创公司,正式发布了Atlas,这是全球首款多模态世界模型。这不仅仅是另一个图像生成器——它是一个理解3D空间的系统,为创作者提供像素级的相机控制。想象一下,你可以像电影摄影师一样在场景中移动,捕捉《黑客帝国》中标志性的“子弹时间”效果——所有这些都来自一张照片。这就是Atlas的承诺。

Atlas是从头开始预训练的,这意味着它学习了视觉数据的复杂性,而不依赖现有模型。其突出特点是能够接受多模态输入(包括相机运动)并将其转化为立体3D视图。通过在模型的空间上下文中精确放置多个输入视图,用户可以生成具有绝对控制力的图像和视频帧。结果如何?流畅的电影级序列,通常需要完整的相机设备和好莱坞预算才能实现。

但Atlas不仅仅关乎炫酷的效果。它在重建方面也很出色。给它几张照片,它就能生成场景的清晰3D模型,其质量往往超过顶级的开源重建模型。这对虚拟现实、游戏甚至机器人等领域具有重大意义,因为这些领域对空间布局的理解至关重要。

那么,它是如何工作的呢?当你指定相机位置和角度时,Atlas会生成与原始内容和几何形状完美匹配的参考图像。然后它扩展场景,用合理的细节填充未见的区域。这就像拥有一个能想象拐角处有什么的AI,让你的虚拟探索感觉无缝。

Atlas处理广泛的任务,如官方公告中详述:

  • 相机控制生成:从一张或多张图像,它可以输出长达1分钟、1440p分辨率的高清视频,并具有像素级相机控制。
  • 空间重建:它可以从数十张输入图像重建真实场景,生成新颖的视角,并提供显式的3D输出。
  • 时空模拟:通过输入视频建模空间和时间,它可以重新组合视频以增强戏剧效果,甚至支持机器人的真实到模拟工作流。
  • 文本到图像和360°全景:它准确遵循复杂提示,渲染文本,并呈现各种视觉风格。

Image

World Labs已经向选定的合作伙伴授予了早期访问权,并计划在未来几周内向更广泛的早期采用者开放。这种分阶段推出表明他们渴望根据真实世界反馈来完善模型。

Atlas的发布标志着AI在理解和生成3D世界方面迈出了重要一步。对于内容创作者来说,它可能使高端视觉效果民主化,让任何拥有电脑的人都能使用。对于AI社区来说,它让我们得以一窥未来,模型不仅能看图像,还能理解它们所代表的空间。

随着Atlas变得更加广泛可用,看看创作者如何利用它的力量将会很有趣。我们会看到独立电影制作人制作出大片级别的视觉效果吗?或者游戏开发者以前所未有的轻松方式打造沉浸式世界?只有时间能告诉我们,但有一件事是肯定的:现实与AI生成内容之间的界限正在模糊,而Atlas正在引领这一潮流。

关键要点

  • 由李飞飞创立的World Labs发布了Atlas,这是首款多模态世界模型。
  • Atlas提供像素级相机控制,实现子弹时间等电影效果。
  • 它在3D重建方面表现出色,超越了许多开源模型。
  • 功能包括相机控制生成、空间重建、时空模拟和文本到图像。
  • 早期访问已提供给合作伙伴,更广泛的推出计划即将进行。