跳转到主要内容

BAAI Unveils See3D: A Breakthrough in 3D Video Learning

BAAI Unveils See3D: A Breakthrough in 3D Video Learning

北京人工智能研究院(BAAI)宣布推出See3D,这一创新的3D生成模型旨在从大规模未标记的互联网视频中学习。这项技术进步与“看视频,获得3D”的理念相契合,是3D学习和生成领域的重要进展。

Technical Innovations of See3D

See3D与传统的相机参数无关。相反,它利用视觉条件技术,仅基于从视频中获得的视觉线索生成可控摄像机方向和几何一致的多视图图像。这种方法省去了昂贵的3D或相机注解的必要性,从而简化了从丰富的互联网视频数据中学习3D先验的过程。

该模型支持多种生成形式,包括:

  • 文本到3D生成
  • 单视图到3D
  • 稀疏视图到3D 此外,它还能够执行3D编辑和高斯渲染。BAAI已将模型、代码和演示作为开源资源提供,促进更广泛的技术参考和实验。

See3D的功能演示包括:

  • 解锁3D互动世界
  • 基于稀疏图像的3D重建
  • 开放世界的3D生成
  • 从单视图生成3D 这些功能突显了See3D在各种创意3D应用中的广泛适用性,使用户能够更动态地与3D环境互动。

image

Motivation Behind the Development

开发See3D的动机源于传统3D数据收集方法所面临的挑战,这些方法往往耗时且成本高昂。相比之下,视频提供了丰富的多视图相关性和相机运动信息,使其在揭示复杂3D结构方面具有重要价值。

See3D团队构建了一个全面的数据集以促进这一过程,包含1600万段视频和3.2亿帧图像。这个名为WebVi3D的数据集对于使模型通过引入与时间有关的噪声到掩蔽视频数据中生成纯2D视觉信号至关重要。这种方法支持可扩展的多视图扩散模型训练,实现不依赖于相机条件的3D生成。

Key Advantages of See3D

See3D提供了几个主要优势:

  • 数据可扩展性:来自大量互联网视频的数据源显著增强了构建的多视图数据集的规模。
  • 相机可控性:该模型支持在复杂相机轨迹下生成场景,确保帧之间的几何一致性。
  • 几何一致性:该模型在生成多视图图像时保持几何完整性,这对于现实的3D表示至关重要。 通过扩展可用数据集的规模,See3D旨在为推进3D生成技术提供新的见解和方法。研究团队希望这一倡议能够激励3D研究社区关注大规模未标记的相机数据,从而降低3D数据收集的成本,并弥合与现有闭源3D解决方案之间的差距。

项目地址: See3D Project

要点

  1. See3D可以从未标记的视频数据生成3D图像。
  2. 该模型消除了传统相机参数的需求。
  3. 它支持多种形式的3D生成和编辑。
  4. 该倡议旨在降低3D数据收集的成本,并促进该领域的研究。