跳转到主要内容

Google DeepMind的GenCeption:一个模型统治五项视觉任务

Google DeepMind推出了GenCeption,这是一种新的AI模型,颠覆了传统的视频生成方式。它不是创建视频,而是将过程反转以分析视觉数据,同时处理五项核心任务:深度估计、图像分割、3D姿态估计、相机运动跟踪等。所有这些都来自一个模型,一次前向传播。

基于阿里巴巴开源的通义万相Wan2.1框架,GenCeption接受一个简单的文本提示,输出丰富的信息集——深度图、分割掩码、相机轨迹等等。关键创新在于?它仅用7500个在Blender中渲染的单个合成视频进行训练。然而,它却能出色地泛化到真实世界的多人视频、动物甚至机器人。

在测试中,较小的模型处理81帧约需6秒,而140亿参数的大模型约需10秒。细节恢复如此出色,甚至超越了原始的合成训练数据,清晰地保留了猫胡须和单根发丝等边缘。

Image

关键点

  • 单一模型,五项任务:深度估计、分割、3D姿态、相机运动等。
  • 基于合成数据训练:仅7500个单人Blender视频,却能处理真实世界的多人场景。
  • 处理速度快:81帧约6秒(小模型),约10秒(大模型)。
  • 细节令人印象深刻:保留猫胡须和发丝等精细特征。