跳转到主要内容

Google DeepMind的GenCeption:一个能理解世界的视频模型

从视频生成到视觉理解

Google DeepMind刚刚发布了一项可能让你重新思考视频生成模型能力的成果。认识一下GenCeption——一个不仅能生成视频,还能真正理解视频的模型。它基于预训练的文本到视频模型(确切地说是阿里巴巴的Wan2.1)构建,能够一次性处理深度估计、图像分割和3D姿态估计等任务。

关键在于:它所需的训练数据仅为传统专用模型的一小部分。我们说的是7500个合成视频——而Segment Anything或Depth Anything等模型通常需要数十万甚至数百万个视频。

它是如何工作的?

GenCeption没有为每个任务构建单独的模型,而是利用了视频生成模型在训练过程中已经学到的空间和运动理解能力。DeepMind团队认为,如果一个模型能够生成逼真的视频,它必然对场景结构、物体运动以及语言与视觉之间的关系有一定的理解。那么,为什么不将这些知识用于其他任务呢?

GenCeption简化了视频生成架构,通过单次前向传播进行预测。你给它一个文本提示——比如“深度图”或“分割掩码”——它就会从同一视频中输出相应的视觉信息。它甚至可以通过可训练模块处理3D关键点。

Image

低成本训练

训练数据是使用Blender创建的合成数据集,结合了800个人体模型和200个动作序列。仅此而已。然而,在深度估计、表面法线预测、3D姿态识别和语言引导分割等基准测试中,GenCeption的表现与最先进的模型相当甚至更优。其训练数据量仅为某些现有模型的七分之一到百分之一。

令人惊讶的泛化能力

有趣的地方来了。尽管训练数据主要是单人的合成人体,但GenCeption能够处理包含多人、动物甚至人形机器人的真实场景。它能为训练中从未见过的类别生成详细的预测。这意义重大——表明该模型已经学到了关于视觉结构的基本知识,而不仅仅是记住了特定模式。

尚不完美

当然,也存在权衡。多任务联合训练可能会损害某些复杂任务的性能。速度也是一个问题:处理81帧视频大约需要6到10秒。这对于离线分析来说没问题,但不适用于实时应用。

这意味着什么

GenCeption表明,视频生成模型正在从内容创作工具演变为更重要的东西——视觉理解的基础模型。未来的挑战是让这些模型在理解物理世界方面更加可靠,并融入真实世界的反馈。但就目前而言,它让我们一窥未来一个模型可能包揽一切的景象。

关键点

  • GenCeption利用预训练的视频生成模型执行多项计算机视觉任务。
  • 仅使用7500个合成视频进行训练,在基准测试中与专用模型相当或更优。
  • 对包含多个物体和未见类别的真实场景具有良好的泛化能力。
  • 当前局限性包括推理速度较慢(每81帧视频6-10秒)以及在复杂任务上的性能下降。
  • 该模型预示着视频生成模型可能成为通用的视觉基础模型。