跳转到主要内容

PhiZero:教AI在渲染前思考

视频生成模型常被誉为具身智能的未来模拟器。但有一个问题:大多数模型直接预测像素,这可能导致视频违反物理定律。一种新模型PhiZero旨在通过引入“物理语言”来解决这个问题,让AI在渲染单帧之前先对世界进行推理。

盲目像素预测的问题

想象一下观看一个球从桌子上滚落的视频。在现实世界中,它会下落并弹起。但许多AI生成的视频可能显示它漂浮或穿过桌子。为什么?因为模型只是在猜测下一个像素是什么,而不理解底层物理。这是主流视频生成模型的核心问题。

引入PhiZero:一种新的思考方式

PhiZero采取了不同的方法。它不是预测像素,而是首先用“物理语言”进行推理——这是一种离散表示,捕捉状态随时间的变化。这种语言是从大量户外视频中学习得到的,使用自监督学习来提取运动和交互的模式。

其架构是“先推理,后渲染”。系统首先在物理语言空间中推断未来的轨迹,然后将其交给扩散解码器生成实际视频。这种分离意味着模型可以专注于场景的动态,而不必陷入像素级细节。

工作原理:分词器和推理器

该系统有两个主要组件:分词器和推理器。分词器使用过渡级Q-Former来捕捉相邻状态之间的变化,将其压缩成紧凑的离散符号。然后,扩散解码器使用这些符号以及第一帧来重建具有丰富细节的视频。

另一方面,推理器使用预训练的视觉语言模型进行初始化。它接收第一帧和动作的文本描述,然后预测接下来将出现的物理语言符号序列。这就是“思考”发生的地方。

已验证的结果

PhiZero已在多个基准测试中进行了测试,包括Physics-IQ Verified、PhyGround和WorldModelBench。它在物理推理和视频生成任务中始终优于其他模型。无论是物体碰撞、重力下拉物体,还是复杂的连锁反应,PhiZero生成的视频看起来和感觉上都符合物理规律。

这对未来意味着什么

随着具身智能和机器人技术的不断进步,拥有一个能够模拟真实交互的世界模型至关重要。PhiZero为可控和交互式世界建模开辟了新的可能性,在长期模拟和运动转移方面具有潜在应用。这是朝着不仅模仿现实而且理解现实的AI迈出的一步。

关键点

  • PhiZero引入了“物理语言”,让AI在生成视频之前对世界动态进行推理。
  • 该模型将推理与渲染分离,提高了物理一致性。
  • 它使用分词器和推理器来处理和预测状态变化。
  • PhiZero在物理推理基准测试中取得了领先性能。
  • 这种方法可以增强具身智能和机器人模拟。

Image

Image