跳转到主要内容

PhiZero:在渲染前教AI思考物理

视频生成模型常被誉为具身AI的未来模拟器。但有一个问题:大多数模型直接预测像素,这可能导致视频违反物理定律——物体漂浮、忽略重力、碰撞看起来错误。对于希望AI理解真实世界的研究人员来说,这是一个头疼的问题。

PhiZero是一种新的物理世界模型,它改变了这一局面。它不是盲目猜测像素空间中接下来会发生什么,而是首先使用一种称为“物理语言”的新概念来推理底层动态。这让AI在渲染之前先思考,就像人类一样。

什么是“物理语言”?

可以将其视为世界如何变化的紧凑符号表示。PhiZero通过观看大量户外视频来学习这种语言,使用自监督学习来提取状态转换的模式。它捕捉运动的规则——物体如何移动、变形和交互——而不会陷入像素级细节。

这是一个游戏规则改变者。通过将“思考”(推理动态)与“绘制”(渲染像素)分离,PhiZero可以生成物理上一致且合理的视频。

它是如何工作的?

该系统有两个主要部分:分词器和推理器。分词器使用过渡级Q-Former来捕获相邻帧之间的变化,并将其压缩为离散符号。然后,扩散解码器使用这些符号以及第一帧来生成最终视频。

另一方面,推理器从预训练的视觉语言模型初始化。它接收第一帧和动作的文本描述(如“一个球滚动并撞到墙上”),并预测未来的物理语言符号序列。

这种“先推理,后渲染”的架构是PhiZero的独特之处。它不仅仅是生成漂亮的图片;它是在模拟世界,尊重物理定律。

已验证的性能

PhiZero已在多个基准测试中进行了测试,包括Physics-IQ Verified、PhyGround和WorldModelBench。结果令人印象深刻。无论是物体碰撞、重力下拉物体,还是复杂的连锁反应,PhiZero始终生成看起来和感觉上都物理准确的视频。

为什么重要

随着具身智能和机器人技术的加速发展,拥有一个能够模拟真实交互的世界模型至关重要。PhiZero为可控和交互式世界建模开辟了新的可能性,这可能对长期模拟甚至将运动技能转移到机器人上至关重要。

所以,虽然大多数视频模型仍在黑暗中摸索,但PhiZero向我们展示了一条更智能的前进道路——AI在行动之前真正思考。


关键点:

  • PhiZero引入了“物理语言”,一种状态转换的离散表示,以实现显式物理推理。
  • 该模型使用“先推理,后渲染”的架构,将动态模拟与像素合成分离。
  • 它在Physics-IQ Verified和WorldModelBench等基准测试中表现出色,展示了高物理合理性。
  • 这种方法可以通过提供更可靠的世界模拟来增强具身AI和机器人技术。