PhiZero:在渲染前教AI思考物理
视频生成模型常被誉为具身AI的未来模拟器。但有一个问题:大多数模型直接预测像素,这可能导致视频违反物理定律——物体漂浮、忽略重力、碰撞看起来错误。对于希望AI理解真实世界的研究人员来说,这是一个头疼的问题。
PhiZero是一种新的物理世界模型,它改变了这一局面。它不是盲目猜测像素空间中接下来会发生什么,而是首先使用一种称为“物理语言”的新概念来推理底层动态。这让AI在渲染之前先思考,就像人类一样。
什么是“物理语言”?
可以将其视为世界如何变化的紧凑符号表示。PhiZero通过观看大量户外视频来学习这种语言,使用自监督学习来提取状态转换的模式。它捕捉运动的规则——物体如何移动、变形和交互——而不会陷入像素级细节。
这是一个游戏规则改变者。通过将“思考”(推理动态)与“绘制”(渲染像素)分离,PhiZero可以生成物理上一致且合理的视频。
它是如何工作的?
该系统有两个主要部分:分词器和推理器。分词器使用过渡级Q-Former来捕获相邻帧之间的变化,并将其压缩为离散符号。然后,扩散解码器使用这些符号以及第一帧来生成最终视频。
另一方面,推理器从预训练的视觉语言模型初始化。它接收第一帧和动作的文本描述(如“一个球滚动并撞到墙上”),并预测未来的物理语言符号序列。
这种“先推理,后渲染”的架构是PhiZero的独特之处。它不仅仅是生成漂亮的图片;它是在模拟世界,尊重物理定律。
已验证的性能
PhiZero已在多个基准测试中进行了测试,包括Physics-IQ Verified、PhyGround和WorldModelBench。结果令人印象深刻。无论是物体碰撞、重力下拉物体,还是复杂的连锁反应,PhiZero始终生成看起来和感觉上都物理准确的视频。
为什么重要
随着具身智能和机器人技术的加速发展,拥有一个能够模拟真实交互的世界模型至关重要。PhiZero为可控和交互式世界建模开辟了新的可能性,这可能对长期模拟甚至将运动技能转移到机器人上至关重要。
所以,虽然大多数视频模型仍在黑暗中摸索,但PhiZero向我们展示了一条更智能的前进道路——AI在行动之前真正思考。
关键点:
- PhiZero引入了“物理语言”,一种状态转换的离散表示,以实现显式物理推理。
- 该模型使用“先推理,后渲染”的架构,将动态模拟与像素合成分离。
- 它在Physics-IQ Verified和WorldModelBench等基准测试中表现出色,展示了高物理合理性。
- 这种方法可以通过提供更可靠的世界模拟来增强具身AI和机器人技术。