PhiZero:在渲染视频前教AI思考物理
视频生成模型已经取得了长足的进步,但它们仍然有一个不为人知的秘密:它们通常不理解所创建场景的物理规律。让一个模型模拟一个球从桌子上滚落,它可能很容易让球飘走或穿过地板。这是因为大多数模型直接预测像素——本质上是在猜测下一帧的样子,而不真正理解潜在的动态。
PhiZero,一种新的世界模型,旨在通过引入其创造者所称的“物理语言”来解决这个问题。它不是盲目地预测像素,而是先推理世界将如何演变,然后将这种演变渲染成视频。这有点像在开始驾驶之前规划一次公路旅行——你不会随意转动方向盘,然后寄希望于最好。
什么是物理语言?
物理语言是一种离散表示,捕捉帧之间的状态转换。该模型通过自监督学习从大量户外视频中学习这种语言,捕捉物体移动、下落或碰撞等模式。一旦有了这个词汇表,它就可以用它来推理未来的状态。
该架构简洁优雅:一个分词器和一个推理器。分词器使用转换级Q-Former来捕捉相邻状态之间的变化,并将它们压缩成紧凑的离散符号。然后,扩散解码器将这些符号和第一帧结合起来,重建详细的视频。同时,推理器——从预训练的视觉语言模型初始化——根据第一帧和动作的文本描述来预测物理语言符号的序列。
为什么这很重要
这种“先推理,后渲染”的方法有一个很大的优势:它将动态模拟与像素级合成分开。模型不必同时学习物理和渲染。相反,它可以专注于在符号空间中正确获取物理,然后让解码器处理视觉细节。
在基准测试中,PhiZero在Physics-IQ Verified、PhyGround和WorldModelBench等任务上表现出领先性能。无论是碰撞引起的物体运动、重力下的变形,还是复杂的连锁反应,该模型产生的结果看起来物理上合理。
未来之路
PhiZero为可控和交互式世界建模开辟了新的可能性。对于具身智能和机器人技术,这可能是一个改变游戏规则的因素。想象一个机器人在移动之前就能模拟其行动的后果——这就是这项技术可能实现的能力。
当然,还有很长的路要走。物理语言是一个新概念,需要进一步完善和扩展。但这是朝着AI不仅生成漂亮图片,而且真正理解它所描绘的世界迈出的有希望的一步。


关键点
- PhiZero 引入了一种用于离散状态转换表示的“物理语言”。
- 该模型采用“先推理,后渲染”的架构,将动态与像素合成分开。
- 它在物理推理基准测试(如Physics-IQ Verified和WorldModelBench)上优于现有模型。
- 这种方法可以为具身AI和机器人技术实现更逼真和可控的模拟。