让机器人把一只虾夹起来,再准确放进锅里。对人类来说,这是一段自然连贯的动作:手臂靠近,夹爪闭合,虾被抬起,随后沿着一条连续轨迹移动到锅的上方。但在目前的视觉世界模型眼中,这个过程往往不是连续发生的。它看到的是第 1 帧、第 2 帧、第 3 帧……模型根据当前画面预测下一个离散时刻的画面,再一步步向未来滚动。
这就带来一个根本问题:
现实世界明明沿着物理时间连续演化,为什么机器人却只能一帧一帧地“猜”未来?
基于此背景,清华大学智能产业研究院(AIR)与 UC Berkeley BAIR 研究团队合作提出了一种全新的预测范式——ODEWorld,连续时间具身世界模型,让机器人从逐帧预测走向连续理解世界。
ODEWorld 不再把未来预测视为一道“下一帧是什么”的逐帧填空题,而是让模型直接学习世界在物理时间中的变化方向与速度。
目前,大多数视频世界模型和潜空间世界模型都建立在离散时间之上。它们把视频切分成一组固定间隔的画面,并学习从一个时间步跳转到下一个时间步。训练数据以什么频率采样,模型通常就按照什么节奏认识世界。
这种范式很自然,也推动了视频生成和机器人预测能力的快速进步。但它始终存在一个结构性的错位:模型学习的是一组离散快照之间的映射,而真实运动发生在快照之间。
一只杯子从桌面被拿起,不是突然从位置 A 跳到位置 B;机械臂靠近抽屉把手时,运动速度也不会一成不变,它会先接近目标,在接触前减速,完成抓握后再次加速,将抽屉拉开。速度、方向、停顿和加速,共同构成了完整的物理过程。
逐帧模型可以模仿这些过程呈现出来的画面,却很难直接表达“此刻的世界正在如何变化”。当采样频率变化、部分观测缺失,或者需要预测训练时从未出现过的中间时刻时,固定时间步就会成为限制。
更棘手的是,机器人视频中真正发生变化的内容往往只占画面的一小部分。
桌面没有动,墙壁没有动,大部分物体纹理也没有动。真正需要建模的,是机械臂、夹爪、被操作物体,以及它们之间不断变化的关系。
如果把整幅画面的所有细节都塞进同一个动力学空间,模型就不得不一边记住大量静态背景,一边学习少数关键运动。
ODEWorld 希望改变这件事。
ODEWorld 背后的核心范式叫作 Physical-Time Flow,简称 PT-Flow。
它的直觉并不复杂。
传统世界模型不断询问:下一帧是什么样?
PT-Flow 则改为询问:此刻的世界正朝哪个方向、以多快的速度变化?
模型先把高维视觉画面压缩到一个紧凑的动态潜空间。在这个空间里,每个状态不再是一个孤立的点,而是处在一片连续的速度场中。
速度场告诉模型,当前状态下一瞬间应该朝哪里移动,以及移动得有多快。给定初始状态后,ODEWorld 通过常微分方程求解器沿着速度场进行积分,就能得到未来任意时刻的潜在状态,再将其还原为视觉画面。
用一个公式表示,就是:


这里的“时间”不再是扩散模型从噪声走向图像的虚拟生成时间,而是视频和机器人真实运动所对应的物理时间。
预测未来,也由此从反复调用下一步预测器,变成了沿着连续动力学轨迹向前积分。


要从复杂的视觉观测中学习物理世界的连续演化规律,引入连续时间方程还不够,还要为物理变化找到合适的表征空间。
无论是机器人操作、自动驾驶,还是自然场景中的物体运动,画面中通常都混合着两类本质不同的信息:
机器人视频是这种矛盾最直观的样本:桌面、墙壁和大部分物体纹理几乎不动,真正决定任务进程的,是机械臂、被操作物体及其相互关系的连续变化。如果让同一个潜空间同时背负这两类信息,速度场就会被大量与动力学无关的细节干扰。
ODEWorld 因此设计了一套动态表征解耦机制。
模型将初始状态作为静态上下文,交给编码器和解码器直接使用。动态潜空间不再需要反复存储背景信息,而是专门表达当前状态相对初始状态发生了什么变化。
换句话说:静态背景由初始状态负责记忆,潜空间只负责描述世界怎么动。

静态信息与动态信息解耦
04/JEPA忙着给隐空间加“防坍缩护栏”,ODEWorld直接改写训练目标
把世界预测搬进隐空间,虽然能避开昂贵的像素生成,却也带来了一个几乎绕不开的问题:表征坍缩。
如果编码器把不同画面、不同动作阶段都压成相同或高度相似的向量,预测器反而可以轻松获得很低的训练损失。但这样的隐空间没有保存真正的世界状态,更不可能用来规划机器人下一步怎么动。
这正是 JEPA 路线长期面对的核心难题。常见做法是在预测目标之外继续增加“防坍缩护栏”:使用停止梯度和 EMA 目标编码器维持两条分支的不对称,或者加入方差、协方差乃至完整分布形状约束,强制隐空间保持足够的信息量。近期围绕 JEPA 的不少工作,重点仍然是在设计更强、更稳定的正则项。
ODEWorld 的解法截然不同。
它没有把“防止坍缩”当成一个需要外挂正则项来补救的问题,而是从一开始就改变隐空间的监督目标。ODEWorld从真实视频序列中估算视觉特征随时间的变化速度,再通过雅可比向量积(JVP)将这一速度投影到动态潜空间,直接监督模型学习正确的一阶速度。
换句话说,这个隐空间不能只给出一个“看起来相似”的答案。它还必须正确解释状态沿物理时间如何移动。这要求动态表征同时满足两件事:能够重建真实发生的视觉变化,并且其一阶导数必须与视频中的真实变化速度保持一致。

这种差异也可以直接从表征质量上看出来。
在相同的 RankMe 评估协议下,ODEWorld 的动态隐空间只有 768 维,有效秩却达到 425.2;同样是 768 维的 DINOv2 CLS 特征,有效秩为 376.1;V-JEPA 2 的表征维度达到 1024,有效秩却只有 203.7。换句话说,ODEWorld 用更紧凑的表征空间,保留了比 DINOv2 和 V-JEPA 2 更丰富的有效变化维度。
这说明,ODEWorld 不是靠不断增加外部约束把隐空间“撑开”,而是通过动态解耦、视觉重建和一阶速度监督,让富含信息量的连续表征成为任务本身的内在要求。

RankMe 有效秩对比。柱顶数字为“有效秩 / 表征维度”;数值越高,说明表征保留的有效变化维度越丰富
连续时间建模最直观的变化,是模型不再被固定帧率锁住。
想生成多快,就采样多快
ODEWorld 学习的是一条连续潜空间轨迹,而不是一组固定时间点。
因此,同一个动作可以按照不同时间间隔进行采样:既可以生成慢动作,也可以正常播放或快速推进。
模型不需要为每一种帧率重新训练。只要改变 ODE 求解时查询的时间点,就能得到对应速度的画面序列。

任意时间分辨率生成
训练视频缺了帧,也能把中间过程补回来
团队还将训练序列降采样到原始帧率的三分之一。
即便只看到更稀疏的观测,ODEWorld 仍然可以查询训练数据中缺失的中间时刻,生成平滑、连贯的动作过程。
这里的补帧并不是在两张图片之间进行普通的视频后处理,而是从模型学习到的连续动力学轨迹中恢复相应时刻的状态。

补帧生成
更有意思的是,同一套速度场还可以反向使用。
ODEWorld 只需将积分方向反转,就能从后续状态出发,沿着学习到的连续动力学轨迹向过去生成。
这不是把一段已经存在的视频直接倒放,而是给模型一个状态,让它在潜空间中按照相反方向重新推演整个变化过程。
同一个模型、同一套动力学,既能向前预测,也能向后追溯。

补帧生成
连续时间并没有让 ODEWorld 变得更重。
由于预测主要发生在紧凑的动态潜空间,速度场又由轻量网络参数化,ODE 积分的计算成本很低。
在 长程视频预测实验中,ODEWorld 生成 64 帧画面只需 0.072 秒。作为对比,V-JEPA 2 需要 0.619 秒,LDP 则需要 3.953 秒(以上结果均在单张 A100 GPU 上测得)。
速度提升的同时,画面质量也没有被牺牲。
在 64 帧预测中,ODEWorld 的 PSNR 达到 19.46,高于 V-JEPA 2 的 16.47 和 LDP 的 16.27;感知相似度指标 LPIPS 则降至 0.134,优于另外两种方法。
这意味着 ODEWorld 不仅可以生成更连贯、更接近真实观测的长程画面,也能以更低的延迟完成整段未来推演。

过去的世界模型习惯把未来拆成一帧帧画面。
ODEWorld 则把未来重新写成了一条随物理时间连续演化的轨迹。
在这套范式下,任意帧率、缺失帧恢复和反向预测不再是额外添加的独立功能,而是连续时间建模自然衍生的能力。
当世界模型不再只预测下一帧,而是开始学习世界此刻如何变化,机器人对未来的理解,也第一次从一组离散快照变成了一条可以前进、放慢、补全,甚至反向追溯的连续时间流。