新闻中心

当前位置: 首页 > 新闻中心 > 学院新闻 > 正文

AIR科研|连续时间具身世界模型:高效生成、任意补帧,还能“倒着推演”

来源:       发布时间:2026-08-05

让机器人把一只虾夹起来,再准确放进锅里。对人类来说,这是一段自然连贯的动作:手臂靠近,夹爪闭合,虾被抬起,随后沿着一条连续轨迹移动到锅的上方。但在目前的视觉世界模型眼中,这个过程往往不是连续发生的。它看到的是第 1 帧、第 2 帧、第 3 帧……模型根据当前画面预测下一个离散时刻的画面,再一步步向未来滚动。

这就带来一个根本问题:

现实世界明明沿着物理时间连续演化,为什么机器人却只能一帧一帧地“猜”未来?

基于此背景,清华大学智能产业研究院(AIR)与 UC Berkeley BAIR 研究团队合作提出了一种全新的预测范式——ODEWorld,连续时间具身世界模型,让机器人从逐帧预测走向连续理解世界。

ODEWorld 不再把未来预测视为一道“下一帧是什么”的逐帧填空题,而是让模型直接学习世界在物理时间中的变化方向与速度。


01/世界是连续的,世界模型却不是

目前,大多数视频世界模型和潜空间世界模型都建立在离散时间之上。它们把视频切分成一组固定间隔的画面,并学习从一个时间步跳转到下一个时间步。训练数据以什么频率采样,模型通常就按照什么节奏认识世界。

这种范式很自然,也推动了视频生成和机器人预测能力的快速进步。但它始终存在一个结构性的错位:模型学习的是一组离散快照之间的映射,而真实运动发生在快照之间。

一只杯子从桌面被拿起,不是突然从位置 A 跳到位置 B;机械臂靠近抽屉把手时,运动速度也不会一成不变,它会先接近目标,在接触前减速,完成抓握后再次加速,将抽屉拉开。速度、方向、停顿和加速,共同构成了完整的物理过程。

逐帧模型可以模仿这些过程呈现出来的画面,却很难直接表达“此刻的世界正在如何变化”。当采样频率变化、部分观测缺失,或者需要预测训练时从未出现过的中间时刻时,固定时间步就会成为限制。

更棘手的是,机器人视频中真正发生变化的内容往往只占画面的一小部分。

桌面没有动,墙壁没有动,大部分物体纹理也没有动。真正需要建模的,是机械臂、夹爪、被操作物体,以及它们之间不断变化的关系。

如果把整幅画面的所有细节都塞进同一个动力学空间,模型就不得不一边记住大量静态背景,一边学习少数关键运动。

ODEWorld 希望改变这件事。

02/不再预测下一帧,而是学习世界的“速度场”

ODEWorld 背后的核心范式叫作 Physical-Time Flow,简称 PT-Flow。

它的直觉并不复杂。

传统世界模型不断询问:下一帧是什么样?

PT-Flow 则改为询问:此刻的世界正朝哪个方向、以多快的速度变化?

模型先把高维视觉画面压缩到一个紧凑的动态潜空间。在这个空间里,每个状态不再是一个孤立的点,而是处在一片连续的速度场中。

速度场告诉模型,当前状态下一瞬间应该朝哪里移动,以及移动得有多快。给定初始状态后,ODEWorld 通过常微分方程求解器沿着速度场进行积分,就能得到未来任意时刻的潜在状态,再将其还原为视觉画面。

用一个公式表示,就是:

这里的“时间”不再是扩散模型从噪声走向图像的虚拟生成时间,而是视频和机器人真实运动所对应的物理时间。

预测未来,也由此从反复调用下一步预测器,变成了沿着连续动力学轨迹向前积分。

03/把“世界是什么”与“世界怎么变”拆开

要从复杂的视觉观测中学习物理世界的连续演化规律,引入连续时间方程还不够,还要为物理变化找到合适的表征空间。

无论是机器人操作、自动驾驶,还是自然场景中的物体运动,画面中通常都混合着两类本质不同的信息:

  • 一类描述“世界是什么”,包括场景结构、物体外观、材质纹理以及相对稳定的环境条件;

  • 另一类描述“世界怎么变”,包括物体的位置、速度、形变,以及接触、碰撞和交互关系随时间发生的变化。

机器人视频是这种矛盾最直观的样本:桌面、墙壁和大部分物体纹理几乎不动,真正决定任务进程的,是机械臂、被操作物体及其相互关系的连续变化。如果让同一个潜空间同时背负这两类信息,速度场就会被大量与动力学无关的细节干扰。

ODEWorld 因此设计了一套动态表征解耦机制。

模型将初始状态作为静态上下文,交给编码器和解码器直接使用。动态潜空间不再需要反复存储背景信息,而是专门表达当前状态相对初始状态发生了什么变化。

换句话说:静态背景由初始状态负责记忆,潜空间只负责描述世界怎么动。

静态信息与动态信息解耦


04/JEPA忙着给隐空间加“防坍缩护栏”,ODEWorld直接改写训练目标

把世界预测搬进隐空间,虽然能避开昂贵的像素生成,却也带来了一个几乎绕不开的问题:表征坍缩。

如果编码器把不同画面、不同动作阶段都压成相同或高度相似的向量,预测器反而可以轻松获得很低的训练损失。但这样的隐空间没有保存真正的世界状态,更不可能用来规划机器人下一步怎么动。

这正是 JEPA 路线长期面对的核心难题。常见做法是在预测目标之外继续增加“防坍缩护栏”:使用停止梯度和 EMA 目标编码器维持两条分支的不对称,或者加入方差、协方差乃至完整分布形状约束,强制隐空间保持足够的信息量。近期围绕 JEPA 的不少工作,重点仍然是在设计更强、更稳定的正则项。

ODEWorld 的解法截然不同。

它没有把“防止坍缩”当成一个需要外挂正则项来补救的问题,而是从一开始就改变隐空间的监督目标。ODEWorld从真实视频序列中估算视觉特征随时间的变化速度,再通过雅可比向量积(JVP)将这一速度投影到动态潜空间,直接监督模型学习正确的一阶速度

换句话说,这个隐空间不能只给出一个“看起来相似”的答案。它还必须正确解释状态沿物理时间如何移动。这要求动态表征同时满足两件事:能够重建真实发生的视觉变化,并且其一阶导数必须与视频中的真实变化速度保持一致。

这种差异也可以直接从表征质量上看出来。

在相同的 RankMe 评估协议下,ODEWorld 的动态隐空间只有 768 维,有效秩却达到 425.2;同样是 768 维的 DINOv2 CLS 特征,有效秩为 376.1;V-JEPA 2 的表征维度达到 1024,有效秩却只有 203.7。换句话说,ODEWorld 用更紧凑的表征空间,保留了比 DINOv2 和 V-JEPA 2 更丰富的有效变化维度。

这说明,ODEWorld 不是靠不断增加外部约束把隐空间“撑开”,而是通过动态解耦、视觉重建和一阶速度监督,让富含信息量的连续表征成为任务本身的内在要求。

RankMe 有效秩对比。柱顶数字为“有效秩 / 表征维度”;数值越高,说明表征保留的有效变化维度越丰富

05/一条连续时间流,带来三种新能力

连续时间建模最直观的变化,是模型不再被固定帧率锁住。

想生成多快,就采样多快

ODEWorld 学习的是一条连续潜空间轨迹,而不是一组固定时间点。

因此,同一个动作可以按照不同时间间隔进行采样:既可以生成慢动作,也可以正常播放或快速推进。

模型不需要为每一种帧率重新训练。只要改变 ODE 求解时查询的时间点,就能得到对应速度的画面序列。

任意时间分辨率生成

训练视频缺了帧,也能把中间过程补回来

团队还将训练序列降采样到原始帧率的三分之一。

即便只看到更稀疏的观测,ODEWorld 仍然可以查询训练数据中缺失的中间时刻,生成平滑、连贯的动作过程。

这里的补帧并不是在两张图片之间进行普通的视频后处理,而是从模型学习到的连续动力学轨迹中恢复相应时刻的状态。

补帧生成

06/不仅能预测未来,还能“倒着推演”

更有意思的是,同一套速度场还可以反向使用。

ODEWorld 只需将积分方向反转,就能从后续状态出发,沿着学习到的连续动力学轨迹向过去生成。

这不是把一段已经存在的视频直接倒放,而是给模型一个状态,让它在潜空间中按照相反方向重新推演整个变化过程。

同一个模型、同一套动力学,既能向前预测,也能向后追溯。

补帧生成

07/64 帧只需 0.072 秒

连续时间并没有让 ODEWorld 变得更重。

由于预测主要发生在紧凑的动态潜空间,速度场又由轻量网络参数化,ODE 积分的计算成本很低。

在 长程视频预测实验中,ODEWorld 生成 64 帧画面只需 0.072 秒。作为对比,V-JEPA 2 需要 0.619 秒,LDP 则需要 3.953 秒(以上结果均在单张 A100 GPU 上测得)。

速度提升的同时,画面质量也没有被牺牲。

在 64 帧预测中,ODEWorld 的 PSNR 达到 19.46,高于 V-JEPA 2 的 16.47 和 LDP 的 16.27;感知相似度指标 LPIPS 则降至 0.134,优于另外两种方法。

这意味着 ODEWorld 不仅可以生成更连贯、更接近真实观测的长程画面,也能以更低的延迟完成整段未来推演。

08/从逐帧模仿,走向连续理解物理世界

过去的世界模型习惯把未来拆成一帧帧画面。

ODEWorld 则把未来重新写成了一条随物理时间连续演化的轨迹。

在这套范式下,任意帧率、缺失帧恢复和反向预测不再是额外添加的独立功能,而是连续时间建模自然衍生的能力。

当世界模型不再只预测下一帧,而是开始学习世界此刻如何变化,机器人对未来的理解,也第一次从一组离散快照变成了一条可以前进、放慢、补全,甚至反向追溯的连续时间流。


下一条:AIR科研|构建物理信息增强的离线强化学习架构,探索复杂工业与能源系统节能降碳新范式

关闭

相关新闻

业务合作:airoffice@air.tsinghua.edu.cn
招生招聘:airhr@air.tsinghua.edu.cn
联系电话:(010)82151160  

办公地点:北京市海淀区清华科技园启迪科技大厦C座12层

官方微信

京ICP备15006448号  |   版权所有©清华大学智能产业研究院