世界动作模型(World Action Models)

构建能够在非结构化物理环境中感知、推理和行动的机器人,长期以来一直是具身人工智能研究的核心目标。近年来,该领域逐渐聚焦于一种强大的范式:视觉-语言-动作(VLA)模型,这类模型将预训练的视觉-语言骨干网络重新用作通用型机器人策略。通过将动作生成建模为基于互联网规模的视觉与语言表征的条件化标记预测,诸如RT-2 [2]、OpenVLA [3] 和 \pi_{0} [4] 等VLA模型已展现出一定的泛化能力——能够遵循新颖的语言指令、操作前所未见的物体,并以极少的微调实现跨不同机器人本体的迁移。这些成果表明,在大规模视觉-语言预训练过程中积累的语义理解可以被有效地“落地”到具体的运动行为中,标志着相较于早期针对特定任务的控制器,这是一次质的飞跃。此后大量基于这一框架的研究工作进一步巩固了VLA模型作为通用具身策略学习主导范式的地位。

然而,标准的VLA模型并未显式地对世界动态进行建模——它们学习的是从观测到动作的直接映射,而不预测环境在干预下如何变化[4]。这种缺乏前瞻性物理推理的能力限制了其泛化性能,而在许多场景中预测未来状态至关重要。因此,为具身策略模型赋予世界建模能力成为一个自然的发展方向[5]。近年来越来越多的研究开始将世界模型集成到具身策略流程中。这些方法利用对环境动态的预测模型来赋予智能体物理上的预见能力——无论是通过视频预测实现视觉规划[6–10]、潜在动态建模用于策略条件化[11–15],还是在统一架构内进行联合状态-动作生成[16–22]。这一新兴方向迅速获得发展势头,催生了多样且不断扩展的方法体系。

我们将这一类方法形式化地称为“世界动作模型”(World Action Models, WAMs):即一类将预测性状态建模与动作生成相统一的具身基础模型,目标是建模未来状态与动作的联合分布p(o', a \mid o, l),而不仅仅是单独的动作分布。现有的WAM方法大致可分为两类架构:(1) 级联式WAM明确分解目标函数,形式上写作p(o', a \mid o, l) = p(a \mid o', o, l)p(o' \mid o, l),首先合成对未来状态的表征,再从中推导出动作;以及(2) 联合WAM直接建模联合分布(p(o', a \mid o, l)),其中状态预测与动作生成在共享的表示空间内协同优化(参见图1了解这些架构的时间演进)。引入世界建模带来了更强的物理理解能力、在新环境中更好的泛化表现,以及能够利用缺乏动作标注的大规模人类视频数据的能力——从而显著拓展了可用于具身策略学习的数据基础。

世界动作模型(WAMs)

世界动作模型(WAMs)代表性工作的时序演进与分类。左侧分支展示了联合WAM架构的发展路径,这类架构将世界预测与动作生成紧密耦合,并分化为自回归和基于扩散的表示方案,其中连续方法进一步分裂为统一流和多流主干网络。右侧分支总结了级联式WAM流程的发展,在该流程中世界建模与动作执行主要解耦,沿着显式和隐式的表示对齐轨迹演化。这些结构策略代表了该领域在架构耦合方面的主要探索方向,而非严格的顺序替代关系。

基础范式

为建立世界动作模型(WAMs)的严谨基础,我们从概率视角定义具身智能任务。我们考虑一个与环境交互的具身智能体。在每个时间步,智能体接收观测值o \in O(包含视觉输入、本体感觉信号以及其他任何感知模态),语言指令l \in L,并生成动作a \in A。我们用o'表示下一时间步的观测值。

视觉-语言-动作(VLA)模型是一类具身基础模型,将机器人控制视为多模态序列建模任务。在此范式中,智能体处理当前观测值o和语言指令l,以生成一系列动作标记a。VLA架构通常利用大型语言模型(LLM)或视觉-语言模型(VLM)的预训练语义潜在空间,将感知输入直接映射到动作空间。形式上,VLA的目标由给定多模态上下文的动作条件概率定义:

\mathcal {L} _ {\mathrm{VLA}} = \mathbb {E} _ {(o, l, a) \sim \mathcal {D}} \left[ - \log p (a \mid o, l) \right]

世界模型(WM)被定义为一种预测性转移函数,用于内化物理环境的因果动力学。WM的功能角色是对世界的正向动力学进行建模——即在给定前一状态o和一系列假设干预a的条件下,模拟环境观测状态o'的演化过程。这通常表示为:

\mathcal {L} _ {\mathrm{WM}} = \mathbb {E} _ {(o, a, o ^ {\prime}) \sim \mathcal {D}} \left[ - \log p (o ^ {\prime} \mid o, a) \right]

在此框架下,该模型充当状态的随机传播器,提供了一种关于环境如何响应特定动作而发生变化的表征方式。

世界动作模型(WAMs)是一类具身基础模型,它将环境动力学建模(即世界建模)与运动控制(即动作生成)统一起来。不同于学习直接从观测到动作映射的标准视觉-语言-动作(VLA)模型,WAMs能够预测物理环境的未来演化过程。正式地,一个WAM必须满足以下两个核心准则:

  1. 前向预测建模:模型必须通过生成或利用对未来状态o'的可量化表征来预测环境的物理演化。这种建模可以表现为显式的视觉预测(例如像素级的视频帧、密集光流),也可以是隐式的物理表征(例如基于物理的潜在空间)。
  2. 耦合的动作生成:模型必须通过将动作命令a严格对齐于预期的未来状态o'来推导出这些动作。这种耦合可以表现为联合概率输出,也可以是在级联或统一的潜在架构中的策略条件化。

正式地,WAM旨在在一个统一框架中刻画未来状态与动作的联合分布或条件分布:

\mathcal {L} _ {\mathrm{WAM}} = \mathbb {E} _ {(o, l, o ^ {\prime}, a) \sim \mathcal {D}} \left[ - \log p (o ^ {\prime}, a \mid o, l) \right].

通过超越单纯的观测到动作映射,转向联合的状态-动作预测,WAMs利用丰富的时空先验知识,实现了更深层次的物理理解以及更强的零样本泛化能力。

概念辨析:WAM与相关概念

为确保概念清晰,我们将世界动作模型(WAMs)与生成式机器人文献中的几个相关概念区分开来。

  1. 视频动作模型(VAMs):VAMs通常指将视频预测与动作生成相结合的模型,通常使生成的动作与合成的未来视觉内容与动作对齐。我们将WAMs定义为更广泛的、不依赖特定模态的预测代理超集。尽管VAMs专门优化以使动作与视频帧合成对齐,但WAM范式认为视频仅是建模世界的可能代理之一。WAMs涵盖了利用其他预测目标的模型——例如单图像状态转移、密集点云或多感官模态如触觉和力反馈。“世界”一词强调模型对底层物理定律和因果动态的内化,而非承诺采用像素级视频格式。
  2. 视频策略:视频策略通常指由结构传承定义的模型——使用生成式视频架构(例如扩散Transformer)作为主干网络以提取强大的时空表示。这种与WAM的区别基于两个维度:结构传承和预测承诺。首先,类似于WAM/VAM的区别,视频策略在概念上与视频生成主干网络(例如视频扩散Transformer)相关联。相比之下,WAMs是主干无关的,可以通过任何能够在多种模态间进行状态合成的架构实例化。其次,如果一个模型仅继承预训练的时空表示来直接将观测映射到动作p(a|o),则可将其归类为视频策略。然而,WAM要求具备主动的预测承诺;它必须受到一个世界建模目标的监督,其中下一状态o'的合成是模型推理和输出的显式组成部分,而不仅仅是主干网络内的隐式特征。
  3. 动作世界模型(AWM):早期文献中使用“动作世界模型”(AWM)来描述将世界建模与动作生成整合在一起的模型(p(o', a \mid o, l))。虽然功能相似,但选择WAM而非AWM反映了具身智能层次结构中的战略转变。在“AWM”这一表述中,名词是“世界模型”,它将系统刻画为一个增强型模拟器。而“世界动作模型”则将系统重新定位为一种主要的智能体类别,其中“世界”(预测性物理)和“动作”(运动控制)是同等重要的组成部分。这一命名法确立了WAM作为视觉-语言-动作谱系的直接概念继承者,强调其作为机器人领域完整基础模型的身份。

参考资料

[1] Yuanzhi Liang, Xufeng Zhan, Haibin Huang, Chi Zhang, Xuelong Li, World Action Models: The Next Frontier in Embodied AI, 2026. URL https://arxiv.org/abs/2607.11689
[2] Anthony Brohan, et, al. Rt-2: Vision-language-action models transfer web knowledge to robotic control, 2023. URL https://arxiv.org/abs/2307.15818.
[3] Moo Jin Kim, et, al. Openvla: An open-source vision-language-action model, 2024. URL https://arxiv.org/abs/2406.09246.
[4] Kevin Black, et, al. \pi_{0} : A vision-language-action flow model for general robot control, 2024. URL https://arxiv.org/abs/2410.24164.

©著作权归作者所有,转载或内容合作请联系作者
【社区内容提示】社区部分内容疑似由AI辅助生成,浏览时请结合常识与多方信息审慎甄别。
平台声明:文章内容(如有图片或视频亦包括在内)由作者上传并发布,文章内容仅代表作者本人观点,简书系信息发布平台,仅提供信息存储服务。

友情链接更多精彩内容