Motus: A Unified Latent Action World Model

概览

Motus 的核心目标在于弥合具身智能领域长期存在的范式割裂:VLA(视觉-语言-动作)模型虽擅长理解复杂场景与人类指令,但难以应对环境的动态变化;而世界模型虽专注于推演未来的物理运动,却缺乏对复杂语义的理解。为此,Motus 旨在构建一个统一架构,以打通感知、想象与行动的闭环。

在架构层面,它融合了 VLA、世界模型、视频生成模型、逆动力学模型以及视频-动作联合生成模型五种具身基础模型范式。

在数据层面,它统一了跨本体机器人数据、任务无关数据、仿真合成数据、人类操作视频及互联网视频的动作空间,并通过大规模预训练实现运动先验的共享。

在动作学习层面,它引入了基于光流提取的潜动作(Latent Action),有效解决了海量互联网视频中动作标签缺失或不一致的难题,使模型在缺乏真实动作标注的情况下,仍能习得运动方向维度的物理直觉。

真实应用展示

在 Cloudflare 人机验证任务中,面对形状不规则的曲面鼠标,由 Motus 驱动的机械臂不仅能实现精准的目标识别,还能基于鼠标与屏幕点击框的相对距离,动态规划出平滑、连续的运动轨迹,最终精确触达目标区域。

在叠衣服任务中,面对具有高度形变特性的柔性物体,Motus 展现了出色的自适应控制能力,能够在物体形态持续发生动态变化的交互过程中,实现顺畅且稳定的柔性操控。

在涉及长程多步推理的孔明棋任务中,Motus 展现了卓越的长时序规划与决策能力,能够依据实时的任务状态反馈,逐步推演并完成数步有效走法。

技术细节

1. 核心挑战

为了达到一个统一模型并实现前文所述的各类认知功能,Motus 将问题拆解为两个核心挑战,分别是统一多模态生成能力从大规模异构数据中学习。前者通过 MoT 架构与 UniDiffuser 调度器实现,后者通过 Latent Action 范式解决。

Motus 核心挑战示意图

2. 架构核心

Motus 的架构核心是 Mixture-of-Transformer(MoT)。它由三个部分组成:视频生成专家、动作专家,以及基于 VLM 的理解专家。其中,视频生成专家和动作专家是具备独立扩散时间步(Diffusion Timestep)的 Rectified Flow Model(DiT 的变种);理解专家则是标准的 Transformer。

Motus 将三个专家的多头自注意力层连接为统一的 Tri-model Joint Attention,让来自三个专家的 Token 进行跨模态融合交互。这样,模型既能够继承和复用成熟 VLM 与视频生成模型在视觉-语言理解、物理世界模拟上的先验知识,也能够在保持各专家功能独立性的同时,实现跨模态特征融合:

  • 理解专家:基于 Qwen3-VL,从图片和指令的多模态输入中理解复杂场景与人类意图。
  • 视频生成专家:基于 Wan 2.2,为决策提供符合物理规律的未来时空推演。
  • 动作专家:负责将前两者多层理解与生成的特征,精准映射为机器人的最终控制信号。

这一设计使得 Motus 在单次前向传递中,就能完成从高维语义感知、物理动力学模拟到低维动作输出的完整映射,从而实现感知、想象与行动的端到端统一。

3. UniDiffuser 调度器

在统一架构的基础上,Motus 进一步引入 UniDiffuser 调度器,用来建模不同模型对应的条件、边际和联合概率分布,打破 VLA、世界模型、逆动力学模型、视频生成等具身基础模型范式之间的壁垒。

在训练阶段:Motus 对待预测的视频噪声和动作噪声分别独立采样扩散时间步。因此,模型会见到多种混合状态,例如“视频很清晰但动作全是噪声”、“动作很清晰但视频全是噪声”,以及“两者都全是噪声”。

在推理阶段:利用这种训练特性,可以人为地给视频和动作两种模态设定不同的时间步,并施加对应的噪声强度,使 Motus 可以灵活切换为五种形态:视觉-语言-动作模型(VLA)、世界模型(WM)、逆动力学模型(IDM)、视频生成模型(VGM)和视频-动作联合预测模型。

通过这一机制,Motus 将感知、想象和行动等多种模式视作针对视频-动作联合分布的不同条件采样。仅凭调整输入噪声,就实现了“一模多能”——训练一个模型,即可推理五种模式,从而适应不同的机器人任务。

4. 六层数据金字塔

除了视觉-语言和视频生成等先验,具身智能还需要通过更本质的运动控制信号来学习如何输出动作。然而,特定本体的真机数据昂贵且稀缺,这限制了模型的泛化能力。为此,Motus 并没有局限于单一数据源,而是整合多个异构数据源,并形成了一个六层的数据金字塔,旨在利用底层海量视频的物理交互知识来为顶层稀缺动作的学习提供先验。

六层数据金字塔示意图

这个数据金字塔包括:特定本体的真机数据、跨本体的真机数据、任务无关数据、仿真合成数据、人类操作视频和互联网视频。通过这种数据集构建方式,模型能够利用底层海量视频中的物理交互知识,为顶层稀缺动作学习提供先验。

5. Latent Action:统一动作空间

然而,这类视频数据面临一个关键挑战,即动作标签的缺失或不一致。在仅包含视觉观测而缺乏对应控制信号的情况下,模型难以直接从大规模无标注视频中学习有效的动作表示。Motus 的解决方法是基于光流的潜动作(Latent Action)。

Latent Action 示意图

具体而言,Motus 利用光流捕捉视频帧之间的运动,并将其压缩编码至一个低维的潜空间(Latent Space),并用少量的带标签机器人数据进行监督,巧妙地将无标签的通用视频与有标签的机器人数据都映射和对齐到了同一个动作特征空间,即建模像素层面的增量动作(Delta Action),使得模型即使在缺乏大规模真实动作标注数据的情况下,也能从通用视频中学习到与物体运动、交互过程和动作变化相关的动作先验。

6. 三阶段训练流程

基于数据金字塔和 Latent Action,Motus 构建了三阶段训练流程,逐步将通用物理动力学知识转化为精确的机器人控制能力:

  • 视频生成预训练:利用多机器人轨迹和人类操作视频来微调视频生成专家,使其能够根据条件帧和语言指令生成合理的机器人操作视频,同时学习物理世界中的基本运动规律,为后续机器人控制能力奠定基础。
  • 潜动作预训练:在冻结 VLM 的情况下,用视频、语言和潜动作同时预训练三个专家,将通用的运动先验注入 Motus 中。
  • 特定本体微调:利用目标机器人的真机数据对模型进行整体微调,使其适应特定场景下的下游任务(如 RoboTwin 仿真和真机机械臂抓取)。
三阶段训练流程示意图

这一训练策略为动作专家提供了可扩展的预训练路径,实现了从视觉运动(Motion)到实体控制(Action)的迁移学习,使具身智能的决策控制能够从大规模数据中提取先验,并增强模型泛化能力。

实验成果

Fold Towel
Fold T-shirt
Fold Towel
Get Water
Brew Coffee
Water the Flowers
Bake Bread
Grind Coffee Beans
Touch Keyboard

实验结果表明,Scaling Law 在物理世界任务中得到了有效验证。在 RoboTwin 2.0 仿真基准测试中,Motus 在 50 个通用任务上取得了 88% 的平均成功率。

RoboTwin 2.0 评测结果

相比于单一任务的性能提升,Motus 的 Scaling Curves 能够更深刻地反映模型在多任务学习中的扩展趋势。

任务数量 Scaling 曲线

从任务数量的 Scaling 曲线来看,随着训练任务数量的增加,Pi-0.5 的表现出现下降,而 Motus 的成功率继续上升。这表明传统 VLA 架构在多任务场景下易受任务间干扰的影响;相比之下,Motus 能够有效沉淀与复用多任务间共享的世界知识,展现出更强的跨任务泛化能力。

数据规模 Scaling 曲线

从数据规模的 Scaling 曲线来看,随着训练数据量的扩大,Motus 的性能保持稳定增长。这表明模型在当前数据规模下尚未达到饱和瓶颈,仍能从更大规模的数据中持续获得性能增益,体现出良好的数据扩展潜力。

进一步地,实验结果显示,Motus 的数据效率相比基线模型提升了 13.55 倍。换言之,在达到相同性能指标时,Motus 所需的数据量仅为基线模型的 1/13.55,体现出其在多任务学习中的高效泛化能力。

在真机测试中,无论是 AC-One 还是 Agilex-Aloha-2 机械臂,Motus 都表现出了较好的适应性。

真机测试结果

总体来看,Motus 通过统一架构与多源异构数据,将感知、预测和行动整合于单个智能体内部,实现了“看—想—动”的端到端闭环。