Motus:开源统一世界模型,
性能全面超越 Pi0.5 达 40%

近日,生数科技联合清华大学,基于视频大模型,融合多技术路线,正式开源大一统通用基座世界模型 Motus。作为生数科技在具身世界模型战略中的关键一环,Motus在多项核心任务上,相较国际领先的 VLA 模型 Pi0.5,实现了40% 的成功率提升,验证了具身基础模型 Scale Up 的有效路径,为具身智能迈向统一智能体形态套定了关键技术基础。

Motus 于 2025 年 12 月 完成论文发布并实现完整开源,早于行业2个月。在此之后,产业界与学术界陆续出现相关研究成果,进一步印证了这一技术路线在具身智能领域的前瞻性与实际价值。值得注意的是,围绕“以视频模型作为具身智能统一表征底座”的核心判断,生数科技与清华大学早在 2025 年 7 月 即已发表 Vidar 具身视频模型相关工作,早于行业半年。

生数科技始终坚持将多模态模型作为通往通用人工智能(AGI)的核心路径。视频天然承载了真实世界的物理时空、因果逻辑与动态演变,是连接感知与行动的最佳表征基底。

基于这一前瞻性战略,生数科技致力于打破过去具身智能领域“感知→推理→行动”相互割裂的碎片化范式,构建贯通多模态生成的大一统通用基座「世界模型」。通过将视频生成的“想象力”与机器人操控的“执行力”深度融合,我们旨在打造如同“人类全脑”般的智能中枢。

Motus论文页面

生数所追求的通用具身智能体,应当像人类一样,在同一个整体中同时具备理解场景与语言指令、进行推理、预测未来及动作后果,并最终执行动作的能力。然而,现有具身智能模型仍面临两大核心瓶颈。

一方面,多模态生成能力长期处于碎片化状态:VLA、视频生成模型、世界模型与 VLM 各自为政,模型往往只能覆盖“感知—推理—行动”链路中的单一环节,难以形成统一闭环。

另一方面,模型对大规模异构数据的利用能力有限,训练过程高度依赖专家采集的任务轨迹,导致泛化能力与迁移能力受限。

Motus的提出,在一个框架中统一了世界模型、VLA、视频生成模型等不同范式的多模态生成能力,并充分挖掘大规模异构数据中的物理交互知识。值得注意的是,Motus 的大一统世界模型与 World Labs 和 Genie3 的路线有所区别,Motus 不止是渲染仿真,而是一个端到端的大一统模型,就像人的全脑,既能感知理解,又能想象预判推理,还能执行,从而能真正走进物理世界,帮助人类干活。

在架构层面,Motus 首次将 VLA、世界模型、视频生成模型、逆动力学模型以及视频–动作联合生成模型等五种主流具身基础模型范式统一到同一框架中,构建起贯通“感知、推理、行动”的统一建模路径。

在数据层面,Motus 进一步打破了长期制约具身智能发展的真机数据瓶颈。面对数据稀缺、来源异构、难以共享的现实困境,Motus 统一了跨本体机器人数据、任务无关数据、仿真合成数据、人类操作视频以及互联网视频的动作空间,并通过大规模预训练共享丰富的运动先验,为模型提供了跨任务、跨平台迁移的基础能力。

LinkedIn业界评价

在 LinkedIn 上,多位海外 AI 与机器人领域从业者对 Motus 给出高度评价,普遍认为其代表了具身智能从“模块拼装式系统”向“统一智能体架构”的关键范式转变。其 Latent Action + 统一建模 的技术路线被视为既聪明又务实,有效打通了从“数字世界”走向“物理世界”的路径。

这一次,机器人,终于能像人一样同时感知、推理和行动了!

Motus代码和模型均已开源:

论文地址:https://arxiv.org/abs/2512.13030

项目主页:https://motus-robotics.github.io/motus

项目代码与模型权重:GitHub:https://github.com/thu-ml/Motus;Hugging Face:https://huggingface.co/motus-robotics

01 超越Pi0.5 40%:Motus引领具身智能多任务泛化性和Scale Up新范式

在采样数据高效利用方面,Motus 展现出显著优势。在 Scaling Curves(规模扩展曲线)实验中,Motus 在数据规模与任务规模两个维度上,均表现出更优的扩展特性。

更值得注意的是,Motus 率先发现了具身智能 Scaling 的新维度,也就是多任务泛化性曲线。这一曲线为具身基座模型的发展提供了一个关键的北极星指标,其演进路径与语言模型的发展高度一致,也呼应了 GPT-2 所提出的核心观点:Language Models are Unsupervised Multitask Learners。

Scaling Curves对比图

在 Data Scaling实验中,相比国际领先的 VLA 模型 Pi0.5,Motus 能够从更广泛的数据类型中学习,并有效融合更多预训练基座模型所提供的先验能力。在 50 个任务的平均成功率上,Motus 相较 Pi0.5 实现了35.1%绝对成功率的提升,同时在相同性能水平下展现出 13.55 倍的数据效率。

这一结果表明,Motus 通过引入更丰富、更异构的多模态先验,在 Scaling Law 作用下,能够更高效地形成更通用的智能能力。

Data Scaling实验动态图

在 Task Number Scaling实验中,随着任务数量的持续增加,Motus 的平均成功率呈现稳定上升趋势;而 Pi-0.5 的成功率则随任务复杂度提升而持续下降。最终,Motus 相较 Pi0.5 实现了37%绝对成功率的提升。

这一多任务性能上的质变,表明 Motus 的“大一统”建模方式能够在不同任务之间学习到可共享的结构性知识与统一的世界知识;相比之下,传统 VLA 模型更容易在单一任务的 action 模式上产生过拟合。

Task Number Scaling实验动态图

02仿真评测:88%成功率,刷新具身智能复杂操作上限

为进一步验证Motus的性能优势在具体任务与真实场景中的可迁移性,研究团队从仿真环境、真机部署等方面,对 Motus 的实际表现进行了系统评测,并在多项关键指标上取得了亮眼结果。

在覆盖 50 个通用任务的 RoboTwin 2.0 仿真环境中,使用官方提供的 2.75 万条混合训练数据(涵盖 Clean 与 Randomized 场景),Motus 取得了约 88% 的平均成功率,在同类模型中表现突出。

即便是在难度极高的 stack bowls three 任务中——这一任务对对齐精度与动态平衡要求极高,稍有偏差便会导致整体坍塎,长期以来让众多机器人频繁“手抖”失误——基线模型的最高成功率始终未超过 16%。相比之下,Motus 的成功率达到了 91%–95%,实现了数量级上的性能跃升。

RoboTwin 2.0评测结果

这一表现并非个例。在多项基线模型表现受限、甚至难以收敛的高难度任务中,Motus 均展现出显著且稳定的性能提升,持续刷新成功率上限,验证了其在复杂操作场景下的强泛化能力与性能天花板。

03 真机评测:从“机械执行”到“端到端智能”

在真机实验中,Motus 分别部署于 AC-One 与 Agilex-Aloha-2 两种不同本体平台上,在多项任务中均取得了显著优于 Pi0.5 等行业领先模型的任务成功率。尤其值得注意的是,Motus 能够从大规模预训练中持续受益,展现出更强的跨任务与跨本体泛化能力。

此外,在 Touch Instructed Keyboard、Place Cube into Plate、Put Bread into Oven 等一系列任务中,Motus 同样表现出对物体间空间关系的深刻理解,能够规划出合理、连贯的运动轨迹,进一步体现了其高协调度的细粒度视觉–动作定位能力。

真机实验结果

在一系列长程、多步骤的复杂真机任务中,Motus 进一步呈现出接近人类水平的决策逻辑与执行稳定性,需要强调的是,这些都不是简单的单步指令,而是典型的长程、多步骤任务,并且由模型端到端完成,而非依赖传统的“快慢双系统”拆分。

在Cloudflare人机验证页面的场景,面对人体工学鼠标,Motus可以精准地找到非规则曲面外形鼠标的着力点,结合自身的视觉理解能力,识别鼠标和Cloudflare点击框的距离并平稳连续地移动鼠标,最后精准地点击鼠标,成功从物理世界破解Cloudflare。

在孔明棋等涉及复杂规则的多步骤任务中,Motus做到了从理解、生成到执行的完美闭环,通过对不断变化的棋局的实时理解与分析,Motus能想象出符合规则的下法,并精准无误地投射到物理世界中,实现连续多步的合理走棋。

在叠衣服、叠毛巾等涉及柔性物体的复杂家政场景,Motus 能够在端到端框架下,实时预测织物形变并完成连续、精细的动作控制。由于织物在外力作用下会持续产生不确定形态变化,机器人必须不断进行状态推演与动作调整。Motus 能够与柔性物体进行稳定交互,完成连贯的折叠流程,突破了传统方法在柔性操作上的长期瓶颈。

战略布局:开源大一统世界模型,迈出 AGI 走向物理世界的关键一步

作为生数科技全球战略布局中的核心引擎,Motus 的开源具有里程碑式意义。这不仅是一次前沿技术成果的对外开放,更标志着具身智能从“单点能力突破”,迈向“统一基础模型体系构建”的关键转向。

Motus 的发布,使机器人首次接近人类的基础认知与行动范式:既能理解当下环境与语言指令,又能对未来状态与动作后果进行想象,并在真实物理世界中执行连贯、可泛化的行动。这不仅体现为模型指标上的领先,更代表着通用人工智能(AGI)从数字世界走向物理世界的关键跃迁。

我们始终相信,具身智能的真正繁荣,不应建立在封闭、割裂的技术领先之上,而应依托可扩展、可复用的统一基础模型。

通过开源 Motus,生数科技向全球开发者与产业伙伴提供了一套高性能、高兼容性的“通用物理智能底座”:无论是工业机械臂、商用服务机器人,还是足式与移动机器人,都能够在同一套“感知–推理–行动”的世界模型范式下持续进化。

从视频模型出发,走向世界模型;从内容生成走向物理智能。生数科技,正在让 AI 不只是理解世界,而是真正改变世界。