Motubrain 为机器人打造的 世界动作模型

查看核心能力
下滑查看更多

世界动作模型介绍

生数科技率先定义通用世界模型路径,于2025年7月和12月发布了首个基于视频大模型的具身基础模型 Vidar 和统一架构的通用基座世界模型 Motus。作为生数科技连接数字世界与物理世界的进化核心,全新世界动作模型 Motubrain 标志着通用世界模型从“视觉推演”向“物理决策”的跨代跃迁。Motubrain 定位于具身智能机器人的通用大脑,具备多本体适配、多任务泛化和长程任务执行能力,能够支撑机器人在家庭、工业、商业等真实场景中,更稳定地完成连续复杂任务。
Motubrain 统一世界动作模型框架,包含四大模型模块 具身数据金字塔:从互联网数据到目标本体数据的分层数据体系

战略合作伙伴

生数科技携手具身智能行业领军企业,深化战略合作,共同推动通用世界模型生态建设,开创世界模型与具身智能融合的新篇章。

深朴智能 SimpleAI
无界动力 Anyverse Dynamics
星尘智能 Astribot
光轮智能 GuangLun 光轮智能 GuangLun

常见问题

您可以在这里找到关于 Motubrain 的常见问题解答,
帮助您更好地了解 Motubrain。

什么是 Motubrain?

Motubrain 是生数科技面向物理世界推出的世界动作模型,定位于具身智能机器人的通用大脑。

它将机器人对环境的感知、世界建模和动作执行统一到同一个模型中,让机器人能够基于对物理世界的理解完成连续决策,而不再依赖多个独立模型分别负责感知、规划和控制。凭借统一架构,Motubrain 具备多本体适配、多任务泛化和长程任务执行能力,可支持机器人在家庭、工业、商业等真实场景中完成复杂任务。

什么是世界动作模型?

世界动作模型是生数科技通用世界模型战略在物理世界中的核心技术路线,也是连接数字世界与物理世界的重要基础。

生数科技认为,通用智能需要同时具备生成世界与行动于世界两种能力:在数字空间,通过世界生成模型学习和生成世界;在物理空间,通过世界动作模型理解物理规律,并驱动机器人完成真实任务。二者共同构成统一世界模型体系,推动智能从数字内容生成延伸到真实世界交互。

相比传统机器人模型主要学习动作映射,世界动作模型通过统一建模视频、动作和语言等多模态信息,学习环境变化、任务目标与机器人行为之间的共同规律,因此能够更好地适应不同任务、不同机器人和不同场景。

Motubrain 和 Motus 的关联?

Motus 定义了世界动作模型的技术范式,Motubrain 则将这一范式发展成为面向真实机器人应用的通用具身智能大脑。

2025 年 12 月,生数科技发布并开源 Motus,率先提出并验证了世界动作模型的核心思想。在此基础上,Motubrain 进一步扩大模型规模,并围绕真实机器人部署完成了系统性的算法和工程升级,包括多视角统一建模、统一动作表征、多本体适配、实时高效闭环控制和推理加速等关键技术,使大规模具身模型能够在真实机器人上高效、稳定运行。

世界动作模型(WAM)和传统视觉语言动作模型(VLA)有什么区别?

传统 VLA(视觉-语言-动作) 模型主要学习“观察—动作”映射,而世界动作模型采用统一建模的方式,同时学习视频、动作和语言等多模态信息。

这种统一建模不仅让模型学习机器人如何执行动作,更学习环境变化、任务目标与动作结果之间的共同规律,从而形成可迁移的世界知识。相比主要依赖机器人轨迹数据训练的传统 VLA,世界动作模型能够充分利用更丰富的异构数据,在多任务、多机器人本体和复杂场景中展现出更强的泛化能力、扩展能力和长程任务执行能力,为构建通用具身智能提供新的技术路径。