Motubrain 为机器人打造的 世界动作模型
查看核心能力世界动作模型
战略合作伙伴
什么是 Motubrain?
Motubrain 是生数科技面向物理世界推出的世界动作模型,定位于具身智能机器人的通用大脑。
它将机器人对环境的感知、世界建模和动作执行统一到同一个模型中,让机器人能够基于对物理世界的理解完成连续决策,而不再依赖多个独立模型分别负责感知、规划和控制。凭借统一架构,Motubrain 具备多本体适配、多任务泛化和长程任务执行能力,可支持机器人在家庭、工业、商业等真实场景中完成复杂任务。
什么是世界动作模型?
世界动作模型是生数科技通用世界模型战略在物理世界中的核心技术路线,也是连接数字世界与物理世界的重要基础。
生数科技认为,通用智能需要同时具备生成世界与行动于世界两种能力:在数字空间,通过世界生成模型学习和生成世界;在物理空间,通过世界动作模型理解物理规律,并驱动机器人完成真实任务。二者共同构成统一世界模型体系,推动智能从数字内容生成延伸到真实世界交互。
相比传统机器人模型主要学习动作映射,世界动作模型通过统一建模视频、动作和语言等多模态信息,学习环境变化、任务目标与机器人行为之间的共同规律,因此能够更好地适应不同任务、不同机器人和不同场景。
Motubrain 和 Motus 的关联?
Motus 定义了世界动作模型的技术范式,Motubrain 则将这一范式发展成为面向真实机器人应用的通用具身智能大脑。
2025 年 12 月,生数科技发布并开源 Motus,率先提出并验证了世界动作模型的核心思想。在此基础上,Motubrain 进一步扩大模型规模,并围绕真实机器人部署完成了系统性的算法和工程升级,包括多视角统一建模、统一动作表征、多本体适配、实时高效闭环控制和推理加速等关键技术,使大规模具身模型能够在真实机器人上高效、稳定运行。
世界动作模型(WAM)和传统视觉语言动作模型(VLA)有什么区别?
传统 VLA(视觉-语言-动作) 模型主要学习“观察—动作”映射,而世界动作模型采用统一建模的方式,同时学习视频、动作和语言等多模态信息。
这种统一建模不仅让模型学习机器人如何执行动作,更学习环境变化、任务目标与动作结果之间的共同规律,从而形成可迁移的世界知识。相比主要依赖机器人轨迹数据训练的传统 VLA,世界动作模型能够充分利用更丰富的异构数据,在多任务、多机器人本体和复杂场景中展现出更强的泛化能力、扩展能力和长程任务执行能力,为构建通用具身智能提供新的技术路径。
Motubrain 的核心优势是什么?
Motubrain 的核心优势在于将世界理解、未来预测与动作生成统一到同一个模型中,让机器人不仅能够“执行动作”,更能理解任务目标、判断环境变化,并持续做出合理行动。
通过对视觉、语言和动作的协同建模,Motubrain 能够从多种类型的数据中学习可迁移的世界规律,因而能够灵活适配多种机器人本体、丰富的任务类型与复杂多变的应用环境。同时,Motubrain 还具备复杂指令理解、长程任务执行、双臂协同与在线纠错能力,并通过实时闭环控制,支持模型在真实机器人场景中的稳定部署与可靠执行。
当环境发生变化时,Motubrain 如何应对?
当环境发生变化时,Motubrain 不会机械地重复预设轨迹,而是持续感知当前环境状态,结合任务目标与动作反馈,实时调整后续行动。
即使面对训练阶段从未出现的物体、摆放位置与环境组合,Motubrain 仍可迁移已学习的世界规律,推演环境状态和动作结果,动态调整行动策略,展现出对新任务、新环境的强泛化能力。
依托世界与动作的统一建模及实时闭环控制,Motubrain 能够灵活应对物体位置变化、任务中断或执行偏差,通过在线纠错重新规划动作,持续推进任务完成,提升机器人在复杂环境中的适应性与执行稳定性。
Motubrain 未来还将拓展哪些能力?
未来,Motubrain 将进一步拓展对不同机器人本体与应用场景的适配能力,持续提升跨本体、跨任务和跨环境的泛化与快速部署能力。通过融合更丰富、更大规模的多模态异构数据,Motubrain 将不断提升零样本场景下的泛化与评测表现,深化对世界状态、任务目标及行动结果的理解与预测,支持更长程、更复杂的多目标协同任务,推动模型在更多真实机器人场景中实现高效、稳定且易于部署的应用,进一步探索并验证跨本体规模定律。