今天,生数科技正式发布通用世界动作模型 Motubrain。作为公司在世界模型方向的重要里程碑,Motubrain 定位于具身智能机器人的通用大脑,具备多本体适配、多任务泛化和长程任务执行能力,能够支撑机器人在家庭、工业、商业等真实场景中,更稳定地完成连续复杂任务。

Motubrain 的核心突破,在于将“看到的世界”和“要执行的动作”放入同一个模型中统一建模,让机器人不仅能理解环境,也能想象/预测环境变化,并生成可执行的行动策略。
具体来看,Motubrain 基于原创的 UniDiffuser 框架统一建模视频与动作两类连续模态,使模型能够同时学习环境变化、动作执行与任务结果之间的关系。通过一次训练,Motubrain 即可支持 VLA、视频生成、逆动力学模型、视频-动作联合预测等多种能力,不再依赖多个模型分别完成感知、预测、规划和执行。
在此基础上,Motubrain 进一步构建了视频、动作与语言协同的三流 MoT 架构,融合已有多模态预训练模型和专家模型能力,使模型能够同时完成场景理解、语言指令遵循、结果预测和动作生成。相比传统方法中感知、规划、执行各环节相互割裂的方式,Motubrain 以统一架构打通完整任务链路,从而具备更强的语义理解能力、指令遵循能力和端到端行动能力。
更重要的是,统一建模让 Motubrain 能够从更广泛的数据中持续学习。它不仅可以吸收完整的机器人任务轨迹数据,也能够利用缺少动作标注的视频数据、缺少语言指令的任务无关数据,以及来自不同机器人本体的视频、动作和语言数据。Motubrain 打破“数据墙”,充分利用海量异构数据,具有更强的可扩展性和泛化能力。
因此,Motubrain 不只是让机器人“学会执行动作”,而是让机器人具备理解世界、预测世界并作用于世界的能力。围绕这一目标,Motubrain 形成了四项关键能力:
一脑多能,应对多种任务。Motubrain 能够在多任务场景中保持稳定表现,不再局限于单一任务训练。随着任务数量持续增加,任务之间的共享世界知识越多,模型的平均任务成功率也同步提升,展现出更强的多任务统一能力与泛化能力。
一脑多型,适配多种本体。Motubrain 并不是为某一种机器人量身定制,而是面向多机器人本体设计的统一智能底座。它打破了“一个机器人一个模型”的传统模式,随着生态内机器人种类、场景和数据不断丰富,模型能力还能持续提升。
一脑贯通,长程任务一步完成。Motubrain 能够直接学习完整任务链路,无需上层规划、任务拆解、快慢双系统或多模型拼接,在复杂长程任务中实现更高的成功率。一个 World Action Model 即可完成 10 个原子动作级别的复杂长程任务。
一脑预见,实现动态决策。Motubrain 不只是执行指令,更能够理解世界并预测环境变化,并据此推演更合理的动作与运动路径。通过将理解世界、预测世界和执行动作统一建模,实现“预测世界,也驱动行动”。





