基于统一架构与视频数据路径,生数科技联合清华大学开源了统一世界模型 Motus,实现了多模态能力的系统性整合。

在模型架构上,Motus基于 UniDiffuser 统一建模框架,通过跨模态先验融合(Cross-modal Priors Fusion),将视觉语言知识(VLM)、视频动态知识(Video Generation Model)与动作技能知识(Action Expert)整合进同一模型,实现语言、视频与动作的统一表达与生成。

在数据利用与规模扩展方面,Motus展现出显著优势。在数据规模扩展实验(Data Scaling)中,相较国际领先的VLA模型 Pi0.5,Motus能够从更广泛的异构数据中学习,并有效融合预训练基座模型中的多模态先验能力。在50个任务的平均成功率上,Motus实现了35.1%的绝对提升,同时在相同性能水平下展现出13.55倍的数据效率。
在任务规模扩展实验(Task Number Scaling)中,随着任务数量增加,Motus的平均成功率持续提升,而对比模型Pi0.5则随任务复杂度提升出现性能下降。最终,Motus实现了37%的绝对成功率优势,体现出更强的多任务泛化能力。
更值得注意的是,Motus率先揭示了具身智能Scaling的新维度——多任务泛化能力曲线。这一曲线为具身基座模型提供了关键的“北极星指标”,其演进路径与语言模型的发展高度一致,也呼应了 GPT-2 所提出的“Language Models are Unsupervised Multitask Learners”的核心思想,被喻为具身智能的“GPT2”时刻。
在长程、多步骤的复杂真机任务中,Motus 进一步呈现出接近人类水平的决策逻辑与执行稳定性。具体而言:在验证码操作任务中,通过机械臂模拟人类鼠标操作,可以实现对屏幕内容的精准识别与高精度点击。在棋类决策任务中,面向长程规划与多步推理场景,协同完成环境感知、状态预测与策略决策。在柔性物体操作任务中,针对复杂、非刚性物体,实现稳定感知与自适应抓取控制。