WAIC 2026|生数科技朱军:通用世界模型是连接数字世界与物理世界的新基础设施

7月20日,WAIC 2026期间,生数科技与万兴科技联合举办“世界模型驱动下的AI影视生产力新范式”专题论坛。论坛上,生数科技创始人、清华大学人工智能研究院副院长朱军发表题为《通用世界模型:连接数字世界与物理世界的新基础设施》的主题演讲,系统分享了通用世界模型的技术演进、核心能力及产业应用路径。

朱军表示,人工智能正在从理解和生成数字内容,进一步走向对世界规律的建模、推理、预测与行动。通用世界模型将成为连接数字世界与物理世界的重要基础设施,推动AI从“生成世界”迈向“理解世界、预测世界、行动于世界”。

朱军演讲

什么是世界模型

朱军演讲现场

从原理上来看,什么是世界模型?我们先来看人的世界模型。大家都有过骑自行车或者开车的经历,在做出动作之前,我们会在大脑中形成一个小模型,帮助我们理解环境、想象不同动作可能产生的结果、规划行动,最终指导动作输出。这就是人的世界模型,它能够帮助我们适应复杂环境,并作出安全、可靠的行动。

今天,全世界都在关注如何构建机器的世界模型。机器世界模型相关的研究很多,前沿进展也非常快。但从本质上来看,机器的世界模型主要需要具备三项能力:第一,对环境进行精准理解;第二,能够基于当前状态和即将采取的动作进行预测和想象;第三,能够在预测过程中学习并采取行动。总体而言,机器世界模型至少要实现理解、想象和行动的一体化。

世界模型与普通模型的区别在于,它不仅要回答“是什么”,实现对世界的理解,还要回答“为什么”,以及“这样做会产生什么后果”。这个领域目前最大的变革,是从专用模型走向通用模型,并形成Scaling Law。

六层数据金字塔与通用架构

要做通用模型,首先需要回答一个问题:我们应该使用什么样的数据?根据理解和建模世界的目标,我们梳理了相关数据,形成了六层数据金字塔。从底层向上,分别包括通用互联网视频、第一视角的人类动作视频,以及机器人相关的操作数据等。

六层数据金字塔

在机器人轨迹采集过程中,大量数据也是以视频形式承载的。总体来看,视频是这套数据体系中最主要的格式。我们的目标是打造通用基模,因此在数据使用上有几个原则:第一,数据规模要足够大;第二,数据类型要尽可能全面;第三,要尽可能使用真实数据。

今天,我们想和大家分享的是,如何通过生成式方法和底层技术原理,让海量视频数据转化为高质量、有价值的训练数据。

我们的目标是打造通用模型,而通用模型需要通用架构。我们较早开始探索这一方向,并提出了全球首个MoT统一架构,将理解专家、生成专家和行动专家统一在同一个模型中,通过统一目标进行训练。

MoT统一架构

因为它是一个一体化模型,所以在使用过程中可以自由切换不同的输出形态。对于机器人,它可以直接输出动作;对于创作者,它可以直接输出高质量的像素级视频。生数科技正在做的就是“通用世界模型”。

世界生成模型与世界动作模型

从数字内容到实时交互

在数字内容方向,对应的是Vidu Q3等模型。通过海量视频数据的大规模训练和Scaling Law,模型可以实现更加精准的理解,以及高动态、高一致性的生成创新。如今,在视频大模型中,我们已经率先实现了理解和想象。

Vidu能力展示

近期,我们还发布了实时生成模型。视频模型不再只是简单地生成素材,也可以成为实时交互模型。以数字人场景为例,传统方式通常需要预设有限的动作模板。现在,我们采用的是完全流式的生成方式,角色的表现可以更加自然、灵活,也更加拟人化。

实时生成模型

它不仅可以实时交互,还能够支持无限时长的连续对话。在需要流式、实时交互的场景中,可以直接使用视频大模型提供相关解决方案。目前,模型可以实现540P的视频输出,最高帧率达到42FPS。

流式生成能力

从数字世界走向物理世界

但我们的最终目标,并不只是停留在数字内容生成上。无论是Vidu视频生成,还是Vidu S1的流式生成,都是在为进一步走向实时的物理交互做准备。这些核心技术也可以支撑模型在物理世界中的行动。

今年4月份发布的最新模型Motubrain,可以基于同一个模型底座,同时驱动多种异构机器人本体,完成复杂的长程任务。

具身智能机器人

我们取得的一个重要进展是,基于较强的通用基模,可以用更加高效的方式,让不同机器人本体快速学习复杂技能。用户可能只需要给出一条文字指令,模型可以理解语言描述,将任务分解为一系列步骤,并精准生成完成任务所需的动作指令。

这也是新一代基座模型与传统VLA方法最本质的区别之一。传统VLA更多是在拟合轨迹,而通过生成式预训练机制,机器人可以基于对未来的想象来规划动作,输出的动作也更加可靠、稳定、安全和高效。同时,通用基模可以支持跨场景、跨任务的泛化。

展望

朱军演讲结语

今天讨论的通用世界模型,不再只是视频模型的升级,也不是语言模型的简单延伸,而是推动AI从生成内容,迈向理解世界、推演世界,并与世界实时交互的新范式。

生数科技从成立之初就定位于基础模型,并以视频建模作为出发点。过去短短两年时间,视频基模已经从最初展示技术可能性,发展到今天真正进入产业、支撑生产力场景。

未来展望

我们的第一个体会是,视频数据是语言之外一种非常丰富、规模庞大且十分宝贵的信息载体。第二,基于视频的大规模预训练,模型可以实现精准理解、高质量和高一致性的想象与预测,并进一步形成可泛化、跨任务、跨本体的行动能力。我们已经看到,在持续提升预训练能力的基础上,再配合高效的后训练,可以推动整个行业实现快速迭代和落地。

希望能够与更多行业同仁开展合作,共同探索通用世界模型的智能上限与产业落地的更多可能。