WAIC 2026|生数科技骆怡航:从理解语言到理解世界,通用世界模型开启 AI 发展新主线

过去几年,大语言模型推动人工智能完成了一次重要跃迁。机器从理解和生成文本,逐步走向深度推理、工具调用和自主执行。但当AI进一步进入视频、游戏、机器人和自动驾驶等动态场景,仅仅理解语言已经不够。

现实世界不是由文字组成的静态知识库,而是一个持续变化的复杂系统。智能体不仅需要识别“正在发生什么”,还要预测“接下来会发生什么”,判断“某个行动会带来什么结果”,并根据环境反馈不断调整决策。

从理解语言到理解世界,正在成为人工智能下一阶段的重要能力跃迁。

7月19日,WAIC 2026启明创投·创业与投资论坛正式举行。生数科技联合创始人、首席执行官骆怡航以“通用世界模型:打通虚实边界,筑基物理智能”为主题,分享了生数科技对通用世界模型的长期判断与技术实践。

骆怡航演讲现场

世界模型:让 AI 从解读信息,走向参与真实世界

世界模型并不是一个全新的概念,但随着视频生成、多模态模型和具身智能快速发展,它正在从学术研究走向产业中心。在骆怡航看来,语言模型主要处理人与语言、知识和信息之间的关系,而世界模型面向的,是智能体与整个世界的交互。

人类智能并不只体现在语言处理上,人脑中大量区域都在参与视觉感知、行动规划和决策。这种智能的核心,是对物理世界的感知,以及基于环境变化作出动作决策。

“如果只依靠大语言模型理解世界,相当于只使用了人类智能中很小的一部分。大模型时代,还需要一个达到LLM范式级别的世界模型。”

视频模型需要理解人物和物体如何运动,机器人需要预测一个动作可能产生的结果,自动驾驶系统则需要在复杂环境中持续感知和实时决策。不同场景背后,依赖的是相似的底层能力:感知环境、预测变化并采取行动。一个完整的世界模型,需要形成持续运行的动态闭环——感知、预测和行动不是三个彼此割裂的模块,而应当建立在统一的世界表征之上。

走向通用化:世界模型规模化落地的必经之路

当前,不少世界模型仍围绕家庭机器人、工业操作、自动驾驶等特定场景构建。但如果一种机器人、一个场景就需要训练一套模型,数据采集、训练和部署成本将难以规模化。

大语言模型带给行业的重要启示,是先通过大规模预训练建立通用能力,再迁移到不同任务和场景。世界模型也需要经历类似的演进。

“世界模型不仅要形成感知、预测与行动的闭环,还要像语言模型一样,足够通用、足够泛化。”

通用化世界模型

不同智能体可以拥有不同形态,数字世界与物理世界也有不同的输出方式,但驱动它们运行的底层智能,应当是统一的。世界模型真正的竞争,不只是谁能在单项任务中取得更高成功率,更在于谁能建立具有规模效应、迁移能力和智能涌现潜力的通用基础模型。

视频,正在成为理解世界的重要入口

构建世界模型,首先需要让AI看到并理解世界。文字是对现实的抽象表达,图像呈现的是某一时刻的状态,而视频则连续记录了世界如何发生变化。人物如何行动、物体如何受力、空间如何变化、一个行为如何引发后续结果,这些信息都蕴含在连续画面之中。

当视频模型预测下一帧画面时,它学习的不只是像素生成,也是在学习世界状态之间的转换关系。因此,视频模型的价值正在超越内容生产本身。

视频作为理解世界的入口

在此基础上,世界模型还需要进一步吸收仿真数据、第一人称数据、人类操作数据和机器人真机数据,将对世界的理解转化为真实行动。生数科技由此构建统一的通用世界模型基座:先建立对世界的理解和预测能力,再面向数字与物理两个空间进行不同解码。

一体两翼:同一通用基座,驱动数字生成与物理行动

围绕统一的世界模型基座,生数科技形成了覆盖世界生成、实时交互和世界行动的产品体系。

产品体系

Vidu Q系列面向数字内容生成,持续提升模型对人物、场景、运动和物理规律的理解与预测能力;Vidu S系列推动视频从离线生成走向实时、连续交互;Motubrain则面向物理世界,将模型对环境和任务的理解转化为机器人动作。

三条产品路线面向不同场景,但背后共享的是对时空、因果和行动的统一建模能力。“数字世界和物理世界的Agent可以千差万别,但它们背后的智能应该是通用的、泛化的、统一的。”

在数字世界,世界模型可以推动视频、游戏和虚拟角色从静态内容走向实时、连续、可交互的动态环境;在物理世界,它则可以推动机器人摆脱固定指令和预设流程,升级为能够理解目标、自主规划的智能体。

从生成世界,到行动于世界

大语言模型让机器开始理解和使用语言,视频生成模型让机器具备视觉创作能力,而通用世界模型所要推动的,是让机器进一步理解世界、预测世界并行动于世界。

在骆怡航看来,未来不同形态的机器人,都将成为物理世界中的Agent,像数字世界中的Agent一样实现自主规划与执行。而实现这一目标,真正的破局点仍然是模型。

骆怡航演讲结语

“通用世界模型是物理智能最具潜力的技术路径。未来,数字世界和物理世界的Agent会是多样化的,但它们背后的智能是通用的——像人一样交流,像人一样创意,也像人一样行动。”

从处理信息,到理解变化;从生成内容,到作出行动,人工智能正在进入一个新的发展阶段。而通用世界模型,正是连接数字智能与物理智能、推动AI真正进入现实世界的关键基础设施。