世界模型可分为感知、理解和决策三层。

作者 | 魏 强

编辑 | 卢旭成

7月19日,2026世界人工智能大会·昆仑万维「世界模型与多模态范式跃迁」主题论坛在上海举办,中国科学院院士周志华做了一个主题为《关于世界模型的一些讨论》的主题分享,里面有很多干货,物理AI大观将其精编发出来:

现在人工智能里很热的一件事情就是具身智能。有些地方把它就当作人形机器人,这是一个误解。

从具身智能的定义来说,只要人工智能算法加载到某种硬件身体里就是具身智能。这个身体不见得是人形机器人,可以是各种装备。现在具身智能在封闭环境下已经有很好的解决方案。

现在面临的重大挑战是开放环境——(需要面对)不同的场景,很多情况下连训练数据都没有。现实中的解决之道大概两种。第一、把开放环境变成封闭环境,比如就在徐汇区训练网约车,训练好后,车就在徐汇跑。人类司机在上海学车,江西来一个单子,只要给钱足够多也愿意去。(自动驾驶出租车)江西的单不接,天气不好不出去,肯定做得很好。

第二、(面对)真的开放(环境),需要对环境建模,这就需要世界模型。优秀的环境建模能力会导致优秀的环境适应能力,也会导致优秀的具身智能系统。

现在世界模型很热,很多东西都把它归到世界模型的范畴下。比如拍短剧要世界模型;做视频也要世界模型。

我们认为,世界模型可以分为三层:第一层感知层世界模型,如何让我们对整个世界进行更精准的感知。

第二、理解层(世界模型),(在看)很多图像视频的基础上,怎么理解这个世界。

第三、决策层世界模型。你看到了很多世界现象,目标不是要感知得多么精准,也不是要理解得多么精准,而是要能够做出好的决策。

有人会说,做好的决策是不是需要对世界理解得很精准?不一定。人类对世界不见得有很精确的理解,但我们能做很好的决策。

我今天报告的内容是关于决策的世界模型。关于决策,以往人工智能里有两条路线:一条是智能规划,它是基于我们对世界的理解,形成很多逻辑上的表达;一条是基于数据驱动的决策,主要的途径之一就是强化学习。它通过机器学习的过程和真实世界做大量的交互,(从而)产生最大化长期回报的策略。比如下围棋、打游戏,都要跟世界决策交互。交互之后,通过这些数据学习出一个决策。强化学习我们组里做过很多工作,比如我们在OpenAI强化学习比赛获得冠军的就是我们和阿里联合组的一个队,我们提供算法,阿里提供工程实现能力。

数据驱动的强化学习非常关键的点就是要跟世界进行大量的交互和试错。这对有些应用是可以的,比如下围棋、打游戏。你不断地让它玩,没有什么成本。但很多现实任务里,代价极高,

比如用算法去开战斗机,任何一个错误导致摔了一架飞机,这个成本不可承受。比如很多智能工厂,设备非常高级,一个机器人不断试错,每一次造成的损害代价极为高昂。

这时怎么办?我们能不能只依赖非常少的交互,承受极小的代价,就能得到很好的决策模型。

这好像有悖论——需要做好的决策,但又得不到这么多的数据,做出来的世界模型,怎么能保证它可靠?从这里得到的交互,又怎么能够保证能够代替原来的真实世界交互?

世界模型:鸡生蛋还是蛋生鸡?

这是鸡生蛋和蛋生鸡的问题。

你先有一个还可以的世界模型,通过它的交互,形成一些比较好的决策。基于这些比较好的决策,当它和真实世界交互的时候,承受的损失就可以大幅度地下降,再进一步提升世界模型(的能力)。一开始基于少量数据,少量交互得到的世界模型要可靠,才能作为一个好的起点。怎么做到这件事?这非常困难。

这和我们做感知层、理解层的世界模型不太一样。感知层和理解层的世界模型,只需要有个很短的推演就可以了。比如我现在看到这个环境,用摄像头拍下来,只要判断说三分钟之后这个环境和现在比不会有大的变化。

决策一定要考虑长期影响。比如我做的每一个操作都会对未来发生影响,它本身就已在改变世界。你的决策体也是世界(模型)的一部分。一旦把这件事考虑进去,你要进行多步推演应对未来的情况。

如果我们说这里面技术挑战的话,多步推演复合误差会非常大。你的拟合难度就很高,因为这里面有很多预见的情况,那么你的泛化误差推广就会很难。这个有多难呢?我们就说多步推演,会导致复合误差,最少平方级的放大。

Michaelking教授,世界上最著名的一本学习理论的书就是他写的,他也是国际顶尖机构的负责人。他做过一个理论证明,说误差随推演步数的增多呈现平方级累计增长。如果你要做一个决策模型,要考虑推演100步,每一步的误差会导致(结果差)1万倍。

决策的世界模型很难学好。长期以来,大家关注世界模型往往只关注感知层和理解层,认为决策世界模型我们想都不要去想,也做不出来。

如何极大地减少多步累计误差

我们组里一位优秀的年轻老师于洋教授在强化学习方面做了很多探索。

他们做了一个证明,发现多步累计误差是可以消除的。如果我们要考虑的是决策,比如飞机飞出去,中间每一步(会发生什么误差,不重要),只要能平安地飞回来,决策就是成功的。

一旦(只需)考虑总体就可以发展出一套新的技术,叫分布匹配技术,这样平方级误差完全可以消除。有了这个结果之后,我们就知道多步推演是可行的了。这为世界模型学习提供了基本可行的支撑。

但这只是说多步推演能做到误差可控(从平方级误差降低到线性级),但能不能在很少的样本上做呢?这是一个很大的问题。比如战斗机歼-20开2次成本已经很高了,但就得到两条轨迹数据。真正可以开回来的路径非常多,别的路径完全没有数据,这时候覆盖的范围很难泛化。

这时怎么做这件事情?Deep Mind有过一些研究,他们认为这是不可能的,用常规方法,没有样本的地方做不到。

现在我们可以发展出一套新的方法,把样本复杂度降到根号T分之一倍,关键是把贝尔曼方程(强化学习的基础)逆过来倒推。

因为我是决策,我就不需要每一个细节都非常精确。我只要知道你最后做的这个东西是对的,这就好了。比如你让机器人去开门,不需要它走的每一步都对,只要开门开对了,中间每一步有些误差关系不大。我们做决策世界模型的时候,不需要每一步都细致,样本(需求量)就大幅度降低。

通过少量交互样本为世界模型小代价学习是可以的。关于决策的世界模型,至少推演的误差可以控下来(以根号T分之一控下来),这样比较靠谱的决策世界模型初始版就能做了。

不需要每个具身智能都做一个世界模型

如果再往下做一步,我们现在很多地方,比如具身智能的系统,有不同的产线,不同的产品,需不需要用不同的产品,不同的产线,每一个都做一个模型。还是有很多模型后,再有新东西,把这些模型组装起来就可以了。

我们认为,未来要依靠很多模型的合作。

现在,世界上有很多人做了很多模型,也愿意分享自己的模型,但不愿意分享自己的数据,数据很贵,数据里有隐私。

学件是什么?模型+规约。大家可以把规约理解为模型的一个说明书。它不是人写的,因为哪怕模型的开发者自己都很难对模型有完全的了解。说明书由人工智能机器学习程序自己生成的。学件可以来自不同的开发者。

未来用户再提出一个需求,我可以组装很多的模型一起解决用户的问题。更关键的是,整个过程模型开发者的数据不需开放,用户的数据也不需要提交,他只要告诉我他想做什么。在这里,规约和学件制作系统非常重要。这个概念是我们2016年就提出来了。

那时候,还没有今天的大语言模型,没有智能体,甚至分布神经网络刚刚开始被很多业外的人关注到。

我简单跟大家说一个规约的生成,你看这里面是不知道两方面实践制作系统,会给模型一个信息,一个K模型,一个N模型,开发者把模型F做出来,再把规约做出来,规约和模型一起提交给学生去做系统。整个过程中,数据不需要分享,基座系统也根本接触不到你的数据。规约是根据你的K和N模型生成的,你不会能反向破解我的训练数据。

我们做了一个论证,哪怕用现在信息安全里面最强的攻击,暴力破解你的数据仍是安全的。所以在整个学件体系下,私有数据非常安全。

有了规约后,我们能做什么?

大家都知道,今天的数据很贵,有这个模型之后,你能为很多下一个任务提供服务,但所有任务属于同一大类的,比如ChatGPT, 它可以做文生文,但没法下棋和打牌。

学件收集你的模型,不收集你的数据。有了这么多学件模型后,我也能为很多下游任务提供服务。面对一些全新的任务,我可以把若干个模型组装起来解决它的问题。比如天气预报的模型能用来做找石油的地质分类。

很多汇集起来的模型是一个可演化的异构大模型,它会长大,还可以重组,可以瘦身。

我们现在在跟一些机器人厂商合作,它有很多产线,原来认为要为每种产品做一个世界模型。现在我们认为,可能只需要做少数几个世界模型,再有任何的新产品,只需把原来的几个世界模型进行某种装配就能解决未来的问题。

我们要开发世界模型的学件和世界模型学件的制作系统,这是我们目前也正在探索的方向。