本文转自临创司南公众号,作者临创司南
本文章为部分摘录,共计约四千字,阅读全文共需约20分钟
为提供更好的阅读体验,后台私信“世界模型”获取全文链接

1. 世界模型的定义和起源
1.1 世界模型基础定义
Scott E. Page 的《模型思考者:让数据为你工作所需了解的知识》(The Model Thinker: What You Need to Make Data Work for You)一书中提出,模型是对真实世界的简化表示,以数学公式、图表、计算机程序等形式表达。它既是推理工具,可输入参数推断结果、预测情况,也是沟通工具,助专业人士交流观点,是认识复杂现实的有力手段。
世界模型——即能够学习环境结构与动态特性的内部仿真器——已成为追求人工通用智能的核心范式,使智能体能够在基于所学表征的框架下进行预测、规划与推理。
资料来源:北京大学 袁粒 《生成未必理解:基于扩散模型能否实现视觉世界模型?》,Scott E. Page《The Model Thinker: What You Need to Make Data Work for You》
1.2 世界模型概念起源
世界模型的概念最早由google提出,于2018年发表在机器学习顶会NeurIPS上。文中以认知科学中人脑mental model来类比世界模型,认为mental model参与了人类的认知、推理、决策过程,其中最核心的能力在于反事实推理(Counterfactual reasoning),这是一种人类天然具备,而机器还做得很差的能力。论文:Recurrent World Models Facilitate Policy Evolution作者:David Ha(Google Brain)、Jürgen Schmidhuber(NNAISENSE)


1.3 世界模型 vs 视频生成 vs 具身智能(概念区分)
业界常混淆世界模型、视频生成、具身智能三类概念,三者定位与目标存在本质差异:
世界模型:一类能够接收动作条件、预测环境未来状态的预测模型,核心价值是为智能体规划与决策提供虚拟推演能力。代表工作:Dreamer、MuZero、Cosmos、GAIA-2 视频生成模型:核心目标是生成视觉逼真的连续视频,多数模型不支持动作可控生成,也不内置面向决策的物理因果推理机制。代表作品:Sora(属性仍存在讨论)、Runway、可灵 具身智能:指能够在真实 / 模拟物理环境中感知、执行动作并完成任务的智能体系统。世界模型是构建高级具身智能的关键内部模拟器,二者并非并列概念,而是模块与整机系统的关系。代表性主体:Figure、Physical Intelligence

1.4 世界模型两大核心路线分类
世界模型可分为“隐式表征”与“物理预测”两大路线,分别对应对世界的“理解”与“生成”能力。世界模型在人工智能领域中的定义和分类是多样化的,但普遍认同分为两类:理解世界和预测世界。
聚焦内部表征(理解向):依托概率模型、物理模型等形式存在。通过对历史数据深度学习,构建世界抽象认知,核心功能为决策、知识推理; 指向未来预测(生成向):核心依赖生成模型,捕捉物体运动、环境时序演化,输出视频、虚拟场景序列。

资料来源:Augusta University《World Models: A Comprehensive Survey of Architectures, Methodologies, Reasoning Paradigms, and Applications》
1.5 世界模型三大功能模块 & 四大技术组件
1.5.1 三模块功能分解(视觉-记忆-控制)
模块包含:视觉-记忆-控制三模块,视觉模型回答「我看到什么」,记忆模型回答「世界如何变化」,控制模型回答「我该做什么」
其中,Decoder 是可选的。例如,MuZero 完全省略 Decoder——它的潜空间只为奖励和价值预测优化,从不重建观测。而JEPA可以直接在表示空间预测,连像素级的 Decoder 都不需要。

资料来源:Augusta University《World Models: A Comprehensive Survey of Architectures, Methodologies, Reasoning Paradigms, and Applications》
1.6 世界模型五维架构分类标准
世界按架构可分为五类:表达 · 动力学 · 模态 · 学习范式 · 下游用途,五个维度互相独立、可交叉定位单一模型:▸ ① 表示层 (Representation):“怎么看懂当前世界”,像素/连续潜/离散 token/JEPA/对象中心/3D共6种表示方案▸ ② 动力学 (Dynamics):“怎么预测下一时刻状态”,确定性/随机/隐式生成/表示空间/记忆增强/混合6类转移机制▸ ③ 模态 (Modality):输入传感器分类,视觉/语言/3D/本体感觉/多模态融合5大类▸ ④ 学习范式 (Learning Paradigm):训练方式,自监督/在线MBRL/离线/基础模型/监督模仿/混合6类▸ ⑤ 下游用途 (Downstream Use):落地场景,强化学习/自动驾驶/机器人/医疗/视频创作/语言推理六大方向
这五个维度是互补的,同一个模型可以同时在每个轴上定位。比如 DreamerV3 在表示轴上是“连续潜变量”,在动力学轴上是“随机性”,在模态轴上是“视觉”,在学习范式轴上是“在线 MBRL”,在下游用途轴上是“RL与规划”。这种多维分类让我们能精确比较不同模型的设计选择。
示例:DreamerV3 在表示轴上是“连续潜变量”,在动力学轴上是“随机性”,在模态轴上是“视觉”,在学习范式轴上是“在线 MBRL”,在下游用途轴上是“RL与规划”。多维分类可精准横向对比不同模型设计取舍。
1.6.1 分类轴①:按表示方式划分(6类)
六种主要表示方式,决定了模型保留何种信息、预测是否可计算
表示方式决定了世界模型保留什么信息。最直接的是像素级表示,例如DIAMOND 和 GameNGen 直接预测每一帧像素,保真度最高但计算昂贵;大多数成功的模型选择压缩到潜空间:连续潜变量(RSSM)适合连续控制,离散 Token(IRIS)类比语言建模;而JEPA 是 LeCun 力推的范式,它不重建像素,直接在表示空间预测,跳过了像素重建瓶颈;对象中心表示(C-SWM)把场景分解为对象 slot,支持组合泛化但复杂度O(N²);3D 占据表示(OccWorld)专为自动驾驶设计,在体素空间预测未来。

1.6.2 分类轴②:按动力学时序转移划分(6类)
六种转移机制形式,从显式参数化到隐式生成与记忆增强
动力学分类回答状态如何转移。确定性动力学最简单,给定状态和动作,下一状态唯一确定,但无法表达对手可能左移也可能右移的多模态未来。随机性动力学引入潜变量建模不确定性;隐式生成动力学(扩散模型)通过去噪过程生成未来,灵活但缺乏可解释的转移结构;表示空间预测(JEPA)直接在嵌入空间预测,跳过重建;记忆增强动力学(CLARITY)检索外部记忆库,适合医疗等需要个性化上下文的场景。当前,混合范式是未来趋势——结合随机性、记忆和扩散的优势。

1.6.3 分类轴③:按输入模态划分

1.6.4 分类轴④⑤:学习范式 & 下游应用
学习范式是指用于训练模型的方式。自监督学习(JEPA)无需标注,从原始视频学习;在线 MBRL(Dreamer)边交互边想象;离线学习(Decision Transformer)从固定数据集学习;基模范式(Cosmos、Genie)先大规模预训练再适配下游。
当前的技术趋势是基模范式,即单一预训练世界模型可为机器人、驾驶、科学建模共享表征基础,减少领域特定数据收集。

临创司南是上海临港集团旗下主要投资于早期科创型企业的私募股权投资基金。基金将面向前沿科技领域,围绕坡长雪厚赛道,孵化培育创新企业,打造产业创新生态。


