World Models · 综述论文 综述 · 论文

Understanding World or Predicting Future? A Comprehensive Survey of World Models

理解世界还是预测未来?世界模型全面综述

Jingtao Ding、Chen Gao、Fengli Xu、Yong Li 等 · 清华大学电子工程系 FIB Lab · ACM Computing Surveys (CSUR) · 2025

世界模型综述总纲具身智能
World Models

项目与产品时间线 3 个节点

  1. 2024
    1. 11 研究

      arXiv v1 发布

      清华 FIB Lab 提交《Understanding World or Predicting Future?》,首次以「隐式表征 vs. 未来预测」两分法统摄世界模型文献。

  2. 2025
    1. 09 研究

      正式发表于 ACM Computing Surveys

      以 ACM CSUR 第 58 卷第 3 期刊出(DOI 10.1145/3746449),成为该领域少数进入顶级综述期刊的世界模型总纲。

    2. 12 研究

      arXiv v4 扩展版

      扩展版补入 Genie 3、Cosmos 等 2025 年新进展,并维护配套论文清单仓库。

文章脉络8

  1. 01

    World Models (Ha & Schmidhuber)

    NeurIPS 2018

    综述认定它「让世界模型这一术语真正复兴并流行」的起点工作,用 VAE+RNN 在潜空间中做梦训练策略。

  2. 02

    Dreamer / DreamerV3

    Google DeepMind, 2020–2023

    潜空间想象式模型基强化学习的代表,DreamerV3 靠鲁棒归一化与平衡技巧在 150+ 任务上通用,无需人类数据即可在 Minecraft 中挖到钻石。

  3. 03

    TD-MPC2

    2024

    把轨迹优化嵌进学到的隐式世界模型潜空间,是 MPC 路线(相对 MCTS 路线)的代表。

  4. 04

    Dynalang / LLM-as-world-model

    2023–2024

    以语言/多模态大模型为骨干的世界模型:预测未来的文本与图像表征,或用 GPT-4 生成并迭代精化 PDDL 领域描述再交给经典规划器。

  5. 05

    Sora

    OpenAI, 2024

    综述视其为视频生成式世界模型的分水岭,但明确指出它缺乏因果推理、难以稳定复现正确物理定律(如流体)。

  6. 06

    Genie 2 / Genie 3

    Google DeepMind, 2024–2025

    可交互、可控的生成式世界模拟,Genie 3 实现实时交互,是「世界模型即环境」的代表。

  7. 07

    Cosmos

    NVIDIA, 2025

    在海量真实物理视频上预训练,被综述列为在物理规律遵循上取得新突破的世界基础模型。

  8. 08

    MetaUrban / UrbanWorld / UniSim

    2024–2025

    从室内(AI2-THOR、LEGENT)到室外城市、再到动作条件动态生成环境的具身环境谱系。

Understanding World or Predicting Future? A Comprehensive Survey of World Models|Jingtao Ding、Yunke Zhang、Chen Gao、Fengli Xu、Yong Li 等 · 清华大学电子工程系 FIB Lab · ACM Computing Surveys 2025(DOI 10.1145/3746449,arXiv 扩展版 49 页) · 原文

这篇综述在回答什么问题

「世界模型(world model)」这个词在过去两年被严重超载:强化学习圈说的是 Dreamer 那种潜空间动力学模型,视频生成圈说的是 Sora 那种能「模拟世界」的生成器,大模型圈又说 LLM 内部隐含了世界知识。这篇综述要做的第一件事,就是把这些互不相干的用法放进同一张地图。作者从术语史出发(Ha & Schmidhuber 2018 被认为让这一术语真正复兴),指出所有分歧其实可以归到一个问题上:世界模型是用来「理解」当前世界,还是用来「预测」未来世界——前者服务于决策,后者服务于模拟。围绕这条主轴,全文覆盖模型基强化学习、语言模型骨干、视频生成、具身环境四条技术线,以及游戏、具身、城市、社会四类应用。

分类框架

综述提出二分法(two-fold taxonomy),两大类各自再细分:

  • 隐式表征外部世界(Implicit Representation of the External World):其一是决策中的世界模型,即模型基强化学习(model-based RL)路线,把决策形式化为 MDP,学习状态转移 M 与奖励函数 R,再用 MPC(模型预测控制)或 MCTS(蒙特卡洛树搜索)两种方式生成策略;其二是以语言模型为骨干的世界模型,把 LLM/MLLM 当作通用表征与常识来源。
  • 模型习得的世界知识(World Knowledge Learned by Models):又分为全局物理世界知识、局部物理世界知识、人类社会知识三层,用来讨论「大模型到底懂不懂物理与社会」。
  • 预测物理世界的未来(Future Prediction of the Physical World):其一是世界模型即视频生成(从视频生成走向视频世界模型,及其能力边界);其二是世界模型即具身环境,按室内、室外、动态三类环境组织。
  • 应用域:游戏智能、具身智能、城市智能(自动驾驶 / 无人物流 / 城市分析)、社会智能(社会模拟器)。

关键结论

  • 两种功能并非同一件事:擅长预测像素级未来的模型未必拥有可解释、可推理的内部世界表征;综述明确指出「稠密潜表征利于预测、结构化可解释表征利于推理」之间存在张力,这也是标题问号的由来。
  • 模型基强化学习线路已从玩具任务走向通用:DreamerV3 借助鲁棒归一化与平衡技巧,在 150 多个任务上以同一套超参取得优异表现,并在无人类数据条件下完成 Minecraft 采钻石;TD-MPC2 则把轨迹优化直接放进学到的潜空间。
  • 视频世界模型的瓶颈是物理与因果,不是画质:综述称 Sora 能生成长达一分钟的时序一致视频并「涌现出部分世界知识」,但缺乏因果推理、难以稳定复现正确的物理定律;随后 Cosmos 靠海量真实物理视频预训练在物理规律遵循上取得突破,Genie 3 则把可控性推进到实时交互。
  • 视频世界模型的四项必要能力:长时程一致预测、多模态(图像/动作/语言)融合、可交互性、跨环境适应性。
  • 具身环境的演进方向:从 AI2-THOR、Matterport3D 这类静态高保真场景,到 LEGENT、AnyHome 这类语言指令生成任意室内环境,再到 MetaUrban、UrbanWorld 的城市尺度,最后到 UniSim、Pandora 这类由动作与语言条件动态生成视频的「动态环境」;总趋势是「从构建静态的当前环境,转向预测动态的未来环境」。

它指出的开放问题

  • 物理规则与反事实模拟:现有生成式世界模型只学到统计相关,不能可靠回答「如果换一个动作会怎样」。
  • 社会维度的缺失:世界不只有物理,还有人;社会模拟器中智能体对外部世界的理解仍然粗糙。
  • 评测基准:缺乏跨领域、能同时衡量「理解」与「预测」两种功能的统一基准。
  • 模拟到现实(sim-to-real):具身智能中生成式环境与真实机器人执行之间的差距仍是核心障碍。
  • 模拟效率:大规模长时程模拟的算力成本难以承受,制约闭环训练。
  • 伦理与安全:自主决策系统与高仿真社会模拟带来的风险。

为什么值得读

它是目前少数进入 ACM Computing Surveys 这一级别期刊的世界模型综述,作者为清华大学电子工程系 FIB Lab(李勇教授团队),成文严谨、覆盖面横跨 RL、视频生成、具身与社会模拟。如果只读一篇来建立「世界模型」的全局坐标系,应该是这一篇:它不偏袒任何一条技术路线,而是给出可以把 Dreamer、Sora、Genie、Cosmos 放在同一张表里比较的语言。配套的 GitHub 论文清单也持续更新,便于顺藤摸瓜。

原文链接

← 返回世界模型