World Models · 综述论文 综述 · 论文

General Agents Need World Models

通用智能体必须拥有世界模型

Jonathan Richens(通讯) · Google DeepMind · ICML 2025(PMLR v267) · 2025

世界模型理论智能体决策与规划AI 安全与可解释性
World Models

项目与产品时间线 4 个节点

  1. 2024
    1. 02 研究

      前作《Robust agents learn causal world models》

      arXiv:2402.10877,ICLR 2024 Oral 并获荣誉提名:鲁棒迁移 ⇒ 因果世界模型。

  2. 2025
    1. 06 研究

      arXiv:2506.01622 首次公开

      标题 General agents contain world models,给出 Theorem 1 与抽取算法。

    2. 07 研究

      ICML 2025 正式发表

      收入 PMLR v267, pp. 51659–51687,会议在温哥华举行。

    3. 10 研究

      arXiv v5 更新

      修订版补充实验与讨论,明确指出定理只覆盖完全可观测环境。

文章脉络8

  1. 01

    Theorem 1(世界模型必然性 + 误差界)

    本文 §3,ICML 2025

    满足 regret 界 δ、目标深度 n 的智能体,其策略完全决定了一个转移概率估计,误差 ≤ √(2P(1−P)/((n−1)(1−δ)))。

  2. 02

    Algorithm 1 / Algorithm 2(世界模型抽取算法)

    本文 §C

    只需查询策略、无监督、对所有满足定义的智能体通用,不需要访问网络权重或激活。

  3. 03

    Theorem 2(myopic 智能体反例)

    本文 §3

    只优化即时结果的智能体,其最优策略只能给出平凡界——世界模型仅对多步长时程目标才是必需的。

  4. 04

    Robust agents learn causal world models

    Richens & Everitt, ICLR 2024 Oral(荣誉提名),arXiv:2402.10877

    同一团队的前作:能适应分布偏移的智能体必然学到近似因果模型。

  5. 05

    World Models(Ha & Schmidhuber)

    2018

    被引作「世界模型」概念的现代起点,本文为其提供了必然性证明。

  6. 06

    Dreamer / DreamerV3

    Hafner et al., 2019–2023

    论文用来说明显式 model-based 架构在样本效率与规划上的收益。

  7. 07

    MuZero

    Schrittwieser et al., 2020

    与 LeCun 2022、Dreamer 并列,被本文列为「结论所支持的显式建模路线」。

  8. 08

    Emergent world representations(Othello-GPT)

    Li et al., 2022

    机制可解释性证据;本文给出了这类隐式世界模型为何会涌现的机制性解释。

General Agents Need World Models(arXiv 版题为 General agents contain world models)|Jonathan Richens、Tom Everitt、David Abel(arXiv 版增列 Alexis Bellot) · Google DeepMind · ICML 2025, PMLR v267, pp. 51659–51687 · 原文

这篇综述在回答什么问题

世界模型是灵活目标导向行为的必要条件,还是 model-free 学习就够了?这场争论可追溯到 Brooks 的《Intelligence without representation》——「世界就是它自己最好的模型」;近年 model-free 通才智能体的成功似乎支持这一立场,而 Othello-GPT 一类可解释性工作又提示它们其实学到了隐式世界模型。本文给出形式化答案:任何能泛化到多步目标导向任务的智能体,必然已学到环境的预测模型,且该模型可从其策略中抽取。这不是方法学综述,而是为整个领域划定边界的理论纲领。

分类框架

论文把「智能体—目标—环境」三元组之间的推断关系补全成一个闭环,这是理解全文的钥匙。

  • 三种推断方向:planning 由「环境模型 + 目标」求策略;IRL / inverse planning 由「环境模型 + 策略」求目标;本文补上最后一条边——由「策略 + 目标」求环境模型
  • 环境:受控马尔可夫过程(cMP,即无奖励函数的 MDP),有限、连通、平稳。
  • 目标:用线性时序逻辑(LTL)表达的复合目标 ψ=⟨φ1,…,φn⟩,必须按顺序达成,深度 n 即时序复杂度。
  • 智能体:只假设「有能力」而不假设「理性」——bounded goal-conditioned agent 指对深度 ≤ n 的所有目标都满足失败率(regret)不超过 δ 的目标条件策略;作者强调这比公理化理性假设更可检验,因为能力可被测量。
  • 世界模型:采用 RL 意义上的预测式世界模型(一步转移概率 Pss′(a)),而非仅指状态表征。

关键结论

  • Theorem 1(必然性与误差界):满足上述定义的智能体的策略完全决定一个转移概率估计 P̂ss′(a),误差不超过 √(2P(1−P)/((n−1)(1−δ)));在 δ≪1、n≫1 时约为 O(δ/√n)+O(1/n)。也就是说,学一个这样的策略与学一个准确世界模型在信息上是等价的
  • 抽取算法通用且无监督:Algorithm 1 只需向策略提问「要么 ψa 要么 ψb」的二选一目标,从其选择反推哪条路成功率更高,进而估出转移概率;输入只有策略,不需要权重或激活,对黑箱模型同样适用。
  • 能力越强,模型越准:δ→0 或 n 增大都会收紧误差界;低概率转移则可以「不学」,这解释了次优智能体为何只需稀疏世界模型。
  • Theorem 2(边界):只追求单步(myopic)目标的最优智能体,其策略只能给出平凡界——世界模型仅在多子目标、多步时程下才成为必需
  • 没有 model-free 捷径:这消解了 model-free 路线的核心动机,转而支持 LeCun 2022、Dreamer、MuZero 这类显式建模架构。
  • 安全与可解释性:既然足够强的黑箱智能体里一定「藏着」世界模型,就有理论保证可以把它抽出来审计,且智能体越强、时程越长(正是 reward hacking 风险最要紧的区间),抽出的模型越准。
  • 能力上限:任何智能体的泛化能力最终被它学会「世界如何运作」的能力所限;在无法建模的开放域中,长时程泛化没有保证,必须依赖在线学习。

它指出的开放问题

  • 证明只覆盖完全可观测环境;部分可观测、非马尔可夫动力学下智能体需要学到关于潜变量的什么,尚不清楚。
  • 定理证明的是世界模型「存在并被编码在策略中」,不涉及智能体是否真的用它来规划,也不能推出更强的认识论主张。
  • 抽取算法目前只在小规模 cMP 上验证(实验为 20 状态、5 动作),如何做成可用于大模型智能体的可扩展 elicitation 算法是明确的后续工作。
  • 达到某类能力需要多少因果知识——作者猜想存在「智能体版的 Pearl 因果层级」。
  • 哪些「简单任务集合」足以蕴含通用世界知识:证明只用到 Ψn 的一个 O(n|A||S|²) 子集,这与基础模型的涌现能力直接相关。

为什么值得读

站内另两篇综述回答「有哪些世界模型、怎么做」,这篇回答更前置的问题——为什么非要有世界模型。它把路线之争从工程直觉推进到可证明的命题:世界模型精度是智能体能力的上界,智能体能力反过来是模型精度的下界。对做具身智能与 VLA 的人,它解释了纯策略模型为何在长时程任务上难以稳定;对做安全与可解释性的人,它给出「从策略而非激活中抽取世界模型」这条新路径。论文出自 Google DeepMind 因果激励(Causal Incentives)团队,前作《Robust agents learn causal world models》为 ICLR 2024 Oral 并获荣誉提名。

原文链接

← 返回世界模型