General Agents Need World Models
通用智能体必须拥有世界模型
Jonathan Richens(通讯) · Google DeepMind · ICML 2025(PMLR v267) · 2025
项目与产品时间线 4 个节点
- 2024
-
前作《Robust agents learn causal world models》
arXiv:2402.10877,ICLR 2024 Oral 并获荣誉提名:鲁棒迁移 ⇒ 因果世界模型。
-
- 2025
-
arXiv:2506.01622 首次公开
标题 General agents contain world models,给出 Theorem 1 与抽取算法。
-
ICML 2025 正式发表
收入 PMLR v267, pp. 51659–51687,会议在温哥华举行。
-
arXiv v5 更新
修订版补充实验与讨论,明确指出定理只覆盖完全可观测环境。
-
文章脉络8
- 01
Theorem 1(世界模型必然性 + 误差界)
满足 regret 界 δ、目标深度 n 的智能体,其策略完全决定了一个转移概率估计,误差 ≤ √(2P(1−P)/((n−1)(1−δ)))。
- 02
Algorithm 1 / Algorithm 2(世界模型抽取算法)
只需查询策略、无监督、对所有满足定义的智能体通用,不需要访问网络权重或激活。
- 03
Theorem 2(myopic 智能体反例)
只优化即时结果的智能体,其最优策略只能给出平凡界——世界模型仅对多步长时程目标才是必需的。
- 04
Robust agents learn causal world models
同一团队的前作:能适应分布偏移的智能体必然学到近似因果模型。
- 05
World Models(Ha & Schmidhuber)
被引作「世界模型」概念的现代起点,本文为其提供了必然性证明。
- 06
Dreamer / DreamerV3
论文用来说明显式 model-based 架构在样本效率与规划上的收益。
- 07
MuZero
与 LeCun 2022、Dreamer 并列,被本文列为「结论所支持的显式建模路线」。
- 08
Emergent world representations(Othello-GPT)
机制可解释性证据;本文给出了这类隐式世界模型为何会涌现的机制性解释。
General Agents Need World Models(arXiv 版题为 General agents contain world models)|Jonathan Richens、Tom Everitt、David Abel(arXiv 版增列 Alexis Bellot) · Google DeepMind · ICML 2025, PMLR v267, pp. 51659–51687 · 原文
这篇综述在回答什么问题
世界模型是灵活目标导向行为的必要条件,还是 model-free 学习就够了?这场争论可追溯到 Brooks 的《Intelligence without representation》——「世界就是它自己最好的模型」;近年 model-free 通才智能体的成功似乎支持这一立场,而 Othello-GPT 一类可解释性工作又提示它们其实学到了隐式世界模型。本文给出形式化答案:任何能泛化到多步目标导向任务的智能体,必然已学到环境的预测模型,且该模型可从其策略中抽取。这不是方法学综述,而是为整个领域划定边界的理论纲领。
分类框架
论文把「智能体—目标—环境」三元组之间的推断关系补全成一个闭环,这是理解全文的钥匙。
- 三种推断方向:planning 由「环境模型 + 目标」求策略;IRL / inverse planning 由「环境模型 + 策略」求目标;本文补上最后一条边——由「策略 + 目标」求环境模型。
- 环境:受控马尔可夫过程(cMP,即无奖励函数的 MDP),有限、连通、平稳。
- 目标:用线性时序逻辑(LTL)表达的复合目标 ψ=⟨φ1,…,φn⟩,必须按顺序达成,深度 n 即时序复杂度。
- 智能体:只假设「有能力」而不假设「理性」——bounded goal-conditioned agent 指对深度 ≤ n 的所有目标都满足失败率(regret)不超过 δ 的目标条件策略;作者强调这比公理化理性假设更可检验,因为能力可被测量。
- 世界模型:采用 RL 意义上的预测式世界模型(一步转移概率 Pss′(a)),而非仅指状态表征。
关键结论
- Theorem 1(必然性与误差界):满足上述定义的智能体的策略完全决定一个转移概率估计 P̂ss′(a),误差不超过 √(2P(1−P)/((n−1)(1−δ)));在 δ≪1、n≫1 时约为 O(δ/√n)+O(1/n)。也就是说,学一个这样的策略与学一个准确世界模型在信息上是等价的。
- 抽取算法通用且无监督:Algorithm 1 只需向策略提问「要么 ψa 要么 ψb」的二选一目标,从其选择反推哪条路成功率更高,进而估出转移概率;输入只有策略,不需要权重或激活,对黑箱模型同样适用。
- 能力越强,模型越准:δ→0 或 n 增大都会收紧误差界;低概率转移则可以「不学」,这解释了次优智能体为何只需稀疏世界模型。
- Theorem 2(边界):只追求单步(myopic)目标的最优智能体,其策略只能给出平凡界——世界模型仅在多子目标、多步时程下才成为必需。
- 没有 model-free 捷径:这消解了 model-free 路线的核心动机,转而支持 LeCun 2022、Dreamer、MuZero 这类显式建模架构。
- 安全与可解释性:既然足够强的黑箱智能体里一定「藏着」世界模型,就有理论保证可以把它抽出来审计,且智能体越强、时程越长(正是 reward hacking 风险最要紧的区间),抽出的模型越准。
- 能力上限:任何智能体的泛化能力最终被它学会「世界如何运作」的能力所限;在无法建模的开放域中,长时程泛化没有保证,必须依赖在线学习。
它指出的开放问题
- 证明只覆盖完全可观测环境;部分可观测、非马尔可夫动力学下智能体需要学到关于潜变量的什么,尚不清楚。
- 定理证明的是世界模型「存在并被编码在策略中」,不涉及智能体是否真的用它来规划,也不能推出更强的认识论主张。
- 抽取算法目前只在小规模 cMP 上验证(实验为 20 状态、5 动作),如何做成可用于大模型智能体的可扩展 elicitation 算法是明确的后续工作。
- 达到某类能力需要多少因果知识——作者猜想存在「智能体版的 Pearl 因果层级」。
- 哪些「简单任务集合」足以蕴含通用世界知识:证明只用到 Ψn 的一个 O(n|A||S|²) 子集,这与基础模型的涌现能力直接相关。
为什么值得读
站内另两篇综述回答「有哪些世界模型、怎么做」,这篇回答更前置的问题——为什么非要有世界模型。它把路线之争从工程直觉推进到可证明的命题:世界模型精度是智能体能力的上界,智能体能力反过来是模型精度的下界。对做具身智能与 VLA 的人,它解释了纯策略模型为何在长时程任务上难以稳定;对做安全与可解释性的人,它给出「从策略而非激活中抽取世界模型」这条新路径。论文出自 Google DeepMind 因果激励(Causal Incentives)团队,前作《Robust agents learn causal world models》为 ICLR 2024 Oral 并获荣誉提名。