A Path Towards Autonomous Machine Intelligence
通往自主机器智能之路
Yann LeCun(2018 图灵奖得主) · NYU Courant 研究所 / Meta FAIR · OpenReview 立场论文 v0.9.2 · 2022
项目与产品时间线 5 个节点
- 2022
-
OpenReview 发布 v0.9.2
LeCun 以立场论文形式提出自主机器智能架构与 JEPA/H-JEPA,明确「不推荐生成式架构」。
-
- 2023
-
I-JEPA 落地
arXiv:2301.08243,纲领提出后的第一个具体实现,图像表征在冻结评估下表现优异。
-
- 2024
-
教程版进入同行评审期刊
Dawid & LeCun 的 LVEBM 教程发表于 Journal of Statistical Mechanics(DOI 10.1088/1742-5468/ad292b)。
-
- 2025
-
V-JEPA 2 发布
12 亿参数视频世界模型,用于零样本机器人操作,纲领第一次在具身任务上闭环。
-
- 2026
-
AMI Labs 成立
LeCun 离开 Meta 后在巴黎创立 AMI Labs,继续以 JEPA 路线推进本文提出的「高级机器智能」计划。
-
文章脉络8
- 01
模块化认知架构(configurator / world model / cost / actor)
全部模块可微,能量梯度可回传,规划等价于能量最小化。
- 02
Mode-1 / Mode-2 双回路
对应 Kahneman 的 System 1 / System 2:反应式策略 vs 用世界模型做模型预测控制。
- 03
JEPA(Joint-Embedding Predictive Architecture)
在表征空间预测 sy≈Pred(sx,z),非生成式,能量即预测误差。
- 04
H-JEPA(Hierarchical JEPA)
多层表征对应多时间尺度预测,支撑分层规划与子目标分解。
- 05
VICReg
本文推荐的非对比式正则化训练法,用方差/不变性/协方差项防止表征坍缩。
- 06
I-JEPA
图像域的首个 JEPA 实现,验证纲领可落地。
- 07
V-JEPA / V-JEPA 2
视频版世界模型,V-JEPA 2 用于零样本机器人抓放,是纲领的具身验证。
- 08
Introduction to Latent Variable Energy-Based Models
LeCun 亲自参与的同行评审教程版,系统讲 EBM→LVEBM→JEPA。
A Path Towards Autonomous Machine Intelligence, Version 0.9.2|Yann LeCun · NYU Courant Institute / Meta FAIR · OpenReview 立场论文 · 2022-06-27 · 原文
这篇综述在回答什么问题
LeCun 开篇即声明:这不是传统技术论文,而是一篇 position paper,回答「机器怎样才能像人和动物一样高效地学习、推理和规划」。他把当代 AI 的欠缺归为三个挑战:(1) 如何主要通过观察学会表征、预测与行动——真实世界的交互既昂贵又危险;(2) 如何让推理规划与基于梯度的学习相容,而非退回符号逻辑;(3) 如何在多层抽象、多时间尺度上表示感知与行动计划。答案是让机器通过自监督学习获得世界模型——常识即是这样一批模型的集合,告诉智能体什么可能、什么合理、什么不可能。
分类框架
全文的骨架是一个所有模块都可微、多数模块可训练的模块化认知架构,以及两种感知—行动回路。
- 六个模块:configurator(按任务配置其余模块,作者自承最「神秘」)、perception、world model(补全感知缺失信息并预测多种可能未来)、cost(不可训练的 intrinsic cost + 可训练 critic,输出标量「能量」)、short-term memory(类海马体键值记忆)、actor(提出动作序列并用梯度优化)。
- Mode-1 vs Mode-2:Mode-1 是策略模块直接由感知输出动作的反应式行为(对应 Kahneman 的 System 1);Mode-2 借世界模型「在脑内推演」,用代价梯度优化动作序列,本质是 model-predictive control(System 2)。推理在这里被统一定义为能量最小化 / 约束满足。
- JEPA:x、y 各过一个编码器得到 sx、sy,预测器在表征空间预测 sy,能量即预测误差 D(sy, Pred(sx, z))。它不是生成式的——无需预测 y 的每个细节,编码器可主动丢掉不可预测的部分;不确定性由编码器不变性与潜变量 z 承载(论文以「汽车驶向岔路口」说明 z 表示左转还是右转)。
- H-JEPA:低层 JEPA 用细粒度表征做短期预测,高层 JEPA 在更抽象的表征上做长期预测,从而把复杂任务分解为逐层细化的子目标,支撑分层规划。
- 训练方法:对比法在高维下效率极低,因此推荐 VICReg 一类非对比的正则化方法,同时最大化表征信息量、最小化预测误差。
关键结论
- 世界模型是核心,不是配件:智能体的绝大部分参数应当用于从观察中学习世界模型,而不是靠试错的奖励信号来学。
- 反对生成式预测:生成式潜变量模型无法真正剔除无关细节,只能把它们塞进潜变量;JEPA 通过编码器的不变性直接扔掉不可预测的细节,因此更适合视频这类高维连续信号。
- 抽象是可预测性的产物:用 VICReg 类准则训练的 JEPA 会学出「让世界变得可预测」的抽象表征,这是分层堆叠与长时程预测的前提。
- Scaling is not enough:LLM 依赖 token 化与生成式建模,在连续高维模态上无法用归一化分布表达不确定性;缺少抽象潜变量也使它难以探索多种解释、难以动态指定目标。
- Reward is not enough:无模型 RL 极端样本低效,标量奖励信息量太低;该架构更接近最优控制而非 RL——奖励只扮演次要角色。
它指出的开放问题
- H-JEPA 究竟能否从视频中训练出所设想的抽象概念层级,仍是未验证的第一号问题。
- 如何正则化潜变量以最小化其信息量(离散化、低维、稀疏、随机——哪种最优尚不清楚)。
- Mode-2 中如何系统地枚举潜变量的多种取值(类似人对 Necker 立方体的多重解释),论文未给出机制。
- 动作空间离散或代价函数不光滑时,梯度优化失效,需要 MCTS、动态规划等无梯度搜索;如何让世界模型学出使规划变成「连续松弛」的表征。
- 短期记忆如何表示对世界状态的信念,以及 configurator 如何自动分解子目标,均只有粗略设想。
为什么值得读
它是「隐式表征世界模型」整条路线的源文件:I-JEPA、V-JEPA、V-JEPA 2 乃至 LeCun 2026 年创立的 AMI Labs,都在兑现这份 2022 年的清单。它与站内两篇方法学综述互补——后者分别给出「理解世界 vs 预测未来」的全景分类与 2D→视频→3D→4D 的生成式路线,而这篇纲领恰站在生成式路线的反面,论证预测为何应发生在表征空间而非像素空间。读它是为了拿到一套判断「什么算世界模型、什么只是视频生成器」的判据。需留意:本文以 OpenReview 形式发布,未经同行评审、无 DOI、OpenAlex 未收录,其地位来自作者与后续工作而非 venue。