Simulating the Real World: A Unified Survey of Multimodal Generative Models
模拟真实世界——多模态生成模型统一综述
Yuqi Hu 等(通讯 Hui Xiong) · 香港科技大学(广州)/ 港科大 MMLab / 香港中文大学 / 清华大学 · IEEE TPAMI · 2026
项目与产品时间线 2 个节点
- 2025
-
arXiv v1 发布
港科大(广州)联合港中文、清华提出以数据维度递进统一 2D/视频/3D/4D 生成的综述框架。
-
- 2026
-
arXiv v3 更新并标注 IEEE TPAMI 2026 收录
最新版补入 Wan、HunyuanVideo、Cat4D 等新一代模型与评测结果;配套仓库标注该综述被 IEEE TPAMI 2026 收录,是「多模态生成作为世界模拟器」方向少数进入顶刊的系统性梳理。
-
文章脉络8
- 01
2D 生成:Stable Diffusion / SDXL / DALL·E 3 / FLUX.1
维度阶梯的第一级,只建模外观(appearance),是后续所有模态的先验来源。
- 02
Sora
综述中作为扩散 Transformer 的标志性系统,能在不同分辨率、宽高比与时长上生成高质量视频,被视为「世界模拟」叙事的引爆点。
- 03
CogVideoX / HunyuanVideo / Wan-14B / Mochi
开源视频生成模型阵营,把「外观+动态」这一级从闭源系统推向可复现研究。
- 04
DreamFusion / Magic3D / ProlificDreamer / MVDream
文本到 3D 的分数蒸馏路线,代表「外观+几何」这一级。
- 05
Zero-1-to-3 / InstantMesh / Point·E / CraftsMan
图像到 3D 与前馈式快速重建,体现 3D 生成从优化式走向前馈式。
- 06
Consistent4D / 4D-fy / DreamGaussian4D / Cat4D
4D 生成代表作,把几何、外观与时间动态统一,是最接近「可交互世界」的一级。
- 07
评测体系:FVD / VBench / T3Bench / GT23D-Bench
综述系统梳理各维度评测,并指出 FVD 对分辨率敏感、文本到 3D 的定量评测「仍是开放问题」。
- 08
维度阶梯 2D → Video → 3D → 4D
以数据维度递进作为统一坐标系,是这篇综述最核心的分类贡献。
Simulating the Real World: A Unified Survey of Multimodal Generative Models|Yuqi Hu、Longguang Wang、Xian Liu、Ling-Hao Chen、Yuwei Guo、Yukai Shi、Ce Liu、Anyi Rao、Zeyu Wang、Hui Xiong(通讯) · 香港科技大学(广州)/ 港科大 MMLab / 港中文 / 清华 · IEEE TPAMI 2026 · 原文
这篇综述在回答什么问题
「生成模型能不能当世界模拟器」是过去两年最热的争论。作者的判断是:这个问题之所以难回答,是因为大家把 2D 图像、视频、3D、4D 当成了四个互不相干的子领域,各自比拼各自的指标,忽略了它们之间的依赖关系。综述的原话是,现有方法「常把不同模态视为独立领域,忽视其相互依赖」,因而只能刻画现实的孤立切面。于是本文提出一个统一叙事:真实世界模拟 = 沿数据维度逐级累加信息——先有外观,再有动态,再有几何,最后四者合一。这是(作者自称的)首次把 2D、视频、3D、4D 生成放进单一框架系统化梳理的尝试。
分类框架
全文以维度阶梯(progression of data dimensionality)为唯一主轴,每一级都按「表征 → 算法 → 应用」展开:
- 2D 生成(appearance):只刻画外观。扩散模型与 Transformer 路线,代表为 Stable Diffusion / SDXL / DALL·E 3 / FLUX.1 / Imagen。它为上层所有模态提供视觉先验。
- 视频生成(appearance + dynamics):加入时间动态。从 Make-A-Video、Imagen Video、AnimateDiff 到 Sora、CogVideoX、HunyuanVideo、Wan-14B、VideoPoet;并专门讨论可控生成(多条件时空编码器)与相机位姿精确控制——后者被认为是视频走向「可交互世界」的关键一环。
- 3D 生成(appearance + geometry):先讲 3D 表征(网格、点云、NeRF、3D Gaussian Splatting),再讲文本到 3D(DreamFusion、Magic3D、ProlificDreamer、MVDream)与图像/视频到 3D(Zero-1-to-3、InstantMesh、Point·E)。
- 4D 生成(appearance + geometry + dynamics):4D 表征与算法(Consistent4D、4D-fy、DreamGaussian4D、Cat4D),被定位为最接近真实世界模拟的一级,直接对应虚拟现实、游戏、机器人与自动驾驶等下游。
- 附录:术语表、预备知识,以及跨四级的数据集与评测汇总。
关键结论
- 维度不是并列关系而是继承关系:视频生成的时序先验能反哺 4D,图像/视频先验能弥补 3D 数据稀缺——综述明确把「用视频与图像先验提升 3D 生成多样性」列为可行路径。
- 相机控制是模拟器化的枢纽:精确的相机位姿控制让视频生成从「看视频」变成「在世界里移动」,是评估其能否充当世界模拟器的实际抓手。
- 评测严重滞后于生成能力:FVD 对分辨率敏感,自动指标与人类感知长期错配,文本到 3D 的定量评测「仍是开放问题」;因此综述强调人类偏好研究仍不可替代,并整理了 VBench、T3Bench、GT23D-Bench 等基准。
- 物理合理性是共同短板:四级模型都能生成好看的结果,但物理与因果合理性(physical and causal plausibility)没有一级真正解决。
- 可控性比保真度更接近「模拟器」的本质:综述用大量篇幅整理条件控制手段(时空条件编码器、多条件组合、深度/姿态/轨迹引导),其潜台词是——一个不能被条件驱动的生成模型,画面再真也只是内容生产工具,不是可供智能体交互的世界。
四级维度阶梯速览
| 层级 | 建模的信息 | 代表工作 | 主要瓶颈 |
|---|---|---|---|
| 2D 生成 | 外观 | Stable Diffusion、SDXL、FLUX.1、DALL·E 3 | 组合式对齐 |
| 视频生成 | 外观 + 动态 | Sora、CogVideoX、HunyuanVideo、Wan-14B | 长时程一致性、物理合理性 |
| 3D 生成 | 外观 + 几何 | DreamFusion、MVDream、Zero-1-to-3、InstantMesh | 多视角一致性、3D 数据稀缺 |
| 4D 生成 | 外观 + 几何 + 动态 | Consistent4D、4D-fy、DreamGaussian4D、Cat4D | 算力成本、评测缺失 |
它指出的开放问题
- 长时程连贯性与叙事结构:如何生成并评估分钟级以上、情节自洽的内容。
- 组合式对齐:主体、动作、场景三者与文本指令的一致性仍不可靠。
- 物理与因果可信度检验:需要能证伪的物理测试而非人眼评分。
- 多视角一致性:3D/4D 生成中不同视角之间的几何冲突。
- 质量与推理速度的取舍:这直接决定生成模型能否实时充当交互式环境。
- 相机控制精度与跨基准验证的可靠性。
为什么值得读
它是「视频生成作为世界模拟器」这条线上少数进入 IEEE TPAMI 的系统综述,作者来自港科大(广州)、港科大 MMLab、港中文与清华,通讯作者为熊辉(Hui Xiong)。相较于以「世界模型」为名的综述,本文更硬核地处理生成侧的表征与算法细节,同时用维度阶梯给出了一个非常好用的判断标准:要问一个生成模型离世界模拟器还有多远,就看它补齐了哪几个维度。对做机器人仿真、数据生成、4D 场景重建的人,这篇的数据集与评测附录本身就是工具书。它与以「世界模型」为名的综述形成互补:后者关心智能体如何用模型做决策,本文关心模型本身能把世界刻画到什么程度,两者合起来才是完整的世界模拟图景。