World Models · 综述论文 综述 · 论文

Simulating the Real World: A Unified Survey of Multimodal Generative Models

模拟真实世界——多模态生成模型统一综述

Yuqi Hu 等(通讯 Hui Xiong) · 香港科技大学(广州)/ 港科大 MMLab / 香港中文大学 / 清华大学 · IEEE TPAMI · 2026

视频生成世界模拟器3D/4D 生成
World Models

项目与产品时间线 2 个节点

  1. 2025
    1. 03 研究

      arXiv v1 发布

      港科大(广州)联合港中文、清华提出以数据维度递进统一 2D/视频/3D/4D 生成的综述框架。

  2. 2026
    1. 02 研究

      arXiv v3 更新并标注 IEEE TPAMI 2026 收录

      最新版补入 Wan、HunyuanVideo、Cat4D 等新一代模型与评测结果;配套仓库标注该综述被 IEEE TPAMI 2026 收录,是「多模态生成作为世界模拟器」方向少数进入顶刊的系统性梳理。

文章脉络8

  1. 01

    2D 生成:Stable Diffusion / SDXL / DALL·E 3 / FLUX.1

    2022–2024

    维度阶梯的第一级,只建模外观(appearance),是后续所有模态的先验来源。

  2. 02

    Sora

    OpenAI, 2024

    综述中作为扩散 Transformer 的标志性系统,能在不同分辨率、宽高比与时长上生成高质量视频,被视为「世界模拟」叙事的引爆点。

  3. 03

    CogVideoX / HunyuanVideo / Wan-14B / Mochi

    2024–2025

    开源视频生成模型阵营,把「外观+动态」这一级从闭源系统推向可复现研究。

  4. 04

    DreamFusion / Magic3D / ProlificDreamer / MVDream

    2022–2024

    文本到 3D 的分数蒸馏路线,代表「外观+几何」这一级。

  5. 05

    Zero-1-to-3 / InstantMesh / Point·E / CraftsMan

    2023–2024

    图像到 3D 与前馈式快速重建,体现 3D 生成从优化式走向前馈式。

  6. 06

    Consistent4D / 4D-fy / DreamGaussian4D / Cat4D

    2023–2025

    4D 生成代表作,把几何、外观与时间动态统一,是最接近「可交互世界」的一级。

  7. 07

    评测体系:FVD / VBench / T3Bench / GT23D-Bench

    2023–2025

    综述系统梳理各维度评测,并指出 FVD 对分辨率敏感、文本到 3D 的定量评测「仍是开放问题」。

  8. 08

    维度阶梯 2D → Video → 3D → 4D

    本文提出的分类主轴

    以数据维度递进作为统一坐标系,是这篇综述最核心的分类贡献。

Simulating the Real World: A Unified Survey of Multimodal Generative Models|Yuqi Hu、Longguang Wang、Xian Liu、Ling-Hao Chen、Yuwei Guo、Yukai Shi、Ce Liu、Anyi Rao、Zeyu Wang、Hui Xiong(通讯) · 香港科技大学(广州)/ 港科大 MMLab / 港中文 / 清华 · IEEE TPAMI 2026 · 原文

这篇综述在回答什么问题

「生成模型能不能当世界模拟器」是过去两年最热的争论。作者的判断是:这个问题之所以难回答,是因为大家把 2D 图像、视频、3D、4D 当成了四个互不相干的子领域,各自比拼各自的指标,忽略了它们之间的依赖关系。综述的原话是,现有方法「常把不同模态视为独立领域,忽视其相互依赖」,因而只能刻画现实的孤立切面。于是本文提出一个统一叙事:真实世界模拟 = 沿数据维度逐级累加信息——先有外观,再有动态,再有几何,最后四者合一。这是(作者自称的)首次把 2D、视频、3D、4D 生成放进单一框架系统化梳理的尝试。

分类框架

全文以维度阶梯(progression of data dimensionality)为唯一主轴,每一级都按「表征 → 算法 → 应用」展开:

  • 2D 生成(appearance):只刻画外观。扩散模型与 Transformer 路线,代表为 Stable Diffusion / SDXL / DALL·E 3 / FLUX.1 / Imagen。它为上层所有模态提供视觉先验。
  • 视频生成(appearance + dynamics):加入时间动态。从 Make-A-Video、Imagen Video、AnimateDiff 到 Sora、CogVideoX、HunyuanVideo、Wan-14B、VideoPoet;并专门讨论可控生成(多条件时空编码器)与相机位姿精确控制——后者被认为是视频走向「可交互世界」的关键一环。
  • 3D 生成(appearance + geometry):先讲 3D 表征(网格、点云、NeRF、3D Gaussian Splatting),再讲文本到 3D(DreamFusion、Magic3D、ProlificDreamer、MVDream)与图像/视频到 3D(Zero-1-to-3、InstantMesh、Point·E)。
  • 4D 生成(appearance + geometry + dynamics):4D 表征与算法(Consistent4D、4D-fy、DreamGaussian4D、Cat4D),被定位为最接近真实世界模拟的一级,直接对应虚拟现实、游戏、机器人与自动驾驶等下游。
  • 附录:术语表、预备知识,以及跨四级的数据集与评测汇总。

关键结论

  • 维度不是并列关系而是继承关系:视频生成的时序先验能反哺 4D,图像/视频先验能弥补 3D 数据稀缺——综述明确把「用视频与图像先验提升 3D 生成多样性」列为可行路径。
  • 相机控制是模拟器化的枢纽:精确的相机位姿控制让视频生成从「看视频」变成「在世界里移动」,是评估其能否充当世界模拟器的实际抓手。
  • 评测严重滞后于生成能力:FVD 对分辨率敏感,自动指标与人类感知长期错配,文本到 3D 的定量评测「仍是开放问题」;因此综述强调人类偏好研究仍不可替代,并整理了 VBench、T3Bench、GT23D-Bench 等基准。
  • 物理合理性是共同短板:四级模型都能生成好看的结果,但物理与因果合理性(physical and causal plausibility)没有一级真正解决。
  • 可控性比保真度更接近「模拟器」的本质:综述用大量篇幅整理条件控制手段(时空条件编码器、多条件组合、深度/姿态/轨迹引导),其潜台词是——一个不能被条件驱动的生成模型,画面再真也只是内容生产工具,不是可供智能体交互的世界。

四级维度阶梯速览

层级建模的信息代表工作主要瓶颈
2D 生成外观Stable Diffusion、SDXL、FLUX.1、DALL·E 3组合式对齐
视频生成外观 + 动态Sora、CogVideoX、HunyuanVideo、Wan-14B长时程一致性、物理合理性
3D 生成外观 + 几何DreamFusion、MVDream、Zero-1-to-3、InstantMesh多视角一致性、3D 数据稀缺
4D 生成外观 + 几何 + 动态Consistent4D、4D-fy、DreamGaussian4D、Cat4D算力成本、评测缺失

它指出的开放问题

  • 长时程连贯性与叙事结构:如何生成并评估分钟级以上、情节自洽的内容。
  • 组合式对齐:主体、动作、场景三者与文本指令的一致性仍不可靠。
  • 物理与因果可信度检验:需要能证伪的物理测试而非人眼评分。
  • 多视角一致性:3D/4D 生成中不同视角之间的几何冲突。
  • 质量与推理速度的取舍:这直接决定生成模型能否实时充当交互式环境。
  • 相机控制精度跨基准验证的可靠性

为什么值得读

它是「视频生成作为世界模拟器」这条线上少数进入 IEEE TPAMI 的系统综述,作者来自港科大(广州)、港科大 MMLab、港中文与清华,通讯作者为熊辉(Hui Xiong)。相较于以「世界模型」为名的综述,本文更硬核地处理生成侧的表征与算法细节,同时用维度阶梯给出了一个非常好用的判断标准:要问一个生成模型离世界模拟器还有多远,就看它补齐了哪几个维度。对做机器人仿真、数据生成、4D 场景重建的人,这篇的数据集与评测附录本身就是工具书。它与以「世界模型」为名的综述形成互补:后者关心智能体如何用模型做决策,本文关心模型本身能把世界刻画到什么程度,两者合起来才是完整的世界模拟图景。

原文链接

← 返回世界模型