World Models

世界模型

空间智能与视频生成仿真——为物理智能提供可交互、可预测的世界模型。

10 份档案 · 2 个方向
类型
方向

10 / 10 份 · 全部

综述论文

4
综述论文 2024–2025 · 3 节点

Understanding World or Predicting Future? A Comprehensive Survey of World Models

理解世界还是预测未来?世界模型全面综述

Jingtao Ding、Chen Gao、Fengli Xu、Yong Li 等 · 清华大学电子工程系 FIB Lab · ACM Computing Surveys (CSUR) · 2025

清华 FIB Lab 发表于 ACM Computing Surveys 的世界模型总纲综述,把纷杂用法收敛为两条主线:一是作为外部世界的隐式表征服务于决策(模型基强化学习、语言模型骨干);二是作为物理世界未来的预测器服务于模拟(视频生成式世界模型、可交互具身环境)。全文串起 Ha & Schmidhuber、Dreamer、TD-MPC2 到 Sora、Genie、Cosmos 的脉络,给出游戏、具身、城市、社会四大应用域与六类开放问题。

查看详情 doi.org
综述论文 2025–2026 · 2 节点

Simulating the Real World: A Unified Survey of Multimodal Generative Models

模拟真实世界——多模态生成模型统一综述

Yuqi Hu 等(通讯 Hui Xiong) · 香港科技大学(广州)/ 港科大 MMLab / 香港中文大学 / 清华大学 · IEEE TPAMI · 2026

IEEE TPAMI 综述,把「世界模拟器」按数据维度拆解:2D 生成负责外观,视频加入动态,3D 加入几何,4D 三者合一。它反对把图像、视频、3D、4D 视为独立领域,主张沿维度递进理解生成模型如何逼近真实世界,并整理各级算法、数据集与评测(FVD、VBench、T3Bench),指出长时程一致性、物理与因果合理性、多视角一致性等缺口。

查看详情 doi.org
综述论文 2022–2026 · 5 节点

A Path Towards Autonomous Machine Intelligence

通往自主机器智能之路

Yann LeCun(2018 图灵奖得主) · NYU Courant 研究所 / Meta FAIR · OpenReview 立场论文 v0.9.2 · 2022

LeCun 的世界模型纲领。提出全可微的模块化认知架构与 Mode-1/Mode-2 双回路,核心是 JEPA 与 H-JEPA:在抽象表征空间而非像素空间预测的非生成式世界模型。它是 I-JEPA、V-JEPA 系列的源头,也论证了「只靠 scaling」与「reward is enough」为何不够。

查看详情 openreview.net
综述论文 2024–2025 · 4 节点

General Agents Need World Models

通用智能体必须拥有世界模型

Jonathan Richens(通讯) · Google DeepMind · ICML 2025(PMLR v267) · 2025

Google DeepMind 的形式化结论:任何能在多步复合目标上满足 regret 界的智能体,策略中必然编码了环境转移模型,并可被无监督算法抽取,误差随 regret 下降、目标深度增加而收敛;只追求单步目标的 myopic 智能体则不需要。通往通用智能体没有 model-free 捷径。

查看详情 proceedings.mlr.press

世界模型

6
DeepMind 官方博客 XLand 环境配图(多智能体 3D 世界俯瞰) 世界模型 8 图 2021–2026 · 8 节点

Google DeepMind Genie

Google DeepMind · Jack Parker-Holder(项目负责人/Research Scientist,Open-Endedness Team)、Stephen Spencer(技术负责人)、Shlomi Fruchte

Genie 系列是 Google DeepMind Open-Endedness 团队自 2024 年起打造的"基础世界模型"(foundation world model)路线,从仅能生成 2D 可玩世界的 Genie 1,发展到能从单张图片生成可玩 3D 世界的 Genie 2,再到 2025 年支持实时交互、被称为"通往 AGI 的垫脚石"的 Genie 3,并于 2026 年初以 Project Genie 形式向消费者开放。同源的 SIMA / SIMA 2 项目则代表了"能在任意 3D 虚拟世界中执行指令的通用具身智能体"技术路线,两条线在 Genie 3 阶段已实现联动(SIMA 2 在 Genie 3 生成的世界中进行训练和评测)。

查看详情
NVIDIA Cosmos发布配图 世界模型 8 图 2025–2026 · 10 节点

NVIDIA Cosmos

NVIDIA(NVIDIA Research / Deep Imagination Research Group / Spatial Intelligence Lab) · Jensen Huang(黄仁勋,创始人兼CEO,历次发布会主讲人

NVIDIA Cosmos 是面向"物理AI"(Physical AI)——即机器人与自动驾驶汽车——的世界基础模型平台,整合了生成式世界模型、视觉分词器(Tokenizer)、护栏(Guardrails)与加速视频处理流水线。黄仁勋在2025年1月CES上称其为机器人领域的"ChatGPT时刻",此后平台以开放模型许可(Apache 2 / NVIDIA Open Model License / OpenMDW-1.1)持续快速迭代,衍生出 Cosmos Predict(世界生成/预测)、Cosmos Transfer(可控合成数据生成)、Cosmos Reason(时空推理)三大产品线,并于2026年推出统一多模态架构的 Cosmos 3。

查看详情
Generating Worlds封面 世界模型 11 图 2024–2026 · 12 节点

World Labs

World Labs(2024年4月成立,总部旧金山) · 李飞飞(Fei-Fei Li,创始人兼CEO)、Justin Johnson(联合创始人,前密歇根大学教授/Meta FAIR)、Ben Mildenhall(联合创始人,NeRF

World Labs由"AI教母"李飞飞于2024年联合三位计算机视觉/图形学领域顶尖研究者创立,主张"空间智能"(spatial intelligence)是继语言智能之后AI的下一前沿。公司致力于打造能够感知、生成、推理并与三维世界交互的"世界模型"(world model),核心产品Marble可将文本、图像、视频等多模态输入转化为可探索、可编辑、可导出的持久化3D世界。成立不到两年,World Labs已完成两轮重量级融资(总额约12.3亿美元),估值从10亿美元跃升至约50亿美元,投资方涵盖a16z、NEA、NVIDIA、AMD、Autodesk等。

查看详情
V-JEPA架构图:上下文编码器/目标编码器与预测器在表征空间中预测被遮盖的时空区域(来自官方GitHub README) 世界模型 4 图 2022–2026 · 9 节点

Yann LeCun / JEPA / AMI Labs

原Meta FAIR(Fundamental AI Research)→ AMI Labs(Advanced Machine Intelligence Labs,总部巴黎,2026年) · Yann LeCun(图灵奖得主)、Alexand

Yann LeCun自2022年提出联合嵌入预测架构(JEPA)以来,在Meta FAIR主导了I-JEPA、V-JEPA、V-JEPA 2一系列"世界模型"研究,主张放弃像素/token级生成式预测,转而在抽象表征空间中学习物理世界的因果结构。2025年11月他因与Meta LLM商业化路线的分歧离职,2026年初携团队在巴黎创立AMI Labs,继续以JEPA为核心技术路线,并于2026年3月完成10.3亿美元种子轮融资(估值35亿美元),成为欧洲历史上最大种子轮之一。

查看详情
封面图 世界模型 5 图 2021–2026 · 15 节点

智谱AI(Zhipu AI)— CogVideoX与世界模型方向

智谱AI / Z.ai(国际品牌,2025年7月启用);主体公司北京智谱华章科技有限公司,2026年更名为"智谱华章科技股份有限公司"(Knowledge Atlas Technology),港交所代码2513.HK · 张鹏(CEO)、唐

智谱AI成立于2019年6月,由清华大学计算机系知识工程实验室(KEG,成立于1996年)技术成果转化而来,是中国最早布局大语言模型的公司之一,被视为"中国版OpenAI",产品矩阵覆盖GLM系列语言模型、CogView图像生成、CogVideoX视频生成及AutoGLM智能体。在视频生成方向,智谱自2022年开源CogVideo起持续迭代至CogVideoX/CogVideoX1.5,商业化产品为"清影"(Ying),技术上强调运动合理性与物理世界模拟能力的提升;不过截至目前,智谱官方并未将CogVideoX正式定位为对标NVIDIA Cosmos、DeepMind Genie的"世界模型"产品,其2026年的公开战略("摸高计划")聚焦长程任务、自主智能体等AGI方向,2026年WAIC具身智能/世界模型专场智谱亦罕见缺席,"潜在演进"更多体现在技术路线(3D因果VAE、时空建模、音画同步CogSound)而非官方话语层面。2026年1月,智谱在港交所上市,成为中国"AI六小龙"中首家完成IPO的大模型公司。

查看详情
Vidu Q3 Reference-to-Video 产品海报 世界模型 3 图 2022–2026 · 15 节点

生数科技

Vidu

北京生数科技股份有限公司(ShengShu Technology) · 朱军(清华大学人工智能研究院副院长、教授,创始人/首席科学家)、唐家渝(联合创始人,现任总裁)、鲍凡(联合创始人)、骆怡航(2025年3月加盟,现任CEO,原字节跳动火

生数科技成立于2023年3月,由清华大学人工智能研究院朱军团队孵化,核心技术源自团队2022年提出的U-ViT(Diffusion+Transformer融合架构)。公司先以视频生成大模型Vidu对标Sora并多次登顶国际榜单,2026年起明确提出"通用世界模型"(General World Model)技术路线,将视频生成技术延伸至具身智能/机器人领域,推出世界行动模型MotuBrain,覆盖"数字世界生成"与"物理世界行动"两端。

查看详情

没有符合当前筛选条件的条目。