World Models · 世界模型 创业公司

Google DeepMind Genie

Google DeepMind · Jack Parker-Holder(项目负责人/Research Scientist,Open-Endedness Team)、Stephen Spencer(技术负责人)、Shlomi Fruchte

世界模型(World Models)

产品线7

开放式学习前身研究

  1. 2021

    XLand

    70 万种游戏、4000 个 3D 世界的开放式训练环境

Genie 世界模型

  1. 2024

    Genie 1

    110 亿参数生成式交互环境,ICML 2024 最佳论文

  2. 2024

    Genie 2

    单张图片生成可玩 3D 世界,一致性约 1 分钟

  3. 2025

    Genie 3

    实时交互 720p/24fps,新增可提示世界事件

SIMA 通用具身智能体

  1. 2024

    SIMA

    跨 9 款商业游戏执行自然语言指令,约 600 项技能

  2. 2025

    SIMA 2

    Gemini 驱动,可在 Genie 3 生成世界中自我提升

消费产品

  1. 2026

    Project Genie

    面向 AI Ultra 订阅用户的交互世界生成原型

项目与产品时间线 8 个节点

  1. 2021
    1. 07 研究

      XLand开放式学习通用智能体

      约70万种游戏、4000个3D世界中训练,末代智能体经历2000亿训练步。

  2. 2022
    1. 11 研究

      电子游戏世界交互式智能体研究

      探索以自然语言指令与图像观察驱动智能体行动,为SIMA奠基。

  3. 2024
    1. 02 研究

      Genie 1 生成式交互环境发布

      110亿参数,用20万小时无标签2D游戏视频无监督训练,获ICML 2024最佳论文。

    2. 03 研究

      SIMA 通用3D虚拟环境智能体发布

      在9款商业游戏中训练,仅靠屏幕画面与语言指令完成约600项基础技能。

    3. 12 研究

      Genie 2 大规模基础世界模型发布

      可从单张图片生成可玩3D世界,一致性保持约1分钟,具反事实推演与长时记忆。

  4. 2025
    1. 08-05 研究

      Genie 3 发布

      首个支持实时交互的通用世界模型,720p/24fps,一致性达数分钟,支持可提示世界事件。

    2. 11-13 研究

      SIMA 2 发布

      以Gemini为核心,可推理对话与自我提升,并在Genie 3生成的世界中验证自我提升循环。

  5. 2026
    1. 01-29 产品

      Project Genie面向消费者推出

      向美国Google AI Ultra订阅用户开放,单次最长60秒、720p、24fps。

方向: 世界模型(World Models) 核心人物: Jack Parker-Holder(项目负责人/Research Scientist,Open-Endedness Team)、Stephen Spencer(技术负责人)、Shlomi Fruchter(Genie 3 联合负责人)、Tim Rocktäschel(DeepMind Open-Endedness Team 负责人,UCL 教授,统筹指导)、Jake Bruce(Genie 1 论文一作) 机构: Google DeepMind 简介: Genie 系列是 Google DeepMind Open-Endedness 团队自 2024 年起打造的"基础世界模型"(foundation world model)路线,从仅能生成 2D 可玩世界的 Genie 1,发展到能从单张图片生成可玩 3D 世界的 Genie 2,再到 2025 年支持实时交互、被称为"通往 AGI 的垫脚石"的 Genie 3,并于 2026 年初以 Project Genie 形式向消费者开放。同源的 SIMA / SIMA 2 项目则代表了"能在任意 3D 虚拟世界中执行指令的通用具身智能体"技术路线,两条线在 Genie 3 阶段已实现联动(SIMA 2 在 Genie 3 生成的世界中进行训练和评测)。

关键成就

  • Genie 1 论文获 ICML 2024 Best Paper Award:《Genie: Generative Interactive Environments》(arXiv:2402.15391)在 ICML 2024 全部投稿中被评为最佳论文(Best Paper),是 Genie 系列迄今唯一正式发表并获顶会最高奖项的工作(Genie 2、Genie 3 均以博客形式发布,未提交学术会议)。来源:ICML 2024 官方论文页
  • Genie 1 论文引用量持续快速增长:据 Semantic Scholar 数据(查询于 2026 年 7 月),该论文发表两年半以来已被引用 696 次,在世界模型/生成式交互环境这一细分方向中属于引用增速较快的奠基性工作。来源:Semantic Scholar 论文记录
  • Genie 3 入选 TIME《2025 年度最佳发明》(Best Inventions of 2025)榜单:TIME 评价其"仅凭文本提示即可生成河流、船只或海洋生物等元素,且结果即时、震撼、可导航长达数分钟"。来源:TIME: Google DeepMind Genie 3
  • Genie 3 发布引发全球科技媒体密集报道:TechCrunch、Yahoo Finance 等主流科技媒体在发布当天即以"DeepMind 认为 Genie 3 世界模型是通往 AGI 的垫脚石"为核心叙事进行报道,DeepMind 官方也将其定位为"通往 AGI 的关键垫脚石",引发业界对世界模型是否将成为下一代智能体训练基础设施的广泛讨论。来源:TechCrunch 报道
  • 技术指标历代跃升:Genie 1(2024-02)仅支持 2D 平台游戏世界、以逐帧动作生成、无公开一致性时长指标;Genie 2(2024-12)跃升至可从单张图片生成的 3D 世界,一致性可保持约 1 分钟;Genie 3(2025-08)进一步实现实时交互,分辨率 720p、帧率约 24fps,世界一致性可保持数分钟,且新增"可提示世界事件"能力。三代模型在维度(2D→3D)、交互实时性、一致性时长上均有明确跨越(数据来源见下方时间线各条目及 DeepMind 官方博客)。
  • Project Genie 用户规模暂未公开:截至 2026 年 7 月,Google 尚未披露 Project Genie 的注册用户数、使用量或等待名单规模等具体数据;已知信息仅为其面向美国地区、18 岁以上、每月 250 美元的 Google AI Ultra 订阅用户开放(未来将扩展至更多地区)。此处不做估测,待官方披露后补充。

时间线(2021-2026)

2021-07 — Generally capable agents emerge from open-ended play(XLand,SIMA 前身研究)

  • DeepMind 发布 XLand 环境与配套论文《Open-Ended Learning Leads to Generally Capable Agents》,在包含约 70 万种独特游戏、4000 个独特 3D 世界的开放式环境中训练智能体,最终一代智能体经历 2000 亿训练步、340 万个独特任务,展现出无需人类示范即可涌现的通用能力。
  • 该工作被视为 SIMA 系列"多世界通用智能体"路线的重要技术铺垫。
  • 链接: Generally capable agents emerge from open-ended play
  • 图片: DeepMind 官方博客 XLand 环境配图(多智能体 3D 世界俯瞰)

2022-11 — Building interactive agents in video game worlds(SIMA 前身研究)

  • DeepMind 发布关于在电子游戏世界中构建交互式智能体的研究博客,探索让智能体通过自然语言指令与图像观察在游戏环境中行动的方法,为后续 SIMA 项目奠定基础。
  • 相关技术论文为 Abramson et al. 的《Evaluating Multimodal Interactive Agents》(arXiv:2205.13274)。
  • 链接: Building interactive agents in video game worlds
  • 图片: DeepMind 官方博客配图:虚拟"playhouse"环境三联图,展示数百种可识别物体的随机化布局

2024-02 — Genie(Genie 1):Generative Interactive Environments

  • Google DeepMind 发布 Genie(后被回溯性称为 "Genie 1"),是首个仅通过无标签互联网视频以无监督方式训练出的"生成式交互环境"模型。模型参数量达 110 亿,由时空视频分词器(spatiotemporal video tokenizer)、自回归动力学模型(dynamics model)与可扩展的潜在动作模型(latent action model)组成。
  • 训练数据来自超过 20 万小时的公开 2D 平台游戏视频,筛选后得到约 3 万小时(680 万段 16 秒片段)。用户可通过文本、合成图像、照片甚至手绘草图生成一张种子图,再逐帧输入键盘动作来"玩"这个生成的 2D 世界,尽管训练时没有使用任何真实动作标签。
  • 论文作者包括 Jake Bruce(一作)、Michael Dennis、Jack Parker-Holder、Jeff Clune、Satinder Singh、Tim Rocktäschel 等。
  • 链接: arXiv:2402.15391 — Genie: Generative Interactive Environments
  • 链接: Google DeepMind Publications 页面
  • 图片: DeepMind Publications 页面配图:Genie 从静态图片生成可玩 2D 世界示意

2024-03 — SIMA:A generalist AI agent for 3D virtual environments

  • Google DeepMind 发布 SIMA(Scalable Instructable Multiworld Agent),一款可在多种 3D 电子游戏环境中理解并执行自然语言指令的通用智能体。团队与 8 家游戏工作室合作,在《No Man's Sky》《Valheim》《Teardown》《Goat Simulator 3》等 9 款商业游戏及自建的 Construction Lab 等研究环境中训练和评测 SIMA。
  • SIMA 只依赖屏幕画面与自然语言指令两种输入,通过虚拟键鼠输出动作,无需访问游戏源码或专用 API;在约 600 项基础技能(导航、物体交互、菜单操作)评测中,跨游戏联合训练的智能体显著优于单一游戏专精智能体,展现出良好的跨环境泛化能力。
  • 技术报告作者包含 Maria Abi Raad、Frederic Besse、Jeff Clune 等数十位研究者。
  • 链接: A generalist AI agent for 3D virtual environments
  • 链接: arXiv:2404.10179 — SIMA 技术报告
  • 图片: SIMA 训练所用的四款游戏画面拼图(Valheim、Teardown、No Man's Sky、Wobbly Life)

2024-12 — Genie 2:A large-scale foundation world model

  • Google DeepMind 于 2024 年 12 月 4 日发布 Genie 2,实现从单张图片生成可玩 3D 世界的能力,标志着从 Genie 1 的 2D 世界向大规模 3D 基础世界模型的重大跃迁。图片可由 Imagen 3 文生图模型生成,用户或智能体随后可用键鼠动作在其中探索最长约 1 分钟保持一致性的世界。
  • 模型展现出多项涌现能力:反事实推演(同一起始帧下因不同动作产生不同轨迹)、长时记忆(画面移出视野后再次出现仍保持一致)、水/烟雾等物理效果建模、复杂角色动画与 NPC 交互建模等。发布时作为面向研究者与创作者的有限研究预览(Research Preview),未向公众全面开放。
  • 作者团队由 Jack Parker-Holder、Stephen Spencer 领衔,并列出 Tim Rocktäschel、Demis Hassabis、Raia Hadsell 等作为共同作者/指导。
  • 链接: Genie 2: A large-scale foundation world model
  • 图片: Genie 2 缩放演示画面
  • 视频: Genie 2 演示视频(genie2_zoom_v6.mp4)

2025-08-05 — Genie 3:A new frontier for world models

  • Google DeepMind 于 2025 年 8 月 5 日发布 Genie 3,被称为首个支持"实时交互"的通用世界模型:仅凭文本提示即可生成可实时导航的动态世界,帧率约 24fps、分辨率 720p,世界一致性可保持数分钟(相比 Genie 2 的约 1 分钟有大幅提升)。DeepMind 将其视为通往 AGI 的重要垫脚石。
  • 新增"可提示世界事件"(promptable world events)能力,允许用户通过文本改变天气、加入新物体/角色等,扩展了智能体训练所需的反事实场景;团队还将 SIMA 智能体接入 Genie 3 生成的世界中进行目标导向导航测试,验证其作为具身智能体训练环境的可行性。已知局限包括:智能体可执行的动作空间有限、多智能体交互建模仍是难题、无法精确复现真实地理位置、清晰文字渲染能力有限、连续交互时长仅几分钟。
  • 作者/负责人为 Jack Parker-Holder 与 Shlomi Fruchter。发布时同样以受信任测试者(trusted testers)的有限预览形式提供,未直接面向公众。
  • 链接: Genie 3: A new frontier for world models
  • 链接: TechCrunch 报道:DeepMind thinks Genie 3 world model presents a stepping stone toward AGI
  • 图片: Genie 3 生成的九种多样化虚拟环境拼图,中央叠加方向键图标
  • 视频: Genie 3 官方发布视频(YouTube)

2025-11-13 — SIMA 2:A Gemini-Powered AI Agent for 3D Virtual Worlds

  • Google DeepMind 发布 SIMA 2,将 Gemini 模型嵌入智能体核心,使其从"指令跟随者"进化为可推理、可对话、可自我提升的"游戏伙伴"。SIMA 2 能理解语音指令、屏幕手绘草图、多语言文本乃至表情符号(emoji)形式的多模态指令,并在未训练过的游戏(如 ASKA、MineDojo/Minecraft 研究环境)中显著缩小与人类水平的差距。
  • 最具突破性的能力是"自我提升"(self-improvement):SIMA 2 可先通过人类示范学习,再完全依靠自我探索和 Gemini 生成的奖励反馈在新环境中持续进化,且团队已在 Genie 3 生成的全新世界中验证了这种自我提升循环——这是"世界模型 + 具身智能体"两条技术路线首次实质性融合。
  • 该研究由 SIMA 团队完成,Satinder Singh Baveja、Adrian Bolton、Raia Hadsell、Demis Hassabis、Shane Legg、Volodymyr Mnih、Daan Wierstra 等提供指导;随附技术报告于 2025 年 12 月 5 日更新发布。发布形式为面向学术界与游戏开发者小范围开放的有限研究预览。
  • 链接: SIMA 2: A Gemini-Powered AI Agent for 3D Virtual Worlds
  • 链接: arXiv:2512.04797 — SIMA 2: A Generalist Embodied Agent for Virtual Worlds
  • 链接: SIMA 2 技术报告 PDF
  • 图片: SIMA 2 在 3D 虚拟环境中行动的四联图
  • 视频: SIMA 2 官方发布视频(YouTube)

2026-01-29 — Project Genie:面向消费者的交互世界生成原型

← 返回世界模型