Skip to content

Blog

WM论文日志

About 26 min read

An English translation is not available yet. The latest Simplified Chinese source is shown without triggering paid translation.

1.使用说明

本文用于长期记录 World Model(WM,世界模型)在机器人导航、路径规划、具身智能方向的论文阅读、复现、实验与创新点分析

当前重点不是先“凑创新点”,而是建立 CV / 3D Vision → World Model → Simulator → Planner / Policy → Robot 的论文谱系,优先关注正式顶会和高水平期刊工作,并从中选择代码完整、算力可承受、能够做闭环实验的 baseline。

当前重点方向:Navigation World Model、Latent World Model、3D Structured World Model、World Model + Planning、World Model + Policy、Model-Based RL、动态障碍预测、实时化、Sim2Real、ROS2 / Nav2 实机部署。


2.先统一几个概念

Sensor / Observation
传感器 / 当前观测

Perception / Representation
感知 / 世界表示

World Model
世界模型

Future Prediction
未来预测

Planner / Policy
规划器 / 策略

Controller
控制器

Robot Command
机器人执行命令
  • Computer Vision(CV,计算机视觉):现在世界是什么样?
  • World Model(WM,世界模型):如果执行动作 A,未来世界会怎样?
  • Planner(规划器) / Policy(策略):应该选择什么动作?
  • Controller(控制器):把动作真正变成速度、关节或力矩指令。

因此 World Model 的输出不一定是 RGB,也通常不等于 cmd_vel。它可以输出 Future RGB、Future Latent、Future Occupancy、Future 3DGS、Future Physical State、Reward / Risk / Value 等。


3.Renderer / Simulator / Planner 框架

3.1.Renderer(渲染器)

回答:未来世界“看起来”是什么样?

常见输出:RGB、Video、Novel View、Depth、3D rendering。

3.2.Simulator(模拟器)

回答:世界在动作作用下实际上会怎样变化?

常见输出:Future State、Future Latent、Future Geometry、Future Occupancy、Future 3DGS、Object Pose、Reward / Risk。

3.3.Planner(规划器)

回答:为了达到目标应该做什么?

常见输出:Action、Action Sequence、Trajectory、Velocity Command。

常见方法:CEM(Cross-Entropy Method,交叉熵方法)、MPC(Model Predictive Control,模型预测控制)、MPPI(Model Predictive Path Integral,模型预测路径积分)、Learned Policy(学习策略)、Actor-Critic(演员-评论家)。


4.核心论文目录

论文 Venue / 状态 核心路线 与移动导航关系 当前定位 优先级
X-MOBILITY ICRA 2025 Latent WM + Policy 直接相关 第一主 baseline 候选 ⭐⭐⭐⭐⭐
Navigation World Models(NWM) CVPR 2025 Oral / Best Paper HM Diffusion Video WM + Planning 直接相关 Navigation WM 标志性工作 ⭐⭐⭐⭐⭐
DINO-WM ICML 2025 Pretrained Visual Latent WM + Planning 高度相关 Latent WM + Planning 核心参考 ⭐⭐⭐⭐⭐
World4Drive ICCV 2025 Physical Latent WM + Trajectory Selection 自动驾驶,方法高度相关 WM → Planning 桥梁重点参考 ⭐⭐⭐⭐⭐
WMNav IROS 2025 VLM + WM Memory + Navigation Policy 直接相关 Object Goal Navigation ⭐⭐⭐⭐
Drive-WM CVPR 2024 Multiview Video WM + Reward Planning 自动驾驶,方法高度相关 Visual WM → Planning 经典工作 ⭐⭐⭐⭐
GWM ICCV 2025 3D Gaussian WM 当前偏 Manipulation 3D / Geometry-aware WM ⭐⭐⭐⭐
DreMa ICLR 2025 Gaussian Digital Twin + Physics 当前偏 Manipulation Compositional WM / Imagination ⭐⭐⭐⭐
MoSim CVPR 2025 Physical-State WM + Model-Based RL 间接相关 非视觉 Dynamics WM ⭐⭐⭐⭐
MaskGWM CVPR 2025 Diffusion Video WM + Mask Reconstruction 自动驾驶,偏 CV 长时视频预测 / 泛化 ⭐⭐⭐
V-JEPA 2 / 2-AC 2025 Research Release / arXiv Foundation Video WM + Action Conditioning 当前偏 Manipulation Foundation Latent WM ⭐⭐⭐⭐
One-Step WM 2026 arXiv One-Step Video WM + Planning 直接相关 Navigation WM 实时化 ⭐⭐⭐⭐⭐
AR Forcing 2026 arXiv Autoregressive Training for Navigation WM 直接相关 Long-horizon stability ⭐⭐⭐⭐
NavWAM 2026 arXiv World Model + Action Model 直接相关 WM → WAM 新路线 ⭐⭐⭐⭐
DreamerNav Frontiers in Robotics and AI 2025 DreamerV3 + MBRL 直接相关 低成本系统参考,不作为高水平主 baseline 首选 ⭐⭐⭐
Atlas World Labs 2026 Research Release Generation + Reconstruction + Simulation Spatial Intelligence Foundation Spatial WM ⭐⭐⭐⭐

5.论文方向占比:每篇到底偏哪里

下表是为了帮助快速建立直觉的研究重心估计,不是作者官方给出的数字。三个百分比相加为 100%。

论文 CV / 3D Vision World Modeling / Simulator Planning / Policy / Robotics 一句话定位
Atlas 55% 40% 5% Foundation Spatial WM,核心是生成、重建、空间模拟
MaskGWM 65% 30% 5% 最偏 CV,重点是驾驶视频生成、长时预测和泛化
GWM 50% 45% 5% 3D Gaussian 世界表示 + dynamics
DreMa 35% 45% 20% 3DGS Digital Twin + Physics + Robot Learning
Drive-WM 45% 35% 20% 多视角未来视频 + image reward planning
NWM 40% 40% 20% Navigation Video WM + CEM planning
One-Step WM 35% 40% 25% 更快的 future imagination + optimization planning
AR Forcing 30% 55% 15% 解决 Navigation WM long-horizon rollout 漂移
DINO-WM 30% 40% 30% 不生成 RGB,在 pretrained latent space 中预测并规划
V-JEPA 2-AC 35% 40% 25% Foundation representation + action-conditioned prediction
World4Drive 25% 35% 40% Latent WM 直接生成/评价候选轨迹
WMNav 20% 30% 50% WM memory 服务 Object Goal Navigation
X-MOBILITY 20% 35% 45% Latent dynamics 服务 Learned Action Policy
DreamerNav 10% 35% 55% RSSM imagination + Actor-Critic + A*
MoSim 5% 55% 40% Future physical state + Model-Based RL
NavWAM 20% 30% 50% Future + Value + Action Chunk 联合建模

6.Renderer / Simulator / Planner 功能强度

这一表与上面的“方向占比”不同。一个系统可以同时是强 Renderer 和强 Simulator,因此三项不要求相加。

论文 Renderer Simulator Planner / Policy 主要输出
Atlas ★★★★★ ★★★★☆ ★☆☆☆☆ RGB / Depth / Point Cloud / 3DGS
MaskGWM ★★★★★ ★★★☆☆ ★☆☆☆☆ Future driving video
GWM ★★★★☆ ★★★★★ ★★☆☆☆ Future 3D Gaussian Scene
DreMa ★★★★☆ ★★★★★ ★★☆☆☆ Digital Twin imagined state / demonstrations
Drive-WM ★★★★★ ★★★★☆ ★★★☆☆ Future multiview video + trajectory choice
NWM ★★★★★ ★★★★☆ ★★★★☆ Future visual observation + CEM / ranking
One-Step WM ★★★★☆ ★★★★☆ ★★★★☆ One-step future prediction + optimized action
AR Forcing ★★★★☆ ★★★★★ ★★★☆☆ Stable long-horizon rollout
DINO-WM ★☆☆☆☆ ★★★★☆ ★★★★☆ Future pretrained visual latent
V-JEPA 2-AC ★☆☆☆☆ ★★★★☆ ★★★★☆ Future latent state
World4Drive ★★☆☆☆ ★★★★☆ ★★★★★ Future latent + selected trajectory
WMNav ★☆☆☆☆ ★★★☆☆ ★★★★★ WM memory / curiosity map → navigation action
X-MOBILITY ★★☆☆☆ ★★★★☆ ★★★★★ Probabilistic latent → velocity / path policy
DreamerNav ★☆☆☆☆ ★★★★☆ ★★★★★ RSSM imagination → navigation policy
MoSim ☆☆☆☆☆ ★★★★★ ★★★★☆ Future physical state → Model-Based RL
NavWAM ★★★☆☆ ★★★★☆ ★★★★★ Future observation + value + action chunk

7.按 World Model 输出形式分类

输出 代表工作 特点
Future RGB / Video NWM、Drive-WM、MaskGWM、One-Step WM 人可以直接观察预测,但生成成本通常较高
Future Latent State DINO-WM、X-MOBILITY、V-JEPA 2-AC、World4Drive、DreamerNav 不追求画出未来,更适合 task-oriented prediction
Future 3D Gaussian Scene GWM 显式三维几何结构
Digital Twin Future / Imagined Data DreMa 显式场景 + Physics,主要服务数据生成和策略学习
Future Physical State MoSim 直接预测机器人动力学状态,几乎不依赖 CV
Future + Action Chunk NavWAM 世界预测与动作生成开始融合
Unified Spatial Output Atlas RGB、Depth、Point Cloud、3DGS 等统一空间内容

8.当前最值得关注的三条论文谱系

A. Visual Future → Planning
Drive-WM → NWM → One-Step WM / AR Forcing

B. Latent Future → Planning / Policy
DINO-WM → X-MOBILITY → World4Drive / NavWAM

C. Explicit / Physical World → Simulator → Decision
GWM / DreMa / MoSim

当前最值得重点追踪的是 B:Latent Future → Planning / Policy

原因:它正好位于 CV、World Model 与机器人规划之间,不必把主要算力花在 photorealistic RGB generation(照片级 RGB 生成)上,同时能够保留移动机器人 Navigation、Planning 和实机闭环优势。

一个长期值得追的问题是:

对于移动机器人导航,什么样的 Future Representation(未来世界表示)最有利于 Planning?Future RGB、Future Latent、Future Occupancy、Future Geometry、Future Risk,谁真正能改善闭环导航?


9.论文链接总表

论文 Paper / Project Code
X-MOBILITY https://arxiv.org/abs/2410.17491 / https://nvlabs.github.io/X-MOBILITY/ https://github.com/NVlabs/X-MOBILITY
NWM https://arxiv.org/abs/2412.03572 / https://www.amirbar.net/nwm/ https://github.com/facebookresearch/nwm
DINO-WM https://arxiv.org/abs/2411.04983 / https://dino-wm.github.io/ https://github.com/gaoyuezhou/dino_wm
World4Drive https://openaccess.thecvf.com/content/ICCV2025/html/Zheng_World4Drive_End-to-End_Autonomous_Driving_via_Intention-aware_Physical_Latent_World_Model_ICCV_2025_paper.html https://github.com/ucaszyp/World4Drive
WMNav https://ieeexplore.ieee.org/document/11246684/ / https://b0b8k1ng.github.io/WMNav/ 项目页为准
Drive-WM https://openaccess.thecvf.com/content/CVPR2024/html/Wang_Driving_into_the_Future_Multiview_Visual_Forecasting_and_Planning_with_CVPR_2024_paper.html / https://drive-wm.github.io/ https://github.com/BraveGroup/Drive-WM
GWM https://openaccess.thecvf.com/content/ICCV2025/html/Lu_GWM_Towards_Scalable_Gaussian_World_Models_for_Robotic_Manipulation_ICCV_2025_paper.html / https://gaussian-world-model.github.io/ https://github.com/Gaussian-World-Model/gaussianwm
DreMa https://arxiv.org/abs/2412.14957 / https://dreamtomanipulate.github.io/ https://github.com/leobarcellona/drema_code
MoSim https://openaccess.thecvf.com/content/CVPR2025/html/Hao_Neural_Motion_Simulator_Pushing_the_Limit_of_World_Models_in_CVPR_2025_paper.html / https://oamics.github.io/mosim_page/ https://github.com/OamIcs/MoSim
MaskGWM https://openaccess.thecvf.com/content/CVPR2025/html/Ni_MaskGWM_A_Generalizable_Driving_World_Model_with_Video_Mask_Reconstruction_CVPR_2025_paper.html 待补充
V-JEPA 2 https://arxiv.org/abs/2506.09985 https://github.com/facebookresearch/vjepa2
One-Step WM https://arxiv.org/abs/2601.12277 / https://robotnav-bot.github.io/nav-onestepwm/ https://github.com/robotnav-bot/NOW
AR Forcing https://arxiv.org/abs/2605.31314 待确认
NavWAM https://arxiv.org/abs/2606.13494 / https://dachii-azm.github.io/navwam/ 待确认
Atlas https://www.worldlabs.ai/blog/atlas 暂无公开训练代码

10.X-MOBILITY — ICRA 2025

10.1.一句话理解

RGB + Robot State

World Model

Probabilistic Latent State

Action Policy

Velocity + Optional Local Path

World Model 与 Action Policy 解耦。核心价值不是生成漂亮未来图,而是让 latent state 通过 world modeling 学到对导航有用的环境和动态信息。

原论文使用 Isaac Sim Nova Carter 数据,包含 Random Action Dataset 和 Nav2 Teacher Dataset,并提供 checkpoint、dataset、ONNX / TensorRT / ROS2 部署链。

当前定位:第一主 baseline 候选。

值得研究的问题:动态障碍、RGB-only geometry grounding、Navigation-oriented representation、轻量化、uncertainty-aware dynamics。


11.1.一句话理解

Observation + Navigation Action

Conditional Diffusion Transformer

Future Visual Observation

CEM / Trajectory Ranking

Navigation

NWM 是 Visual World Model → Planning 的代表。它说明视频生成型 WM 并不只是 CV:模型可以对不同候选 action 想象不同未来,再由 CEM 选择更好的动作。

主要问题:推理成本、long-horizon drift、OOD mode collapse、pedestrian temporal dynamics。

当前定位:必须精读,但大模型从零训练成本过高,不优先作为第一篇完整重训 baseline。


12.DINO-WM — ICML 2025

12.1.一句话理解

Image

DINOv2 Features

World Model

Future Visual Latent

CEM / Gradient Planning

核心问题:World Model 为什么一定要重建未来 RGB?

DINO-WM 直接在 pretrained visual feature space(预训练视觉特征空间)预测未来,减少无关 pixel reconstruction,并让 world representation 更 task-oriented。

当前定位:Latent World Model + Planning 必读;非常适合启发 Navigation-Oriented World Model。


13.World4Drive — ICCV 2025

13.1.一句话理解

Camera / Scene Features

Vision Foundation Model

Physical Latent World Model

Generate Candidate Trajectories

Predict Intention-aware Future Latents

World Model Selector

Best Trajectory

这篇最值得学习的是:World Model 直接参与 Trajectory Generation / Evaluation / Selection(轨迹生成 / 评价 / 选择)

虽然任务是自动驾驶,但方法思想非常容易迁移到移动机器人:

MPPI / Policy
产生候选轨迹

World Model
预测每条轨迹对应的 Future State / Risk

Trajectory Selection

当前定位:WM → Planning 桥梁重点参考。


14.WMNav — IROS 2025

14.1.一句话理解

WMNav 将 Vision-Language Model(视觉语言模型)、World Model Memory(世界模型记忆)与 Object Goal Navigation(目标物体导航)结合。

它维护 Curiosity Value Map(好奇价值地图),并根据 world-model plan 与真实 observation 的反馈差异减轻 hallucination(幻觉)对导航决策的影响。

当前定位:明显偏 Planner / Navigation。它说明 WM 不一定是视频生成器,也可以是导航系统中的 memory / reasoning component。


15.Drive-WM — CVPR 2024

Current Multiview Images
+ Different Driving Maneuvers

Drive-WM

Multiple Future Videos

Image-based Reward

Choose Safer Trajectory

它是理解 Renderer / Simulator → Planner 链路的经典工作:先想象多个驾驶动作对应的未来视觉,再根据 reward 选择更安全的轨迹。

当前定位:CV / Video WM 较重,但与 Planning 的连接非常明确。


16.GWM — ICCV 2025

GWM 把 World Representation 改成显式 3D Gaussian(3D 高斯)

RGB Image(s)

3D Gaussian Scene

3D VAE

Gaussian Latent + Action

Latent Diffusion Transformer

Future 3D Gaussian Scene

核心不是“换一种传感器输入”,而是让世界表示具有显式三维几何结构。

当前定位:3D Vision + Simulator,适合学习 Geometry-aware World Model,不是移动导航主 baseline 首选。


17.DreMa — ICLR 2025

DreMa 使用 Gaussian Splatting + Physics Simulator 构建 Learnable Digital Twin(可学习数字孪生):

Few Real Demonstrations

Learnable Digital Twin

Imagination

Synthetic Demonstrations

Imitation Learning

Robot Policy

当前定位:Simulator + Robot Learning。核心价值是理解 WM 不只用于在线规划,也可以用于 imagination / data generation。


18.MoSim — CVPR 2025

MoSim 非常适合纠正“WM = 未来视频生成”的误解:

Current Physical State
+ Action

MoSim

Future Physical State

Model-Based RL / Zero-shot RL

Physical State 包含关节位置、速度、空间位置与速度等。

当前定位:Simulator / Dynamics / Model-Based RL,几乎不依赖 CV。


19.MaskGWM — CVPR 2025

MaskGWM 使用 Diffusion Transformer + Video Mask Reconstruction,重点解决 Driving World Model 的 Long-Horizon Prediction(长时预测)、Generalization(泛化)和 Multi-view Generation(多视角生成)。

当前定位:明显偏 CV / Generative World Model。论文很强,但与当前移动机器人 Planning 主线距离比 World4Drive、DINO-WM、X-MOBILITY 更远。


20.One-Step WM / AR Forcing / NavWAM:2026 新路线

20.1.One-Step World Model

重点解决多步 Diffusion + Autoregressive Generation 的高延迟问题,用 One-Step Generation 提升 Navigation WM 实时性,再接 optimization-based planning。

20.2.AR Forcing

重点解决训练时使用 Ground Truth Context、推理时使用 Model-generated Context 导致的 Train-Test Distribution Shift 和 Long-Horizon Error Accumulation。

Observation + Goal

World Action Model

Future Observation
+ Goal Progress
+ Action Chunk

它把“预测未来”和“决定动作”联合起来,体现 WM → WAM(World Action Model,世界动作模型) 的趋势。


21.当前 Baseline 选择判断

21.1.第一梯队:真正考虑拿来改

  1. X-MOBILITY — ICRA 2025:最贴移动机器人、ROS2、Sim2Real、Policy。
  2. DINO-WM — ICML 2025:最适合研究“Future Latent 是否比 Future RGB 更适合 Planning”。
  3. NWM — CVPR 2025:Navigation WM 标志性工作,但完整训练成本高。
  4. World4Drive — ICCV 2025:如果研究重点逐渐偏“WM 如何评价/选择轨迹”,价值很高。

WMNav、Drive-WM、GWM、DreMa、MoSim、One-Step WM、AR Forcing、NavWAM。

21.3.不建议当前作为主 baseline

  • MaskGWM:太容易滑向纯视频生成;
  • Atlas:没有公开完整训练链,规模也不适合作为硕士第一篇 baseline;
  • DreamerNav:工程和学习价值高,但如果目标明确要求高水平 venue,不再优先作为主 baseline。

22.一个值得长期追的 Research Question

Navigation World Model 真的有必要预测 photorealistic Future RGB 吗?

可以逐渐形成这样的实验谱系:

Future RGB
vs
Future Latent
vs
Future Occupancy / BEV
vs
Future Geometry / 3DGS
vs
Future Risk

同一个 Planning / Policy Framework

比较:
Success Rate
Collision Rate
Generalization
Latency
VRAM
Real-Robot Performance

这比单纯“给某个模型加一个模块”更接近一个可以持续做下去的研究问题。


23.统一论文阅读模板

以后每篇新论文优先回答以下问题。

23.1.基本信息

  • Title:
  • Venue / Year:
  • Organization:
  • Paper / Project / GitHub:
  • 是否正式发表:
  • 是否有 Code / Checkpoint / Dataset:

23.2.Observation / Input(观测 / 输入)

模型看什么:RGB、Depth、LiDAR、Robot State、Camera Pose、Language Goal?

23.3.World Representation(世界表示)

模型脑子里怎么表示世界:Pixel / Video Latent、DINO Feature、RSSM Latent、BEV、Occupancy、3D Gaussian、Physical State、Digital Twin?

23.4.World Model Output(世界模型输出)

Future RGB、Future Latent、Future Occupancy、Future 3DGS、Future Physical State、Reward / Risk / Value、Action Chunk?

23.5.Renderer / Simulator / Planner 定位

Renderer:
Simulator:
Planner / Policy:

23.6.CV ↔ Robotics 方向占比

CV / 3D Vision:
World Modeling / Simulator:
Planning / Policy / Robotics:

23.7.Planner / Policy

CEM、MPC、MPPI、Gradient Planning、Learned Policy、Actor-Critic,还是 World Action Model?

23.8.Robot Output

移动机器人:vx / vy / wz、trajectory、local path?

机械臂:joint position、joint velocity、end-effector pose、action chunk?

23.9.Training / Compute

记录 GPU、数量、显存、训练时间、Epoch / Steps、Precision、Multi-GPU Strategy。

23.10.Evaluation

记录 Baselines、Main Results、Ablation、Efficiency、Generalization、Failure Cases、Real Robot、Sim2Real。

23.11.是否适合当我的 baseline

代码完整度:
Checkpoint:
Dataset:
算力可承受:
移动机器人相关性:
实机难度:
创新空间:

24.当前阶段 Checklist

  • 精读 X-MOBILITY
  • 精读 NWM
  • 精读 DINO-WM
  • 精读 World4Drive
  • 阅读 WMNav
  • 阅读 Drive-WM
  • 精读 GWM
  • 阅读 DreMa
  • 阅读 MoSim
  • 阅读 MaskGWM
  • 阅读 One-Step WM
  • 阅读 AR Forcing
  • 阅读 NavWAM
  • 理解 Renderer / Simulator / Planner
  • 理解 RGB / Latent / Occupancy / 3DGS / Physical State 等不同 WM 输出
  • 跑通至少一个正式顶会 baseline 的 official checkpoint
  • 建立 Failure Case Dataset
  • 从稳定 failure 提出 Research Question
  • 做最小修改验证 hypothesis
  • 再进入正式创新点设计