跳到正文

博客

WM论文日志

约 26 分钟阅读

1.使用说明

本文用于长期记录 World Model(WM,世界模型)在机器人导航、路径规划、具身智能方向的论文阅读、复现、实验与创新点分析

当前重点不是先“凑创新点”,而是建立 CV / 3D Vision → World Model → Simulator → Planner / Policy → Robot 的论文谱系,优先关注正式顶会和高水平期刊工作,并从中选择代码完整、算力可承受、能够做闭环实验的 baseline。

当前重点方向:Navigation World Model、Latent World Model、3D Structured World Model、World Model + Planning、World Model + Policy、Model-Based RL、动态障碍预测、实时化、Sim2Real、ROS2 / Nav2 实机部署。


2.先统一几个概念

Sensor / Observation
传感器 / 当前观测

Perception / Representation
感知 / 世界表示

World Model
世界模型

Future Prediction
未来预测

Planner / Policy
规划器 / 策略

Controller
控制器

Robot Command
机器人执行命令
  • Computer Vision(CV,计算机视觉):现在世界是什么样?
  • World Model(WM,世界模型):如果执行动作 A,未来世界会怎样?
  • Planner(规划器) / Policy(策略):应该选择什么动作?
  • Controller(控制器):把动作真正变成速度、关节或力矩指令。

因此 World Model 的输出不一定是 RGB,也通常不等于 cmd_vel。它可以输出 Future RGB、Future Latent、Future Occupancy、Future 3DGS、Future Physical State、Reward / Risk / Value 等。


3.Renderer / Simulator / Planner 框架

3.1.Renderer(渲染器)

回答:未来世界“看起来”是什么样?

常见输出:RGB、Video、Novel View、Depth、3D rendering。

3.2.Simulator(模拟器)

回答:世界在动作作用下实际上会怎样变化?

常见输出:Future State、Future Latent、Future Geometry、Future Occupancy、Future 3DGS、Object Pose、Reward / Risk。

3.3.Planner(规划器)

回答:为了达到目标应该做什么?

常见输出:Action、Action Sequence、Trajectory、Velocity Command。

常见方法:CEM(Cross-Entropy Method,交叉熵方法)、MPC(Model Predictive Control,模型预测控制)、MPPI(Model Predictive Path Integral,模型预测路径积分)、Learned Policy(学习策略)、Actor-Critic(演员-评论家)。


4.核心论文目录

论文 Venue / 状态 核心路线 与移动导航关系 当前定位 优先级
X-MOBILITY ICRA 2025 Latent WM + Policy 直接相关 第一主 baseline 候选 ⭐⭐⭐⭐⭐
Navigation World Models(NWM) CVPR 2025 Oral / Best Paper HM Diffusion Video WM + Planning 直接相关 Navigation WM 标志性工作 ⭐⭐⭐⭐⭐
DINO-WM ICML 2025 Pretrained Visual Latent WM + Planning 高度相关 Latent WM + Planning 核心参考 ⭐⭐⭐⭐⭐
World4Drive ICCV 2025 Physical Latent WM + Trajectory Selection 自动驾驶,方法高度相关 WM → Planning 桥梁重点参考 ⭐⭐⭐⭐⭐
WMNav IROS 2025 VLM + WM Memory + Navigation Policy 直接相关 Object Goal Navigation ⭐⭐⭐⭐
Drive-WM CVPR 2024 Multiview Video WM + Reward Planning 自动驾驶,方法高度相关 Visual WM → Planning 经典工作 ⭐⭐⭐⭐
GWM ICCV 2025 3D Gaussian WM 当前偏 Manipulation 3D / Geometry-aware WM ⭐⭐⭐⭐
DreMa ICLR 2025 Gaussian Digital Twin + Physics 当前偏 Manipulation Compositional WM / Imagination ⭐⭐⭐⭐
MoSim CVPR 2025 Physical-State WM + Model-Based RL 间接相关 非视觉 Dynamics WM ⭐⭐⭐⭐
MaskGWM CVPR 2025 Diffusion Video WM + Mask Reconstruction 自动驾驶,偏 CV 长时视频预测 / 泛化 ⭐⭐⭐
V-JEPA 2 / 2-AC 2025 Research Release / arXiv Foundation Video WM + Action Conditioning 当前偏 Manipulation Foundation Latent WM ⭐⭐⭐⭐
One-Step WM 2026 arXiv One-Step Video WM + Planning 直接相关 Navigation WM 实时化 ⭐⭐⭐⭐⭐
AR Forcing 2026 arXiv Autoregressive Training for Navigation WM 直接相关 Long-horizon stability ⭐⭐⭐⭐
NavWAM 2026 arXiv World Model + Action Model 直接相关 WM → WAM 新路线 ⭐⭐⭐⭐
DreamerNav Frontiers in Robotics and AI 2025 DreamerV3 + MBRL 直接相关 低成本系统参考,不作为高水平主 baseline 首选 ⭐⭐⭐
Atlas World Labs 2026 Research Release Generation + Reconstruction + Simulation Spatial Intelligence Foundation Spatial WM ⭐⭐⭐⭐

5.论文方向占比:每篇到底偏哪里

下表是为了帮助快速建立直觉的研究重心估计,不是作者官方给出的数字。三个百分比相加为 100%。

论文 CV / 3D Vision World Modeling / Simulator Planning / Policy / Robotics 一句话定位
Atlas 55% 40% 5% Foundation Spatial WM,核心是生成、重建、空间模拟
MaskGWM 65% 30% 5% 最偏 CV,重点是驾驶视频生成、长时预测和泛化
GWM 50% 45% 5% 3D Gaussian 世界表示 + dynamics
DreMa 35% 45% 20% 3DGS Digital Twin + Physics + Robot Learning
Drive-WM 45% 35% 20% 多视角未来视频 + image reward planning
NWM 40% 40% 20% Navigation Video WM + CEM planning
One-Step WM 35% 40% 25% 更快的 future imagination + optimization planning
AR Forcing 30% 55% 15% 解决 Navigation WM long-horizon rollout 漂移
DINO-WM 30% 40% 30% 不生成 RGB,在 pretrained latent space 中预测并规划
V-JEPA 2-AC 35% 40% 25% Foundation representation + action-conditioned prediction
World4Drive 25% 35% 40% Latent WM 直接生成/评价候选轨迹
WMNav 20% 30% 50% WM memory 服务 Object Goal Navigation
X-MOBILITY 20% 35% 45% Latent dynamics 服务 Learned Action Policy
DreamerNav 10% 35% 55% RSSM imagination + Actor-Critic + A*
MoSim 5% 55% 40% Future physical state + Model-Based RL
NavWAM 20% 30% 50% Future + Value + Action Chunk 联合建模

6.Renderer / Simulator / Planner 功能强度

这一表与上面的“方向占比”不同。一个系统可以同时是强 Renderer 和强 Simulator,因此三项不要求相加。

论文 Renderer Simulator Planner / Policy 主要输出
Atlas ★★★★★ ★★★★☆ ★☆☆☆☆ RGB / Depth / Point Cloud / 3DGS
MaskGWM ★★★★★ ★★★☆☆ ★☆☆☆☆ Future driving video
GWM ★★★★☆ ★★★★★ ★★☆☆☆ Future 3D Gaussian Scene
DreMa ★★★★☆ ★★★★★ ★★☆☆☆ Digital Twin imagined state / demonstrations
Drive-WM ★★★★★ ★★★★☆ ★★★☆☆ Future multiview video + trajectory choice
NWM ★★★★★ ★★★★☆ ★★★★☆ Future visual observation + CEM / ranking
One-Step WM ★★★★☆ ★★★★☆ ★★★★☆ One-step future prediction + optimized action
AR Forcing ★★★★☆ ★★★★★ ★★★☆☆ Stable long-horizon rollout
DINO-WM ★☆☆☆☆ ★★★★☆ ★★★★☆ Future pretrained visual latent
V-JEPA 2-AC ★☆☆☆☆ ★★★★☆ ★★★★☆ Future latent state
World4Drive ★★☆☆☆ ★★★★☆ ★★★★★ Future latent + selected trajectory
WMNav ★☆☆☆☆ ★★★☆☆ ★★★★★ WM memory / curiosity map → navigation action
X-MOBILITY ★★☆☆☆ ★★★★☆ ★★★★★ Probabilistic latent → velocity / path policy
DreamerNav ★☆☆☆☆ ★★★★☆ ★★★★★ RSSM imagination → navigation policy
MoSim ☆☆☆☆☆ ★★★★★ ★★★★☆ Future physical state → Model-Based RL
NavWAM ★★★☆☆ ★★★★☆ ★★★★★ Future observation + value + action chunk

7.按 World Model 输出形式分类

输出 代表工作 特点
Future RGB / Video NWM、Drive-WM、MaskGWM、One-Step WM 人可以直接观察预测,但生成成本通常较高
Future Latent State DINO-WM、X-MOBILITY、V-JEPA 2-AC、World4Drive、DreamerNav 不追求画出未来,更适合 task-oriented prediction
Future 3D Gaussian Scene GWM 显式三维几何结构
Digital Twin Future / Imagined Data DreMa 显式场景 + Physics,主要服务数据生成和策略学习
Future Physical State MoSim 直接预测机器人动力学状态,几乎不依赖 CV
Future + Action Chunk NavWAM 世界预测与动作生成开始融合
Unified Spatial Output Atlas RGB、Depth、Point Cloud、3DGS 等统一空间内容

8.当前最值得关注的三条论文谱系

A. Visual Future → Planning
Drive-WM → NWM → One-Step WM / AR Forcing

B. Latent Future → Planning / Policy
DINO-WM → X-MOBILITY → World4Drive / NavWAM

C. Explicit / Physical World → Simulator → Decision
GWM / DreMa / MoSim

当前最值得重点追踪的是 B:Latent Future → Planning / Policy

原因:它正好位于 CV、World Model 与机器人规划之间,不必把主要算力花在 photorealistic RGB generation(照片级 RGB 生成)上,同时能够保留移动机器人 Navigation、Planning 和实机闭环优势。

一个长期值得追的问题是:

对于移动机器人导航,什么样的 Future Representation(未来世界表示)最有利于 Planning?Future RGB、Future Latent、Future Occupancy、Future Geometry、Future Risk,谁真正能改善闭环导航?


9.论文链接总表

论文 Paper / Project Code
X-MOBILITY https://arxiv.org/abs/2410.17491 / https://nvlabs.github.io/X-MOBILITY/ https://github.com/NVlabs/X-MOBILITY
NWM https://arxiv.org/abs/2412.03572 / https://www.amirbar.net/nwm/ https://github.com/facebookresearch/nwm
DINO-WM https://arxiv.org/abs/2411.04983 / https://dino-wm.github.io/ https://github.com/gaoyuezhou/dino_wm
World4Drive https://openaccess.thecvf.com/content/ICCV2025/html/Zheng_World4Drive_End-to-End_Autonomous_Driving_via_Intention-aware_Physical_Latent_World_Model_ICCV_2025_paper.html https://github.com/ucaszyp/World4Drive
WMNav https://ieeexplore.ieee.org/document/11246684/ / https://b0b8k1ng.github.io/WMNav/ 项目页为准
Drive-WM https://openaccess.thecvf.com/content/CVPR2024/html/Wang_Driving_into_the_Future_Multiview_Visual_Forecasting_and_Planning_with_CVPR_2024_paper.html / https://drive-wm.github.io/ https://github.com/BraveGroup/Drive-WM
GWM https://openaccess.thecvf.com/content/ICCV2025/html/Lu_GWM_Towards_Scalable_Gaussian_World_Models_for_Robotic_Manipulation_ICCV_2025_paper.html / https://gaussian-world-model.github.io/ https://github.com/Gaussian-World-Model/gaussianwm
DreMa https://arxiv.org/abs/2412.14957 / https://dreamtomanipulate.github.io/ https://github.com/leobarcellona/drema_code
MoSim https://openaccess.thecvf.com/content/CVPR2025/html/Hao_Neural_Motion_Simulator_Pushing_the_Limit_of_World_Models_in_CVPR_2025_paper.html / https://oamics.github.io/mosim_page/ https://github.com/OamIcs/MoSim
MaskGWM https://openaccess.thecvf.com/content/CVPR2025/html/Ni_MaskGWM_A_Generalizable_Driving_World_Model_with_Video_Mask_Reconstruction_CVPR_2025_paper.html 待补充
V-JEPA 2 https://arxiv.org/abs/2506.09985 https://github.com/facebookresearch/vjepa2
One-Step WM https://arxiv.org/abs/2601.12277 / https://robotnav-bot.github.io/nav-onestepwm/ https://github.com/robotnav-bot/NOW
AR Forcing https://arxiv.org/abs/2605.31314 待确认
NavWAM https://arxiv.org/abs/2606.13494 / https://dachii-azm.github.io/navwam/ 待确认
Atlas https://www.worldlabs.ai/blog/atlas 暂无公开训练代码

10.X-MOBILITY — ICRA 2025

10.1.一句话理解

RGB + Robot State

World Model

Probabilistic Latent State

Action Policy

Velocity + Optional Local Path

World Model 与 Action Policy 解耦。核心价值不是生成漂亮未来图,而是让 latent state 通过 world modeling 学到对导航有用的环境和动态信息。

原论文使用 Isaac Sim Nova Carter 数据,包含 Random Action Dataset 和 Nav2 Teacher Dataset,并提供 checkpoint、dataset、ONNX / TensorRT / ROS2 部署链。

当前定位:第一主 baseline 候选。

值得研究的问题:动态障碍、RGB-only geometry grounding、Navigation-oriented representation、轻量化、uncertainty-aware dynamics。


11.1.一句话理解

Observation + Navigation Action

Conditional Diffusion Transformer

Future Visual Observation

CEM / Trajectory Ranking

Navigation

NWM 是 Visual World Model → Planning 的代表。它说明视频生成型 WM 并不只是 CV:模型可以对不同候选 action 想象不同未来,再由 CEM 选择更好的动作。

主要问题:推理成本、long-horizon drift、OOD mode collapse、pedestrian temporal dynamics。

当前定位:必须精读,但大模型从零训练成本过高,不优先作为第一篇完整重训 baseline。


12.DINO-WM — ICML 2025

12.1.一句话理解

Image

DINOv2 Features

World Model

Future Visual Latent

CEM / Gradient Planning

核心问题:World Model 为什么一定要重建未来 RGB?

DINO-WM 直接在 pretrained visual feature space(预训练视觉特征空间)预测未来,减少无关 pixel reconstruction,并让 world representation 更 task-oriented。

当前定位:Latent World Model + Planning 必读;非常适合启发 Navigation-Oriented World Model。


13.World4Drive — ICCV 2025

13.1.一句话理解

Camera / Scene Features

Vision Foundation Model

Physical Latent World Model

Generate Candidate Trajectories

Predict Intention-aware Future Latents

World Model Selector

Best Trajectory

这篇最值得学习的是:World Model 直接参与 Trajectory Generation / Evaluation / Selection(轨迹生成 / 评价 / 选择)

虽然任务是自动驾驶,但方法思想非常容易迁移到移动机器人:

MPPI / Policy
产生候选轨迹

World Model
预测每条轨迹对应的 Future State / Risk

Trajectory Selection

当前定位:WM → Planning 桥梁重点参考。


14.WMNav — IROS 2025

14.1.一句话理解

WMNav 将 Vision-Language Model(视觉语言模型)、World Model Memory(世界模型记忆)与 Object Goal Navigation(目标物体导航)结合。

它维护 Curiosity Value Map(好奇价值地图),并根据 world-model plan 与真实 observation 的反馈差异减轻 hallucination(幻觉)对导航决策的影响。

当前定位:明显偏 Planner / Navigation。它说明 WM 不一定是视频生成器,也可以是导航系统中的 memory / reasoning component。


15.Drive-WM — CVPR 2024

Current Multiview Images
+ Different Driving Maneuvers

Drive-WM

Multiple Future Videos

Image-based Reward

Choose Safer Trajectory

它是理解 Renderer / Simulator → Planner 链路的经典工作:先想象多个驾驶动作对应的未来视觉,再根据 reward 选择更安全的轨迹。

当前定位:CV / Video WM 较重,但与 Planning 的连接非常明确。


16.GWM — ICCV 2025

GWM 把 World Representation 改成显式 3D Gaussian(3D 高斯)

RGB Image(s)

3D Gaussian Scene

3D VAE

Gaussian Latent + Action

Latent Diffusion Transformer

Future 3D Gaussian Scene

核心不是“换一种传感器输入”,而是让世界表示具有显式三维几何结构。

当前定位:3D Vision + Simulator,适合学习 Geometry-aware World Model,不是移动导航主 baseline 首选。


17.DreMa — ICLR 2025

DreMa 使用 Gaussian Splatting + Physics Simulator 构建 Learnable Digital Twin(可学习数字孪生):

Few Real Demonstrations

Learnable Digital Twin

Imagination

Synthetic Demonstrations

Imitation Learning

Robot Policy

当前定位:Simulator + Robot Learning。核心价值是理解 WM 不只用于在线规划,也可以用于 imagination / data generation。


18.MoSim — CVPR 2025

MoSim 非常适合纠正“WM = 未来视频生成”的误解:

Current Physical State
+ Action

MoSim

Future Physical State

Model-Based RL / Zero-shot RL

Physical State 包含关节位置、速度、空间位置与速度等。

当前定位:Simulator / Dynamics / Model-Based RL,几乎不依赖 CV。


19.MaskGWM — CVPR 2025

MaskGWM 使用 Diffusion Transformer + Video Mask Reconstruction,重点解决 Driving World Model 的 Long-Horizon Prediction(长时预测)、Generalization(泛化)和 Multi-view Generation(多视角生成)。

当前定位:明显偏 CV / Generative World Model。论文很强,但与当前移动机器人 Planning 主线距离比 World4Drive、DINO-WM、X-MOBILITY 更远。


20.One-Step WM / AR Forcing / NavWAM:2026 新路线

20.1.One-Step World Model

重点解决多步 Diffusion + Autoregressive Generation 的高延迟问题,用 One-Step Generation 提升 Navigation WM 实时性,再接 optimization-based planning。

20.2.AR Forcing

重点解决训练时使用 Ground Truth Context、推理时使用 Model-generated Context 导致的 Train-Test Distribution Shift 和 Long-Horizon Error Accumulation。

Observation + Goal

World Action Model

Future Observation
+ Goal Progress
+ Action Chunk

它把“预测未来”和“决定动作”联合起来,体现 WM → WAM(World Action Model,世界动作模型) 的趋势。


21.当前 Baseline 选择判断

21.1.第一梯队:真正考虑拿来改

  1. X-MOBILITY — ICRA 2025:最贴移动机器人、ROS2、Sim2Real、Policy。
  2. DINO-WM — ICML 2025:最适合研究“Future Latent 是否比 Future RGB 更适合 Planning”。
  3. NWM — CVPR 2025:Navigation WM 标志性工作,但完整训练成本高。
  4. World4Drive — ICCV 2025:如果研究重点逐渐偏“WM 如何评价/选择轨迹”,价值很高。

WMNav、Drive-WM、GWM、DreMa、MoSim、One-Step WM、AR Forcing、NavWAM。

21.3.不建议当前作为主 baseline

  • MaskGWM:太容易滑向纯视频生成;
  • Atlas:没有公开完整训练链,规模也不适合作为硕士第一篇 baseline;
  • DreamerNav:工程和学习价值高,但如果目标明确要求高水平 venue,不再优先作为主 baseline。

22.一个值得长期追的 Research Question

Navigation World Model 真的有必要预测 photorealistic Future RGB 吗?

可以逐渐形成这样的实验谱系:

Future RGB
vs
Future Latent
vs
Future Occupancy / BEV
vs
Future Geometry / 3DGS
vs
Future Risk

同一个 Planning / Policy Framework

比较:
Success Rate
Collision Rate
Generalization
Latency
VRAM
Real-Robot Performance

这比单纯“给某个模型加一个模块”更接近一个可以持续做下去的研究问题。


23.统一论文阅读模板

以后每篇新论文优先回答以下问题。

23.1.基本信息

  • Title:
  • Venue / Year:
  • Organization:
  • Paper / Project / GitHub:
  • 是否正式发表:
  • 是否有 Code / Checkpoint / Dataset:

23.2.Observation / Input(观测 / 输入)

模型看什么:RGB、Depth、LiDAR、Robot State、Camera Pose、Language Goal?

23.3.World Representation(世界表示)

模型脑子里怎么表示世界:Pixel / Video Latent、DINO Feature、RSSM Latent、BEV、Occupancy、3D Gaussian、Physical State、Digital Twin?

23.4.World Model Output(世界模型输出)

Future RGB、Future Latent、Future Occupancy、Future 3DGS、Future Physical State、Reward / Risk / Value、Action Chunk?

23.5.Renderer / Simulator / Planner 定位

Renderer:
Simulator:
Planner / Policy:

23.6.CV ↔ Robotics 方向占比

CV / 3D Vision:
World Modeling / Simulator:
Planning / Policy / Robotics:

23.7.Planner / Policy

CEM、MPC、MPPI、Gradient Planning、Learned Policy、Actor-Critic,还是 World Action Model?

23.8.Robot Output

移动机器人:vx / vy / wz、trajectory、local path?

机械臂:joint position、joint velocity、end-effector pose、action chunk?

23.9.Training / Compute

记录 GPU、数量、显存、训练时间、Epoch / Steps、Precision、Multi-GPU Strategy。

23.10.Evaluation

记录 Baselines、Main Results、Ablation、Efficiency、Generalization、Failure Cases、Real Robot、Sim2Real。

23.11.是否适合当我的 baseline

代码完整度:
Checkpoint:
Dataset:
算力可承受:
移动机器人相关性:
实机难度:
创新空间:

24.当前阶段 Checklist

  • 精读 X-MOBILITY
  • 精读 NWM
  • 精读 DINO-WM
  • 精读 World4Drive
  • 阅读 WMNav
  • 阅读 Drive-WM
  • 精读 GWM
  • 阅读 DreMa
  • 阅读 MoSim
  • 阅读 MaskGWM
  • 阅读 One-Step WM
  • 阅读 AR Forcing
  • 阅读 NavWAM
  • 理解 Renderer / Simulator / Planner
  • 理解 RGB / Latent / Occupancy / 3DGS / Physical State 等不同 WM 输出
  • 跑通至少一个正式顶会 baseline 的 official checkpoint
  • 建立 Failure Case Dataset
  • 从稳定 failure 提出 Research Question
  • 做最小修改验证 hypothesis
  • 再进入正式创新点设计