Blog
WM论文日志
An English translation is not available yet. The latest Simplified Chinese source is shown without triggering paid translation.
1.使用说明
本文用于长期记录 World Model(WM,世界模型)在机器人导航、路径规划、具身智能方向的论文阅读、复现、实验与创新点分析。
当前重点不是先“凑创新点”,而是建立 CV / 3D Vision → World Model → Simulator → Planner / Policy → Robot 的论文谱系,优先关注正式顶会和高水平期刊工作,并从中选择代码完整、算力可承受、能够做闭环实验的 baseline。
当前重点方向:Navigation World Model、Latent World Model、3D Structured World Model、World Model + Planning、World Model + Policy、Model-Based RL、动态障碍预测、实时化、Sim2Real、ROS2 / Nav2 实机部署。
2.先统一几个概念
Sensor / Observation
传感器 / 当前观测
↓
Perception / Representation
感知 / 世界表示
↓
World Model
世界模型
↓
Future Prediction
未来预测
↓
Planner / Policy
规划器 / 策略
↓
Controller
控制器
↓
Robot Command
机器人执行命令
- Computer Vision(CV,计算机视觉):现在世界是什么样?
- World Model(WM,世界模型):如果执行动作 A,未来世界会怎样?
- Planner(规划器) / Policy(策略):应该选择什么动作?
- Controller(控制器):把动作真正变成速度、关节或力矩指令。
因此 World Model 的输出不一定是 RGB,也通常不等于 cmd_vel。它可以输出 Future RGB、Future Latent、Future Occupancy、Future 3DGS、Future Physical State、Reward / Risk / Value 等。
3.Renderer / Simulator / Planner 框架
3.1.Renderer(渲染器)
回答:未来世界“看起来”是什么样?
常见输出:RGB、Video、Novel View、Depth、3D rendering。
3.2.Simulator(模拟器)
回答:世界在动作作用下实际上会怎样变化?
常见输出:Future State、Future Latent、Future Geometry、Future Occupancy、Future 3DGS、Object Pose、Reward / Risk。
3.3.Planner(规划器)
回答:为了达到目标应该做什么?
常见输出:Action、Action Sequence、Trajectory、Velocity Command。
常见方法:CEM(Cross-Entropy Method,交叉熵方法)、MPC(Model Predictive Control,模型预测控制)、MPPI(Model Predictive Path Integral,模型预测路径积分)、Learned Policy(学习策略)、Actor-Critic(演员-评论家)。
4.核心论文目录
| 论文 | Venue / 状态 | 核心路线 | 与移动导航关系 | 当前定位 | 优先级 |
|---|---|---|---|---|---|
| X-MOBILITY | ICRA 2025 | Latent WM + Policy | 直接相关 | 第一主 baseline 候选 | ⭐⭐⭐⭐⭐ |
| Navigation World Models(NWM) | CVPR 2025 Oral / Best Paper HM | Diffusion Video WM + Planning | 直接相关 | Navigation WM 标志性工作 | ⭐⭐⭐⭐⭐ |
| DINO-WM | ICML 2025 | Pretrained Visual Latent WM + Planning | 高度相关 | Latent WM + Planning 核心参考 | ⭐⭐⭐⭐⭐ |
| World4Drive | ICCV 2025 | Physical Latent WM + Trajectory Selection | 自动驾驶,方法高度相关 | WM → Planning 桥梁重点参考 | ⭐⭐⭐⭐⭐ |
| WMNav | IROS 2025 | VLM + WM Memory + Navigation Policy | 直接相关 | Object Goal Navigation | ⭐⭐⭐⭐ |
| Drive-WM | CVPR 2024 | Multiview Video WM + Reward Planning | 自动驾驶,方法高度相关 | Visual WM → Planning 经典工作 | ⭐⭐⭐⭐ |
| GWM | ICCV 2025 | 3D Gaussian WM | 当前偏 Manipulation | 3D / Geometry-aware WM | ⭐⭐⭐⭐ |
| DreMa | ICLR 2025 | Gaussian Digital Twin + Physics | 当前偏 Manipulation | Compositional WM / Imagination | ⭐⭐⭐⭐ |
| MoSim | CVPR 2025 | Physical-State WM + Model-Based RL | 间接相关 | 非视觉 Dynamics WM | ⭐⭐⭐⭐ |
| MaskGWM | CVPR 2025 | Diffusion Video WM + Mask Reconstruction | 自动驾驶,偏 CV | 长时视频预测 / 泛化 | ⭐⭐⭐ |
| V-JEPA 2 / 2-AC | 2025 Research Release / arXiv | Foundation Video WM + Action Conditioning | 当前偏 Manipulation | Foundation Latent WM | ⭐⭐⭐⭐ |
| One-Step WM | 2026 arXiv | One-Step Video WM + Planning | 直接相关 | Navigation WM 实时化 | ⭐⭐⭐⭐⭐ |
| AR Forcing | 2026 arXiv | Autoregressive Training for Navigation WM | 直接相关 | Long-horizon stability | ⭐⭐⭐⭐ |
| NavWAM | 2026 arXiv | World Model + Action Model | 直接相关 | WM → WAM 新路线 | ⭐⭐⭐⭐ |
| DreamerNav | Frontiers in Robotics and AI 2025 | DreamerV3 + MBRL | 直接相关 | 低成本系统参考,不作为高水平主 baseline 首选 | ⭐⭐⭐ |
| Atlas | World Labs 2026 Research Release | Generation + Reconstruction + Simulation | Spatial Intelligence | Foundation Spatial WM | ⭐⭐⭐⭐ |
5.论文方向占比:每篇到底偏哪里
下表是为了帮助快速建立直觉的研究重心估计,不是作者官方给出的数字。三个百分比相加为 100%。
| 论文 | CV / 3D Vision | World Modeling / Simulator | Planning / Policy / Robotics | 一句话定位 |
|---|---|---|---|---|
| Atlas | 55% | 40% | 5% | Foundation Spatial WM,核心是生成、重建、空间模拟 |
| MaskGWM | 65% | 30% | 5% | 最偏 CV,重点是驾驶视频生成、长时预测和泛化 |
| GWM | 50% | 45% | 5% | 3D Gaussian 世界表示 + dynamics |
| DreMa | 35% | 45% | 20% | 3DGS Digital Twin + Physics + Robot Learning |
| Drive-WM | 45% | 35% | 20% | 多视角未来视频 + image reward planning |
| NWM | 40% | 40% | 20% | Navigation Video WM + CEM planning |
| One-Step WM | 35% | 40% | 25% | 更快的 future imagination + optimization planning |
| AR Forcing | 30% | 55% | 15% | 解决 Navigation WM long-horizon rollout 漂移 |
| DINO-WM | 30% | 40% | 30% | 不生成 RGB,在 pretrained latent space 中预测并规划 |
| V-JEPA 2-AC | 35% | 40% | 25% | Foundation representation + action-conditioned prediction |
| World4Drive | 25% | 35% | 40% | Latent WM 直接生成/评价候选轨迹 |
| WMNav | 20% | 30% | 50% | WM memory 服务 Object Goal Navigation |
| X-MOBILITY | 20% | 35% | 45% | Latent dynamics 服务 Learned Action Policy |
| DreamerNav | 10% | 35% | 55% | RSSM imagination + Actor-Critic + A* |
| MoSim | 5% | 55% | 40% | Future physical state + Model-Based RL |
| NavWAM | 20% | 30% | 50% | Future + Value + Action Chunk 联合建模 |
6.Renderer / Simulator / Planner 功能强度
这一表与上面的“方向占比”不同。一个系统可以同时是强 Renderer 和强 Simulator,因此三项不要求相加。
| 论文 | Renderer | Simulator | Planner / Policy | 主要输出 |
|---|---|---|---|---|
| Atlas | ★★★★★ | ★★★★☆ | ★☆☆☆☆ | RGB / Depth / Point Cloud / 3DGS |
| MaskGWM | ★★★★★ | ★★★☆☆ | ★☆☆☆☆ | Future driving video |
| GWM | ★★★★☆ | ★★★★★ | ★★☆☆☆ | Future 3D Gaussian Scene |
| DreMa | ★★★★☆ | ★★★★★ | ★★☆☆☆ | Digital Twin imagined state / demonstrations |
| Drive-WM | ★★★★★ | ★★★★☆ | ★★★☆☆ | Future multiview video + trajectory choice |
| NWM | ★★★★★ | ★★★★☆ | ★★★★☆ | Future visual observation + CEM / ranking |
| One-Step WM | ★★★★☆ | ★★★★☆ | ★★★★☆ | One-step future prediction + optimized action |
| AR Forcing | ★★★★☆ | ★★★★★ | ★★★☆☆ | Stable long-horizon rollout |
| DINO-WM | ★☆☆☆☆ | ★★★★☆ | ★★★★☆ | Future pretrained visual latent |
| V-JEPA 2-AC | ★☆☆☆☆ | ★★★★☆ | ★★★★☆ | Future latent state |
| World4Drive | ★★☆☆☆ | ★★★★☆ | ★★★★★ | Future latent + selected trajectory |
| WMNav | ★☆☆☆☆ | ★★★☆☆ | ★★★★★ | WM memory / curiosity map → navigation action |
| X-MOBILITY | ★★☆☆☆ | ★★★★☆ | ★★★★★ | Probabilistic latent → velocity / path policy |
| DreamerNav | ★☆☆☆☆ | ★★★★☆ | ★★★★★ | RSSM imagination → navigation policy |
| MoSim | ☆☆☆☆☆ | ★★★★★ | ★★★★☆ | Future physical state → Model-Based RL |
| NavWAM | ★★★☆☆ | ★★★★☆ | ★★★★★ | Future observation + value + action chunk |
7.按 World Model 输出形式分类
| 输出 | 代表工作 | 特点 |
|---|---|---|
| Future RGB / Video | NWM、Drive-WM、MaskGWM、One-Step WM | 人可以直接观察预测,但生成成本通常较高 |
| Future Latent State | DINO-WM、X-MOBILITY、V-JEPA 2-AC、World4Drive、DreamerNav | 不追求画出未来,更适合 task-oriented prediction |
| Future 3D Gaussian Scene | GWM | 显式三维几何结构 |
| Digital Twin Future / Imagined Data | DreMa | 显式场景 + Physics,主要服务数据生成和策略学习 |
| Future Physical State | MoSim | 直接预测机器人动力学状态,几乎不依赖 CV |
| Future + Action Chunk | NavWAM | 世界预测与动作生成开始融合 |
| Unified Spatial Output | Atlas | RGB、Depth、Point Cloud、3DGS 等统一空间内容 |
8.当前最值得关注的三条论文谱系
A. Visual Future → Planning
Drive-WM → NWM → One-Step WM / AR Forcing
B. Latent Future → Planning / Policy
DINO-WM → X-MOBILITY → World4Drive / NavWAM
C. Explicit / Physical World → Simulator → Decision
GWM / DreMa / MoSim
当前最值得重点追踪的是 B:Latent Future → Planning / Policy。
原因:它正好位于 CV、World Model 与机器人规划之间,不必把主要算力花在 photorealistic RGB generation(照片级 RGB 生成)上,同时能够保留移动机器人 Navigation、Planning 和实机闭环优势。
一个长期值得追的问题是:
对于移动机器人导航,什么样的 Future Representation(未来世界表示)最有利于 Planning?Future RGB、Future Latent、Future Occupancy、Future Geometry、Future Risk,谁真正能改善闭环导航?
9.论文链接总表
10.X-MOBILITY — ICRA 2025
10.1.一句话理解
RGB + Robot State
↓
World Model
↓
Probabilistic Latent State
↓
Action Policy
↓
Velocity + Optional Local Path
World Model 与 Action Policy 解耦。核心价值不是生成漂亮未来图,而是让 latent state 通过 world modeling 学到对导航有用的环境和动态信息。
原论文使用 Isaac Sim Nova Carter 数据,包含 Random Action Dataset 和 Nav2 Teacher Dataset,并提供 checkpoint、dataset、ONNX / TensorRT / ROS2 部署链。
当前定位:第一主 baseline 候选。
值得研究的问题:动态障碍、RGB-only geometry grounding、Navigation-oriented representation、轻量化、uncertainty-aware dynamics。
11.Navigation World Models(NWM)— CVPR 2025
11.1.一句话理解
Observation + Navigation Action
↓
Conditional Diffusion Transformer
↓
Future Visual Observation
↓
CEM / Trajectory Ranking
↓
Navigation
NWM 是 Visual World Model → Planning 的代表。它说明视频生成型 WM 并不只是 CV:模型可以对不同候选 action 想象不同未来,再由 CEM 选择更好的动作。
主要问题:推理成本、long-horizon drift、OOD mode collapse、pedestrian temporal dynamics。
当前定位:必须精读,但大模型从零训练成本过高,不优先作为第一篇完整重训 baseline。
12.DINO-WM — ICML 2025
12.1.一句话理解
Image
↓
DINOv2 Features
↓
World Model
↓
Future Visual Latent
↓
CEM / Gradient Planning
核心问题:World Model 为什么一定要重建未来 RGB?
DINO-WM 直接在 pretrained visual feature space(预训练视觉特征空间)预测未来,减少无关 pixel reconstruction,并让 world representation 更 task-oriented。
当前定位:Latent World Model + Planning 必读;非常适合启发 Navigation-Oriented World Model。
13.World4Drive — ICCV 2025
13.1.一句话理解
Camera / Scene Features
↓
Vision Foundation Model
↓
Physical Latent World Model
↓
Generate Candidate Trajectories
↓
Predict Intention-aware Future Latents
↓
World Model Selector
↓
Best Trajectory
这篇最值得学习的是:World Model 直接参与 Trajectory Generation / Evaluation / Selection(轨迹生成 / 评价 / 选择)。
虽然任务是自动驾驶,但方法思想非常容易迁移到移动机器人:
MPPI / Policy
产生候选轨迹
↓
World Model
预测每条轨迹对应的 Future State / Risk
↓
Trajectory Selection
当前定位:WM → Planning 桥梁重点参考。
14.WMNav — IROS 2025
14.1.一句话理解
WMNav 将 Vision-Language Model(视觉语言模型)、World Model Memory(世界模型记忆)与 Object Goal Navigation(目标物体导航)结合。
它维护 Curiosity Value Map(好奇价值地图),并根据 world-model plan 与真实 observation 的反馈差异减轻 hallucination(幻觉)对导航决策的影响。
当前定位:明显偏 Planner / Navigation。它说明 WM 不一定是视频生成器,也可以是导航系统中的 memory / reasoning component。
15.Drive-WM — CVPR 2024
Current Multiview Images
+ Different Driving Maneuvers
↓
Drive-WM
↓
Multiple Future Videos
↓
Image-based Reward
↓
Choose Safer Trajectory
它是理解 Renderer / Simulator → Planner 链路的经典工作:先想象多个驾驶动作对应的未来视觉,再根据 reward 选择更安全的轨迹。
当前定位:CV / Video WM 较重,但与 Planning 的连接非常明确。
16.GWM — ICCV 2025
GWM 把 World Representation 改成显式 3D Gaussian(3D 高斯):
RGB Image(s)
↓
3D Gaussian Scene
↓
3D VAE
↓
Gaussian Latent + Action
↓
Latent Diffusion Transformer
↓
Future 3D Gaussian Scene
核心不是“换一种传感器输入”,而是让世界表示具有显式三维几何结构。
当前定位:3D Vision + Simulator,适合学习 Geometry-aware World Model,不是移动导航主 baseline 首选。
17.DreMa — ICLR 2025
DreMa 使用 Gaussian Splatting + Physics Simulator 构建 Learnable Digital Twin(可学习数字孪生):
Few Real Demonstrations
↓
Learnable Digital Twin
↓
Imagination
↓
Synthetic Demonstrations
↓
Imitation Learning
↓
Robot Policy
当前定位:Simulator + Robot Learning。核心价值是理解 WM 不只用于在线规划,也可以用于 imagination / data generation。
18.MoSim — CVPR 2025
MoSim 非常适合纠正“WM = 未来视频生成”的误解:
Current Physical State
+ Action
↓
MoSim
↓
Future Physical State
↓
Model-Based RL / Zero-shot RL
Physical State 包含关节位置、速度、空间位置与速度等。
当前定位:Simulator / Dynamics / Model-Based RL,几乎不依赖 CV。
19.MaskGWM — CVPR 2025
MaskGWM 使用 Diffusion Transformer + Video Mask Reconstruction,重点解决 Driving World Model 的 Long-Horizon Prediction(长时预测)、Generalization(泛化)和 Multi-view Generation(多视角生成)。
当前定位:明显偏 CV / Generative World Model。论文很强,但与当前移动机器人 Planning 主线距离比 World4Drive、DINO-WM、X-MOBILITY 更远。
20.One-Step WM / AR Forcing / NavWAM:2026 新路线
20.1.One-Step World Model
重点解决多步 Diffusion + Autoregressive Generation 的高延迟问题,用 One-Step Generation 提升 Navigation WM 实时性,再接 optimization-based planning。
20.2.AR Forcing
重点解决训练时使用 Ground Truth Context、推理时使用 Model-generated Context 导致的 Train-Test Distribution Shift 和 Long-Horizon Error Accumulation。
20.3.NavWAM
Observation + Goal
↓
World Action Model
↓
Future Observation
+ Goal Progress
+ Action Chunk
它把“预测未来”和“决定动作”联合起来,体现 WM → WAM(World Action Model,世界动作模型) 的趋势。
21.当前 Baseline 选择判断
21.1.第一梯队:真正考虑拿来改
- X-MOBILITY — ICRA 2025:最贴移动机器人、ROS2、Sim2Real、Policy。
- DINO-WM — ICML 2025:最适合研究“Future Latent 是否比 Future RGB 更适合 Planning”。
- NWM — CVPR 2025:Navigation WM 标志性工作,但完整训练成本高。
- World4Drive — ICCV 2025:如果研究重点逐渐偏“WM 如何评价/选择轨迹”,价值很高。
21.2.第二梯队:强 Related Work / 方法参考
WMNav、Drive-WM、GWM、DreMa、MoSim、One-Step WM、AR Forcing、NavWAM。
21.3.不建议当前作为主 baseline
- MaskGWM:太容易滑向纯视频生成;
- Atlas:没有公开完整训练链,规模也不适合作为硕士第一篇 baseline;
- DreamerNav:工程和学习价值高,但如果目标明确要求高水平 venue,不再优先作为主 baseline。
22.一个值得长期追的 Research Question
Navigation World Model 真的有必要预测 photorealistic Future RGB 吗?
可以逐渐形成这样的实验谱系:
Future RGB
vs
Future Latent
vs
Future Occupancy / BEV
vs
Future Geometry / 3DGS
vs
Future Risk
↓
同一个 Planning / Policy Framework
↓
比较:
Success Rate
Collision Rate
Generalization
Latency
VRAM
Real-Robot Performance
这比单纯“给某个模型加一个模块”更接近一个可以持续做下去的研究问题。
23.统一论文阅读模板
以后每篇新论文优先回答以下问题。
23.1.基本信息
- Title:
- Venue / Year:
- Organization:
- Paper / Project / GitHub:
- 是否正式发表:
- 是否有 Code / Checkpoint / Dataset:
23.2.Observation / Input(观测 / 输入)
模型看什么:RGB、Depth、LiDAR、Robot State、Camera Pose、Language Goal?
23.3.World Representation(世界表示)
模型脑子里怎么表示世界:Pixel / Video Latent、DINO Feature、RSSM Latent、BEV、Occupancy、3D Gaussian、Physical State、Digital Twin?
23.4.World Model Output(世界模型输出)
Future RGB、Future Latent、Future Occupancy、Future 3DGS、Future Physical State、Reward / Risk / Value、Action Chunk?
23.5.Renderer / Simulator / Planner 定位
Renderer:
Simulator:
Planner / Policy:
23.6.CV ↔ Robotics 方向占比
CV / 3D Vision:
World Modeling / Simulator:
Planning / Policy / Robotics:
23.7.Planner / Policy
CEM、MPC、MPPI、Gradient Planning、Learned Policy、Actor-Critic,还是 World Action Model?
23.8.Robot Output
移动机器人:vx / vy / wz、trajectory、local path?
机械臂:joint position、joint velocity、end-effector pose、action chunk?
23.9.Training / Compute
记录 GPU、数量、显存、训练时间、Epoch / Steps、Precision、Multi-GPU Strategy。
23.10.Evaluation
记录 Baselines、Main Results、Ablation、Efficiency、Generalization、Failure Cases、Real Robot、Sim2Real。
23.11.是否适合当我的 baseline
代码完整度:
Checkpoint:
Dataset:
算力可承受:
移动机器人相关性:
实机难度:
创新空间:
24.当前阶段 Checklist
- 精读 X-MOBILITY
- 精读 NWM
- 精读 DINO-WM
- 精读 World4Drive
- 阅读 WMNav
- 阅读 Drive-WM
- 精读 GWM
- 阅读 DreMa
- 阅读 MoSim
- 阅读 MaskGWM
- 阅读 One-Step WM
- 阅读 AR Forcing
- 阅读 NavWAM
- 理解 Renderer / Simulator / Planner
- 理解 RGB / Latent / Occupancy / 3DGS / Physical State 等不同 WM 输出
- 跑通至少一个正式顶会 baseline 的 official checkpoint
- 建立 Failure Case Dataset
- 从稳定 failure 提出 Research Question
- 做最小修改验证 hypothesis
- 再进入正式创新点设计