SG-WAM: Self-Guided World Modeling in Geometry-Aware Policy Space
让机器人用生成动作的同一个策略来预测未来,比用单独的预测模块效果更好
SG-WAM是一种机器人策略模型,它在生成下一步动作的同时,用同一套策略表示来预测场景将如何变化,而不是依赖单独的未来预测模块。它用策略自身的缓慢更新副本(EMA目标)作为预测目标,并用一个冻结的3D几何模型给视觉特征注入空间结构信息。该方法在LIBERO仿真基准上平均成功率达98.5%,在更具挑战性的LIBERO-Plus上达73.0%,在真实机器人实验中也优于对比基线。
METAL MEDIA 解读图
SG-WAM架构:用策略自身的表示预测未来
证据状态已报告实测结果
- 观测+语言+动态令牌输入当前多视角摄像头图像、任务指令与8个可学习动态令牌一起输入共享的VLM主干(Qwen3.5-0.8B)
- 几何监督(VGGT教师)冻结的3D模型VGGT通过余弦相似度损失,对主视角视觉令牌进行塑形,注入空间结构信息
- 自引导世界预测器(SGWP)接收当前动态令牌状态和机器人即将执行的动作序列,预测动态令牌未来的演变
- EMA目标路径同一策略的缓慢更新副本处理未来观测,生成预测目标,且梯度被阻断
- 流匹配动作生成器以包含动态令牌的完整策略上下文为条件生成连续机器人动作;推理时教师模型、预测器和EMA路径全部被移除
他们做了什么
- 现有的世界动作模型(WAM)要么直接预测未来图像/视频,导致模型把精力浪费在纹理、光照等与操作无关的视觉细节上;要么在一个单独的潜空间里预测特征,但这个空间未必与真正用于生成动作的表示对齐。
- SG-WAM在一个视觉语言模型(VLM)中插入8个可学习的动态令牌(dynamics tokens),并训练一个自引导世界预测器(SGWP)来预测这些令牌在机器人即将执行的动作作用下将如何变化。预测目标由同一策略的EMA(指数滑动平均)副本在看到未来观测后生成,使预测值和目标值来自同一表示体系。
- 与此同时,一个冻结的3D基础模型VGGT通过余弦相似度损失,对策略的主视角视觉令牌进行几何塑形,使动态令牌因此也携带场景的空间位置信息。
- 几何塑形、未来预测和负责生成实际动作的流匹配(flow matching)动作生成器在同一阶段联合训练;而在推理(实际部署)时,几何教师、SGWP预测分支和EMA目标路径全部被移除,只留下轻量级的部署策略。
- SG-WAM在LIBERO四个标准任务套件上平均成功率达到98.5%,在引入相机视角、光照、背景等扰动的零样本迁移基准LIBERO-Plus上以73.0%的总成功率领先,并在使用UR5e机械臂的三项真实任务(拾取放置、毛巾折叠、工具箱整理)中,在熟悉环境和背景/光照/新物体等未见条件下均优于VPP和VLA-JEPA基线。

| Method | Params | Embodied PT. | Spatial | Object | Goal | Long | Avg. |
|---|---|---|---|---|---|---|---|
| OpenVLA-OFT [21] | 7B | ✓ | 97.6 | 98.4 | 97.9 | 94.5 | 97.1 |
| π0 [6] | 3.3B | ✓ | 98.0 | 96.8 | 94.4 | 88.4 | 94.4 |
| π0-FAST [31] | 3.3B | ✓ | 96.4 | 96.8 | 88.6 | 60.2 | 85.5 |
| π0.5 [5] | 3.3B | ✓ | 98.8 | 98.2 | 98.0 | 92.4 | 96.9 |
| GR00T N1.6 [4] | 3B | ✓ | 97.7 | 98.5 | 97.5 | 94.4 | 97.0 |
| Spatial Forcing [24] | 7B | ✓ | 99.4 | 99.6 | 98.8 | 96.0 | 98.5 |
| WorldVLA [10] | 7B | ✗ | 87.6 | 96.2 | 83.4 | 60.0 | 81.8 |
| LAPA [44] | 7B | ✓ | 55.4 | 58.8 | 74.6 | 73.8 | 65.7 |
| RynnVLA-002 [9] | 7B | ✗ | 99.0 | 99.8 | 96.4 | 94.4 | 97.4 |
| Mantis [42] | 5.8B | ✓ | 98.8 | 99.2 | 94.4 | 94.2 | 96.7 |
| UniVLA [8] | 7B | ✓ | 96.5 | 96.8 | 95.6 | 92.0 | 95.2 |
| Fast-WAM [45] | 6B | ✗ | 98.2 | 100.0 | 97.0 | 95.2 | 97.6 |
| VLA-JEPA [34] | 2B | ✗ | 94.8 | 99.6 | 95.8 | 94.0 | 96.1 |
| SG-WAM | 0.9B | ✗ | 99.4 | 99.8 | 98.6 | 96.2 | 98.5 |

| Method | Params | Camera | Robot | Language | Light | Background | Noise | Layout | Overall |
|---|---|---|---|---|---|---|---|---|---|
| WorldVLA [10] | 7B | 0.1 | 27.9 | 41.6 | 43.7 | 17.1 | 10.9 | 38.0 | 25.0 |
| Spatial Forcing [24] | 7B | 20.1 | 13.4 | 40.9 | 29.1 | 33.4 | 25.7 | 39.3 | 29.1 |
| Mantis [42] | 5.8B | 15.7 | 41.8 | 45.9 | 45.1 | 28.9 | 39.2 | 62.5 | 39.8 |
| UniVLA [8] | 7B | 4.3 | 50.3 | 71.8 | 59.1 | 80.0 | 25.3 | 34.3 | 41.5 |
| Fast-WAM [45] | 6B | 16.4 | 44.5 | 68.9 | 78.2 | 53.7 | 37.7 | 60.7 | 50.0 |
| π0 [6] | 3.3B | 13.8 | 6.0 | 58.8 | 85.0 | 81.4 | 79.0 | 68.9 | 53.6 |
| VLA-JEPA [34] | 2B | 40.3 | 55.7 | 72.9 | 88.2 | 70.5 | 38.2 | 74.6 | 62.9 |
| OpenVLA-OFT [21] | 7B | 56.4 | 31.9 | 79.5 | 88.7 | 93.3 | 75.8 | 74.2 | 69.6 |
| SG-WAM | 0.9B | 58.6 | 48.9 | 81.4 | 89.8 | 86.1 | 80.7 | 74.2 | 73.0 |

| Model | Pick and Place | Towel Folding | Toolbox Organization | ||||||
|---|---|---|---|---|---|---|---|---|---|
| ID | Background | Light Change | Novel Object | ID | Background | Light Change | Novel Object | ID | |
| VLA-JEPA | 35% | 20% | 25% | 20% | 20% | 10% | 10% | 15% | 20% |
| VPP | 30% | 15% | 10% | 10% | 35% | 15% | 15% | 10% | 30% |
| SG-WAM | 75% | 55% | 60% | 40% | 45% | 25% | 35% | 25% | 50% |

| Geo. | WM. | Spatial | Object | Goal | Long | Avg. |
|---|---|---|---|---|---|---|
| ✗ | ✗ | 97.0 | 97.6 | 95.6 | 91.0 | 95.3 |
| ✓ | ✗ | 98.2 | 97.8 | 98.0 | 92.2 | 96.6 |
| ✗ | ✓ | 97.8 | 99.8 | 98.2 | 94.4 | 97.6 |
| ✓ | ✓ | 99.4 | 99.8 | 98.6 | 96.2 | 98.5 |
| Number of Token | Spatial | Object | Goal | Long | Avg. |
|---|---|---|---|---|---|
| 1 | 97.2 | 98.8 | 98.2 | 90.2 | 96.1 |
| 4 | 99.0 | 98.4 | 97.4 | 95.2 | 97.5 |
| 8 | 99.4 | 99.8 | 98.6 | 96.2 | 98.5 |
| 16 | 99.4 | 99.4 | 97.6 | 92.4 | 97.2 |

| Model | Towel Folding | Toolbox Organization | ||||
|---|---|---|---|---|---|---|
| First Folding | Second Folding | Pick the Screwdriver | Pick the First Gear | Pick the Second Gear | Close the Toolbox | |
| VLA-JEPA | 50% | 20% | 50% | 40% | 20% | 20% |
| VPP | 60% | 35% | 70% | 50% | 40% | 30% |
| SG-WAM | 75% | 45% | 80% | 60% | 50% | 50% |

| Variant | Spatial | Object | Goal | Long | Avg. |
|---|---|---|---|---|---|
| Null-Action Sequence | 98.4 | 99.2 | 98.0 | 94.6 | 97.6 |
| SG-WAM | 99.4 | 99.8 | 98.6 | 96.2 | 98.5 |

研究结果
- 在LIBERO四个标准任务套件上,SG-WAM平均成功率达到98.5%,与使用更大模型或大规模具身预训练的最强基线持平。
- 在引入相机视角、光照、背景、语言、场景布局等扰动的零样本迁移测试LIBERO-Plus上,SG-WAM以73.0%的总成功率排名第一,尤其在相机、语言、光照和布局扰动下表现最佳。
- 在使用UR5e机械臂进行的拾取放置、毛巾折叠、工具箱整理三项真实任务中,SG-WAM在熟悉环境以及背景变化、光照变化、新物体等条件下,均优于VPP(显式视频预测)和VLA-JEPA(隐式潜空间预测)基线。
- 同时移除几何监督和自引导世界建模后,LIBERO平均成功率降至95.3%;两者结合时达到最佳的98.5%。仅移除世界建模会损失1.9个百分点,仅移除几何监督损失0.9个百分点,在长时序任务LIBERO-Long上差距最大(从96.2%降到92.2%)。
- 将可学习动态令牌数量从1个增加到8个,平均成功率从96.1%提升到98.5%,但继续增加到16个时反而降到97.2%。把真实的中间动作序列替换为全零序列后,平均成功率从98.5%降到97.6%,说明真实动作信息对预测提供了可测量但有限的帮助。

可应用场景
- 希望用相对较小的模型同时获得强操作性能和更好的视觉分布外鲁棒性的机器人学习系统设计。
- 希望在不生成昂贵未来图像或视频的前提下,让策略学习动作如何改变环境的机器人策略研究。
- 希望减少多步骤长时序操作任务(如按顺序整理多个物体)中错误累积问题的研究。

局限与待验证事项
- 真实实验仅限于UR5e机械臂、特定相机配置和三项任务(拾取放置、毛巾折叠、工具箱整理),尚未验证在其他机器人形态或更广泛任务上的泛化能力。
- 结果基于一个相对较小的0.9B参数模型,且未经大规模具身预训练;作者明确将扩展到更大策略骨干网络和跨具身数据集列为未来工作。
- 动态令牌数量的影响呈非单调趋势(增加到16个时性能反而下降),这一最优令牌数是否能直接迁移到其他任务或模型规模尚不确定。
- 真实环境的分布外评估仅涵盖背景变化、光照变化、新物体三种具体扰动,对更极端或其他类型环境变化的鲁棒性尚未验证。

为什么重要
这项工作说明,机器人策略可以通过预测自身内部状态的未来变化(而非重建像素或依赖不匹配的辅助潜空间)来同时获得更强的操作性能和分布外鲁棒性。而且这一效果是在一个相对较小的0.9B参数模型上、且未经大规模具身预训练的情况下取得的,这对计算资源有限的团队有实际意义。
本文术语
- 世界动作模型(World Action Model, WAM) · 在生成机器人动作的同时,联合学习预测环境如何随动作变化的模型
- 动态令牌(dynamics tokens) · 加入模型中的可学习向量,用来编码场景在动作作用下的变化
- EMA(指数滑动平均)目标 · 模型自身的一个缓慢更新副本,用于生成稳定的预测目标,且不参与梯度反传
- 流匹配(flow matching) · 一种生成方法,通过逐步把随机噪声转换为目标输出(这里是连续的机器人动作)来生成结果
- VGGT · 一个冻结的3D几何基础模型,训练时用于给策略的视觉特征注入空间结构信息
无法转载的图表
- Figure 9: Visualization of 3 OOD settings. 1) Left: Background Shift. 2) Middle: Light Change. 3) Right: Novel Object.
论文原文摘要(英文)
World Action Models (WAMs) couple action generation with prediction of future states. Their effectiveness depends on whether future dynamics are modeled in a space that is both aligned with action generation and sufficiently geometry-aware to capture where and how actions change the scene. Existing WAMs typically satisfy only part of this requirement, relying on either perceptually heavy observation-space targets or auxiliary latent spaces that are not jointly structured for action relevance and
在 arXiv 阅读最新论文
- SWE-bench Science: Can Coding Agents Resolve Engineering Tasks in Science?让AI编程助手去修复真实科学软件,连最强的那个也有一半以上任务没做对
- FlashPrefill V2: Block-Sparse Prefill Attention for Long-Context LLM Serving把稀疏注意力从论文原型变成能真正上线服务的加速方案
- PolicyGuide: From Guarding One Action to Guiding the Whole Workflow for Policy-Compliant LLM Agents让客服AI坐席不只是拦住一个危险动作,而是把整个流程走对
- EXIMO: VLM Guided Exploration of VLA Policies不用人工遥控演示,让会说话的AI来教机械臂做新家务
- EnvHarness: Awakening Static Worlds for Agent Learning不重新搭建训练环境,而是给现有环境套一层可插拔组件,针对每个智能体的具体弱点重新塑形
- Bounded Sovereignty and the Control Tax: Pricing AI Oversight When the Deployer Does Not Own the Model租用AI而非拥有AI的机构,安全监管能力只剩一半
- Beyond Imitation: Filtering On-Policy Distillation by Reasoning ProgressAI模仿老师模型学习时,会误伤本来推理正确的步骤,新方法专门过滤掉这种误伤
- PersonalBench: Measuring the Authorship Gap in LLM Personalization让AI模仿某人的文风,结果发现它始终摆脱不了自己的腔调
METAL MEDIA 最新报道
图片来源: Ruiteng Zhao et al., arXiv:2608.01397, arxiv-nonexclusive