摘要
本文解读 arXiv 2026 论文《LiLa-WAM: Lightweight Latent Reasoning World-Action Model for Robotic Manipulation》。该论文提出 LiLa-WAM 轻量潜空间世界-动作模型,通过融合未来状态预测、动作生成与视觉转移 token(VTT)免语言任务指定,在紧凑潜空间中单流端到端联合推理,其特别之处在于仅 0.5B 参数即可在单张 24GB 显卡上训练。实验表明RoboTwin 2.0 五十任务平均成功率 90.48%(Clean 第一),LIBERO 平均 97.1% 追平 7B OpenVLA-OFT,真机平均 82.0%,为资源受限条件下的机器人世界模型研究提供了重要借鉴。
视频讲解:点击观看 B 站视频
论文基本信息
| 项目 | 内容 |
|---|---|
| 标题(英文) | LiLa-WAM: Lightweight Latent Reasoning World-Action Model for Robotic Manipulation |
| 标题(中文) | 轻量潜空间推理世界-动作模型 LiLa-WAM |
| 作者 | Fan Yang, Yuting Su, Xiaobo Wang, Yuncheng You, Fugui Fan, Yuting Wu, Minghui Wu, Chenxu Zhao, Jiahong Ning, Peiguang Jing |
| 机构 | 天津大学 · 深圳理工大学 · 明略科技 · 自然资源部信息中心 · 深信服 |
| 会议 | arXiv 2026(2026 年 8 月预印本) |
| arXiv | https://arxiv.org/abs/2608.03701 |
| 代码 | https://github.com/teee000/LiLa-WAM |
背景与动机
世界-动作模型(World-Action Model, WAM)是机器人操作领域的新范式:策略不仅要根据当前观测生成动作,还要显式预测场景在干预下如何演化,这种"预见能力"被认为有助于鲁棒控制。但现有 WAM 普遍训练昂贵,阻碍了中等算力实验室的复现与使用。
像素空间方法(UniPi、VPP、WorldVLA、UVA、Motus、GigaWorld-Policy)显式合成未来图像/视频,大量模型容量被花在纹理、光照、背景等与控制无关的细节上,训练与推理开销巨大——Motus 8B、GigaWorld-Policy 5B,视频生成骨干(如 WAN)的适配成本远超单卡预算。潜空间方法(WoG、LaWAM、Being-H0.7)避免了像素合成,但常需多阶段训练:先单独训练预测组件再与策略耦合(WoG、LaWAM),或依赖额外对齐损失防止特征坍缩(Being-H0.7)。
更深层的问题是骨干错配:VLM 骨干的大量参数服务于语言建模,视频生成骨干服务于像素级动态,都不是精细操作真正需要的线索。作者因此提出核心观察——一个紧凑、富含细粒度空间细节的视觉骨干 + 视觉形式任务信息可能就足以支撑世界-动作建模,这直接促成了 LiLa-WAM 的轻量化设计。
研究主线:从问题到结论

图 8:LiLa-WAM 研究主线——WAM 训练昂贵 → 容量浪费 → 冻结 DINOv3 轻量设计 → 单流联合预测 → VTT 免语言任务指定 → 单卡训练 → RoboTwin 90.48%(Mermaid 流程图)
基准/方法设计
LiLa-WAM 以冻结的 DINOv3-ViT-L/16 自监督视觉骨干为基础:融合第 17 与第 21 层补丁特征(保留从空间细节到高层语义的多粒度信息),经线性投影后送入 64-query 交叉注意力适配器,把密集补丁压缩为固定数量的视觉 token $\mathbf{Z}_v$($N_q=64$),潜空间大小与输入分辨率完全解耦。
核心是 Foresight-Aware Action Expert——一个 12 层 DiT(8 头、维度 768)的动作专家。每个 flow-matching 去噪步的输入是单条 token 序列 $[\mathbf{Z}a;\mathbf{Z}_q;c\tau;\mathbf{Z}v]$,其中 $\mathbf{Z}_a$ 是带噪动作块嵌入、$\mathbf{Z}_q$ 是本体感状态嵌入、$c\tau$ 是 VTT 任务 token、$\mathbf{Z}v$ 是压缩视觉上下文。动作速度从动作 token 位置读出,未来潜状态 $\hat{\mathbf{z}}{t+\Delta}$ 从观测侧读出——两个目标共享同一表征。

图 1:LiLa-WAM 总览——推理 token、VTT、本体感 token 与带噪动作 token 进入单一 DiT 流,同时读出动作速度与未来潜状态,训练时在特征空间监督、推理时丢弃解码器
分类全景

图 9:世界-动作模型谱系分类——像素空间(UniPi/VPP/Motus)、潜空间(WoG/LaWAM/Being-H0.7)与本文单流端到端 LiLa-WAM(Mermaid 流程图)
方法细节
未来状态预测(前视监督):训练时,预测的 $\hat{\mathbf{z}}{t+\Delta}$ 经 Q-Former 式轻量解码器映射回冻结 DINOv3 的特征空间,与真实未来观测 $o{t+\Delta}$ 的补丁特征做逐 token 余弦损失。无需像素解码器——未来预测成为塑造共享潜空间的辅助目标,推理时解码器直接丢弃,零额外测试开销。
训练目标:$\mathcal{L} = \mathcal{L}{\mathrm{fm}} + \lambda{\mathrm{ff}}\,\mathcal{L}{\mathrm{ff}}$,其中 flow-matching 损失 $\mathcal{L}{\mathrm{fm}}$ 回归线性插值轨迹的常速目标 $\mathbf{v}^\star = \mathbf{x}1 - \mathbf{x}_0$,$\lambda{\mathrm{ff}}=0.5$ 平衡前视损失。AdamW 优化器、batch 128、峰值学习率 $2\times10^{-4}$ 后降为 $5\times10^{-5}$,全部训练在一张 24GB 显卡完成(RTX 5090 上 50 任务联合训练约 110 GPU 小时);推理用 10 步 Euler 积分,RTX 4090 上单次仅 85 ms。
Visual Transition Token(VTT):对任务 $\tau$ 的演示集合,取每条演示首尾帧的全局嵌入差再平均:$\mathbf{u}\tau = \frac{1}{|\mathcal{E}\tau|} \sum_e (\mathbf{g}_T^e - \mathbf{g}_0^e)$。VTT 把任务编码为特征空间中的转移方向("这个任务改变了场景中的什么"),经 MLP 投影后作为任务 token 注入专家——测试时既不需要文本指令,也不需要目标图像,只需查表。

图 2:VTT 由演示首尾帧全局嵌入之差平均得到;RoboTwin 2.0 十个任务的转移嵌入按语义聚成清晰簇,证明该方向携带任务级信息
实验设计与结果
评测协议
| 平台 | 任务数 | 训练方式 | 观测 | 评估 |
|---|---|---|---|---|
| RoboTwin 2.0 | 50 | 单模型联合训练(每任务 50 clean + 500 random 演示) | 单视角 320×240 | 每任务 50 次 rollout |
| LIBERO | 40(4 套件) | 每套件独立训练 | 三视角 + 腕部 256×256 | 每任务 50 次 rollout |
| 真机 | 4 | 每任务 60 条演示 | RealSense D435 256×256 | 每任务 50 次 rollout |
动作块长度 32(执行前 16 步),未来间隔 $\Delta=32$;真机为 AgileX Piper 6-DoF 臂,30 Hz 绝对关节角控制,采用异步推理队列(剩余动作降至 8 个时后台线程触发推理回填)消除执行停顿。
RoboTwin 2.0 主结果
| 方法 | 参数 | Clean | Random |
|---|---|---|---|
| ABot-M0 | 4B | 81.20 | 80.40 |
| $\pi_0$ | 3B | 65.92 | 58.40 |
| StarVLA | 4B | 88.20 | 88.30 |
| Motus | 8B | 88.66 | 87.02 |
| GigaWorld-Policy | 5B | 86.36 | 85.04 |
| Being-H0.7 | 3B | 90.20 | 89.60 |
| LiLa-WAM(本文) | 0.5B | 90.48 | 89.04 |
Clean 设置全场第一:超越 8B Motus 1.8 分、5B GigaWorld-Policy 4.1 分,参数量分别少 16 倍与 10 倍;随机化设置与最强潜空间基线 Being-H0.7 基本持平。
LIBERO 结果
| 方法 | 参数 | Spatial | Object | Goal | Long |
|---|---|---|---|---|---|
| OpenVLA-OFT | 7B | 97.6 | 98.4 | 97.9 | 94.5 |
| StarVLA | 4B | 97.8 | 98.6 | 96.2 | 93.8 |
| $\pi_0$ | 3B | 96.8 | 98.8 | 95.8 | 85.2 |
| GR00T-N1.6 | 3.3B | 97.7 | 98.5 | 97.5 | 94.4 |
| JEPA-VLA | — | 97.2 | 98.0 | 95.6 | 94.8 |
| SmolVLA | 2B | 93.0 | 94.0 | 91.0 | 77.0 |
| EVO-1 | 0.8B | 92.7 | 97.7 | 96.3 | 92.3 |
| LiLa-WAM(本文) | 0.5B | 98.0 | 98.8 | 97.2 | 94.2 |
平均 97.1%:与 7B OpenVLA-OFT 持平(参数少约 14 倍)、超 $\pi_0$ 3.0 分;轻量阵营中超 EVO-1 2.3 分、SmolVLA 8.3 分;最难的长程 Long 套件 94.2% 与 3.3B GR00T-N1.6 持平。

图 3:RoboTwin 2.0 与 LIBERO 上成功率 vs 模型规模——LiLa-WAM 以远小于多数方法的参数量达到竞争性平均性能(RoboTwin 上为最高点)

图 4:四项真机任务的执行过程,使用随机初始摆放考验泛化能力
消融研究(10 任务子集)
| 设置 | 平均成功率 |
|---|---|
| DINOv3 + 无前视损失(纯反应式 VLA) | 54.4 |
| DINOv3 + 前视 + CLIP 语言条件 | 61.4 |
| Qwen3VL-2B 骨干 + 前视 + 语言条件 | 61.0 |
| DINOv3 + 前视 + VTT(完整模型) | 70.0 |
三个结论:前视监督值 15.6 分(70.0→54.4);VTT 比 CLIP 语言指令高 8.6 分;2.2B Qwen3VL 全骨干训练反而比 0.5B 冻结 DINOv3 方案低 9 分——更大的预训练骨干在同等训练预算下并不保证更好的控制性能。适配器 query 数 $N_q=64$ 最优(8/32/64/96 对应 66.2/65.2/70.0/67.6,训练显存 14.7→21.3 GB);DINOv3 特征层选择上,17 与 21 层组合(70.0)优于单层(第 24/23/21/17 层分别 48.0/53.2/57.4/67.2),印证中层特征保留精细操作所需的空间细节。
注意力分析与动作条件化验证
可视化显示两种 token 存在明确分工:VTT 的注意力集中在任务作用对象(风扇与目标垫、积木与锤子),动作 token 集中在机械臂与夹爪——"做什么"与"怎么动"解耦。跨去噪步动态显示动作 token 前期强依赖推理 token(上下文收集)、后期转向动作精修。动作扰动探针证明未来特征确由动作条件化:注入噪声或替换整条动作轨迹都会显著改变未来特征预测;屏蔽视觉→动作注意力通路后成功率 70.0→64.8($-$5.2 分)。

图 5:VTT 注意力落在任务对象上,动作 token 注意力落在手臂与夹爪附近,模型自发学到任务级与执行级解耦

图 6:press_stapler 任务跨 10 个去噪步的组间注意力:VTT 全程保持与视觉上下文的交互,动作 token 前期依赖推理 token 后期转向精修

图 7:真机演示集与 LIBERO-Goal 的转移嵌入 t-SNE——共享物体/场景的任务聚簇更近,VTT 保留任务语义相似度结构
真机实验
| 方法 | Button | Block | Banana | Basketball | 平均 |
|---|---|---|---|---|---|
| w/o $\mathcal{L}_{\mathrm{ff}}$ | 72 | 84 | 92 | 48 | 74.0 |
| LiLa-WAM | 86 | 90 | 96 | 56 | 82.0 |
任务为按绿色按钮 / 红块上箱 / 香蕉上粉盘 / 篮球入筐(随机初始摆放)。前视监督在真机上平均提升 8 分,最大增益出现在"按绿色按钮"($+$14 分)。
结果对比总结

图 10:结果对比总结——0.5B LiLa-WAM 在 RoboTwin 2.0(90.48% vs 8B Motus 88.66%)与 LIBERO(97.1% vs 7B OpenVLA-OFT 97.1%)上以小搏大(Mermaid 流程图)
关键发现
- 轻量世界-动作建模可行:0.5B 参数(0.2B 可训练)单流端到端模型,单卡 24GB 训练约 110 GPU 小时,RoboTwin 2.0 五十任务 Clean 成功率 90.48% 全场第一,超越 8B Motus 1.8 分。
- 前视是训练信号而非副产品:移除未来状态预测损失,十任务成功率从 70.0% 跌至 54.4%($-$15.6 分),真机从 74.0% 跌至 82.0% 之下(各任务 4–14 分增益被抹平)。
- VTT 免语言任务指定有效:比 CLIP 语言指令高 8.6 分,且测试时无需文本、无需目标图;t-SNE 显示转移嵌入按任务语义聚簇。
- 冻结骨干优于更大骨干:2.2B Qwen3VL 全骨干训练仅 61.0%,低于 0.5B 冻结 DINOv3 方案的 70.0%——容量与任务错配才是关键。
- 未来预测确由动作条件化:动作扰动探针与注意力掩码消融(70.0→64.8)双重验证。
- 创新模式定位清晰:从顶会创新模式视角看,本文同时命中 P7 制造监督信号(前视损失)、P13 条件化适配而非重训练(冻结 DINOv3)与 P6 重新表述为可解对象(VTT 把任务指定重表述为特征空间转移方向)三类模式,每项均有量化消融支撑。
- 注意力自发分工:VTT 关注任务对象、动作 token 关注机械臂,模型端到端学到"做什么/怎么动"解耦。
局限性
- 困难任务差距明显:真机"篮球入筐"仅 56%,RoboTwin 上 Hanging Mug 等长程任务落后于强基线,前视能力尚未完全转化为长程操作。
- VTT 是任务级固定向量:每任务离线一个 token,缺乏组合性,难以表达交互式/多阶段任务,且依赖演示覆盖。
- 完全免语言:无文本指令通道,无法响应用户语言指示(设计取舍,同时也是限制)。
- 依赖冻结 DINOv3 骨干:特征质量决定上限;评测限于单臂桌面操作,未覆盖移动操作、双手协同与动态场景。
常见问题(FAQ)
LiLa-WAM 与像素空间世界模型(如 Motus)的核心区别是什么?
LiLa-WAM 不合成未来图像/视频,而是在紧凑潜空间中预测未来状态,以 DINOv3 特征空间的余弦损失监督;因此无需视频生成骨干,0.5B 参数即可单卡训练,而 Motus 为 8B 参数。
VTT(Visual Transition Token)如何指定任务?
VTT 是任务演示首尾帧全局嵌入之差的平均,把任务编码为特征空间的转移方向,离线计算、测试时查表注入,无需文本指令或目标图像。
LiLa-WAM 在单张显卡上训练需要多久?
50 个 RoboTwin 2.0 任务联合训练约 110 GPU 小时(RTX 5090,24GB 显存);推理单次 85 ms(RTX 4090,10 步 Euler 积分)。
前视监督(未来状态预测)为什么重要?
消融显示移除前视损失后成功率从 70.0% 跌至 54.4%($-$15.6 分),真机从 82.0% 跌至 74.0%;动作扰动探针证明未来特征确由动作条件化,前视信号把"预见"变成可训练的监督。
论文在哪些基准上评测?
RoboTwin 2.0(50 任务,90.48%)、LIBERO(40 任务,平均 97.1%)与 4 项真机任务(平均 82.0%),并给出 query 数、特征层、注意力掩码等系统消融。
LiLa-WAM 代码开源了吗?
开源:https://github.com/teee000/LiLa-WAM,论文为 arXiv:2608.03701 预印本(2026 年 8 月发布)。
参考链接
- arXiv 论文:https://arxiv.org/abs/2608.03701
- 官方代码:https://github.com/teee000/LiLa-WAM
- WoG(潜空间 WAM):https://arxiv.org/abs/2602.22010
- LaWAM(潜空间 WAM):https://arxiv.org/abs/2606.15768
- Being-H0.7(潜空间 WAM):https://arxiv.org/abs/2605.00078
- $\pi_0$(VLA 流模型):https://arxiv.org/abs/2410.24164
- OpenVLA:https://arxiv.org/abs/2406.09246
- LIBERO 基准:https://arxiv.org/abs/2306.03351
- RoboTwin 2.0 基准:https://arxiv.org/abs/2506.18088
- DINOv2(自监督骨干):https://arxiv.org/abs/2304.07193
给大家推荐一款自用写文献综述、无虚构文献的 AI:
🌟 复旦大学 FudanNLP 团队自研 切问学术
覆盖 3.6 亿篇可溯源真实中英文文献,能自动整合文献观点生成规范综述
还能挖掘研究创新点、复现实验,配合视频教学,新手快速上手文献综述写作
🍀后记🍀
博客的关键词集中在编程、算法、机器人、人工智能、数学等等,持续高质量输出中。
🌸讨论QQ群:白拾的小屋 (750365700)
⭐B站账号:白拾的物理AI组会(活跃于知识区和动画区)
✨GitHub主页:YhbCode000(工程文件)

216

被折叠的 条评论
为什么被折叠?



