【arXiv 2026】LiLa-WAM 论文解读:轻量潜空间世界-动作模型,单卡训练 90.48%|从具身智能轻量部署视角

摘要

本文解读 arXiv 2026 论文《LiLa-WAM: Lightweight Latent Reasoning World-Action Model for Robotic Manipulation》。该论文提出 LiLa-WAM 轻量潜空间世界-动作模型,通过融合未来状态预测动作生成视觉转移 token(VTT)免语言任务指定,在紧凑潜空间中单流端到端联合推理,其特别之处在于仅 0.5B 参数即可在单张 24GB 显卡上训练。实验表明RoboTwin 2.0 五十任务平均成功率 90.48%(Clean 第一),LIBERO 平均 97.1% 追平 7B OpenVLA-OFT,真机平均 82.0%,为资源受限条件下的机器人世界模型研究提供了重要借鉴。

视频讲解点击观看 B 站视频

论文基本信息

项目内容
标题(英文)LiLa-WAM: Lightweight Latent Reasoning World-Action Model for Robotic Manipulation
标题(中文)轻量潜空间推理世界-动作模型 LiLa-WAM
作者Fan Yang, Yuting Su, Xiaobo Wang, Yuncheng You, Fugui Fan, Yuting Wu, Minghui Wu, Chenxu Zhao, Jiahong Ning, Peiguang Jing
机构天津大学 · 深圳理工大学 · 明略科技 · 自然资源部信息中心 · 深信服
会议arXiv 2026(2026 年 8 月预印本)
arXivhttps://arxiv.org/abs/2608.03701
代码https://github.com/teee000/LiLa-WAM

背景与动机

世界-动作模型(World-Action Model, WAM)是机器人操作领域的新范式:策略不仅要根据当前观测生成动作,还要显式预测场景在干预下如何演化,这种"预见能力"被认为有助于鲁棒控制。但现有 WAM 普遍训练昂贵,阻碍了中等算力实验室的复现与使用。

像素空间方法(UniPi、VPP、WorldVLA、UVA、Motus、GigaWorld-Policy)显式合成未来图像/视频,大量模型容量被花在纹理、光照、背景等与控制无关的细节上,训练与推理开销巨大——Motus 8B、GigaWorld-Policy 5B,视频生成骨干(如 WAN)的适配成本远超单卡预算。潜空间方法(WoG、LaWAM、Being-H0.7)避免了像素合成,但常需多阶段训练:先单独训练预测组件再与策略耦合(WoG、LaWAM),或依赖额外对齐损失防止特征坍缩(Being-H0.7)。

更深层的问题是骨干错配:VLM 骨干的大量参数服务于语言建模,视频生成骨干服务于像素级动态,都不是精细操作真正需要的线索。作者因此提出核心观察——一个紧凑、富含细粒度空间细节的视觉骨干 + 视觉形式任务信息可能就足以支撑世界-动作建模,这直接促成了 LiLa-WAM 的轻量化设计。

研究主线:从问题到结论

LiLa-WAM 研究主线流程图:从世界-动作模型训练昂贵问题到单卡可训结论

图 8:LiLa-WAM 研究主线——WAM 训练昂贵 → 容量浪费 → 冻结 DINOv3 轻量设计 → 单流联合预测 → VTT 免语言任务指定 → 单卡训练 → RoboTwin 90.48%(Mermaid 流程图)

基准/方法设计

LiLa-WAM 以冻结的 DINOv3-ViT-L/16 自监督视觉骨干为基础:融合第 17 与第 21 层补丁特征(保留从空间细节到高层语义的多粒度信息),经线性投影后送入 64-query 交叉注意力适配器,把密集补丁压缩为固定数量的视觉 token $\mathbf{Z}_v$($N_q=64$),潜空间大小与输入分辨率完全解耦。

核心是 Foresight-Aware Action Expert——一个 12 层 DiT(8 头、维度 768)的动作专家。每个 flow-matching 去噪步的输入是单条 token 序列 $[\mathbf{Z}a;\mathbf{Z}_q;c\tau;\mathbf{Z}v]$,其中 $\mathbf{Z}_a$ 是带噪动作块嵌入、$\mathbf{Z}_q$ 是本体感状态嵌入、$c\tau$ 是 VTT 任务 token、$\mathbf{Z}v$ 是压缩视觉上下文。动作速度从动作 token 位置读出,未来潜状态 $\hat{\mathbf{z}}{t+\Delta}$ 从观测侧读出——两个目标共享同一表征

LiLa-WAM 轻量世界-动作模型整体框架:单流联合预测未来状态与动作

图 1:LiLa-WAM 总览——推理 token、VTT、本体感 token 与带噪动作 token 进入单一 DiT 流,同时读出动作速度与未来潜状态,训练时在特征空间监督、推理时丢弃解码器

分类全景

世界-动作模型分类树:像素空间、潜空间与本文单流端到端方法

图 9:世界-动作模型谱系分类——像素空间(UniPi/VPP/Motus)、潜空间(WoG/LaWAM/Being-H0.7)与本文单流端到端 LiLa-WAM(Mermaid 流程图)

方法细节

未来状态预测(前视监督):训练时,预测的 $\hat{\mathbf{z}}{t+\Delta}$ 经 Q-Former 式轻量解码器映射回冻结 DINOv3 的特征空间,与真实未来观测 $o{t+\Delta}$ 的补丁特征做逐 token 余弦损失。无需像素解码器——未来预测成为塑造共享潜空间的辅助目标,推理时解码器直接丢弃,零额外测试开销。

训练目标:$\mathcal{L} = \mathcal{L}{\mathrm{fm}} + \lambda{\mathrm{ff}}\,\mathcal{L}{\mathrm{ff}}$,其中 flow-matching 损失 $\mathcal{L}{\mathrm{fm}}$ 回归线性插值轨迹的常速目标 $\mathbf{v}^\star = \mathbf{x}1 - \mathbf{x}_0$,$\lambda{\mathrm{ff}}=0.5$ 平衡前视损失。AdamW 优化器、batch 128、峰值学习率 $2\times10^{-4}$ 后降为 $5\times10^{-5}$,全部训练在一张 24GB 显卡完成(RTX 5090 上 50 任务联合训练约 110 GPU 小时);推理用 10 步 Euler 积分,RTX 4090 上单次仅 85 ms。

Visual Transition Token(VTT):对任务 $\tau$ 的演示集合,取每条演示首尾帧的全局嵌入差再平均:$\mathbf{u}\tau = \frac{1}{|\mathcal{E}\tau|} \sum_e (\mathbf{g}_T^e - \mathbf{g}_0^e)$。VTT 把任务编码为特征空间中的转移方向("这个任务改变了场景中的什么"),经 MLP 投影后作为任务 token 注入专家——测试时既不需要文本指令,也不需要目标图像,只需查表。

LiLa-WAM 的 VTT 视觉转移 token 构造与 t-SNE 聚类可视化

图 2:VTT 由演示首尾帧全局嵌入之差平均得到;RoboTwin 2.0 十个任务的转移嵌入按语义聚成清晰簇,证明该方向携带任务级信息

实验设计与结果

评测协议

平台任务数训练方式观测评估
RoboTwin 2.050单模型联合训练(每任务 50 clean + 500 random 演示)单视角 320×240每任务 50 次 rollout
LIBERO40(4 套件)每套件独立训练三视角 + 腕部 256×256每任务 50 次 rollout
真机4每任务 60 条演示RealSense D435 256×256每任务 50 次 rollout

动作块长度 32(执行前 16 步),未来间隔 $\Delta=32$;真机为 AgileX Piper 6-DoF 臂,30 Hz 绝对关节角控制,采用异步推理队列(剩余动作降至 8 个时后台线程触发推理回填)消除执行停顿。

RoboTwin 2.0 主结果

方法参数CleanRandom
ABot-M04B81.2080.40
$\pi_0$3B65.9258.40
StarVLA4B88.2088.30
Motus8B88.6687.02
GigaWorld-Policy5B86.3685.04
Being-H0.73B90.2089.60
LiLa-WAM(本文)0.5B90.4889.04

Clean 设置全场第一:超越 8B Motus 1.8 分、5B GigaWorld-Policy 4.1 分,参数量分别少 16 倍与 10 倍;随机化设置与最强潜空间基线 Being-H0.7 基本持平。

LIBERO 结果

方法参数SpatialObjectGoalLong
OpenVLA-OFT7B97.698.497.994.5
StarVLA4B97.898.696.293.8
$\pi_0$3B96.898.895.885.2
GR00T-N1.63.3B97.798.597.594.4
JEPA-VLA97.298.095.694.8
SmolVLA2B93.094.091.077.0
EVO-10.8B92.797.796.392.3
LiLa-WAM(本文)0.5B98.098.897.294.2

平均 97.1%:与 7B OpenVLA-OFT 持平(参数少约 14 倍)、超 $\pi_0$ 3.0 分;轻量阵营中超 EVO-1 2.3 分、SmolVLA 8.3 分;最难的长程 Long 套件 94.2% 与 3.3B GR00T-N1.6 持平。

LiLa-WAM 与各方法成功率-参数量对比散点图

图 3:RoboTwin 2.0 与 LIBERO 上成功率 vs 模型规模——LiLa-WAM 以远小于多数方法的参数量达到竞争性平均性能(RoboTwin 上为最高点)

LiLa-WAM 真机四任务执行过程(AgileX Piper + RealSense D435)

图 4:四项真机任务的执行过程,使用随机初始摆放考验泛化能力

消融研究(10 任务子集)

设置平均成功率
DINOv3 + 无前视损失(纯反应式 VLA)54.4
DINOv3 + 前视 + CLIP 语言条件61.4
Qwen3VL-2B 骨干 + 前视 + 语言条件61.0
DINOv3 + 前视 + VTT(完整模型)70.0

三个结论:前视监督值 15.6 分(70.0→54.4);VTT 比 CLIP 语言指令高 8.6 分2.2B Qwen3VL 全骨干训练反而比 0.5B 冻结 DINOv3 方案低 9 分——更大的预训练骨干在同等训练预算下并不保证更好的控制性能。适配器 query 数 $N_q=64$ 最优(8/32/64/96 对应 66.2/65.2/70.0/67.6,训练显存 14.7→21.3 GB);DINOv3 特征层选择上,17 与 21 层组合(70.0)优于单层(第 24/23/21/17 层分别 48.0/53.2/57.4/67.2),印证中层特征保留精细操作所需的空间细节。

注意力分析与动作条件化验证

可视化显示两种 token 存在明确分工:VTT 的注意力集中在任务作用对象(风扇与目标垫、积木与锤子),动作 token 集中在机械臂与夹爪——"做什么"与"怎么动"解耦。跨去噪步动态显示动作 token 前期强依赖推理 token(上下文收集)、后期转向动作精修。动作扰动探针证明未来特征确由动作条件化:注入噪声或替换整条动作轨迹都会显著改变未来特征预测;屏蔽视觉→动作注意力通路后成功率 70.0→64.8($-$5.2 分)。

LiLa-WAM 的 VTT 与动作 token 注意力可视化对比

图 5:VTT 注意力落在任务对象上,动作 token 注意力落在手臂与夹爪附近,模型自发学到任务级与执行级解耦

LiLa-WAM 跨去噪步的组间注意力动态曲线

图 6:press_stapler 任务跨 10 个去噪步的组间注意力:VTT 全程保持与视觉上下文的交互,动作 token 前期依赖推理 token 后期转向精修

LiLa-WAM 真机与 LIBERO 演示集的视觉转移嵌入 t-SNE

图 7:真机演示集与 LIBERO-Goal 的转移嵌入 t-SNE——共享物体/场景的任务聚簇更近,VTT 保留任务语义相似度结构

真机实验

方法ButtonBlockBananaBasketball平均
w/o $\mathcal{L}_{\mathrm{ff}}$7284924874.0
LiLa-WAM8690965682.0

任务为按绿色按钮 / 红块上箱 / 香蕉上粉盘 / 篮球入筐(随机初始摆放)。前视监督在真机上平均提升 8 分,最大增益出现在"按绿色按钮"($+$14 分)。

结果对比总结

LiLa-WAM 结果对比总结图:0.5B 参数击败 8B Motus 等大模型

图 10:结果对比总结——0.5B LiLa-WAM 在 RoboTwin 2.0(90.48% vs 8B Motus 88.66%)与 LIBERO(97.1% vs 7B OpenVLA-OFT 97.1%)上以小搏大(Mermaid 流程图)

关键发现

  • 轻量世界-动作建模可行:0.5B 参数(0.2B 可训练)单流端到端模型,单卡 24GB 训练约 110 GPU 小时,RoboTwin 2.0 五十任务 Clean 成功率 90.48% 全场第一,超越 8B Motus 1.8 分。
  • 前视是训练信号而非副产品:移除未来状态预测损失,十任务成功率从 70.0% 跌至 54.4%($-$15.6 分),真机从 74.0% 跌至 82.0% 之下(各任务 4–14 分增益被抹平)。
  • VTT 免语言任务指定有效:比 CLIP 语言指令高 8.6 分,且测试时无需文本、无需目标图;t-SNE 显示转移嵌入按任务语义聚簇。
  • 冻结骨干优于更大骨干:2.2B Qwen3VL 全骨干训练仅 61.0%,低于 0.5B 冻结 DINOv3 方案的 70.0%——容量与任务错配才是关键。
  • 未来预测确由动作条件化:动作扰动探针与注意力掩码消融(70.0→64.8)双重验证。
  • 创新模式定位清晰:从顶会创新模式视角看,本文同时命中 P7 制造监督信号(前视损失)、P13 条件化适配而非重训练(冻结 DINOv3)与 P6 重新表述为可解对象(VTT 把任务指定重表述为特征空间转移方向)三类模式,每项均有量化消融支撑。
  • 注意力自发分工:VTT 关注任务对象、动作 token 关注机械臂,模型端到端学到"做什么/怎么动"解耦。

局限性

  • 困难任务差距明显:真机"篮球入筐"仅 56%,RoboTwin 上 Hanging Mug 等长程任务落后于强基线,前视能力尚未完全转化为长程操作。
  • VTT 是任务级固定向量:每任务离线一个 token,缺乏组合性,难以表达交互式/多阶段任务,且依赖演示覆盖。
  • 完全免语言:无文本指令通道,无法响应用户语言指示(设计取舍,同时也是限制)。
  • 依赖冻结 DINOv3 骨干:特征质量决定上限;评测限于单臂桌面操作,未覆盖移动操作、双手协同与动态场景。

常见问题(FAQ)

LiLa-WAM 与像素空间世界模型(如 Motus)的核心区别是什么?

LiLa-WAM 不合成未来图像/视频,而是在紧凑潜空间中预测未来状态,以 DINOv3 特征空间的余弦损失监督;因此无需视频生成骨干,0.5B 参数即可单卡训练,而 Motus 为 8B 参数。

VTT(Visual Transition Token)如何指定任务?

VTT 是任务演示首尾帧全局嵌入之差的平均,把任务编码为特征空间的转移方向,离线计算、测试时查表注入,无需文本指令或目标图像。

LiLa-WAM 在单张显卡上训练需要多久?

50 个 RoboTwin 2.0 任务联合训练约 110 GPU 小时(RTX 5090,24GB 显存);推理单次 85 ms(RTX 4090,10 步 Euler 积分)。

前视监督(未来状态预测)为什么重要?

消融显示移除前视损失后成功率从 70.0% 跌至 54.4%($-$15.6 分),真机从 82.0% 跌至 74.0%;动作扰动探针证明未来特征确由动作条件化,前视信号把"预见"变成可训练的监督。

论文在哪些基准上评测?

RoboTwin 2.0(50 任务,90.48%)、LIBERO(40 任务,平均 97.1%)与 4 项真机任务(平均 82.0%),并给出 query 数、特征层、注意力掩码等系统消融。

LiLa-WAM 代码开源了吗?

开源:https://github.com/teee000/LiLa-WAM,论文为 arXiv:2608.03701 预印本(2026 年 8 月发布)。

参考链接

  • arXiv 论文:https://arxiv.org/abs/2608.03701
  • 官方代码:https://github.com/teee000/LiLa-WAM
  • WoG(潜空间 WAM):https://arxiv.org/abs/2602.22010
  • LaWAM(潜空间 WAM):https://arxiv.org/abs/2606.15768
  • Being-H0.7(潜空间 WAM):https://arxiv.org/abs/2605.00078
  • $\pi_0$(VLA 流模型):https://arxiv.org/abs/2410.24164
  • OpenVLA:https://arxiv.org/abs/2406.09246
  • LIBERO 基准:https://arxiv.org/abs/2306.03351
  • RoboTwin 2.0 基准:https://arxiv.org/abs/2506.18088
  • DINOv2(自监督骨干):https://arxiv.org/abs/2304.07193

给大家推荐一款自用写文献综述、无虚构文献的 AI:

🌟 复旦大学 FudanNLP 团队自研 切问学术

官网:qiewenpaper.com

覆盖 3.6 亿篇可溯源真实中英文文献,能自动整合文献观点生成规范综述

还能挖掘研究创新点、复现实验,配合视频教学,新手快速上手文献综述写作


🍀后记🍀

博客的关键词集中在编程、算法、机器人、人工智能、数学等等,持续高质量输出中。

🌸讨论QQ群白拾的小屋 (750365700)

⭐B站账号白拾的物理AI组会(活跃于知识区和动画区)

✨GitHub主页YhbCode000(工程文件)

评论
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包

打赏作者

白拾ShiroX

你的鼓励将是我创作的最大动力

¥1 ¥2 ¥4 ¥6 ¥10 ¥20
扫码支付:¥1
获取中
扫码支付

您的余额不足,请更换扫码支付或充值

打赏作者

实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值