26年2月来自流形空间公司的论文"WorldScape Policy: Generalizable Robotic Learning via a Foundation World Model"。
世界模型为机器人学习提供了一条极具前景的途径,它能够直接在高维视觉空间中进行预测和规划。然而,与在语言空间中进行推理但通常难以应对分布外视觉变化的视觉-语言-动作(VLA)策略不同,将强大的生成式世界模型转化为可执行的策略仍然极具挑战性。WorldScape Policy 1.0,是一种基于世界模型的策略,它将预训练的扩散基础世界模型适配为通用机器人规划器。通过将世界模型与轻量级动作专家耦合到统一的混合Transformer(MoT)架构中,其方法克服传统两阶段逆动力学流水线中累积误差的问题。该策略在统一的流匹配目标下联合建模RGB、深度和连续动作块,并结合深度-觉察 token 条件化,以支持对接触丰富的操作进行鲁棒的3D空间推理。为了超越特定具身监督的局限,引入一个自动化的整理和标注流程,该流程将大规模的以自我为中心的人类视频转换为交错的指令-动作片段,并将其与跨具身机器人演示相结合。而且一个四阶段的训练方案进一步将预测动力学与控制相协调,并通过基于优势条件的后训练人机交互支持持续改进。在双臂物理平台上进行的大量实验表明,WorldScape Policy 对严重的分布变化具有前所未有的鲁棒性。此外,该方法展现出对未见过的任务和具身的出色少样本适应性,建立了强大的鲁棒性。
WorldScape Policy,是一种将 WorldScape 视频基础世界模型(video foundation world model)转化为通用机器人规划器的方法。与那些先预测未来状态再学习独立逆动力学模型(inverse dynamics model)的两阶段流程不同——后者往往面临误差累积和针对特定具身形态需重新调整参数的问题——WorldScape Policy 采用一种统一的 Transformer 混合(MoT)架构,通过端到端优化实现“视频-深度-动作”的联合建模。该策略在预测未来视觉轨迹的同时,对连续动作片段进行去噪,从而实现视频与动作的紧密对齐,并允许策略直接在模型的预测特征空间中进行规划。为了支持涉及丰富接触交互的 3D 感知推理,在语言/视觉推理 Token 中引入深度位置编码,并结合深度视频扩散目标进行训练,从而促使策略在时间维度上保持几何表征的一致性。
1 WorldScape 基础世界模型
采用 WorldScape 这一基础世界模型作为 WorldScape Policy的核心。WorldScape 策略是通过在多任务目标下对该基础模型进行微调而获得的,且无需修改其核心的扩散 Transformer结构。
自回归扩散架构。如图 1 所示,WorldScape 构建于一种基于自回归扩散的视频 Transformer 之上,用于执行基于动作条件的未来状态预测。给定当前的观测数据和控制输入,该模型以“分块(chunk-level)”自回归的方式生成随时间演变的未来状态。每个生成步骤都依赖于以下条件:(i) 当前观测的视觉潜表示(visual latents),(ii) 结构化控制信号,以及 (iii) 先前生成的数据块所缓存的表征。其主干网络采用一种在分块潜 Token 上应用因果注意机制(causal attention)的扩散 Transformer。所有模态均在统一的去噪框架内进行建模。

统一的交互条件化机制。该基础模型将结构化控制输入整合到扩散 Transformer 内部统一的 Token 级条件化机制中。它支持两类交互信号:由相机轨迹参数表示的移动控制(locomotion control),以及由关节姿态序列表示的操作控制(manipulation control)。移动控制信号采用逐帧 Plücker 嵌入(Plücker embeddings)P_i 进行参数化,并由轻量级卷积适配器(convolutional adapter)进行处理;由此产生的空间对齐控制特征通过残差加法注入到 Transformer 的隐状态中。操作控制信号则表示为转换为控制视频的姿态序列;在去噪之前,该控制视频在通道维度上与视觉潜表示进行拼接,从而允许在同一扩散步骤内联合处理感知信号与动作信号。在每个 World-Action DiT 模块内部,图像、深度和动作的潜表示被视为独立的 Token 流。这些 Token 通过共享的联合注意模块(joint-attention module)进行交互,从而显式地建模跨模态依赖关系。自适应层归一化(AdaLN)根据时间嵌入和控制嵌入对 Transformer 层进行条件化处理,确保动作信号在不同去噪阶段的整合保持一致。因此,移动控制和操作控制均在 Token 层面于同一个扩散主干网络内进行建模,而无需引入特定于模态的分支结构。在预训练阶段,Transformer 学习控制 Token 与视觉状态 Token 之间的联合分布,从而在潜空间中建立共享的视频-动作表征。这种经学习获得的视频-动作对应关系在微调过程中得以保留,并在将模型扩展至 WorldScape Policy 以预测机器人动作片段时,提供一个经初始化的、以动作为条件的生成先验。
3D 空间一致性训练。为了在训练中引入几何约束,采用一种具备空间-觉察能力的多任务目标,该目标结合了扩散监督与 3D 一致性正则化。令 z_t 表示时间步 t 处的带噪潜变量,v_theta(z_t, t) 表示预测的速度场。为了强制实现三维一致性,利用去噪后的潜变量 zˆ_0 在 K 个相机视点下重建深度和 RGB 信号。
分层记忆机制。WorldScape 通过嵌入在自回归 Transformer 中的分层 KV 缓存设计,维持长时程的一致性。在每个去噪步骤 t,注意上下文由三个记忆分区构成:存储持久场景 Token 的锚点记忆(anchor memory)、保留选定历史状态的全局记忆池,以及保存近期时间上下文的局部窗口。每个缓存条目均由其关联的相机位姿(由朝向和平移参数表示)进行索引。记忆检索过程采用一种几何感知相似度评分方法,该方法结合当前查询位姿与候选记忆位姿之间的方向对齐度及空间邻近度。在跨 Token 注意计算期间,仅针对具有高几何相关性的条目进行注意分配。为控制冗余,系统利用基于相似度的门控准则,将新生成的 KV 条目与全局记忆池中的内容进行评估比对。若某条目可由现有记忆高精度重构,则将其丢弃;反之,若代表新视角,则在满足固定容量限制的前提下将其插入全局记忆池。当记忆占用超出预算时,系统会执行旨在保持多样性的剪枝操作。该操作基于位姿空间中的分布离散度来选择条目子集,从而促进对平移和旋转维度的覆盖。这种分层记忆结构使模型既能在重访区域保持空间连续性,又能确保在长时程自回归推演过程中缓存规模保持在有限范围内。
对 WorldScape 策略的适配。WorldScape 策略是通过对该基础模型进行微调获得的,其训练目标涵盖未来状态预测与动作预测。该策略保留原有的扩散 Transformer 主干网络、交互条件设定方案、3D 空间一致性训练范式以及分层记忆机制。因此,该策略不仅继承基础模型的生成动力学特性与几何归纳偏置,还将模型能力扩展到了世界-动作(world-action)建模领域。
2 架构
如图2所示,采用一个遵循MoT(Mixture-of-Transformers,即Transformer混合)架构的统一框架,旨在实现多任务目标下的“视频-深度-动作”联合扩散训练。具体而言,首先利用现成的3D基础模型(如VGGT [35])根据当前观测推断相应的深度线索。随后,WorldScape策略通过预训练的世界VAE编码器和额外的动作编码器,将多模态输入转换为潜空间表示;这些表示随后由一系列World-Action DiT模块处理,在VLM token和文本嵌入等多种条件的引导下,实现不同token流之间的联合交互。

此外,为了赋予推理条件深度觉察能力,通过逐位置深度编码器和逐元素相加操作,将位置深度嵌入 [36–38] 注入到VLM token中(如图3所示)。

与此同时,机器人的本体感知序列(具体包括初始状态和带噪动作片段)被输入到动作专家模块中进行动作去噪。在视觉生成和连续动作建模中均采用Flow Matching(流匹配)技术,这有助于实现全面的机器人控制,确保在复杂任务和多样化具身形态下均能进行高精度执行。世界-动作联合注意力层遵循图4所示的注意掩码模式。最后,去噪后的多模态潜表示被解码为结构化输出,用于未来状态预测和机器人规划。

为了验证具身世界模型作为机器人规划器的通用性,WorldScape策略通过跨模态“世界-动作联合注意”机制,结合了三个基于Transformer的专家模块以应对不同用途。在推理方面,利用现成大语言模型(如Qwen3-VL-2B [40] 和 PaliGemma-2B [41])的能力。WorldScape基础模型构建于Wan2.1-1.3B主干网络之上,而动作专家模块则采用由若干DiT模块组成的轻量化结构。
为了构建稳健的 WorldScape Policy 模型,整理一个大规模数据集,其中涵盖各种以人为中心的活动以及多具身(multi-embodiment)机器人演示,并附带丰富的上下文注释和动作标签。其方法旨在通过利用来自不同来源、涵盖广泛活动的异构数据混合体,实现任务和具身层面的泛化。该策略的核心在于:将各种原始、非结构化的以人为中心(egocentric)的视频转换为包含详细上下文和动作注释的结构化统一格式,同时辅以跨具身机器人数据,以确保广泛的任务覆盖范围和针对特定目标的精确性。总计收集并整理了 13,400 小时的人类及跨具身视频,用于 WorldScape Policy 模型的训练。
1 数据构成
如图 5 所示,为 WorldScape Policy 训练构建一个具身数据金字塔,该金字塔包含三个层级的数据,其数量和质量各异,以适配不同的训练阶段。这种金字塔结构体现了我们的训练策略:第 1 层(基础层)包含海量的多样化以人为中心的人类数据,用于基础世界模型的预训练;第 2 层(中间层)纳入了跨具身机器人演示数据,用于通用动作表征学习;第 3 层(顶层)由高质量的目标机器人遥操作数据组成,用于针对特定具身的微调。数据源自三个主要领域,以确保任务和平台的多样性。

2 面向交错动作人类数据的处理流水线
利用人类视频训练 WorldScape 模型时,主要挑战在于缺乏统一的动作标签和结构化的上下文标注。通过一条自动化处理流水线来应对这一挑战,将原始的第一人称视角(egocentric)视频转换为包含动作轨迹标注和交错上下文描述的结构化数据,如图 6 所示。

WorldScape 策略通过四个结构化阶段进行训练,旨在将来自多样化数据集的物理交互先验逐步整合,从而形成可迁移至目标机器人的策略。
阶段 1:世界模型预训练
第一阶段训练 WorldScape 基础模型,以学习受动作条件约束的视觉动力学。该模型基于预训练的视频扩散主干网络进行初始化,并针对在结构化控制输入下的未来视觉状态预测进行优化。利用视频-轨迹对,模型在闭环生成设置下对运动信号驱动的、依赖于视角的狀態转换进行建模。为了将几何结构融入所学的动力学中,模型通过空间一致性损失,将多视图深度监督与扩散目标进行联合优化。此外,模型通过基于 LoRA 的微调适应操作信号,将关节姿态条件整合到同一扩散框架中。由此生成的 WorldScape 基础模型构成了后续策略适配的视觉动力学基础。
阶段 2:统一世界模型动作预训练
第二阶段旨在学习一种基于预测性视觉动力学的通用动作表征。为了将物理先验转化为有效的机器人控制,在精选的视频-动作轨迹数据集上对整个 WorldScape 策略进行联合预训练。该数据集包含从第一人称视角(egocentric)人类视频和跨形态机器人演示中提取的标注手部轨迹,从而在视觉状态转换与连续动作空间之间建立稳健的对齐关系。
阶段 3:统一世界模型动作微调
该阶段将通用动作先验适配到目标机器人的特定运动学特性和控制频率上。在进行设备端部署之前,专门利用从目标形态机器人采集的高质量、特定任务的遥操作数据对 WorldScape 策略进行微调,以确保精确执行及针对特定形态的结构对齐。
阶段 4:优势条件(Advantage-Conditioned)训练
为了持续提升策略在实际运行中的表现及应对现实世界分布偏移的鲁棒性,引入一个额外的训练后阶段,采用“人在回路”(HITL)的学习范式(如图 7 所示)。这一过程通过 DAgger [58] 算法进行迭代式策略在线(on-policy)数据采集,并结合实时价值预测来实现。这种闭环交互促进基于优势条件的策略优化,使模型能够有效纠正执行错误并完善其长程规划能力。

1 基线与设置
评估两种用于机器人操作的主流策略:基于 VLA(视觉-语言-动作)的策略和基于视频的策略。
基于 VLA 的策略。将方法与几种最先进的视觉-语言-动作 (VLA) 模型进行了比较。𝜋0.5 [59] 是一种基于流匹配 (flow-matching) 的 VLA 模型,可直接输出连续动作。X-VLA [60] 是一种基于大型视觉-语言模型构建并采用软提示 (soft prompts) 技术的开源 VLA 模型,展现出强大的泛化能力。GigaBrain-0 [61] 是一种在大规模机器人数据集上训练而成的通用操作 VLA 模型。
基于视频的策略。还与近期利用视频生成进行机器人规划的基于视频的策略进行了比较。Motus [21] 是一种具有代表性的基于视频的策略,它通过学习同时预测未来的视频帧和动作,从而实现强大的时空推理能力。
2 实现细节
各阶段的训练细节。采用多阶段训练策略,逐步赋予模型世界知识与动作能力。在阶段 1(世界模型预训练)中,用 AdamW 优化器训练视觉动力学模型,学习率设为 1 × 10⁻⁴,批大小(batch size)为 48×10。该模型基于视觉观测预测未来帧,训练数据源自大规模人类第一人称视角视频。在阶段 2(统一世界模型动作预训练)中,引入动作专家,并联合训练视频分支与动作分支。此时学习率为 5 × 10⁻⁵,批大小为 32×10,训练数据混合人类视频-动作轨迹与跨具身(cross-embodiment)机器人数据。平衡视频与动作目标的损失权重,以确保联合训练的稳定性。在阶段 3(统一世界模型动作微调)中,利用目标机器人数据对整个策略进行微调。学习率降至 1 × 10⁻⁵,批大小设为 48。该阶段侧重于将通用动作先验适配到目标具身特定的运动学特性与控制频率上。在阶段 4(优势条件化训练)中,结合 DAgger [58] 与优势条件化优化(advantage-conditioned optimization)进行在线策略(on-policy)微调。收集在线交互数据并以 5 × 10⁻⁶ 的学习率更新策略,使模型能够纠正自身的执行错误,并提升在真实场景中的鲁棒性。
动作表示。采用关节角度与末端执行器 6D 位姿相结合的形式来表示动作。策略通过预测基于末端位姿的动作片段(action chunk)来系统地控制机械臂。
3 真实环境中的评估
真实世界任务设置。在双臂 PIPER 平台上评估 WorldScape 策略,涵盖 7 项长时程灵巧操作任务:从篮中取衬衫、展平衬衫、折叠衬衫、从饮水机取水、倒水、清理桌上垃圾以及擦净桌面。这些任务需要在非结构化环境中进行复杂的时空推理、精确的双臂协同以及稳健的物理交互。

352

被折叠的 条评论
为什么被折叠?



