26年7月来自清华、Striding AI公司、普渡、中科院自动化所、无问芯穹公司、港科大和中关村学院的论文“Harness VLA: Steering Frozen VLAs into Reliable Manipulation Primitives via Memory-Guided Agents”。
基于语言指令的操作任务既需要精确且涉及丰富接触交互的控制能力,也需要针对语言、场景及长程任务序列的鲁棒推理能力。端到端视觉-语言-动作(VLA)模型虽具备强大的局部视觉运动控制技能,但其训练依赖于特定分布的任务轨迹,在面对语义重定向、目标重绑定、空间布局偏移及局部接触不稳定等部署扰动时,性能往往会显著下降。大语言模型(LLM)驱动的智体虽能提供互补的语义与组合推理能力,但纯粹基于解析式方法的原语在处理不规则抓取、受限放置及与铰接体交互等任务时往往力不从心。为此,提出 Harness VLA 这一记忆增强型智体框架:该框架将冻结参数的 VLA 视为一种可重试的、支持丰富接触交互的原语,并将其与一组小型固定解析式原语(涵盖语义定位、预备动作、搬运、导航及释放等功能)进行组合。
Harness VLA 并不盲目扩充技能库,而是通过学习特定任务的执行轨迹、全局成功规则及失败模型,来掌握这些固定原语的适用操作范围。通过将语义重定位、非接触式执行及 VLA 预备动作调整等任务交由规划器处理,同时仅在涉及丰富接触交互的局部阶段调用冻结参数的 VLA,Harness VLA 实现在无需微调的情况下,将预训练 VLA 的应用范围扩展至原始轨迹分布之外。在桌面操作、家庭厨房场景及从整洁到随机布局的双臂操作等受扰动测试中,Harness VLA 表现优异:在 LIBERO-Pro 和 RoboCasa365 基准测试中,其性能较最强基线分别提升 38.6 和 25.4 个百分点;在 RoboTwin C2R 测试中,成功率达到 58.4%。
如图 1所示Harness VLA 概述:

基于程序与工具使用的机器人智体
“代码即策略”(Code-as-policies)类系统将机器人控制重新定义为程序合成问题:模型编写可执行程序来协调感知与运动API,既利用大语言模型(LLM)的组合泛化能力,又保持底层控制的确定性。继 Code-as-Policies [8]、ProgPrompt [9]、Instruct2Act [60] 和 ChatGPT-for-Robotics [61] 之后,这一范式已扩展至多模态程序合成(如 RoboCodeX [62]、ViperGPT [63]、VisProg [10])、3D价值图生成 [64]、VLM监督下的装配任务 [65] 以及长程智体框架 [11, 66]。Harness VLA同样致力于通过显式的感知与控制接口将语言模型的推理转化为可执行操作,但在动作表示上有所不同:智体规划器并不合成可执行代码或新的控制程序。相反,它在一个闭环“驾驭”(harness)内输出结构化的 JSON 原语调用,在每个原语执行后观察结果,并根据当前的 RGB-D 观测数据和记忆信息重新绑定下一个原语的参数。
近期研究还探讨智体如何构建可复用的技能库:例如,ASPIRE [67] 利用细粒度的执行轨迹来诊断故障并合成经由验证的修复方案,进而将由此产生的定位、导航、运动、抓取及调试模式纳入不断扩展的技能库中。这一研究方向与本文工作互补:ASPIRE 侧重于扩展智体的可复用技能,而 Harness VLA 则有意保持原语词汇表固定不变,重点研究如何利用记忆引导的组合方式,在无需于部署阶段扩展原语的前提下,对固定的 VLA 模型进行功能扩展。
另一类相关研究借鉴软件工程领域的智体技术:经验表明,可执行代码是 LLM 智体的一种强有力的动作表示形式 [14],而 SWE-agent [15] 和 OpenHands [16] 等系统则针对迭代式编辑、执行与反馈流程建立规范化的控制框架。借鉴其中的框架原则——即结构化接口、持久化状态、执行反馈及记忆机制——但并未沿用“必须将动作表示为代码”这一特定要求。通过自校正机制 [68–70] 和跨步骤保持的持久化符号状态 [71],系统的可靠性得到进一步提升;与此同时,基于大语言模型(LLM)的规划器 [72–79] 也展示 LLM 能够编排预训练的原语或模块、将指令映射至 3D 场景并从失败中恢复的能力。
然而,现有文献中反复出现两个局限性。首先,针对特定任务的执行轨迹很少被转化为可复用的参数化记忆,从而无法在新的空间布局下重新应用。其次,关于失败的经验教训很少被提炼并存入“全局记忆”(Global Memory)中,导致规划器无法避免重复出现已知的无效抓取、虚假成功或不稳定的过渡动作选择。Voyager [18] 的研究表明,持久化记忆能提升数字沙盒中具身智体的性能,但这种以记忆为中心的设计尚未与支持物理操作、且具备丰富接触交互能力的 VLA原语相结合。
本文框架将两者进行有机结合:利用冻结参数的 VLA 作为处理复杂接触交互的专家模块,并通过统一的原语接口进行调用;成功的原语序列被存储在“任务特定记忆”中;而可复用的成功规则与失败模型则被提炼并存入“全局记忆”中。这两项设计决策——即利用 VLA 处理接触密集型操作,并对其他任务采用记忆增强的原语组合方式——使得单一的、由记忆驱动的智能规划器能够应对特定环境下的全套任务分布。这其中包括各种改写表述或重新指定目标的自然语言指令,而这些指令往往能难倒那些语言处理能力仅具雏形(即语言通道功能退化)的端到端 VLA 模型 [2, 4]。
机器人操作领域的一个长期目标是构建一个能够可靠执行自由形式自然语言指令的系统,以适应不断变化的物体、布局和机器人形态。目前,两种主流范式正从截然不同的方向向这一目标迈进。端到端视觉-语言-动作(VLA)模型直接从机器人轨迹中学习涉及丰富接触交互的视觉运动控制;而基于大语言模型(LLM)的编程智体则利用语言模型的推理能力,组合显式的感知与控制 API。这两种范式各具优势,但也都在不恰当的组件上赋予过重的负担:整体式 VLA 必须在单一策略内同时处理语言语义落地(grounding)、长程任务组合及底层控制;而编程智体则不得不通过人工设计或智体生成的 API 来实现物理上精细的交互操作。如图 2 展示解决方案:利用解析式原语(analytic primitives)来应对部署时的环境扰动,仅在局部接触密集区域(即 VLA 训练分布具有高信息量的区域)调用 VLA。

端到端 VLA 模型发展迅速,已从通用的机器人策略 [1, 2] 演进为流匹配(flow-matching)和动作推理架构 [3–6]。其优势在于处理局部的、基于图像输入的接触任务,例如抓取不规则物体、高精度放置,或操作那些对解析式控制器而言过于脆弱的机械装置。其局限性在于难以应对超出训练轨迹分布的部署场景。一个在特定任务轨迹分布上训练出的模型,虽能掌握抓取牛奶盒或转动水龙头的技能,但在语义目标变更、目标谓词重定义、物体布局改变,或需将短时技能组合成更长程的操作序列时,往往会失效。在这些部署扰动下,即便指令或场景关联已发生变化,策略仍可能重复训练期间熟悉的行为 [2, 4, 7];此外,单次不稳定的接触失败也可能导致整个整体式执行过程彻底失败。
基于 LLM 的编程智体及其驾驭(harness)提供互补的语义理解与组合推理能力。诸如“Code as Policies(CaP)”和“ProgPrompt”之类的系统,利用精选的感知与控制 API 组合生成可执行程序 [8, 9];而近期的多模态或智体变体则进一步扩展这一理念,引入更丰富的感知能力、工具使用、反馈机制以及持久化的执行状态 [10–13]。从更广泛的角度来看,“编码智体驾驭”(coding-agent harness)将模型输出封装在一个包含工具接口、记忆机制、验证器、执行循环及反馈通道的结构化运行时环境中;这使得智体能够修正决策、将成功的操作轨迹或失败诊断写入记忆,并在统一的控制界面下协调各种异构工具 [14–17]。然而,在机器人操作领域,扩展此类系统往往意味着扩充“原语”(primitive)或技能库;相比之下,纯粹的解析式原语——例如逆运动学(IK)移动、手腕旋转、基座运动、夹爪开合与释放等确定性运动学或基于模型的控制器——往往难以应对不规则抓取、受限放置以及关节物体操作等复杂场景。
Harness VLA 将这种编码智体框架的理念应用于机器人操作:保持原语库规模小且固定,让智体学习如何协调这些原语。规划器负责组合解析式原语,以处理非接触式结构化动作,如目标定位(grounding)、自由空间移动、姿态调整、移动至预备位、失败后的重定位以及释放动作。对于接触密集的阶段,规划器则通过一个经学习得到的原语——VLA ACT——来调用冻结的 VLA 模型。这种方式将 VLA 从单一的轨迹策略转变为可复用的“接触操作专家”,使其能够胜任超出原始轨迹分布的任务,且无需进行微调或在部署阶段扩展原语库。关键不仅在于提供 VLA ACT 这一接口,更在于学习何时以及如何使用它。Harness VLA 将 VLA 的执行视为一种可重试的局部尝试:规划器可将机器人调整至有利的局部观测位姿,调用 VLA,检查接触结果,并在必要时重新调整位姿。智体框架内部的两个记忆模块支持这一过程 [14, 15, 18]:特定任务轨迹(task-specific traces)存储成功的原语组合,用于少样本(few-shot)下的重定位;全局记忆(global memory)则存储可复用的成功规则与失败模型。该框架并非单纯增加技能,而是让规划器掌握每个固定原语的适用范围:明确哪些子问题应采用解析式方法处理,何时适合使用 VLA ACT,以及在接触尝试失败后应如何重新调整位姿。
用于语言条件化操作任务的智体框架遵循图1所示的系统架构。任务描述、RGB-D观测数据和机器人状态被输入到智体规划器中;该规划器基于固定的基元库进行推理,并从“任务特定记忆”与“全局记忆”中检索上下文信息。智体驾驭通过JSON序列化的基元接口将规划器与仿真器连接起来,驱动基于回合的执行循环,并将成功的探索轨迹写入“任务特定记忆”,同时将泛化的启发式策略存入“全局记忆”。基元库(primitive lib)定义规划器允许调用的唯一操作:包括一组少量的解析型基元,以及一个结构特殊的VLA基元——后者封装用于高接触交互的预训练视觉运动策略。
1 任务设置和智体执行环
任务设置。考虑在由刚体物理引擎(例如,通过 Robosuite 实现的 MuJoCo)驱动的环境 E 中进行语言条件化的机器人操作。在每个时间步 t,环境会暴露一个多模态观测元组 o_t = (Irgb_t,Id_t,q_t),其中包含一个智体视角的 RGB 图像 Irgb_t、一个共轴对齐的度量深度图 Id_t 以及一个机器人本体感受状态 q_t(末端执行器姿态和夹爪状态的连接)。任务由自然语言描述 l 和一个二元补全谓词 G 定义,G 仅在回合结束时作为稀疏成功信号暴露。
智体执行循环。如图 1 中的展开条所示,任务展开被构建为高级智体规划器 Π 和底层物理引擎之间基于回合的自回归交互。没有将视觉运动策略视为一个独立的层级,而是将所有底层控制机制(包括冻结的预训练视觉运动学习算法 f_θ 和所有确定性操作空间控制器)统一到一个预定义的原始库 P 中。
在每个执行回合 t,规划器 Π 处理当前的多模态观测值 o_t、任务描述 l 以及从任务特定记忆和全局记忆中检索到的上下文信息。作为唯一的认知协调器,Π 会针对选定的原始库 c_t ∈ P 发出一个结构化的 JSON 调用。物理引擎直接接收此调用,并在模拟器中执行相应的物理运动,直到满足原始库的内部后置条件。原始库执行完毕后,引擎会输出后续观测值 o_t+1 和更新后的机器人状态 q_t+1。这个环境规划器循环会持续迭代,直到目标谓词 G 得到满足或达到最大步数预算为止。
2 Harness VLA 架构
受近期“编码智体”(coding agents)的启发——这类智体通过“驾驭执行-反馈环”将模型决策转化为可执行操作 [14–16]——Harness VLA 采用类似的 REPL 风格形式来封装机器人操作。该 驾驭(Harness)充当规划器与环境之间的运行时契约:它负责公开原语(primitive)方案、将决策序列化为 JSON 指令、执行原语、更新 RGB-D 及本体感知(proprioception)观测数据、记录执行轨迹、检索任务特定记忆与全局记忆、强制执行重置与资源预算策略,并通过基准测试谓词 [17] 检查任务进度。
由于该驾驭(Harness)将所有细粒度执行任务委托给原语库,智体规划器 Π 得以从繁琐细节中解脱,专注于组合推理。为此,它高度依赖多模态观测通道:RGB 图像支持定性的场景推理(如杂乱程度、语义类别),而对齐的深度图与本体感知数据则提供用于精确定位的度量空间信息。
将该 Harness 框架下的智体生命周期划分为两个截然不同的阶段:探索性引导阶段(exploratory bootstrapping phase)和严格的部署评估阶段。
探索性引导阶段。智体基于任务的单个参考实例,自主与环境交互以寻找可行的解决方案。在此阶段,规划器 Π 拥有独占的 RESET原语调用权限,并享有宽松的实际运行时间(wall-clock)预算。由于原语词汇表是固定的,探索过程完全聚焦于迭代组合:即寻找学习型 VLA 原语与确定性解析原语(analytic primitives)的最优编排方式。规划器 Π 反复尝试不同的操作阶段顺序、接触前位姿、VLA ACT 调用时机以及提前终止阈值。它观察每次原语调用的物理效应,并在失败时进行策略修正。
任务成功完成后,智体将其经验系统地抽象并存入图 1 所示的两个记忆模块中。首先,经由验证的原语调用序列被序列化为 JSONL 格式。该文件明确记录成功的逐步原语调用过程,并通过将具体的空间坐标替换为符号化感知查询来进行参数化处理,从而确保该序列在不同空间布局下均可复用。这种参数化的 JSONL 轨迹被存储在“任务特定记忆”中,作为后续泛化测试的结构化先验信息。其次,智体从探索过程中提取通用的启发式规则,并将其存入持久化的“全局记忆”(Global Memory)中。这一共享存储库明确汇总各类成功规则,例如能够充分利用完整任务指令的最优提示(prompting)策略;同时,它也记录关键的失败模式,包括识别“空抓”(empty-grasp)操作及误判成功的情况。这种汇总机制确保规划器在处理不同任务时,能够避免重蹈覆辙。
部署评估阶段。在针对未见过的环境变体(包括位置互换、指令重定向以及基于多个初始状态种子的测试)进行正式评估时,该驾驭(harness)实施严格的执行规范:完全禁用 RESET 原语,并大幅缩减操作步骤的限额。为了解决这些经扰动的任务,规划器 Π 从“特定任务记忆”(Task Specific Memory)中检索预计算的 JSONL 轨迹数据,并结合实时的 RGB-D 观测信息进行动态落地执行。智体依据全局记忆中积累的成功规则与失败模式,以确定性的方式执行该轨迹。在此严格阶段取得的性能表现直接构成本文报告的基准测试结果,从而验证 Harness VLA 框架的整体有效性。
3 统一原语接口
原语库 P 是暴露给规划器的唯一动作接口。每个原语通过单个 JSON 对象进行调用,在环境中执行直至满足内部后置条件,随后交还控制权并返回更新后的观测数据。规划器从不直接输出低级力矩、关节目标值或动作片段;它负责选择原语,并根据语言指令、RGB-D 观测、本体感知及记忆信息来绑定原语参数。
将 P 划分为两大操作原语族。解析式原语(Analytic primitives)是基于模型的确定性控制器,由机器人运动学定义,无需训练数据。它们又细分为:复合原语(composite primitives),接收世界坐标系下的空间目标,并运行内置求解器以协调多个自由度;以及原子原语(atomic primitives),驱动单个固有通道(如手腕朝向、夹爪状态或底盘速度)达到参数化设定点。VLA 原语 VLA ACT 是一种基于学习的策略调用,将提示信息(prompt)和实时相机画面映射为动作片段,以实现局部的、富含接触交互的行为。用于探索的 RESET 工具仅在引导阶段(bootstrapping)使用,不计入操作原语范畴。
表 1 列出贯穿本文使用的原语词汇表。该共享操作接口包含六个解析式原语和一个 VLA 原语;RoboCasa365 额外使用两个移动底盘原语——NAVIGATE TO(导航至)和 MOVE BASE(移动底盘)——用于厨房场景下的任务预置与布局调整。关键在于,原语词汇表在评估前即已固定;规划器无法在部署阶段自行创建新原语。

下方的简洁 JSON 契约展示该共享接口:

基于 VLA 的接触原语。VLA ACT 是用于富含接触交互场景的学习型原语。在各项基准测试中,VLA ACT 涵盖了抓取、受限放置、夹具操作、按键、抽屉或门体操作、插入动作以及特定具身形态下的接触行为。规划器提供一个任务相关的提示信息(prompt)和一个提前终止谓词 tau。随后,冻结参数的 VLA 模型 f_theta 输出动作片段,直至满足 tau 条件或耗尽动作片段配额。这种设计使 VLA 保持作为“局部接触专家”的角色,而语义接地(semantic grounding)、空间重绑定(spatial re-binding)、导航、重置(re-staging)以及长程任务组合(long-horizon composition)则由规划器(planner)控制。
驾驭将执行循环实现为一种基于文件的同步式“读取-求值-打印循环”(REPL)。一个长期运行的环境工作进程(worker)维护着实时的仿真器状态,而规划器 Π 仅通过序列化的原语调用及持久化的观测数据与该状态进行交互;规划器无法访问仿真器的特权状态、物体位姿或控制器的内部机制。
任务特定记忆(Task Specific Memory)。任务特定记忆存储已解决任务实例的可复用结构。它包含程序性 JSONL 轨迹和语义性 JSON 摘要。轨迹记录执行了哪些原语调用;摘要则记录了该策略为何有效以及应避免哪些做法。
成对的过程轨迹(trace)存储了基元(primitive)的执行顺序。该“轨迹”是一个任务级的解决方案框架,而非开环轨迹。它记录分析型原语与基于 VLA原语的执行顺序、VLA 调用的位置,以及涉及接触的执行、搬运、释放和验证各阶段之间的转换点。存储轨迹中的空间参数被视为“参考场景绑定”(reference-scene bindings)。在部署阶段,规划器会复用该内存结构,但会根据当前观测结果,重新将物体、固定装置、支撑表面及目标位姿进行“重新接地”(re-grounding,即重新建立与当前环境的关联)。
全局记忆。全局记忆存储了供原语库使用的、与具体任务无关的操作知识,以便在重试前进行诊断。
迭代式记忆构建。记忆是在交互过程中构建的,而非仅在完整执行(rollout)结束后才写入。在执行每个原语(primitive)动作后,规划器会读取新的观测数据和诊断记录,并将结果分类为:进展、可恢复的失败或不可恢复的失败。成功的执行过程会被存储为“特定任务记忆”(Task Specific Memory)。可恢复的失败记录会保留在轨迹中,并在语义摘要中加以说明,以便后续步骤记录纠正措施。失败的尝试也会作为负面证据保留,并可能为“全局记忆”(Global Memory)贡献失败模型。
在多次尝试的过程中,记忆是经过提炼优化的,而不仅仅是简单的累积。如果后续尝试能产生更短或更可靠的解决方案,便可替换原有的程序化轨迹;同时,早期的失败观测数据依然具有价值,可作为未来规划的约束条件。这种分离机制使得 Harness VLA 能够迁移任务的求解方法,而无需机械地重现参考场景中物体的具体位置。
通用解析式原语。MOVE TO 是共享的末端执行器移动原语:它接收一个基于世界坐标系的笛卡尔目标,并将其委托给当前环境中可用的求解器。其内部后端可以是操作空间伺服控制器、基于雅可比矩阵的控制器或逆运动学(IK)规划器,但对外暴露的原语语义是相同的。MOVE POSE 在 MOVE TO 的基础上进行了扩展,使位置与姿态分量,如俯仰角(pitch),同步变化;当环境不直接支持此功能时,可通过组合 ROTATE PITCH 和 MOVE TO 来实现相同的行为。ROTATE WRIST 和 ROTATE PITCH 分别应用偏航角(yaw)和俯仰角(pitch)设定值,同时保持当前的空间位置不变。SET GRIPPER 将夹爪驱动至打开或关闭状态,而 RELEASE 是相应的夹爪打开原语,并包含“释放”这一后置条件。特定于环境的夹爪操作惯例被封装在原语接口之下。
移动底座与双臂操作细节。RoboCasa365 增加两个移动底座原语,因为厨房尺度的任务需要在固定机械臂的工作空间之外进行预备操作。NAVIGATE TO 是一个复合原语,驱动底座向世界坐标系下的平面目标点移动;而 MOVE BASE 是一个原子原语,通过应用局部底座速度设定值来实现精细的位置调整。RoboTwin C2R 未引入新的操作原语名称;相反,每个原语都可以通过机械臂参数绑定到左臂、右臂或双臂任务模式。因此,交接类任务被表示为双臂绑定模式下 VLA ACT、解析式移动原语和 RELEASE 原语的组合,而非单独的原语。
VLA ACT。VLA ACT 是该原语集合中唯一一个基于学习的原语。它绑定到当前基准测试所使用的冻结 VLA,并根据提示(prompt)和实时观测数据执行动作片段(action chunks)。规划器配置一个停止谓词 τ,该谓词可对应于“提起并抓取”条件、接触状态条件、基准测试谓词或动作片段数量限制。因此,该原语涵盖抓取、放置、夹具操作、插入和双臂接触等动作,同时保留规划器在语义接地(semantic grounding)、空间重绑定、导航和重定位(re-staging)方面的职责。
实验设置
在四个基准测试系列上评估 Harness VLA。桌面操作(tabletop)系列包括 LIBERO [19] 和 LIBERO-Pro [20];家庭场景和双臂操作系列则分别为 RoboCasa365 [21] 和 RoboTwin C2R [22]。在所有评估中,规划器均基于同一套固定的基元词汇表 P 运行,且不允许在部署阶段引入新的基元。
VLA 基元通过针对特定基准测试的固定策略(frozen policies)进行实例化,同时保持统一的 VLA ACT 接口:针对 LIBERO 和 LIBERO-Pro 使用 RLinf 发布的 π0.5-SFT 检查点(记为 π_RLinf [23]);针对 RoboCasa365 使用固定的 RLDX-1 RoboCasa 检查点 [24];针对 RoboTwin C2R 使用训练后的 LingBot-VLA 检查点 [25]。Harness VLA (Codex) 和 Harness VLA (CC) 分别表示使用 Codex 和 Claude Code 规划器实例化的同一 Harness 系统;CC 即 Claude Code 的缩写。π_RLinf、RLDX-1 和 LingBot-VLA 对应的行作为各自基准测试的直接固定 VLA 基线(baseline)。
LingBot-VLA
LingBot-VLA [25] 是 RoboTwin 后端用于双手动操作的视觉-语言-动作(VLA)模型。它是一个大规模的 VLA 基础模型,旨在实现跨各种真实世界实例的连续机器人控制。本工作用 RoboTwin 后训练的 LingBot-VLA 检查点作为 Harness VLA 框架内的冻结底层执行模块。
架构。该模型基于预训练的 Qwen2.5-VL 视觉语言骨干网络构建,并扩展混合 Transformer (MoT) 架构,将视觉语言推理和动作生成分离到专用的 Transformer 路径中。这些路径通过共享的自注意机制耦合,从而实现统一的多模态序列建模,同时减轻跨模态干扰。引入一个动作专家模块,用于预测基于多模态嵌入的连续控制信号。
动作建模。 LingBot-VLA 采用流匹配公式进行连续动作预测。为了提高长时域操作的时间一致性,它采用分块动作解码,即在单次前向传播中自回归预测固定长度的动作序列。分块大小设置为 T = 50,从而实现稳定且时间一致的控制。
训练。首先,该模型在 9 种机器人实例上收集的大规模真实世界双臂远程操作数据上进行预训练,从而提供广泛的跨实例泛化能力。然后,通过在 RoboTwin 操作轨迹上进行监督微调 (SFT) 来进一步调整模型,使其专门用于双臂操作任务。在后训练阶段之后,所有直接 VLA 和 Harness VLA 评估中的检查点均保持冻结状态。
训练配置。在表 14 中总结控制后训练的关键超参数。这些参数对应于本文报告的所有 LingBot-VLA 后训练实验所使用的配置。

性能。在 RoboTwin 随机评估设置下,LingBot-VLA 在直接冻结智体配置(即作为独立策略,不进行智体级分解或外部规划)下取得了 50.4% 的成功率。该直接基线与主表中的外部 π0.5 对比有所不同:LingBot-VLA 是 Harness VLA 使用的 RoboTwin 专用冻结 VLA 后端,而 π0.5 是一个具有代表性的外部 VLA 基线。结果表明,LingBot-VLA 在进行智体级分解之前就已经具备强大而稳定的接触丰富操作能力。
在本文中,LingBot-VLA 被用作 Harness VLA 中的冻结执行模块,作为 RoboTwin 双手动控制的底层接触丰富操作原语。

386

被折叠的 条评论
为什么被折叠?



