
【导语:2026年8月5日,小米自研的具身基座模型Xiaomi - Robotics - 1正式开源,它在多个主流机器人操作benchmark上表现出色,训练范式独特,参数规模选择也有其考量,对行业影响深远。】

2026年8月5日,小米技术官微宣布自研的具身基座模型Xiaomi - Robotics - 1正式开源。该模型实力强劲,在4个主流机器人操作benchmark上击败了Pi0、Gemma3、Qwen2.5 - VL等竞品。其中,在RoboDojo上的表现比对手高了58.3%,在VLABench上高出第二名11.1个百分点。

XR - 1采用两阶段训练范式,即大语言模型式的预训练 + 后训练。预训练使用来自1700多个场景的UMI轨迹数据,超过10万小时。UMI通过手持设备收集人类操作轨迹并映射到机器人动作空间,此阶段让模型形成对物理交互的基本认知,且该预训练数据量是目前开源VLA模型里最大的。
后训练使用7200小时以上在CyberDog和CyberOne上实际跑出来的真机数据,意味着模型跨越了从仿真到真实的迁移。同时训练中做了视觉生成增强,加入MiMo预测头提升空间推理能力。这种两阶段设计在适配新机器人本体时优势明显,给不到10小时的新本体数据,XR - 1在未见过的任务上就能达到75%成功率,而Pi0.5在同等条件下仅为40%;给到40小时以内,XR - 1能达到85%,Pi0.5还在53%。

XR - 1总参数50亿,在2026年的VLA模型赛道上不算大,OpenAI的π0.5、Google的RT - 2 - X等都是更大的模型。但具身智能对推理延迟要求极高,更大的模型意味着更慢的推理速度、更高的硬件门槛和更难部署到实际机器人本体上。
小米选择5B的VLA架构,其视觉编码器用了SigLIP2 - 400M和Gemma3 - 12B的集成方案,动作解码器是diffusion - based head。5B模型可以直接跑在单张消费级GPU上,大幅降低了社区复现和实际部署的门槛。
编辑观点:小米开源的具身基座模型Xiaomi - Robotics - 1在性能、训练范式和参数规模上都有独特优势,降低了行业门槛,有望推动具身智能的发展。

116

被折叠的 条评论
为什么被折叠?



