Google DeepMind推出Gemini Robotics 2,具身智能模型能否走进生活场景?

WAIC2026:人形机器人成人礼

前段时间,雷科技WAIC2026报道团亲赴现场,观察了这场全球AI大展,看到一场规模空前的人形机器人成人礼。超过200家机器人相关企业、300多台真机同台竞技,从宇树三米高的载人变形机甲切换形态,到智元的机器人夹起2毫米电阻焊到电路板上。过去吸引观众的后空翻和机械舞还在,但厂商更想证明机器人不只会动,还能干活。

瓶颈:机器人的「大脑」

造出能跑、能跳、能伸手的「身体」,已不是当下最稀缺的能力。真正的瓶颈是「大脑」,即让机器人看懂混乱环境,决定下一步行动,并将决定稳定传至几十个关节。

Google DeepMind推出Gemini Robotics 2

WAIC结束一周多后,Google DeepMind推出Gemini Robotics 2,这是一个主打「全身智能」的机器人通用模型,适用于各种不同形态的机器人。人类完成弯腰捡水壶、封自封袋等动作很自然,机器人却要连续算对一串彼此牵制的动作。身体零件越齐全,控制难度越大。谷歌此次发布包含三个模型,Gemini Robotics ER 2负责理解环境、规划长任务和与人沟通,Gemini Robotics 2这个VLA模型把视觉与语言直接转成动作,On - Device 2则把动作模型压到本地,并能用少于200个样例、几小时数据适配新的机器人本体。核心在于,谷歌用一组模型协调人形机器人的双腿、躯干、双臂和手指,让它边思考推理边移动操作。

全身智能的体现与不足

过去不少机器人演示有回合制游戏感,动作切换时易暴露独立模块的接缝。上一代Gemini Robotics主要控制机器人上半身处理桌面任务,到了Gemini Robotics 2,官方视频中的Apptronik Apollo 2能完成走向水壶、提壶、取棒球手套等动作。这些动作依赖视野、可达范围、步态和重心,视频标注机器人均为自主运行,动作按真实速度播放。这意味着模型把整副身体视为相互耦合的动作空间,且同一模型已用于不同机器人。不过,Apollo动作速度慢,谷歌承认移动速度需提高。官方测试中,Apollo从桌面、地面和货架取物的平均成功率分别为68.4%、45.7%和76.3%,地面取物成功率最低。

「最后几厘米」的难题

全身控制解决机器人抵达和站稳问题,真正决定其能否进入家庭和工厂的是「最后几厘米」。官方视频里,Apollo 2用五指SharpaWave灵巧手尝试拧灯泡、封自封袋、给垃圾袋打结,Franka Duo的夹爪把工具装进工具箱。这些任务涉及连续接触、双手配合和形变,与过去简单抓取演示不同。Gemini Robotics 2要从视觉和指令直接生成高频、连续动作。谷歌公布的成绩显示,两指夹爪在通用抓放、工具配套和精密插入上平均成功率较高,多指灵巧手在拧灯泡、扎垃圾袋等任务上成功率较低,说明大模型能接管复杂手部动作,但多指灵巧操作远未达「人类级」。

机器人协作的探索

视频中,Apollo与Franka Duo共同整理工具箱,两台机器人各自运行一套模型,通过高层推理分配和衔接工作,ER 2会查看视频判断任务进度、决定是否重试。这与机械执行预设工序不同,谷歌想让不同形态机器人像团队一样交接任务,但官方视频展示的场景离真实工厂多机连续协作还有很长的稳定性验证距离。

拆掉身体边界的「大小脑」架构

具身智能行业普遍将机器人架构概括成「大脑」和「小脑」,大模型负责高层推理,小模型和传统控制器负责底层控制,这样做务实但存在模块边界问题,物理世界中高层计划与底层动作易出现理解不一致,导致错误累积和动作停顿。谷歌并未放弃「大小脑」,ER 2仍是高层大脑,VLA统一全身动作,减少机器人动作的割裂感。这是更准确的分界线,高层分层,身体端到端。同时,考虑到底层控制和高层推理的不同需求、训练成本和安全问题,谷歌没有把所有环节塞进一个巨型网络。而且,类似路线并非谷歌独有,Figure和智元也有相关探索。

全身智能面临的挑战

目前具身智能模型前沿探索追求更多本体、更长任务和更少的专用数据,如英伟达、Physical Intelligence、蚂蚁灵波等都有相关成果。Gemini Robotics On - Device 2用少量样例适配新本体值得关注,但机器人比聊天模型更难,英伟达承认多任务语言跟随和分布外泛化是挑战,谷歌五指任务成功率也表明模型控制不同身体的稳定性不足,真实部署还需面对更多问题。

具身智能的展望与2026世界机器人大会

Gemini Robotics 2的重要意义在于让具身智能模型越过桌面和上半身,将多种能力纳入考量。WAIC上成熟的芯片、关节和整机为AI提供了身体,谷歌试图证明模型开始把身体当作整体使用。但机器人真正走进生活,不只需要全身智能。8月19日到23日,2026世界机器人大会(WRC)将在北京举办,主题是「人机共生,产需共融」,参展企业300余家,比去年多36%,展品超2000件,首发新品突破150件,1万多名赛手将参加机器人大赛总决赛。雷科技将派出WRC报道团进行全程现场报道。那么,未来具身智能模型能否在生活场景中得到更好应用呢?

内容概要:本文围绕“组稀疏信号去噪”展开,深入研究了基于非凸正则化与凸优化的信号处理方法,并提供了完整的Matlab代码实现。文章系统阐述了如何通过引入非凸正则项克服传统稀疏恢复方法的局限性,从而在语音增强等实际应用中实现更优的去噪性能。研究采用组稀疏建模范式,将信号按子带或时频块进行分组,以更好地保留信号的结构性特征。文中详细构建了相应的数学模型,将原始优化问题转化为可通过凸优化技术求解的形式,并设计了高效的求解算法。通过全面的仿真实验,验证了该方法在提升信噪比和改善语音主观质量方面的显著优势,尤其在强噪声环境下表现出更强的鲁棒性。; 适合人群:具备一定信号处理理论基础和Matlab编程能力的研究生、科研人员,以及从事语音增强、音频处理、通信工程等相关领域的技术研发人员。; 使用场景及目标:①应用于语音通信系统、智能助听设备、语音识别前端预处理等对语音清晰度要求高的场景,有效提升嘈杂环境下的语音可懂度;②为科研工作者提供一个将非凸正则化理论与凸优化算法相结合的完整研究范例,促进先进信号恢复算法在实际工程系统中的转化与应用。; 阅读建议:建议读者结合提供的Matlab代码,深入剖析算法实现的核心步骤,重点关注目标函数的设计理念、非凸正则项的选取依据以及优化求解器的具体实现;同时,鼓励通过调整算法参数或在不同类型的噪声环境中进行测试,以探究算法的性能边界和鲁棒性特征。
内容概要:本文档聚焦于三电平ANPC并网逆变器的先进控制策略研究,重点阐述了一种融合DPWMA(离散脉宽调制)调制、正负序电流分离控制与电网电压前馈补偿的复合控制方法,并基于Simulink平台完成了系统建模与仿真验证。该方法旨在提升逆变器在电网电压不平衡等复杂工况下的动态响应性能与运行稳定性,特别针对低电压穿越(LVRT)能力进行了优化设计。研究内容还涵盖了中点电位平衡控制、虚拟同步发电机(VSG)技术以及构网型逆变器的双闭环控制架构,体现了对高阶电力电子变换系统深层次的建模与控制探索。文档同时罗列了大量相关的MATLAB/Simulink仿真实例,覆盖电力电子、新能源并网、优化算法、机器学习、路径规划等多个前沿科研领域,强调了科研工作中“借力”现有成果与追求“创新”突破的双重重要性。; 适合人群:从事电力电子与电力传动、新能源发电系统、微电网与智能电网控制等相关领域的研究生、科研人员及工程技术人员,要求具备扎实的电力系统基础知识、现代控制理论背景以及熟练的MATLAB/Simulink仿真操作能力。; 使用场景及目标:①深入研究三电平ANPC逆变器在不平衡电网条件下的高性能控制策略;②实现DPWMA调制技术与正负序电流独立控制的协同仿真与性能评估;③设计并验证融合电网前馈补偿与中点电位平衡的复合控制算法;④作为高级电力电子系统仿真与构网型控制技术的学习范本与项目开发参考。; 阅读建议:建议读者结合文档指引,通过指定公众号或网盘获取完整的仿真模型资源,在Simulink环境中动手复现核心控制模块,重点关注正负序分离算法、DPWMA调制波生成逻辑与前馈控制环节的实现细节,同时参考文末列出的多样化研究方向,以拓宽技术视野并激发创新思维。
评论
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包
实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值