银河通用全自主夺冠,破解具身智能三大难题
银河通用在世界人形机器人运动会场景赛中,以全自主模式包揽家庭、餐饮、商超三金,揭示具身大模型在长程任务、柔性操作和开放世界中的突破,其背后是真实场景数据驱动的模型进化闭环。
赛场上的隐形战场:场景赛才是真考验
8月底,国家速滑馆“冰丝带”内,第二届世界人形机器人运动会如火如荼。田径赛场上,机器人百米冲刺、电机冒火的画面刷爆朋友圈,但专业观众的目光却聚焦在另一个赛场——场景赛。这里没有跑道,只有临时搭建的客厅、厨房和货架,考验的是机器人在真实工作场景中的综合能力。
业内共识是:田径比的是运动控制算法,靠算力和仿真就能优化;而场景赛考的是具身大模型,涉及“大脑”的决策和“小脑”的动作协调。环境动态变化、物品柔软易变、随时有人干扰,对模型的泛化能力要求极高。
本届比赛允许遥操,但积分规则明显偏向全自主:自主模式权重1.0,遥操仅0.5。尽管如此,多数队伍仍选择遥操避险——毕竟,让AI完全掌控沉重的钢铁躯体,风险实在太大。一位选手坦言:“0.5的折扣虽疼,但总比机器人死机或砸了厨房强。”
银河通用全自主夺冠,破解三大底层难题
在这样的背景下,银河通用却坚持三项场景全部全自主,不依赖任何人工干预,由其自研的银河星脑(AstraBrain)世界动作模型独立决策执行。最终,家庭、餐饮、商超三赛项全部夺冠,商超更是包揽金银铜牌。
家庭场景:对抗“误差级联”与“记忆断片”
家庭赛程长达30分钟,是全场最长的项目。机器人需穿梭于客厅、卧室、卫生间,执行捡拾、开门、洗衣、叠衣、晾晒等任务。两大难点:一是柔性物体操作,如叠衣服,布料无限自由度,传统几何算法失效,必须依赖端到端视觉-动作模型实时调整;二是长程任务中的随机干扰,比赛现场突然插入语音指令“有快递送达”,机器人需暂停手头工作去取件,再回到原位继续。这考验模型的时空接地和长短期记忆调度。银河通用不仅顺利应对,还在赛后复核中首次即获满分,证明其泛化能力并非偶然。
餐饮场景:挑战“莫拉维克悖论”与力控难题
餐饮任务包括用食品夹取餐、放入微波炉、拧旋钮、加热后取出、送饮料。人类觉得简单的动作,对AI却极难。食品夹不固定,机器人需将感知延伸至工具末端;拧旋钮则要求柔顺控制,刚性位置控制稍有偏差就会掰断塑料件。多数队伍选择遥操接管精细动作,银河通用仍全自主,以6分55秒零失误完赛,说明AstraBrain已能穿透到底层力矩输出。
商超场景:告别“过拟合”,进入开放世界
商超是20分钟限时任务,包括按订单拣货、巡查货架、补货、归位错放商品。地图无用,订单动态、缺货随机、干扰项众多。袋装薯片反光不规则,传统视觉易抓空,但银河通用凭借多模态大模型实时感知,精准识别并纠正错放。最终包揽前三,证明其适应动态环境的能力。
赛场之外:真实数据驱动的进化闭环
有人质疑:这会不会是特化模型?银河通用的底气来自日常积累。其打造的“银河太空舱”零售店已进入全国近50城、约200个点位,稳定运行超一年;在医疗场景,联合建设的近百个智慧药房,7×24小时运行,累计出药超百万次。这些真实交互数据持续回流至AstraBrain,形成“真实应用—数据回流—模型进化”闭环,赛场上的干扰不过是日常训练的子集。
具身智能的“ChatGPT时刻”何时到来?
运动会落幕,趋势已明:人形机器人竞争正从硬件转向具身智能大脑。硬件日益同质化,没有强大的“操作系统”,再好的躯壳也是废铁。银河通用的策略是押注世界动作模型,而非为特定任务写死代码。当模型能像ChatGPT预测下一个词一样,预测物理世界的下一步动作,具身智能的“ChatGPT时刻”或许就不远了。