具身模型“卸妆”考:原力灵机登顶,记忆成关键
RoboDojo评测揭示具身模型行业短板,原力灵机DM0.5以记忆能力登顶,成功率远超同行,展示长程任务潜力。
机器人演示的“滤镜”与“照妖镜”
近期,机器人运动会和WRC 2026上的视频刷屏,机器人叠衣服、冲咖啡、百米冲刺,看似无所不能。然而,这些演示背后往往隐藏着数千次的调试和过拟合,行业内称之为“Demo滤镜”。外行难以分辨动作是预设还是模型实时驱动,这让具身智能领域鱼龙混杂。
好在学术界保留了“照妖镜”——RoboDojo,一个由香港大学多媒体实验室牵头,联合UC伯克利、清华等近20所顶尖机构推出的权威评测平台。它像一场“统一高考”,为全球机器人模型设定42道仿真题和18道真机题,覆盖泛化、记忆、精细操作、长程执行和开放语义理解五大科目。考场统一硬件(如ARX X5、Piper双臂机器人),流程标准化,评审双盲打分,杜绝摆拍和挑题。
行业惨淡现状:头部模型成功率不足10%
成绩单相当惨烈。截至今年7月,仿真榜上30多个参评模型(包括π0.5、GR00T-N1.7、OpenVLA-OFT等知名模型)的平均成功率仅8.80%,而人类专家为76.03%。真机榜更惨,头部模型总体成功率12.8%,人类为100%。最难的开放语义任务,成功率仅1.67%——相当于考60次蒙对1次。这暴露了行业级现实:具身模型离落地还差得远。
原力灵机DM0.5:以记忆能力登顶
然而,中国公司原力灵机的通用具身基础模型DM0.5,以24.90综合得分和19.34%平均成功率双项第一,综合排名登顶。其关键优势在于记忆能力。
在RoboDojo的“Cover Blocks”任务中,机器人需记住红、绿、蓝积木的遮盖顺序并依次揭开。大多数模型因缺乏记忆而失败,但DM0.5在三个随机种子下全部100%通过,且完成完整闭环。在Memory维度,DM0.5得分47.74分、成功率47.44%,而第二名仅13.37分和12.11%,差距接近4倍。
原力灵机的记忆技术并非偶然。其MemoryVLA成果已被Physical Intelligence的Mem架构论文引用,并在最新π0.7论文中再次被引用,显示其在该领域的领先地位。
记忆为何难攻克?成本与架构
记忆能力难攻克,主要因为成本高:将长历史数据纳入模型会暴涨计算量,需重构架构。大语言模型的进化史证明了上下文长度的重要性,而具身模型若缺乏记忆,只能活在10秒的Demo里。
DM0.5的解决方案是“原生记忆”:在预训练阶段就融入记忆能力。其架构由4B的VLM主干和680M的Action Expert组成,中间设计“上下文抽象层”,高效压缩历史信息,支持最长60秒记忆。预训练阶段围绕历史上下文、具身推理等优化,微调时加入20秒历史观测,使记忆成为模型原生能力。
全面实力:从精细操作到实时决策
除了记忆,DM0.5在其他科目也表现优异。在LIBERO综合成功率99.0%,RoboTwin 2.0简单和复杂场景分别为93.6%和93.3%。实机演示中,它能拼装微型积木(精度0.1-1毫米),自主纠错;削黄瓜、切黄瓜展示精细力控;物流分拣平均3秒一件,准确率超99%;抗干扰测试中,被推开后仍能继续任务,体现60秒记忆。
数据家底与实用价值
DM0.5的成功离不开数据支撑:5万小时真机高精度操作数据,10万小时第一视角数据,以及大量仿真数据。这些数据让模型在预训练阶段就学会处理真实世界复杂性。
对于开发者而言,DM0.5的开源(GitHub仓库)提供了可复现的基线,尤其适合长程任务场景(如家庭服务、工业分拣)。其记忆机制为行业指明方向:具身模型需从“金鱼”进化为“大象”,才能应对真实世界的长程挑战。
结语
RoboDojo的榜单撕开了演示滤镜,而DM0.5的登顶证明记忆是具身智能的关键突破口。未来,谁能解决记忆与泛化,谁就能真正让机器人走进生活。