智能工具库

清华AIR发布Zeva:冻结参数实现具身智能自进化

清华AIR发布Zeva:冻结参数实现具身智能自进化

清华AIR与域变换联合推出Zeva,首个实现具身In-Context Causal Learning的模型,参数冻结下累计成功率从26%提升至73%,支持一次人类演示学会新操作。

2026-09-01 0来源:量子位

背景:具身智能的进化难题

具身智能(Embodied AI)要让机器人在真实物理世界中执行操作任务,核心挑战在于模型能否在部署后越用越好。传统方法依赖重新采集数据、微调模型或测试时训练(Test-Time Training),但这些方式需要梯度更新,速度慢、成本高,且可能破坏已有能力。另一类上下文学习(In-Context Learning)方法虽能根据演示调整行为,却局限于任务理解,无法从动作后果中学习物理因果。

Zeva:首个具身In-Context Causal Learning模型

清华AIR(智能产业研究院)与域变换公司联合发布Zeva,这是首个实现具身上下文因果学习(ICCL) 的模型。其核心创新在于:在不更新模型权重的前提下,从自身交互经验中持续学习。在多个具身基准任务上,Zeva将冻结模型的累计成功率从26%提升至73%;在真实化学实验室中,机械臂通过多次尝试逐渐稳定;甚至一次人类演示就能让模型学会新操作。

技术拆解:三大模块实现自进化

Zeva的推理链路包含三个关键模块:

  • Causal Transition Encoder:显式学习动作引起的状态变化,提取因果交互信号(Causal Interaction Signal),使模型能"看见"动作与结果的关系。
  • Dual-timescale Causal Memory:双时标因果记忆,包含Brief Interaction Trace(当前尝试内连贯执行)和Persistent Interaction Memory(跨尝试累积经验),让模型在重复尝试中越用越强。
  • In-Context Policy Injection:通过Causal Prompt将任务、阶段和交互证据注入冻结的动作生成模型,仅作为条件影响后续动作,不参与梯度更新,实现"不调权重也能进化"。

数据验证:自进化与一次性演示增强

在RoboCasa365-Atomic5基准上,Zeva平均成功率76.8%,且部署后的自进化曲线显示累计成功率从Evolve 1的26%提升至Evolve 4的73%。在真实化学实验室ChemLab-Evo中,三个原子任务(Pick Up Test Tube、Place Beaker、Pour Water)的成功率均单调增长,例如Pick Up Test Tube从65%升至100%。此外,一次人类演示初始化可显著提升性能:Place Beaker提升20个百分点,Pour Water提升15个百分点。

范式意义:从参数空间到上下文空间

Zeva的深层价值在于将具身模型的扩展(Scaling)从参数空间延伸到上下文空间。传统Scaling依赖扩大数据、参数和算力,而Zeva通过不断增加可供模型消费的因果上下文(每次交互产生的证据)来实现能力增长。其理论基础是:模型可将新场景的环境属性(如物体质量、摩擦条件)作为隐变量,在推理时从过去的动作-效果证据中推断,从而逼近物理系统的真实动态。跨任务实验显示,等价物理效应在Causal Interaction Signal空间中彼此靠近,这支持跨域迁移,使"域变换"成为可计算、可复用的技术概念。

结语

Zeva重新定义了具身模型的自进化:不调权重也能越用越强,不重新训练也能从一次演示中学会新操作。这为具身智能开辟了新的Scaling路径——在真实物理世界中,机器人自己学习因果、完成进化。清华AIR与域变换的这次合作,标志着前沿研究向产业落地迈出重要一步。

本文基于 量子位 的公开内容,由 AI 辅助整理改写后发布。

原标题:自进化WAM来了!清华AIR联手域变换提出具身In-Context Causal Learning

阅读原文