自进化WAM来了!清华AIR联手域变换提出具身In-Context Causal Learning

AITNT-国内领先的一站式人工智能新闻资讯网站
# 热门搜索 #
自进化WAM来了!清华AIR联手域变换提出具身In-Context Causal Learning
8040点击    2026-09-01 14:21

模型不更新,能力却持续增长。


这是Zeva最反直觉的地方,也是清华AIR域变换联手给出的新答案。


在多个典型具身基准任务上,将冻结模型的累计成功率从26%提升到73%;在真实化学实验室,机械臂在多次尝试中越用越稳。


更关键的是,一次人类演示就能让模型“学会”一个新操作。


Zeva首个实现In-Context Causal Learning(ICCL)的具身WAM


它让模型可以在不更新权重的情况下,从自己的交互经验中持续学习。当这种能力逐步成熟,具身智能将迎来属于自己的“GPT时刻”


项目信息


项目名称:Zeva
发布机构:清华AIR、域变换
论文题目:Zeva: In-Context Causal Learning for Generalizable Embodied Manipulation
项目主页:https://air-embodied-brain.github.io/Zeva/


自进化WAM来了!清华AIR联手域变换提出具身In-Context Causal Learning


具身模型的自进化,为什么过去很难?


具身智能的真正瓶颈,是“模型到了现场能不能越做越好”。


传统思路里,想让机器人适应新环境,通常要重新采集数据、微调模型或做test-time training。


但这些方法依赖梯度更新,速度慢、成本高,还可能在适应新任务时破坏已有能力。


另一类in-context learning方法可以让模型根据演示或任务描述调整行为,但主要解决“任务理解”,并没有让模型从自己的动作后果中学习物理因果。


从“任务泛化”到“因果迁移”


过去我们谈跨域,更多是sim-to-real、跨本体迁移、跨任务泛化。这些方法大多依赖数据对齐或表征对齐,本质上是在不同域之间搬运“任务经验”。


Zeva更进一步:它迁移的是“动作与状态变化之间的因果关系”。


同一个模型,在仿真里学到的物理因果,可以被带到真实机械臂;在一次尝试里积累的失败经验,可以指导另一个相似物理过程的尝试;人类的一次演示,也可以直接变成机器人的因果上下文。


这种跨域迁移通过上下文完成。模型在上下文中推断环境因果结构,并把因果知识用于下一次动作生成。这就是Zeva所定义的In-Context Causal Learning。


示例一:从放置称量纸的误操作中提取因果关系,完成上下文内学习,提升任务精度。


自进化WAM来了!清华AIR联手域变换提出具身In-Context Causal Learning


示例二:从称取试剂至称量纸的误操作中提取因果关系,完成上下文内学习,提升任务精度。


自进化WAM来了!清华AIR联手域变换提出具身In-Context Causal Learning


示例三:从一次人类演示中完成上下文内因果学习。


自进化WAM来了!清华AIR联手域变换提出具身In-Context Causal Learning


Zeva:把“因果学习”装进模型上下文


自进化WAM来了!清华AIR联手域变换提出具身In-Context Causal Learning

Zeva总体框架。模型通过Causal Interaction Extraction、Dual-timescale Causal Memory、In-Context Policy Injection,在不更新权重的情况下实现部署中自进化。图片来源:论文


Zeva是一个模型。它的Causal Transition Encoder、Dual-timescale Causal Memory、In-Context Policy Injection,都属于模型推理链路的一部分。


在每个环境步,Zeva提取三类信号:视觉状态、动作编码、观察到的状态变化。


它们被递归编码为Causal Interaction State,并进一步投影为Phase Token和Causal Interaction Signal。


这些因果信号被组织成双时标上下文:Brief Interaction Trace负责当前尝试内的连贯执行,Persistent Interaction Memory跨尝试累积可复用经验。


决策时,Zeva检索与当前任务阶段匹配的交互证据,构造Causal Prompt,注入冻结的Cosmos3动作生成模型。整个过程零梯度更新。


技术拆解:Zeva如何“以小博大”


亮点一:Causal Transition Encoder,让模型看见“动作→结果”。


模型显式学习动作引起的状态变化。训练目标包括因果效果预测、任务聚类和阶段进度,让Causal Interaction Signal真正携带物理因果信息。


亮点二:双时标因果记忆,让模型可以跨尝试自我进化。


BIT保证当前执行的连贯性,PIM把一次失败、一次修正、一次成功沉淀为后续可检索的上下文。同一个模型在repeated attempts中越用越强。


亮点三:In-Context Policy Injection,让冻结模型直接消费因果上下文。


通过Causal Prompt把任务、阶段和交互证据注入生成模型,不加额外噪声、不参与flow loss,只作为条件影响后续动作。这是“不调权重也能进化”的关键设计。


和传统Test-Time Training相比,Zeva的差异很直接:


自进化WAM来了!清华AIR联手域变换提出具身In-Context Causal Learning


数据说话:自进化+One-Shot人类演示增强


在RoboCasa365-Atomic5上,Zeva平均成功率76.8%,效果最优。


更重要的是部署后的self-evolution曲线:累计成功率从Evolve 1的26%提升到Evolve 4的73%。


真实化学实验室ChemLab-Evo上,三个原子任务同样呈现单调增长:Pick Up Test Tube从65%到100%,Place Beaker从25%到70%,Pour Water从30%到80%。


Zeva还支持one-shot human demonstration enhancement:一次人类演示初始化PIM后,模型无需微调即可复现关键操作。


量化结果显示,人类warm-up在Place Beaker上最高带来20个百分点的提升,在Pour Water上带来15个百分点的提升。


自进化WAM来了!清华AIR联手域变换提出具身In-Context Causal Learning

RoboCasa365上,Zeva在模型权重完全冻结的情况下,累计成功率从Evolve 1的26%提升到Evolve 4的73%。图片来源:论文


自进化WAM来了!清华AIR联手域变换提出具身In-Context Causal Learning

真实化学实验室中,三个原子任务累计成功率随尝试里程碑提升。模型参数未更新。图片来源:论文


自进化WAM来了!清华AIR联手域变换提出具身In-Context Causal Learning

One-shot人类演示warm-up对三个原子任务的影响。虚线为有人类演示初始化,实线为纯自进化。图片来源:论文


为什么Zeva是一个新范式?


Zeva的深层意义,是把具身模型的scaling从“参数空间”延伸到“上下文空间”。


传统scaling通过扩大数据、参数、算力来提升模型能力。


Zeva展示的另一种scaling是:在部署过程中不断增加可供模型消费的因果上下文。


每一次尝试都会产生新的interaction evidence,这些证据被压缩为Causal Interaction Signal并进入双时标记忆。


模型每多一次交互,就多一次对当前物理环境的“隐式系统辨识”。


这里的理论基础是:模型可以把每个新场景的环境属性作为隐变量,在推理时从过去的动作-效果证据中推断出来。


物体质量、关节约束、接触特性、摩擦条件,都可以通过交互信号被隐式估计。冻结策略因此可以在不改变参数的情况下,不断逼近当前物理系统的真实动态。


更进一步,Zeva的Causal Interaction Signal是一个效应空间中的紧凑表示,直接编码物理效应信息。


跨任务effect retrieval实验显示,不同物体、视角和任务指令下的等价物理效应,会在该空间中彼此靠近。


这意味着模型学到的是“这类物理效应如何产生”,同时也覆盖具体任务的做法。这种表示天然支持跨域迁移,也让“域变换”成为一个可计算、可检索、可复用的技术概念。


如果把VLA看作“任务理解与动作生成”的基础设施,世界模型看作“经验想象”的基础设施,那么Zeva定义的ICCL就是“现场因果学习”的基础设施。


它把部署从“能力消耗”变成“能力积累”,把每一次失败从噪声变成可检索的因果证据。


如果ICCL成立,具身智能的scaling将多出一条独立于参数规模的曲线:交互次数越多,因果上下文越丰富,模型对当前物理域的辨识越准,任务成功率越高。这才是“域变换”作为新范式的真正含义。


结语


清华AIR与域变换联手发布的Zeva,重新定义了具身模型的自进化:


不调权重,也能越用越强;不重新训练,也能从一次人类演示中学会新操作。


域变换开启的,可能是一条新的scaling路径:让机器人在真实物理世界中,自己学会因果,自己完成进化。


参考链接:
[1]论文:Zeva: In-Context Causal Interaction Memory for Embodied Action Generalization
[2]项目主页:https://air-embodied-brain.github.io/Zeva/


关于清华AIR与域变换


清华AIR(Institute for AI Industry Research, Tsinghua University)是清华大学面向第四次工业革命的国际化、智能化、产业化的研究机构,被视为中国AI产学研结合的第一梯队。域变换是清华AIR面向物理智能自进化时代孵化的公司,由刘云新教授和曹婷教授发起,本次发布的Zeva是清华AIR在具身智能方向从前沿研究走向产业落地的重要标志。


自进化WAM来了!清华AIR联手域变换提出具身In-Context Causal Learning


刘云新


清华大学智能产业研究院副院长、博导、万国数据冠名教授、首席研究员,国家级高层次人才、IEEE Fellow


前微软亚洲研究院首席研究主管,长期从事AIoT、端侧智能研究


获得了MobiCom、MobiSys、SenSys等多个国际顶级学术会议奖励,以及CCF科技进步一等奖等奖项。


自进化WAM来了!清华AIR联手域变换提出具身In-Context Causal Learning


曹婷


清华大学教授,北京市高层次引进人才


前微软亚洲研究院首席研究主管,研究方向为边缘智能、具身智能等


获顶级会议最佳论文奖四次,工作入选ACM/Microsoft研究亮点等,其中ACM研究亮点由图灵奖获得者David Patterson亲自撰文推荐。


文章来自于"量子位",作者 "Zeva团队"。

AI转型,免费服务,就找AITNT
AITNT资源拓展
根据文章内容,系统为您匹配了更有价值的资源信息。内容由AI生成,仅供参考
1
AI数据分析

【开源免费】DeepBI是一款AI原生的数据分析平台。DeepBI充分利用大语言模型的能力来探索、查询、可视化和共享来自任何数据源的数据。用户可以使用DeepBI洞察数据并做出数据驱动的决策。

项目地址:https://github.com/DeepInsight-AI/DeepBI?tab=readme-ov-file

本地安装:https://www.deepbi.com/

【开源免费airda(Air Data Agent)是面向数据分析的AI智能体,能够理解数据开发和数据分析需求、根据用户需要让数据可视化。

项目地址:https://github.com/hitsz-ids/airda

2
微调

【开源免费】XTuner 是一个高效、灵活、全能的轻量化大模型微调工具库。它帮助开发者提供一个简单易用的平台,可以对大语言模型(LLM)和多模态图文模型(VLM)进行预训练和轻量级微调。XTuner 支持多种微调算法,如 QLoRA、LoRA 和全量参数微调。

项目地址:https://github.com/InternLM/xtuner

3
prompt

【开源免费】LangGPT 是一个通过结构化和模板化的方法,编写高质量的AI提示词的开源项目。它可以让任何非专业的用户轻松创建高水平的提示词,进而高质量的帮助用户通过AI解决问题。

项目地址:https://github.com/langgptai/LangGPT/blob/main/README_zh.md

在线使用:https://kimi.moonshot.cn/kimiplus/conpg00t7lagbbsfqkq0