顶会具身辩论赛实况:徐丹飞激辩,PI连输三轮,谷歌大佬倒戈

AITNT-国内领先的一站式人工智能新闻资讯网站
# 热门搜索 #
顶会具身辩论赛实况:徐丹飞激辩,PI连输三轮,谷歌大佬倒戈
9748点击    2026-07-27 10:50

数据从哪来?控制靠像素还是动作?


 在具身智能与机器人领域迅速演进的今天,一个问题正在浮出水面:


要想让机器人真正走进千家万户,我们到底该靠特定硬件采集的“具身数据”,还是该拥抱浩瀚如海的“互联网与人类行为数据”?


2026年RSS大会最后一天的workshop圆桌讨论,现场火药味十足。五位专家围绕世界模型的实际落地展开激烈交锋。


来自Georgia Tech和Nvidia的徐丹飞,以组合世界模型的研究闻名;Google与NYU的Sherry Yang,专注物理代理的世界模型评估与改进;Physical Intelligence的Laura Smith,强调具身智能的实践落地;NVIDIA的Max Li,长期深耕大模型架构;OpenDriveLab的Li Chen,则在机器人数据与控制领域有丰富经验。


主持人抛出三个核心辩题,让五位专家分成两派正面碰撞。AI科技评论小队在现场记录下这场思想碰撞,以下是完整实录:


01

第一轮辩论:

世界模型和策略模型,应该合体还是分开?


大家都知道现在搞AI都在追求大一统,但在机器人领域,这条路真的走得通吗?主持人一上来就抛出问题——世界模型和策略模型,应该合体还是分开?现场的几位大佬瞬间根据各自的学术立场分成了两大阵营。


本轮对阵的双方是:


  • “大一统”合体派: PI科学家Laura Smith、英伟达Max Li(主张把所有功能塞进一个超级模型里,既动脑又动手)
  • “各司其职”分开派: 谷歌Sherry Yang、源策未来陈立(Lee)、徐丹飞(主张分开搞,看重工程运行效率和调试清晰度)


顶会具身辩论赛实况:徐丹飞激辩,PI连输三轮,谷歌大佬倒戈


支持“合体”的一方认为,现在AI的大趋势就是Everything in One。Laura认为,MoE模型都能把成百上千个专家塞进一个网络,为什么世界模型和策略不能合并?最终我们肯定想要一个超级模型,既能理解世界,又能直接行动。


她的观点得到了同阵营 Max Li 的赞同。从长远来看,Max 也相信未来的终局一定是全能的大模型,但他非常务实地补充道:现在AI“能想象到什么”和机器人“实际能做到什么”之间,其实存在着一条巨大的鸿沟。


视频模型学得再好,动作数据太少也发挥不出来,所以目前的当务之急,是怎么通过表征学习把世界模型的想象力翻译成机器人的执行力。


听到这里,坐在“分开派”阵营的 陈立(Lee) 坐不住了,他直接从底层工程的“运行效率”出发,给合体派泼了一盆冷水。


陈立强调,机器人是要在现实中实时干活的,策略模型的响应速度和运算效率是命根子,必须保证它跑得飞快。


要是为了盲目追求合体,把世界模型这个庞然大物强行塞进同一个网络里,导致策略模型被拖慢、机器人动作卡顿,那在实际落地中根本没办法用。为了效率,必须分开调试和特殊化处理。


顶会具身辩论赛实况:徐丹飞激辩,PI连输三轮,谷歌大佬倒戈


陈立的说法得到了 Sherry Yang 的强烈声援。Sherry 指出:“目前绝大多数模型其实还处于欠拟合阶段。世界模型要吃下海量具身交互数据已经非常吃力,如果再强行塞进策略学习的任务,两个目标会互相打架,训练效果反而下降。”


她进一步解释了两个模块的本质差异:世界模型需要大量失败数据来真正理解物理规律,比如机器人撞到东西、滑倒、抓不稳等场景,这些对提升模型鲁棒性非常重要。但策略模型的主要目标是学习成功行为。如果强行合体,失败数据可能会污染策略,让机器人学到更多错误的动作模式。


徐丹飞也站在分开派这一边。他补充道:分开还有一个很大实际好处——调试和迭代更清晰


当机器人任务失败时,我们能快速定位:到底是世界模型没想对(预测未来不准),还是策略没执行好(动作选错了)。如果全塞到一个黑箱模型里,出了问题就很难指责具体哪个部分。


顶会具身辩论赛实况:徐丹飞激辩,PI连输三轮,谷歌大佬倒戈


现场有观众立刻通过Slido提问:“如果合并了,失败了到底怪谁?”这个问题引起全场笑声,也让辩论更加接地气。最终,这一轮“分开派”在观众投票中略占优势。


第一轮辩完,现场观众的投票里,各司其职派胜过了大一统派,但嘉宾最后互相之间算是勉强达成了共识:世界模型和策略最好还是各回各家、各司其职。


但问题马上又来了,既然把世界模型单独拎出来了,那我们怎么知道这个模型到底有没有把这个世界“看懂、学对”呢?


是看它能不能像拍好莱坞大片一样,生成极其逼真的画面?还是看它能不能精准指导机器人的下一个动作?顺着这个话茬,两派圆桌嘉宾在第二轮直接陷入了更深层的技术纠结。


02

第二轮辩论:

可控性到底靠像素,还是动作?


到了第二轮,关于怎么控制世界模型的讨论,让上一轮的阵营直接打破重组,学术新星和产业专家开始各执一词


本轮对阵的是:


  • “视觉颜值”像素派: Max Li、Laura Smith、陈立(主张视频画面最直观,是人类看懂大模型在想什么的便利接口)
  • “硬核实操”动作派: 徐丹飞、Sherry Yang(中途根据实验修正立场)(主张机器人最终是在现实里干活,动作价值和语义先验高于画面颜值)


第二个问题更加技术化:世界模型的可控性,到底应该主要依赖生成真实像素(视频),还是更应该关注动作层面的 grounding?


顶会具身辩论赛实况:徐丹飞激辩,PI连输三轮,谷歌大佬倒戈


支持像素派的英伟达科学家Max Li 一上来就金句频出。他认为视频是目前最自然、最有效的监督信号,而且他生动地打了个比方:生成高保真的视频,能让我们看清这个大模型到底在想什么——这就好比父母总想搞懂自己处于青春期叛逆孩子的内心想法一样。


英伟达的Max 坚信,人类需要这种视觉上的高保真度,这能带来极佳的可解释性,是人类调试黑盒子系统最方便的接口。


同阵营来自PI的Laura Smith 顺着 Max 的话茬表达了支持。她认为,把未来的画面用视频直观地生动展示出来,最大的好处就是当机器人干砸了的时候,人类能一眼看过去进行“责任划分”(blame assignment),瞬间揪出到底是哪个环节在推卸责任。


但支持动作 grounding 的反方很快泼了冷水。他们承认视频作为人类接口很有用,但指出过度追求像素级真实性有时反而是一种干扰和算力浪费


机器人最终要执行的是可靠的物理动作,而不是去拍一部奥斯卡电影。把算力都花在生成漂亮画面上,可能会牺牲动作的物理一致性和精度,尤其在接触丰富(contact-rich)的任务上。


面对两派的拉扯,Sherry Yang 在这一轮分享了自己的“倒戈”心路历程。她坦言,自己以前也是像素派的坚定支持者,但最近的大模型实验让她开始动摇。


顶会具身辩论赛实况:徐丹飞激辩,PI连输三轮,谷歌大佬倒戈


因为她发现即使把模型规模做到极大,单纯靠堆像素和扩大规模,在遇到需要精细接触的任务时画面依然不够稳健。所以她现在更倾向于在视频生成中引入更多语义信息和物理先验,而不是单纯看画面好不好看。


徐丹飞 也表达了类似的观点。他一针见血地指出,视频其实只是现实世界的一个部分切片。人类在黑暗中摸索或者抓取物品时,根本不需要在脑子里想象出一幅画面,而是更依赖触觉和力反馈。


顶会具身辩论赛实况:徐丹飞激辩,PI连输三轮,谷歌大佬倒戈


因此,判断一个世界模型好不好,核心不能看它画画美不美,而是要看它能不能产出真正的动作价值


这一轮讨论虽然没有明确赢家,但大家逐渐形成共识:视频和动作不是对立关系,而是需要更好结合。单纯靠哪一边都走不远。


讨论到这里,台上的气氛已经有点胶着了。大家发现,无论是追求炫酷的视频画面,还是死磕精细的手感反馈,说到底都是“下游”的应用和表现。


科学家们心里都清楚,再聪明的模型、再完美的算法,没有数据喂养也只是个空壳子。


那么,去哪里给机器人找最顶级、最管饱的“自学教材”?是去白嫖铺天盖地的互联网人类视频,还是必须收集机器人自己的亲身体验?这也就是本场圆桌的最后一问。


03

第三轮辩论:数据该从哪里来?


最后一轮辩论直指根本问题:训练世界模型,主要应该靠互联网和人类视频数据,还是靠具身机器人数据?


本轮对阵的双方是:


  • “借鉴全网”互联网视频派: 徐丹飞、Sherry Yang、Max Li(主张人类视频规模巨大,能极大提升机器人的泛化能力)
  • 崇尚“亲身体验”具身控制派: 陈立、Laura Smith(主张互联网视频难救具体应用,高精度控制必须靠机器人自己的真实数据)


顶会具身辩论赛实况:徐丹飞激辩,PI连输三轮,谷歌大佬倒戈


支持具身数据优先的专家认为,机器人数据包含真实的物理参数、动作反馈和接触力,是最“干净”、最直接的信号。


没有这些,模型很难准确学到接触动力学等关键知识。具身数据才是地基,人类视频只是锦上添花。


甚至连作为“细节控”的 陈立(Lee) 这一轮也站出来公开表达了对互联网数据的怀疑。


他直言不讳地指出,现在业界一谈到大模型就盲目崇拜互联网上的海量数据,但在他看来,那些铺天盖地的互联网视频对机器人具体的、高精度的具身应用来说,并没有那么直接的帮助。


顶会具身辩论赛实况:徐丹飞激辩,PI连输三轮,谷歌大佬倒戈


陈立认为,互联网视频顶多在宏观上帮机器人规划一个“子目标”(sub-goals),但要解决底层的抓取和手脚控制,还是得死磕机器人自己的具身数据。


但支持人类/互联网数据的一方则从规模和泛化角度反驳。徐丹飞说:“纯靠机器人数据,规模太有限,很难覆盖现实中的长尾场景。人类视频数据量巨大,包含各种各样的交互方式和技能组合,能极大提升模型的泛化能力。”


Sherry补充道:“人类本身就是地球上最强大的物理代理。我们可以把人类视频看作另一种‘机器人数据’,通过端到端控制或者姿态表示来对齐二者,这条路非常值得探索。”


尽管双方最终达成较高共识:两者都不可或缺。但现场观众依然对这轮辩论给出了“现场法官”的评判:“借鉴全网”互联网视频派,以61%的投票率,胜过了39%的崇尚“亲身体验”具身控制派。


顶会具身辩论赛实况:徐丹飞激辩,PI连输三轮,谷歌大佬倒戈


当前阶段,如何高效利用人类视频数据、并通过世界模型把它和机器人数据桥接起来,可能是最重要的突破方向。


未来很可能形成一个混合数据飞轮:互联网数据提供广度,机器人数据提供精度,世界模型负责融合和迭代。


04

圆桌总结:技术仍在快速迭代中


三轮辩论结束后,既有输赢,又有共识。


先总结一下投票结果,从现场百位本届RSS参与学者的现场投票来看,第一轮世界模型和策略模型之争,现场投票中,各司其职派的说法更受现场台下学者们的拥护。


第二轮,世界模型的可控性,到底靠像素,还是动作问题上,现场投票更倾向于动作派,也就是主张机器人最终是在现实里干活,动作价值和语义先验高于画面颜值。


第三轮关于训练世界模型,主要应该靠互联网和人类视频数据,还是靠具身机器人数据的辩论中,现场投票更多的,是前者。


进行到这里,现场发生一个小插曲,来自Physical Intelligence的Laura Smith,在三次辩论的投票结果中,都输了,这也让她有一些困惑,但搁置争议,现场还是有很多共识。


几位嘉宾一致认为,世界模型是机器人走向通用的关键,但目前仍面临融合方式、可控性、数据利用等一系列挑战。


真正的突破,可能来自更聪明的组合机制、更平衡的数据策略,以及理论与工程的紧密结合


徐丹飞在最后说:“我们现在看到的只是冰山一角。未来几年,这个领域会非常热闹。”


现场观众报以热烈掌声。这场圆桌没有标准答案,却留下了大量值得深入思考的问题——这或许正是学术会议最迷人的地方。


文章来自于"AI科技评论",作者 "张璐"。

AI转型,免费服务,就找AITNT