WAIC 2026观察:智元、PI、Genesis、Sunday同台论道,数据飞轮能否推倒Scaling Law的物理墙?

AITNT-国内领先的一站式人工智能新闻资讯网站
# 热门搜索 #
WAIC 2026观察:智元、PI、Genesis、Sunday同台论道,数据飞轮能否推倒Scaling Law的物理墙?
6390点击    2026-07-21 10:31

WAIC 2026观察:智元、PI、Genesis、Sunday同台论道,数据飞轮能否推倒Scaling Law的物理墙?


模型决定起点,数据定义终局。


2026年盛夏,上海世博中心,世界人工智能大会(WAIC)如约而至。如果说前几届大会的焦点是数字世界中的大模型参数竞赛,那么今年,聚光灯无疑打向了一个更富挑战性的领域:物理AI。


大会期间,中国向全球宣布支持人工智能发展与国际合作的重要举措,释放出进一步推动AI开放创新的信号。随着人工智能从实验室走向产业,全球AI竞争也正在进入一个新的阶段:从单纯追求模型能力突破,转向探索如何让智能真正进入现实世界。


7月19日,一场名为“智启具身”的论坛,汇聚了来自Physical Intelligence(PI)、Genesis AI、Dyna Robotics、腾讯Robotics X、Sunday Robotics、智元及觅蜂科技等全球具身智能领域的代表力量。


与过去围绕大模型参数规模、训练算力展开的讨论不同,这场论坛的议题更加底层,也更加紧迫:当Scaling Law在数字世界推动大模型不断突破,而机器人进入现实世界后遭遇数据稀缺、物理规律复杂以及长尾场景不可预测等限制,下一阶段的智能增长究竟依靠什么?


这不仅是本次论坛的核心悬念,也是当前具身智能产业最大的时代之问。


01. 

技术路线四路交汇:寻找物理世界的Scaling路径 


过去几年,以大语言模型为代表的数字智能证明了一条路径:数据规模越大、模型参数越多、算力越强,智能涌现的效果就越显著。然而,当人工智能试图从数字空间进入物理世界时,它面临的是完全不同的数据环境。语言模型学习的是互联网上已沉淀的数字信息,而机器人需要学习如何感知、理解并作用于一个不断变化的物理世界。一次简单的抓取动作,背后不仅包含视觉理解与语言指令,还涉及物体属性、空间关系、力度控制以及接触后的实时反馈。


当前,具身智能领域并不存在一条已被证明绝对正确的技术路径。不同团队正从不同角度探索通往通用机器人的路线,而这些探索的背后,本质上对应着对“智能如何产生”的不同理解。


Physical Intelligence(PI)代表的VLA(Vision-Language-Action)路线,是当前最接近大模型发展逻辑的路径之一。其核心思路是将视觉、语言和动作统一到一个基础模型中,让机器人通过大规模经验数据学习通用能力。


WAIC 2026观察:智元、PI、Genesis、Sunday同台论道,数据飞轮能否推倒Scaling Law的物理墙?


PI研究科学家任至意在论坛现场分享了π系列模型的演进历程:从π0到π0.5、π0.6,再到2026年4月发布的π0.7,PI通过不断扩大机器人训练数据规模,追求更强的泛化能力。据介绍,π0.7已在部分未见场景中实现了超过80%的任务成功率,且无需针对具体任务进行微调。


值得注意的是,PI在最新模型中引入了更丰富的上下文信息,包括详细的视觉历史、密集的多模态语言指令,甚至对数据质量的元信息标注,让模型能够理解不同数据的价值。任至意认为,π0.7已经展现出一种“可控的涌现能力”,即通过精准的提示指引,一个模型可以完成叠衣服、操作空气炸锅等从未见过的任务,甚至实现了跨本体的技能迁移。


不过,VLA路线也面临一个关键质疑:机器人不能仅靠“看到”来完成任务,它必须理解任务背后的物理过程。对于语言模型而言,“拿起杯子”是一段文本描述;但对于机器人而言,这意味着识别杯子的位置与材质、判断重量、控制抓取力度,并根据接触反馈不断调整动作。


这也是为什么世界模型路线开始受到越来越多关注。


清华大学计算机系副研究员苏航在演讲中指出,具身智能并非简单地将大语言模型能力迁移到机器人身上,而是需要构建面向物理交互的新型基础模型。在他看来,具身智能需要也值得拥有自己领域的原生大模型,因为许多物理操作(如打螺丝、炒菜、拉拉链)很难仅用语言和图像完整描绘。他提出,未来的具身模型应当综合利用遥操数据、无本体数据、互联网视频以及人类第一视角数据,构建一个统一的概率空间建模框架,将预测、感知和行动融合为一体。


WAIC 2026观察:智元、PI、Genesis、Sunday同台论道,数据飞轮能否推倒Scaling Law的物理墙?


苏航团队的实验表明,世界动作模型在任务泛化能力上明显优于传统VLA,即当任务数量增多时,VLA模型容易出现性能退化,而世界动作模型则能保持稳定甚至持续提升。


仿真与真实数据路线则从另一个维度回应了数据稀缺的挑战。


Genesis AI联合创始人王尊玄强调,机器人问题本质上是一个系统工程问题。相比大模型可以直接利用互联网数据训练,机器人需要同时解决硬件、数据采集、训练环境、评估体系以及部署等多个环节。Genesis AI的探索重点在于构建高保真仿真环境,将其作为模型评测和强化学习后训练的核心平台。其核心逻辑是:如果能够构建出与真实高度一致的仿真环境,那么机器人训练就可以像代码Agent一样,通过大规模并行计算来缩放,将物理问题转化为计算问题。


王尊玄同时指出,仿真与真实之间的差距(Sim-to-Real Gap)仍然是行业长期需要解决的问题。当前仿真环境与真实环境的相关性虽已提升,但物理世界中物体摩擦、光照变化、接触关系等不确定因素依然难以被完全模拟。


Dyna Robotics所代表的真实数据路线,则更加关注机器人在真实环境中如何获得持续稳定的能力。其联合创始人兼首席科学家马也骋认为,具身智能要产生真正的商业价值,模型必须具备极高的可靠性和成功率。为此,Dyna Robotics在部署场景中构建了一套完整的奖励函数模型,通过实时评估任务进度来精准定位错误环节,再针对性地采集恢复数据。


WAIC 2026观察:智元、PI、Genesis、Sunday同台论道,数据飞轮能否推倒Scaling Law的物理墙?


正是通过这种“部署—反馈—再训练”的循环,Dyna的机器人在餐厅折餐巾任务中实现了24小时不间断运行、累计完成800余件的高可靠性表现。马也骋强调,部署回流数据是整个数据金字塔的顶端,虽然数量最少,但质量最高、价值最大,能够显著加速后续场景的部署效率。


从论坛中四位前沿研究者的讨论来看,这些路线之间并非简单的竞争关系。VLA需要世界模型提升物理理解,世界模型需要真实数据进行校准,仿真需要现实反馈来修正偏差,而真实机器人部署又需要基础模型和仿真环境来提高效率。行业正在从寻找“唯一答案”,转向探索一个融合式架构。


而在这个架构背后,一个更关键的问题逐渐浮现:当模型能力逐渐提升之后,下一阶段真正限制具身智能发展的,到底是什么?


答案正在指向数据。


02. 

数据飞轮:冲破物理世界的三重围墙 


如果说大模型时代最宝贵的资源是互联网上已数字化的海量信息,那么具身智能时代最稀缺的资源,则是能够真实反映物理交互的高质量数据。这是机器人区别于语言模型最大的挑战:它无法通过阅读文本获得抓取、移动、装配等技能,而必须通过一次次实际行动,与环境发生交互,再从结果中学习。


智元合伙人、觅蜂科技CEO姚卯青在开篇演讲中将这一挑战总结为“三道墙”:数据墙,真实交互数据极其稀缺,获取成本远高于爬取网页信息;表征墙,缺少跨任务、跨场景、跨本体的统一物理表征,各领域“各自为战”;闭环墙,在真实世界中试错代价昂贵,一次失败可能导致硬件损坏,反馈周期长且难以规模化。


在这三道墙中,数据墙是当前最直接、最紧迫的限制。姚卯青在演讲中透露,部分真实机器人数据的采集成本约为每小时1000元。这意味着,具身智能无法像语言模型那样依靠简单扩大数据规模来获得能力提升,企业必须探索更高效的数据生产方式。


WAIC 2026观察:智元、PI、Genesis、Sunday同台论道,数据飞轮能否推倒Scaling Law的物理墙?


觅蜂科技提出的“数据金字塔”模型代表了一种典型探索:底层是海量的互联网视频数据,帮助模型建立对世界的基本认知;中间层是通过MEgo系列无本体采集设备获得的第一视角交互数据,包括MEgo Gripper(高精度物理交互采集)和MEgo View(多视角头戴式采集系统),这些设备可以让人走进真实场景全天候采集数据,同时通过自研VIO算法实现毫米级空间轨迹精度和亚毫秒级多传感器时间同步;顶层则是最高价值的真机数据和部署回流数据。


值得注意的是,觅蜂科技在数据治理环节也构建了核心壁垒。其MEgo Engine一站式数据治理平台,能够将长达数小时的原始视频自动切分为帧级精准的原子技能单元,语义打标准确率超过98%,目前已构建起涵盖十大动作类、120余种原子动作的技能图谱。这种将非结构化的物理交互过程转化为结构化、可复用数据资产的能力,正在成为数据飞轮能否有效运转的关键。


而在真实数据之外,仿真也在重新定位自身的角色。它不再被视为真实数据的替代品,而是数据体系中的一个有机组成部分,即通过大规模仿真扩大数据规模,再利用真实环境反馈不断修正模型,让机器人训练逐渐接近大模型时代的规模化路径。姚卯青在总结中提出:“模型决定了企业进入赛道的起点,而持续产生数据的能力,决定最终能够走多远。”


03. 

从“堆参数”到“建循环”:具身智能竞争范式的切换 


纵观整场论坛,一个清晰的变化正在发生:具身智能的竞争正在从单一的模型能力比拼,转向“模型—数据—部署”三位一体的系统能力竞争。谁能够让机器人规模化进入真实环境,谁就拥有了持续获得高质量数据的机会,这也正在成为新一代具身智能企业的核心护城河。


这种转变在多家企业的实践中得到印证。PI通过将机器人部署到真实的Airbnb家庭环境中采集多样化数据,再结合数据质量标注和错误数据回流,构建了从π0到π0.7的持续迭代飞轮。Dyna Robotics则通过在餐厅、洗衣房等真实场景中部署,将部署反馈数据重新注入预训练,使后续新场景的部署时间不断缩短。智元与觅蜂更是将“百台机器人集群在线强化学习”变为现实,在嘉兴的实验场地中,超过100台机器人通过“云—边—端”协同组网,实时上报交互经验,模型权重可在2秒内下发到所有机器人,训练周期从天级压缩到分钟级。


这些实践共同指向一个趋势:具身智能的未来,不是由某一次模型突破单独定义的,而是由一套能够持续产生数据、持续优化模型、持续扩展能力的系统所决定的。就像姚卯青在演讲结尾所说的那样:“模型决定起点,数据定义终局。只有飞轮真正转动起来,智能涌现才会出现。”


04. 

全球竞合与“ChatGPT时刻”的共识 


从WAIC这场论坛可以观察到,全球具身智能产业正在形成差异化的竞争格局。


海外企业更多从基础模型和单点技术创新切入:PI致力于打造通用具身大脑,Genesis AI试图通过系统化方式解决机器人工程难题,Dyna Robotics则强调真实场景中的可靠部署。而中国企业正在探索另一条路径:不仅关注模型本身,也试图打通机器人本体、数据采集、部署场景和制造能力。


WAIC 2026观察:智元、PI、Genesis、Sunday同台论道,数据飞轮能否推倒Scaling Law的物理墙?


而在论坛圆桌环节结尾,一个核心问题被提及:机器人距离自己的“ChatGPT时刻”还有多远?


不同嘉宾给出了各自的判断。姚卯青认为大约需要两年,主要取决于数据方面的进展;Physical Intelligence研究科学家任至意表示,自己曾认为需要十年,如今可能缩短到四五年;Dyna Robotics联合创始人马也骋判断约为四年;腾讯Robotics X负责人张正友则预估三到五年,但强调需要“踏踏实实去做”;Sunday Robotics联合创始人兼CEO赵子豪则更为乐观,认为这一时刻可能在三年内到来。


尽管时间窗口各有差异,但背后指向同一个趋势:物理AI正在进入加速阶段,这个加速的核心动力不是算力或算法的单一突破,而是数据飞轮真正开始转动。


文章来自于"新物种Sinovum",作者 "新物种Sinovum"。

AI转型,免费服务,就找AITNT
AITNT资源拓展
根据文章内容,系统为您匹配了更有价值的资源信息。内容由AI生成,仅供参考
1
智能体

【开源免费】AutoGPT是一个允许用户创建和运行智能体的(AI Agents)项目。用户创建的智能体能够自动执行各种任务,从而让AI有步骤的去解决实际问题。

项目地址:https://github.com/Significant-Gravitas/AutoGPT


【开源免费】MetaGPT是一个“软件开发公司”的智能体项目,只需要输入一句话的老板需求,MetaGPT即可输出用户故事 / 竞品分析 / 需求 / 数据结构 / APIs / 文件等软件开发的相关内容。MetaGPT内置了各种AI角色,包括产品经理 / 架构师 / 项目经理 / 工程师,MetaGPT提供了一个精心调配的软件公司研发全过程的SOP。

项目地址:https://github.com/geekan/MetaGPT/blob/main/docs/README_CN.md

2
微调

【开源免费】XTuner 是一个高效、灵活、全能的轻量化大模型微调工具库。它帮助开发者提供一个简单易用的平台,可以对大语言模型(LLM)和多模态图文模型(VLM)进行预训练和轻量级微调。XTuner 支持多种微调算法,如 QLoRA、LoRA 和全量参数微调。

项目地址:https://github.com/InternLM/xtuner