一个模型场景通吃!它石智航AWE3.7的泛化能力有点狠
一个模型场景通吃!它石智航AWE3.7的泛化能力有点狠长期以来,机器人系统大多依赖专有模型。
搜索
长期以来,机器人系统大多依赖专有模型。
真正的智能,在于能否基于有限的数据,实现可靠的泛化与迁移。
作为具身智能最主流的路线之一,VLA 快速发展的同时也因为其各种问题被诟病。其中最主要的痛点之一便是指令泛化能力。
RoboScience机器科学直接把世博馆展台,变成了 Visics 的压力测试场。换本体、换物品、换任务,多轮挑战轮番上阵,专挑具身大模型最容易掉链子的地方下手。Visics 的泛化能力究竟行不行?现场观众可以直接点题,围观验货。
最近,来自 Google、哥本哈根大学、牛津大学等机构的研究者提出了 VGGRPO(Visual Geometry GRPO,收录于 ECCV 2026)。这项工作聚焦于一个核心问题:如何在不牺牲预训练模型泛化能力的前提下,高效地提升视频生成的几何一致性,并使其适用于动态场景。其核心思路是,在隐空间(latent space)中利用 4D 几何奖励,进行几何感知的视频后训练。
来自清华大学与腾讯的研究者提出了 Generalizable Predictive Prompt Selection(GPS)。GPS 的做法很直接:先训练一个小型、可泛化的 Prompt Predictive Model(PPM),让它预测不同 prompt 在当前模型下的难度;再根据难度和 batch 多样性选择训练样本,从而减少无效 rollout。
今天原力灵机正式发布的 DM0.5 往前推进了一步。它不只是继续提高某些固定任务上的表现,而是围绕真实世界里的泛化问题做了一次系统突。 如果深入分析,就会发现 DM0.5 这几个核心提升,都是想解决一个问题:如何让具身模型从可控环境里的能力演示,走向开放环境里的稳定执行。
VLA 大模型看似强大,却被一个致命弱点扼住喉咙——相机稍微挪动几毫米,操作成功率就能暴跌一半。招商局先进技术研究院下属实验室提出新的移动数据范式,首次在真实机器人系统上证明:让相机动起来采集数据,就能以极低成本破解 VLA 的空间泛化瓶颈,且效果普适于多种主流架构。被一个致命弱点扼住喉咙——相机稍微挪动几毫米,操作成功率就能暴跌一半。
Yann LeCun的JEPA架构很可能不会work,但至少证明了隐空间比像素或文本空间具备更强的泛化能力;
当前,物理 AI 正面临着关于泛化能力的普遍质疑。当模型缺乏对真实物理规律的深度认知、难以跨越复杂多变的开放场景时,如何让机器人真正理解物理世界并精准规划决策,已成为具身智能破局的关键。