UniSteer用机械臂「拼豆」:让人类指导进入VLA噪声空间强化学习
UniSteer用机械臂「拼豆」:让人类指导进入VLA噪声空间强化学习视觉 - 语言 - 动作模型(Vision-Language-Action Model,VLA)正在成为机器人操作的重要基础模型。经过少量示范微调后,VLA 已经能够完成抓取、放置、堆叠等多种任务。然而,一旦任务涉及精密接触、狭小容差或分布外位置,模型的成功率仍会明显下降。
搜索
视觉 - 语言 - 动作模型(Vision-Language-Action Model,VLA)正在成为机器人操作的重要基础模型。经过少量示范微调后,VLA 已经能够完成抓取、放置、堆叠等多种任务。然而,一旦任务涉及精密接触、狭小容差或分布外位置,模型的成功率仍会明显下降。
影眸Hyper3D发布世界生成模型WorldGen,用户上传一张场景图片即可在两三分钟内生成由多个独立可交互物体组成的3D场景,物体具备质量、摩擦系数等物理属性,可直接接入Blender、Unity、Unreal Engine等主流工具及机器人仿真环境,标志着3D生成进入场景级时代。
国家集成电路产业投资基金三期(大基金三期)通过控股的国家人工智能产业投资基金,向快手旗下AI视频生成产品可灵投资14亿元,正大机器人同期投资1.31亿元,可灵本轮约204.47亿元认购限额已全部动用。
COCO Matrix CEO高宇翔在访谈中提出,真实世界不可能被提前穷举,具身智能应将In-Context Learning作为核心范式,让机器人通过现场示范和纠正直接适应新任务与新环境,而非每遇到新任务都依赖重新采集大量数据并训练模型,从而显著降低部署门槛和适配成本。
众擎机器人CEO赵同阳在2026世界机器人大会上透露,今年已将60%资金与人力投入机器人"大脑"研发,发布仿人脑五层体系架构EngineAI Awaken,明确不做"第二个宇树",借鉴英伟达底层平台与生态路线,并将80%至90%资源押注商用、工业及家庭等应用场景。
新加坡Physical AI公司Ropedia正式发布新一代多模态采集系统HOMIE Gen2,以4目全景360°、十余种模态同步采集与开箱即用的高精度训练级数据,将人类经验规模化为机器人可直接学习的训练数据,推动Physical AI的经验规模化落地。
不久前在北京一南一北,前后脚有两场科技大会开幕。南边是亦庄的世界机器人大会,北边是海淀的科学智能大会。虽然很多人没听说过后者,但它实实在在关乎AI的前沿进展,其今年主题为:人工智能变革科研范式。
造物100第4期盘点Hugging Face开源鸭子机器人Microduck、Plaud One AI录音耳机、字节TRAE联名FoloToy的AI工牌及Autonomous.ai桌面台灯等多款新品,指出软件公司正以更低价格和半成品DIY策略推动AI从屏幕走向物理设备。
从《四驱兄弟》里那些在赛道上奔跑的机械想象,到后来扎进机器人学习领域的漫长探索,徐梦迪始终被同一个问题牵引:机器要怎样进入物理世界,并在那里持续生长。
在 2026 世界人形机器人运动会 - 工业场景赛 -「装配上料岗」赛项中,一台机器人需要连续完成搬运上架、拣选上料、物料装配三项任务:从搬运 10kg 物料箱,到七类零件拣选,再到发动机 18 个气门的亚毫米级装配。