反击VLA中「L」无用论:用对位置指令泛化能力暴涨20-40%
反击VLA中「L」无用论:用对位置指令泛化能力暴涨20-40%作为具身智能最主流的路线之一,VLA 快速发展的同时也因为其各种问题被诟病。其中最主要的痛点之一便是指令泛化能力。
搜索
作为具身智能最主流的路线之一,VLA 快速发展的同时也因为其各种问题被诟病。其中最主要的痛点之一便是指令泛化能力。
当 VLA、WAM、RL、TAMP、MPC 等机器人控制策略在各自擅长的任务中大放异彩,如何刻画其能力边界,并在正确的时机为不同子任务匹配最合适的策略,正逐渐成为机器人完成复杂长时序任务的关键。
近年来,视觉 — 语言 — 动作模型(Vision-Language-Action Model,VLA)正逐渐成为通用机器人控制的重要技术路线,但当这些模型真正进入高频闭环执行时,一个矛盾越来越突出:模型越来越大、语义能力越来越强,动作更新却未必足够快。
谷歌:在LLM圈里我唯唯诺诺,在机器人圈里我直接大打出手!
2026 WAIC 刚刚落幕,具身智能无疑是最受关注的技术方向之一。
谁能想到,在全球具身智能操作能力的顶级榜单上,打败海外标杆模型π0的,居然是一个只有1B级参数的轻量级模型。
VLA模型已经会做任务,但真实机器人还是慢!PolicyTrim是一种优化VLA机器人执行效率的方法,无需重新训练。它通过扩展可靠动作序列并减少冗余步骤,帮助机器人更直接完成任务,提升整体速度。
一项机器人拼搭长城的展示火爆全网。从彩排现场的照片来看,围观者已经里三层外三层。原力灵机联合阶跃星辰,用 6 台机器人挑战 15 小时连续作业,搭建完成一座包含超 8 万个零件的长城模型 —— 最小组件不到 1 厘米宽,成品长 3.5 米、宽 1.5 米、高 1.1 米。其中 4 台桌面机器人负责精细零件的拼装,2 台轮式机器人 Apex 负责将拼装完成的组件运输、组装。
机器人,也开始拥有“触觉想象力”了。
音乐和视频之间那道墙,好像被打破了。 上个月,一个做独立音乐的朋友找我吃饭,聊到新歌宣发的事,愁得不行。 歌写好了,录完了,混音也做了,但到了要发的时候才发现,没有视觉内容。 发网易云?光秃秃一个音频