Meta全开源HumanCLAW:基础模型正进入具身智能的决策层
Meta全开源HumanCLAW:基础模型正进入具身智能的决策层Meta联合南洋理工大学等多所高校全开源HumanCLAW基准,将高层行动决策与低层运动控制分离以单独测量视觉语言模型的行动智能,九个前沿模型完整交互成功率仅16.8%,揭示出当前基础模型缺乏持续维护自身身体状态估计的具身自我感知缺口。
搜索
Meta联合南洋理工大学等多所高校全开源HumanCLAW基准,将高层行动决策与低层运动控制分离以单独测量视觉语言模型的行动智能,九个前沿模型完整交互成功率仅16.8%,揭示出当前基础模型缺乏持续维护自身身体状态估计的具身自我感知缺口。
当我们惊叹于大语言模型能写诗、会编程时,科学家们正面临一个更棘手的问题:如何让AI像真正的科研工作者一样,去解决那些需要数月甚至数年持续思考、且充满未知的科学难题?
强化学习与可验证奖励(RLVR)已成为提升视觉语言模型(VLM)推理能力的标配手段。但一个隐蔽的问题始终存在:最终答案的奖励信号,只告诉模型「答对了没有」,却从不告诉它「答案应该从图像的哪个区域得出」。答对,可能是因为真的看懂了图,也可能只是语言先验的捷径、数据集的偏差,甚至是一次幸运的瞎猜。
大视觉语言模型(LVLM)把语言理解扩展到了图像等多模态输入,同时,也带来了更隐蔽的攻击面。
扩散智能DiffuSpace与Acrab联合测试显示,扩散语言模型凭借全局并行生成机制可将端侧Agent运行速度提升约5倍,双方计划加速推进其在AI PC、智能汽车等场景落地。
如果说大语言模型拉开了本轮人工智能革命的序幕,那么今天人机交互的瓶颈,早已不再是模型的智商,而是人类接收信息的生理带宽。
大语言模型,现在真的长出手了。 本周四,Anthropic 宣布推出硬件用 MCP:Model Hardware Standard(MHS),这是一项新标准,用于帮助所有大模型驱动的 AI 智能体(Agent)安全快捷地操纵物理设备。
据 Business Insider 报道,人工智能开源平台 Hugging Face 正探索出售事宜,交易估值有望达到 130 亿美元(约合人民币 876.6 亿元)。该公司总部位于纽约,目前托管着大量开源大语言模型和数据集,并已聘请投行协助评估潜在竞购方意向。
随着大语言模型能力边界的持续拓展,AI Agent 已从概念验证阶段迈入大规模工程落地。然而,Agent 内部复杂的任务规划、工具调用与记忆检索机制,使得传统的应用观测手段在面临这类非确定性系统时显得力不从心。
Pixel 擅长表达 appearance,Code 擅长表达 structure;未来会进入 Pixel-Code 联合的视觉表达。