VLA动作预测必须经过LLM吗?TurboVLA仅0.2B参数,RTX 4090上跑出32Hz在线动作预测
VLA动作预测必须经过LLM吗?TurboVLA仅0.2B参数,RTX 4090上跑出32Hz在线动作预测近年来,视觉 — 语言 — 动作模型(Vision-Language-Action Model,VLA)正逐渐成为通用机器人控制的重要技术路线,但当这些模型真正进入高频闭环执行时,一个矛盾越来越突出:模型越来越大、语义能力越来越强,动作更新却未必足够快。
搜索
近年来,视觉 — 语言 — 动作模型(Vision-Language-Action Model,VLA)正逐渐成为通用机器人控制的重要技术路线,但当这些模型真正进入高频闭环执行时,一个矛盾越来越突出:模型越来越大、语义能力越来越强,动作更新却未必足够快。
8 月 3 日,在 AGI Playground 2026 大会上,Genspark 创始人&CEO 景鲲在现场发布了一款新产品 GenOffice。这是一个面向 Windows 和 Mac 的本地 Office 客户端。开源、免费、无广告,保留用户熟悉的文档编辑能力,同时把 AI 引入 Word、PPT 等高频办公场景。
8 月 3 日,阿里巴巴正式发布新一代基座大模型 Qwen3.8,总参数量 2.4 万亿,在编程(Coding)和专业办公(Cowork)方面能力大幅提升。今日放榜的权威三方榜单 Arena 中,阿里 Qwen 模型仅次于 Anthropic 的 Claude 系列,整体性能处于全球大模型第一梯队。。
Jay 发自 凹非寺 量子位 | 公众号 QbitAI 啥,谷歌真比OpenAI还早一年搞出了ChatGPT? 不是谷歌事后找补了,这次是OpenAI自己人,Codex负责人Tibo刚佐证的消息: 那
又一家AI初创公司加入了这场狂飙突进的独角兽俱乐部:Simile。据该初创公司透露,就在结束隐身状态、宣布完成由Index Ventures领投的1亿美元A轮融资仅仅五个月后,公司已完成2亿美元B轮融资,估值达到20亿美元。
AI浏览器正为用户完成跨网站的重复工作。
美国政府正在成为 AI 基建的“超级风投”。按公开交易逐笔统计,过去 14 个月,特朗普政府公布的股权或准股权安排已增至约 37 笔。
「我明天要见心理咨询师,」一位居住在波士顿的年轻妈妈,正在规划第二天的行程,不过,这话她既不是说给丈夫听的,也不是说给孩子听的,而是说给 Claude 听的。「帮我捋一捋上次咨询之后我们聊过什么,有什么该拿出来说的。」
最近,一款叫Town的AI助手,成了硅谷创投圈最火的AI产品之一。
当数字人视频从数秒扩展到数分钟,生成系统面对的核心问题不再只是单帧质量,而是递归生成中的误差累积。
这两天,AI圈百家争鸣。GPT-6曝光、DeepSeek V4 Flash公测、SD2.5发布、MiniMax多模态开源视频模型发布……
Agent的能力越来越强,但使用体验仍有一个尴尬之处: 每换一个Agent甚至换一个session,就像换了一个完全不了解你的新员工。
本期《财富》杂志(Fortune Magazine)的旗舰播客《Fortune Next Lead》将镜头对准了戛纳国际创意节(Cannes Lions)上的一场重量级对话。
前段时间,米哈游的一个工程师,在测多Agent协作时忘了设熔断。几十个Agent进入循环调用。
近五分钟“肌肉记忆”,推理延迟不随历史增长
OpenAI还有大招!
整个AI圈,都在为Opus 5沸腾!
7月29日,华盛顿国会山。 奥特曼刚结束一场与参议员的闭门会,一出门就被记者围住。
电影史上有些技术,普通观众未必叫得出名字,却会改变一代人的镜头记忆。
2亿枚AI芯片,要集体开机了!目前,全球投入使用的AI芯片,总算力已经相当于约2000万枚英伟达H100芯片。按照Epoch AI的估算,这个数字大约每9个月翻一倍。到2028年年底,全球AI算力预计将相当于约2亿枚。
最近一个月,差不多每隔两天就有人问我同一个问题:"现在这轮AI,是不是特别像当年互联网刚起来的时候?那是不是闭眼买就完事了?"我每次都被问得一愣。因为这问题问得其实挺对——AI和互联网确实是最常被拿来类比的两件事。但我越想越觉得,它最值钱的部分不是"像不像",而是"像哪一年"。
一个80亿参数的大模型,一口气吞下15万亿token的训练数据,堆到硬盘上差不多7TB。可它真正「背」得下来的,少得可怜:每个参数只装得下3.6 bit。一个英文字母8 bit,连半个都填不满。
Corgi,这家每周工作七天、在旧金山经营通宵咖啡馆的AI保险初创公司,再次从投资者那里获得了融资——不到三个月,已是第三次。多位知情人士告诉《福布斯》,本次融资对公司的估值为40亿美元,几乎是5月底以来其估值的两倍。
近日,独立开发者 Harshal Singh 公布了一个仅有 3500 万参数的基础语言模型 BarunLM,并声称:「我预训练了世界上参数量小于 100M 的最好模型」。
2025 年秋天,Meta 上线了一名可以替商家卖货的“AI 员工”。商家不需要重新整理一套资料,它会直接读取品牌过去发布的社交媒体内容、广告、商品目录和网站信息,自动学会这家公司卖什么、用什么语气和顾客说话。
近日,由清华大学深圳国际研究生院智能机器人实验室刘厚德教授领衔、王立博博士后担任 AI 首席研究员的大模型团队,正式发布了 VeriLoop Coder-E1—— 一款基于 Qwen3.6-27B 构建、面向仓库级代码修复与智能体式软件工程任务的开源垂类代码模型。
8月,一年一度的ChinaJoy又在上海落幕了。今年的主题是“与AI同游”,近900家企业参展,AI成了游戏之外最热的词。当所有镜头都聚焦在游戏时,一个“逆流而上”的展台引起了我们的注意——WPS。
“怎么全世界都在陪着12星座胡闹啊!”AI练习生马上就在要网友们的“打投”中出道了。注意看,在一档名为《12星练赛》的AI选秀节目中,白羊、狮子和射手三位火象星座练习生正在初舞台上展示唱跳实力。
GPT-5.6 Sol 推翻 100 多年前的麦克斯韦猜想,下一代模型突破 10 个!数学家菲利普·阿拉图恩、加文·鲍尔和马修·D·克瓦尔海姆于 2026 年 7 月 29 日在 arXiv 上发表论文,提到由 GPT-5.6 Sol 找到了一个反例,证明了 100 多年前的麦克斯韦猜想是假的。
Seltz为Agent自建一套持续更新的Web索引,让它能够及时看见公开网络中正在发生什么;AnySearch聚合开放Web和20多个垂直数据源,让Agent知道面对不同问题应该去哪里查;Octen则重写索引、排序和服务层,让Agent可以同时展开几十甚至上百次查询,更快、更大规模地看见信息。