Zero-Shot、长记忆、抗干扰,DM0.5把VLA带进真实世界
Zero-Shot、长记忆、抗干扰,DM0.5把VLA带进真实世界今天原力灵机正式发布的 DM0.5 往前推进了一步。它不只是继续提高某些固定任务上的表现,而是围绕真实世界里的泛化问题做了一次系统突。 如果深入分析,就会发现 DM0.5 这几个核心提升,都是想解决一个问题:如何让具身模型从可控环境里的能力演示,走向开放环境里的稳定执行。
搜索
今天原力灵机正式发布的 DM0.5 往前推进了一步。它不只是继续提高某些固定任务上的表现,而是围绕真实世界里的泛化问题做了一次系统突。 如果深入分析,就会发现 DM0.5 这几个核心提升,都是想解决一个问题:如何让具身模型从可控环境里的能力演示,走向开放环境里的稳定执行。
来自浙江大学 APRIL 实验室、快手主站技术部和清华大学的研究团队提出了 MobileForge,试图把手机 GUI Agent 的适配过程变成一个 “无标注、自探索、自反馈、自优化” 的闭环系统。
本文是北京大学彭宇新教授团队联合福州大学柯逍教授团队在细粒度多模态动作质量评价领域的最新研究成果,相关论文已被 ICML 2026 接收为 Spotlight,并已开源。真实世界中的多模态数据往往并不完整。在动作质量评价任务中,视频、光流、音频等模态能够从不同角度描述动作执行过程,但在实际采集时,传感器故障、环境噪声、隐私限制等因素都会导致模态缺失。
一家法国公司完成了一轮 4.8 亿欧元(约 5.5 亿美元)的融资,估值一举冲到 55 亿欧元(约 63 亿美元)。这家公司叫 Alan。它做的恰恰就是最不被看好的健康保险。但它的故事之所以值得讲,是因为 Alan 根本不是一家「用了 AI 的保险公司」,它更像是一家「顺便卖保险的 AI 公司」。
一家叫生数科技的公司,用自己的方式来切入。他们最近上线了一款叫Vidy的产品,定位是AI Vibe Buddy。文字陪聊,语音输入等部分部分基本基本功能在AI陪伴产品中都是最常见的,有日常话题推荐,比如让AI讲个笑话,推荐一部电影,或者讲一个故事。更进一步的就是语音通话功能,这一个也是目前越来越多陪伴产品支持的。
多模态 Agent 的记忆系统,过去很容易被理解成一个升级版 RAG:图片、图表、PDF 进来之后,先抽取内容、做 embedding、写进向量库;用户提问时,再用 query 做检索,把命中的top-k图片、文档页或图表一并塞进上下文,再交给多模态模型回答。整个过程中,所有原始模态信息都会不加选择的塞给大模型。
从5月发布AI支付全栈产品构建智能体交易信任底座,到6月通过“史上最大改版”的AI版支付宝革新C端交互范式,再到本次开放平台打通全行业、全域服务链路,支付信任底层、用户交互入口、跨端开放生态三层核心能力依次落地。
朋友向她推荐了字节旗下的扣子。今年3月起,朋友就用扣子自动盯盘、分析、复盘,生成每日投资日报。在她看来,扣子之所以适合投资人,关键在于接入了同花顺、中金、广发等多个数据源,再配合定时任务,能把投研中大量重复、连续的工作沉淀为固定流程。
现在,我依然会使用AI,但是我不再把AI的产出当成最终答案。AI可以帮我提高效率,却不能替我承担结果。它写错一个字、弄错一条信息,最后向客户解释的是我,被领导追责的也是我。该自己做的判断,一个都不能省。
葬AI身边的朋友常常有个疑问:为什么MiniMax M3做的不够好(问了很多在做模型测评的朋友,也是类似看法),但市场仍然觉得他们是第一梯队?我朋友@朱亦辉的解释是,MiniMax M3的核心科技是叙事能力,让外界觉得他们和Kimi是一个级别,达到一个强行双骄的效果。