AI资讯新闻榜单内容搜索-泛化能力

AITNT-国内领先的一站式人工智能新闻资讯网站
# 热门搜索 #
搜索: 泛化能力
全球首个云端具身大模型炸场WAIC:一脑控多手、30秒换手,行业首例

全球首个云端具身大模型炸场WAIC:一脑控多手、30秒换手,行业首例

全球首个云端具身大模型炸场WAIC:一脑控多手、30秒换手,行业首例

RoboScience机器科学直接把世博馆展台,变成了 Visics 的压力测试场。换本体、换物品、换任务,多轮挑战轮番上阵,专挑具身大模型最容易掉链子的地方下手。Visics 的泛化能力究竟行不行?现场观众可以直接点题,围观验货。

来自主题: AI资讯
8069 点击    2026-07-18 10:27
ECCV 2026|Google等推出VGGRPO:用4D隐空间奖励实现世界一致的视频生成

ECCV 2026|Google等推出VGGRPO:用4D隐空间奖励实现世界一致的视频生成

ECCV 2026|Google等推出VGGRPO:用4D隐空间奖励实现世界一致的视频生成

最近,来自 Google、哥本哈根大学、牛津大学等机构的研究者提出了 VGGRPO(Visual Geometry GRPO,收录于 ECCV 2026)。这项工作聚焦于一个核心问题:如何在不牺牲预训练模型泛化能力的前提下,高效地提升视频生成的几何一致性,并使其适用于动态场景。其核心思路是,在隐空间(latent space)中利用 4D 几何奖励,进行几何感知的视频后训练。

来自主题: AI技术研报
9190 点击    2026-07-18 10:09
对话2004年生世界模型创业者陈博远:我不是天才|新皮层

对话2004年生世界模型创业者陈博远:我不是天才|新皮层

对话2004年生世界模型创业者陈博远:我不是天才|新皮层

Yann LeCun的JEPA架构很可能不会work,但至少证明了隐空间比像素或文本空间具备更强的泛化能力;

来自主题: AI资讯
9387 点击    2026-07-01 15:39
登顶权威榜单!无界动力发布全球首个「长时序双向物理因果链」隐空间世界模型 MWA™

登顶权威榜单!无界动力发布全球首个「长时序双向物理因果链」隐空间世界模型 MWA™

登顶权威榜单!无界动力发布全球首个「长时序双向物理因果链」隐空间世界模型 MWA™

当前,物理 AI 正面临着关于泛化能力的普遍质疑。当模型缺乏对真实物理规律的深度认知、难以跨越复杂多变的开放场景时,如何让机器人真正理解物理世界并精准规划决策,已成为具身智能破局的关键。

来自主题: AI技术研报
7915 点击    2026-06-30 10:48
刚刚,国产预训练具身大模型开源了,让后训练不再是必选项!

刚刚,国产预训练具身大模型开源了,让后训练不再是必选项!

刚刚,国产预训练具身大模型开源了,让后训练不再是必选项!

2026 年初,国内具身智能赛道掀起了一波开源潮,越来越多团队开始公开自己的视觉-语言-动作(VLA)模型、数据集与训练框架。与此同时,行业竞争也逐渐集中到 benchmark 成绩、任务成功率以及跨任务泛化能力上,尤其是在标准化或已训练任务中的表现。

来自主题: AI技术研报
8600 点击    2026-05-29 09:19
首创TTFA指标!港大团队开源FASTER,让VLA模型真正实现「即刻响应」

首创TTFA指标!港大团队开源FASTER,让VLA模型真正实现「即刻响应」

首创TTFA指标!港大团队开源FASTER,让VLA模型真正实现「即刻响应」

具身智能正以前所未有的速度发展,VLA 模型展现出越来越强的动作和泛化能力。然而,当我们真正把 VLA 模型部署到物理世界时,一个核心挑战浮出水面:实时性。

来自主题: AI技术研报
8726 点击    2026-05-15 09:55
VLA模型为何忽视语言?破解指令跟随幻觉,分布外场景泛化新突破

VLA模型为何忽视语言?破解指令跟随幻觉,分布外场景泛化新突破

VLA模型为何忽视语言?破解指令跟随幻觉,分布外场景泛化新突破

当前VLA模型常依赖视觉线索而非语言指令,导致在新场景下表现不佳。论文提出LangForce方法,通过引入对数似然比损失,强化模型对语言的依赖,提升其在分布外环境中的泛化能力,并保留语言核心功能。

来自主题: AI技术研报
10256 点击    2026-05-13 15:00
用雨伞「钓」无人机?首个针对自主目标跟踪闭环系统的物理攻击

用雨伞「钓」无人机?首个针对自主目标跟踪闭环系统的物理攻击

用雨伞「钓」无人机?首个针对自主目标跟踪闭环系统的物理攻击

研究者用特制雨伞干扰无人机视觉系统,让其误判目标在远去,从而失控俯冲。FlyTrap攻击无需信号干扰,仅靠物理图案就能欺骗多款商用无人机,实现静默捕获或击毁。实验显示,物理闭环攻击成功率超60%,且对新人物、新场景均有强泛化能力。这项研究揭示了AI感知系统的重大安全隐患,警示我们:视觉安全正成为智能设备的阿喀琉斯之踵。

来自主题: AI技术研报
10575 点击    2026-04-07 14:28
ICRA 2026 | NUS邵林团队提出Goal-VLA:生成式大模型化身「世界模型」,实现零样本机器人操作

ICRA 2026 | NUS邵林团队提出Goal-VLA:生成式大模型化身「世界模型」,实现零样本机器人操作

ICRA 2026 | NUS邵林团队提出Goal-VLA:生成式大模型化身「世界模型」,实现零样本机器人操作

在具身智能领域,机器人操作的泛化能力一直是一个核心挑战。当前,视觉 - 语言 - 动作(VLA)模型主要分为两大范式:端到端模型与分层模型。端到端 VLA 模型(如 RT-2 [1], OpenVLA [2])严重依赖海量的 “指令 - 视觉 - 动作” 成对数据,获取成本极高,导致其在面对新任务或新场景时零样本泛化能力受限。

来自主题: AI技术研报
6669 点击    2026-03-30 15:00
用SFT打出RL的效果?微软联合提出高效后训练算法

用SFT打出RL的效果?微软联合提出高效后训练算法

用SFT打出RL的效果?微软联合提出高效后训练算法

在大模型后训练阶段,监督微调(SFT)和强化学习(RL)是两根不可或缺的支柱。SFT 利用高质量的离线(Off-policy)数据快速注入知识,但受限于静态数据分布,泛化能力往往容易触及天花板并带来灾难性遗忘;RL 则允许模型在探索中不断自我迭代,产生与当前策略同分布(On-policy)的数据,上限极高,但往往伴随着训练极度不稳定、计算资源消耗巨大的痛点。

来自主题: AI技术研报
6102 点击    2026-03-26 10:47