AI资讯新闻榜单内容搜索-RL

AITNT-国内领先的一站式人工智能新闻资讯网站
# 热门搜索 #
搜索: RL
98年哈工大教授带队,破晓智能要把触觉写进机器人基础模型

98年哈工大教授带队,破晓智能要把触觉写进机器人基础模型

98年哈工大教授带队,破晓智能要把触觉写进机器人基础模型

瞄准这类 “看起来做对了,物理上却没完成” 的失败。破晓智能(PHANES AI)创始人、哈工大(深圳)长聘教授杨朔及其团队发布了最新论文 TouchWorld: A Predictive and Reactive Tactile Foundation Model for Dexterous Manipulation。

来自主题: AI资讯
10358 点击    2026-07-12 16:37
老黄RTX Spark真机现身Bilibili World!CPU和GPU直接焊在一起,笔记本跑120B大模型

老黄RTX Spark真机现身Bilibili World!CPU和GPU直接焊在一起,笔记本跑120B大模型

老黄RTX Spark真机现身Bilibili World!CPU和GPU直接焊在一起,笔记本跑120B大模型

就在这届Bilibili World上,英伟达首次面向大众玩家展示了搭载RTX Spark超级芯片的笔记本电脑。这款芯片专为个人智能体打造,不仅搭载了Blackwell RTX GPU,连CPU也是出自英伟达的Grace CPU。

来自主题: AI资讯
9152 点击    2026-07-12 10:52
北航、北大和美团联合提出:策略提升强化学习!

北航、北大和美团联合提出:策略提升强化学习!

北航、北大和美团联合提出:策略提升强化学习!

来自北航、北大、美团的研究团队提出了Policy Improvement Reinforcement Learning, PIRL,以及对应的落地算法 PIPO。这项工作关注的是大模型 RL 后训练中一个非常基础、但长期被默认跳过的问题:一次更新在当前数据上看起来优化了学习信号,是否就真的说明模型策略变强了?

来自主题: AI技术研报
7915 点击    2026-07-12 10:44
ICML 2026|小模型也能「指挥」大模型RL后训练:清华&腾讯提出GPS,最高减少69% Rollout成本

ICML 2026|小模型也能「指挥」大模型RL后训练:清华&腾讯提出GPS,最高减少69% Rollout成本

ICML 2026|小模型也能「指挥」大模型RL后训练:清华&腾讯提出GPS,最高减少69% Rollout成本

来自清华大学与腾讯的研究者提出了 Generalizable Predictive Prompt Selection(GPS)。GPS 的做法很直接:先训练一个小型、可泛化的 Prompt Predictive Model(PPM),让它预测不同 prompt 在当前模型下的难度;再根据难度和 batch 多样性选择训练样本,从而减少无效 rollout。

来自主题: AI技术研报
8268 点击    2026-07-11 11:16
你的自教师模型还在用参考解吗?马普所联合清华大学推出d-OPSD,第一个针对扩散语言模型的在线自蒸馏学习

你的自教师模型还在用参考解吗?马普所联合清华大学推出d-OPSD,第一个针对扩散语言模型的在线自蒸馏学习

你的自教师模型还在用参考解吗?马普所联合清华大学推出d-OPSD,第一个针对扩散语言模型的在线自蒸馏学习

有没有一种更为合适的 OPSD 范式?近期,清华大学和马普所等机构的研究者们联合推出的 d-OPSD,给这一问题提供了完美的答案。这是第一个针对扩散大语言模型的 OPSD 范式,无需参考解,无需额外的教师模型,只需要 RL 十分之一的训练步数,便可以达到或超出 RL 的后训练效果。

来自主题: AI技术研报
8044 点击    2026-07-10 10:41
蚂蚁灵波发布最新世界模型 LingBot-World 2.0,无限时长、随机变化的世界,终于来了?

蚂蚁灵波发布最新世界模型 LingBot-World 2.0,无限时长、随机变化的世界,终于来了?

蚂蚁灵波发布最新世界模型 LingBot-World 2.0,无限时长、随机变化的世界,终于来了?

最新世界模型 LingBot-World 2.0 正在试图实现的事情。「一个世界只需要几秒钟就能造出来」不再仅限于预制的世界,而是让每一次生成,都是一次全新的创造。这是一个秒级生成、支持实时交互的开源世界模型。

来自主题: AI资讯
9051 点击    2026-07-10 10:24
首发|物理AI公司深度智控融资数亿元,清华博士用AI“重塑”AI

首发|物理AI公司深度智控融资数亿元,清华博士用AI“重塑”AI

首发|物理AI公司深度智控融资数亿元,清华博士用AI“重塑”AI

7月9日,投中网获悉,物理AI公司深度智控(DeepCtrls)(以下简称“深度智控”)已完成战略轮与B轮融资,合计融资金额数亿元,本轮资金将用于核心产品研发、商业化拓展及国际化布局。深度智控成立于2018年,定位为物理AI能源基础设施服务商。

来自主题: AI资讯
8541 点击    2026-07-09 17:35
别让AI一上来就“进厂打螺丝”:智源悟界·Orca要先教模型理解世界如何变化

别让AI一上来就“进厂打螺丝”:智源悟界·Orca要先教模型理解世界如何变化

别让AI一上来就“进厂打螺丝”:智源悟界·Orca要先教模型理解世界如何变化

智源研究院悟界·RoboBrain Orca Team发布的技术报告Orca: The World is in Your Mind,想探索的正是这个问题。也有评论认为,Orca更接近早期通用世界模型的形态,即先学习世界如何变化,再将这种世界表征读出到理解、预测和行动任务中。

来自主题: AI资讯
9040 点击    2026-07-08 17:23
刚刚,全球首个超高帧世界模型MoWorld诞生!英伟达含量0,狂飙50帧

刚刚,全球首个超高帧世界模型MoWorld诞生!英伟达含量0,狂飙50帧

刚刚,全球首个超高帧世界模型MoWorld诞生!英伟达含量0,狂飙50帧

专注于4D世界模型研发和产业化的魔芯科技联合浙江大学潘云鹤院士团队发布MoWorld——全球首个Flash World Model,也是首个全栈基于国产NPU构建的实时交互世界模型。

来自主题: AI资讯
9470 点击    2026-07-08 16:00
世界模型太慢?西交大提出Fast LeWorldModel:用「动作前缀并行预测」让动态估计加速4倍

世界模型太慢?西交大提出Fast LeWorldModel:用「动作前缀并行预测」让动态估计加速4倍

世界模型太慢?西交大提出Fast LeWorldModel:用「动作前缀并行预测」让动态估计加速4倍

以 LeWorldModel(LeWM)为例,它在规划时有一个重要瓶颈:每评估一条候选动作序列,模型都要一步步自回归 rollout。也就是说,LeWM 先预测下一步 latent,再把预测出的 latent 输入 dynamics model,继续预测下一步:

来自主题: AI技术研报
7950 点击    2026-07-07 14:57