AI资讯新闻榜单内容搜索-RL

AITNT-国内领先的一站式人工智能新闻资讯网站
# 热门搜索 #
搜索: RL
开源Agent框架刷爆ARC-AGI-3,「自我改进」的RLM harness引争议

开源Agent框架刷爆ARC-AGI-3,「自我改进」的RLM harness引争议

开源Agent框架刷爆ARC-AGI-3,「自我改进」的RLM harness引争议

这个框架名叫 Prime Agent,由 Prime Intellect 发布。官方对它的定义是:一个面向编程、研究和长时间自主任务的「自我改进 RLM harness」。RLM 是 MIT 博士生 Alex Zhang 等人去年 10 月发布的一项工作(参见《递归语言模型登场!MIT华人新作爆火,扩展模型上下文便宜又简单》)

来自主题: AI技术研报
9663 点击    2026-08-08 13:17
继何恺明团队ELF后,南京大学基于昇腾算力同步提出连续扩散语言模型

继何恺明团队ELF后,南京大学基于昇腾算力同步提出连续扩散语言模型

继何恺明团队ELF后,南京大学基于昇腾算力同步提出连续扩散语言模型

近日来自南京大学模式识别实验室(PRLab)的梁嘉骏、廖宇程,在司晨阳教授的指导下,联合新加坡南洋理工大学、英国帝国理工学院,提出连续扩散语言模型 AURORA-LM(Autoencoding Unified Representation for Continuous-Latent Diffusion Language Modeling),对连续空间下的语言建模作出了更多的思考和发现。

来自主题: AI技术研报
8267 点击    2026-08-08 13:15
无法蒸馏的美国市场,谁在分食 Frontier Labs 百亿美金数据预算?

无法蒸馏的美国市场,谁在分食 Frontier Labs 百亿美金数据预算?

无法蒸馏的美国市场,谁在分食 Frontier Labs 百亿美金数据预算?

在模型层之外,2026 年上半年在硅谷增长最快的赛道之一是数据:Mercor 的 run rate 从去年下半年的 5 亿美元涨到今年年中的 20 亿美元;Handshake 转型 human data 后,run rate 在年初三个月内从 5.5 亿美元冲到 10 亿美元;RL 环境公司 Fleet 则在半年内从百万美元级别做到 6000 万美元 run rate,

来自主题: AI资讯
9304 点击    2026-08-06 22:31
李飞飞最新访谈:人也不全靠现实数据学习啊

李飞飞最新访谈:人也不全靠现实数据学习啊

李飞飞最新访谈:人也不全靠现实数据学习啊

时隔近两年,李飞飞终于再做客a16z,畅谈空间智能和World Labs在机器人赛道上的全盘布局。

来自主题: AI资讯
6744 点击    2026-08-06 15:42
别再吹AI生图了,不能图层编辑的AI都是“画饼”

别再吹AI生图了,不能图层编辑的AI都是“画饼”

别再吹AI生图了,不能图层编辑的AI都是“画饼”

面向设计生产场景,兔展智能研发了UniWorld-Design,进一步强化了视觉生成与编辑能力的结合,并基于此打造了产模一体战略的重要产品——RabbitVis。AI正在从通用能力竞争,进入场景能力竞争

来自主题: AI资讯
8502 点击    2026-08-06 10:47
视觉AI从「会生成」走向「能创作」,RabbitVis探索AI应用新范式

视觉AI从「会生成」走向「能创作」,RabbitVis探索AI应用新范式

视觉AI从「会生成」走向「能创作」,RabbitVis探索AI应用新范式

随着 AI 生图能力不断提升,如何让 AI 真正进入创作流程成为新的行业问题。兔展智能基于 UniWorld-Design 视觉 AI 大模型推出 RabbitVis,尝试推动视觉 AI 从图片生成走向可编辑、可交付的创作流程。

来自主题: AI技术研报
8858 点击    2026-08-06 09:36
告别通用具身模型崇拜:具身智能走向异构策略编排

告别通用具身模型崇拜:具身智能走向异构策略编排

告别通用具身模型崇拜:具身智能走向异构策略编排

当 VLA、WAM、RL、TAMP、MPC 等机器人控制策略在各自擅长的任务中大放异彩,如何刻画其能力边界,并在正确的时机为不同子任务匹配最合适的策略,正逐渐成为机器人完成复杂长时序任务的关键。

来自主题: AI技术研报
7766 点击    2026-08-03 15:31
ICML 2026 | 我们让蒸馏模型当了采样器,Diffusion RL采样成本降低一个数量级

ICML 2026 | 我们让蒸馏模型当了采样器,Diffusion RL采样成本降低一个数量级

ICML 2026 | 我们让蒸馏模型当了采样器,Diffusion RL采样成本降低一个数量级

过去的 Diffusion RL 多聚焦于奖励设计与优化算法,训练时的采样成本被忽视。DMSampler 指出:在在线 RL 中,限制规模化的不只是奖励信号或优化器,很多时候是 rollout 本身太贵。

来自主题: AI技术研报
8352 点击    2026-08-01 10:44