ICML 2026|让奖励模型更准更高效,TikTok、NUS提出置信度门控
ICML 2026|让奖励模型更准更高效,TikTok、NUS提出置信度门控奖励模型(Reward Model, RM)是大语言模型对齐的核心组件,负责为模型输出提供符合人类偏好的评价信号。现有方法各有短板:标量判别式 RM 高效稳定但可解释性有限;生成式 judge 能给出判断理由,却需为每个样本生成长 reasoning,token 与延迟开销显著。
搜索
奖励模型(Reward Model, RM)是大语言模型对齐的核心组件,负责为模型输出提供符合人类偏好的评价信号。现有方法各有短板:标量判别式 RM 高效稳定但可解释性有限;生成式 judge 能给出判断理由,却需为每个样本生成长 reasoning,token 与延迟开销显著。
近期,围绕「世界模型」的讨论持续升温。机器人、自动驾驶、视频生成、具身智能等多个方向都在频繁使用这一概念,相关系统不断出现,演示形式日益丰富,评价指标也越来越多。伴随这一趋势,一个基础问题变得格外重要:当一个模型被称为「世界模型」时,人们究竟在评价什么?
在过去二三十年的互联网发展中,个性化推荐几乎一直是平台的核心能力之一。打开视频 app,平台决定你接下来会刷到什么视频;打开购物软件,平台预测你可能会购买什么商品;打开短视频 app,平台根据你的浏览、点赞、停留和互动,不断优化信息流。某种意义上,现代互联网的用户体验本身就是由推荐系统塑造的。
人类可以在一生中持续学习新知识,而不会轻易遗忘已有技能。然而对 AI 模型而言,这恰恰是一道极具挑战性的难题:每当模型学习新任务时,参数更新往往会覆盖历史知识,产生经典的 “灾难性遗忘” 难题。持续学习(Continual Learning)正是为突破这一瓶颈而生的研究方向。
过去几年,大语言模型几乎成为了AI的代名词。从ChatGPT到Google DeepMind推出的Gemini,从Anthropic开发的Claude到中国的DeepSeek,人们讨论更多的是聊天机器人、推理能力和生成内容。但如果问Google DeepMind CEO、2024年诺贝尔化学奖得主Demis Hassabis(下简称“哈萨比斯”)
用 AI 生图的人,应该都体会过这种痛苦。
2026年下半场,AI Coding赛道最大的焦虑变了。
上周六,7月11号,我去了旧金山一家叫Corgi Cafe的地方,参加了一场demo day。这场活动本来定在6月20号,后来因为场地和大家时间的原因,改到了这一天。主办人提前在群里说,活动在二楼,大家先在楼下咖啡馆等,她会带人上去。5点demo正式开始,一直到7点,中间还留了开放麦的环节,谁想上去讲两句都可以。
FounderPark 独家获悉,AI 潮玩品牌珞博智能(Robopoet)宣布于 2026 年初完成亿元级 Pre-A 轮融资。本轮融资新增华映资本、广和通、涂鸦智能三大新股东,同时老股东红杉中国、
卷起来了!