AI资讯新闻榜单内容搜索-可解释性

AITNT-国内领先的一站式人工智能新闻资讯网站
# 热门搜索 #
搜索: 可解释性
ICML 2026|让奖励模型更准更高效,TikTok、NUS提出置信度门控

ICML 2026|让奖励模型更准更高效,TikTok、NUS提出置信度门控

ICML 2026|让奖励模型更准更高效,TikTok、NUS提出置信度门控

奖励模型(Reward Model, RM)是大语言模型对齐的核心组件,负责为模型输出提供符合人类偏好的评价信号。现有方法各有短板:标量判别式 RM 高效稳定但可解释性有限;生成式 judge 能给出判断理由,却需为每个样本生成长 reasoning,token 与延迟开销显著。

来自主题: AI技术研报
7396 点击    2026-07-13 14:44
ACL 2026 | 用图异常检测抓出多智能体网络中的内鬼!XG-Guard:首个无监督、可解释、细粒度的MAS安全防线

ACL 2026 | 用图异常检测抓出多智能体网络中的内鬼!XG-Guard:首个无监督、可解释、细粒度的MAS安全防线

ACL 2026 | 用图异常检测抓出多智能体网络中的内鬼!XG-Guard:首个无监督、可解释、细粒度的MAS安全防线

研究团队提出了 XG-Guard (eXplainable and fine-Grained safeGuarding framework), 一个基于 GAD 且兼具可解释性和细粒度检测能力的无监督安全防护框架。目前工作已被 ACL 2026 Main Conference 接收。

来自主题: AI技术研报
7985 点击    2026-07-11 11:07
如何判断AI视频真假?综述动态、可溯源、可解释的检测体系 | ACL26

如何判断AI视频真假?综述动态、可溯源、可解释的检测体系 | ACL26

如何判断AI视频真假?综述动态、可溯源、可解释的检测体系 | ACL26

AI视频生成技术迅猛发展,生成内容的逼真度不断提升,现有检测方法已无法满足需求。最新综述提出「事实保真度验证」新目标,从视觉与语言双视角梳理出四层检测框架,涵盖底层线索、时空一致性、跨模态核验及世界知识推理,强调多层证据耦合与可解释性。

来自主题: AI技术研报
8127 点击    2026-07-07 14:56
条条电路通罗马:大模型可解释性的「唯一机制」可能从一开始就不存在

条条电路通罗马:大模型可解释性的「唯一机制」可能从一开始就不存在

条条电路通罗马:大模型可解释性的「唯一机制」可能从一开始就不存在

长期以来,机制可解释性(mechanistic interpretability)领域有一个几乎从未被明说、却被视为理所当然的前提:模型对于同一种任务的能力或表现,背后对应着一条唯一的、或近乎唯一的内部「电路」(circuit)。该领域的研究者们之所以要做「电路发现」(circuit discovery),是为了要把这些「特定的」电路找出来。

来自主题: AI技术研报
8201 点击    2026-06-30 15:12
《Anthropic 炒作大辞典》

《Anthropic 炒作大辞典》

《Anthropic 炒作大辞典》

如果你身边声称将为人类未来负责的人,这样和你聊天,你感受如何: “在应对 ASL-3 级别的灾难性风险时,我们通过机制可解释性的神经解剖,在神经网络的暗物质中,发现了潜伏特工(Sleeper Agen

来自主题: AI资讯
8410 点击    2026-04-11 10:35
打破具身世界模型可执行性鸿沟 !港中深-跨维智能团队提出EVA框架,用强化学习让视频世界模型真正“动”起来

打破具身世界模型可执行性鸿沟 !港中深-跨维智能团队提出EVA框架,用强化学习让视频世界模型真正“动”起来

打破具身世界模型可执行性鸿沟 !港中深-跨维智能团队提出EVA框架,用强化学习让视频世界模型真正“动”起来

近期,利用视频生成模型为机器人构建 “世界模型”,已成为具身智能领域的热门技术路线。给定当前观测和自然语言指令,这类模型能够先 “想象” 出未来的视觉轨迹,再由逆动力学模型(IDM)将生成画面解码为机器人动作,从而形成 “先预测、后执行” 的解耦式规划范式。由于兼具较强的可解释性与开放场景泛化潜力,这一路线正在受到学术界和工业界的广泛关注。

来自主题: AI技术研报
9295 点击    2026-03-28 09:50
清华新框架让大模型学会「精读略读」!实现12倍端到端加速,基准评分翻倍

清华新框架让大模型学会「精读略读」!实现12倍端到端加速,基准评分翻倍

清华新框架让大模型学会「精读略读」!实现12倍端到端加速,基准评分翻倍

来自清华大学、鹏城实验室与阿里巴巴未来生活实验室的联合研究团队发现:现有任务相关的压缩方法不仅陷入效率瓶颈——要么一次性加载全文(效率低),要么自回归逐步压缩(速度慢),更难以兼顾“保留关键信息”与“保持自然语言可解释性”。

来自主题: AI技术研报
10291 点击    2026-02-15 21:25
大模型哪里出问题、怎么修,这篇可解释性综述一次讲清

大模型哪里出问题、怎么修,这篇可解释性综述一次讲清

大模型哪里出问题、怎么修,这篇可解释性综述一次讲清

过去几年,机制可解释性(Mechanistic Interpretability)让研究者得以在 Transformer 这一 “黑盒” 里追踪信息如何流动、表征如何形成:从单个神经元到注意力头,再到跨层电路。但在很多场景里,研究者真正关心的不只是 “模型为什么这么答”,还包括 “能不能更稳、更准、更省,更安全”。

来自主题: AI技术研报
11286 点击    2026-01-28 10:13
拆解AI黑箱,深度解读“机制可解释性”|2026年十大突破性技术

拆解AI黑箱,深度解读“机制可解释性”|2026年十大突破性技术

拆解AI黑箱,深度解读“机制可解释性”|2026年十大突破性技术

现在,我们越来越多地将大语言模型应用于搜索、编程、内容生成和决策辅助等现实场景中。尽管每天有数百万人使用大模型,但它的问题也随之而来,例如有时会产生幻觉,甚至在特定情境下表现出误导或欺骗用户的倾向。

来自主题: AI资讯
9273 点击    2026-01-13 16:09
NeurIPS 2025 | DePass:通过单次前向传播分解实现统一的特征归因

NeurIPS 2025 | DePass:通过单次前向传播分解实现统一的特征归因

NeurIPS 2025 | DePass:通过单次前向传播分解实现统一的特征归因

随着大型语言模型在各类任务中展现出卓越的生成与推理能力,如何将模型输出精确地追溯到其内部计算过程,已成为 AI 可解释性研究的重要方向。然而,现有方法往往计算代价高昂、难以揭示中间层的信息流动;同时,不同层面的归因(如 token、模型组件或表示子空间)通常依赖各自独立的特定方法,缺乏统一且高效的分析框架。

来自主题: AI技术研报
6708 点击    2025-12-01 13:49