AI资讯新闻榜单内容搜索-SSI

AITNT-国内领先的一站式人工智能新闻资讯网站
# 热门搜索 #
搜索: SSI
视觉推理「囫囵吞枣」靠不住!ProLaViT教会多模态大模型在隐空间里「步步为营」

视觉推理「囫囵吞枣」靠不住!ProLaViT教会多模态大模型在隐空间里「步步为营」

视觉推理「囫囵吞枣」靠不住!ProLaViT教会多模态大模型在隐空间里「步步为营」

针对这一挑战,腾讯内容服务部 BAC 提出了一个名为 ProLaViT(Progressive Latent Visual Thought) 的全新框架。它的核心思想是:别急着下结论,先在连续隐空间里像人一样「步步推导」。 即让模型遵循 「定位 → 聚焦 → 分离」(Locate → Focus → Isolate) 的因果链,逐步收紧视觉注意力,最终精准锁定目标。

来自主题: AI技术研报
8197 点击    2026-07-21 16:55
首次,统一建模视角下的扩散语言模型后门威胁

首次,统一建模视角下的扩散语言模型后门威胁

首次,统一建模视角下的扩散语言模型后门威胁

扩散语言模型(DLM)正逐渐成为自回归(Autoregressive, AR)语言模型之外一种新兴的建模范式。

来自主题: AI技术研报
8389 点击    2026-07-15 14:35
提示词压缩竟成大模型新漏洞?港科大提出黑盒攻击框架COMA | ASE 2026

提示词压缩竟成大模型新漏洞?港科大提出黑盒攻击框架COMA | ASE 2026

提示词压缩竟成大模型新漏洞?港科大提出黑盒攻击框架COMA | ASE 2026

现在的 AI Agent 动辄需要处理超长上下文,既要看系统提示词、工具说明,又要翻阅历史对话和检索文档。为了省钱、省算力并降低延迟,很多开发者会给系统加上 “提示词压缩”(Prompt Compression)模块,把冗长的上下文浓缩后再喂给大模型。

来自主题: AI技术研报
8792 点击    2026-07-08 15:03
只用15%数据,多模态指令微调反超全量训练15.8%!

只用15%数据,多模态指令微调反超全量训练15.8%!

只用15%数据,多模态指令微调反超全量训练15.8%!

来自上海交大、马来亚大学、CMU、MBZUAI、KIT和KAUST的团队提出VisNec(Visual Necessity Score,视觉必要性分数),用一个分数衡量每条训练样本里“图像到底起了多大作用”,被ECCV 2026收录。

来自主题: AI技术研报
8007 点击    2026-07-04 10:47
上百个Agent,该怎么管?清华团队新思路:用OpenRath重做Session

上百个Agent,该怎么管?清华团队新思路:用OpenRath重做Session

上百个Agent,该怎么管?清华团队新思路:用OpenRath重做Session

最近,一个来自清华大学与中山大学的团队(Rath Team)把他们的解法开源了,叫OpenRath:这是一个像PyTorch的多智能体、多会话运行时。它的主张是:别再围着Agent转了。真正该被当成一等公民的,是Session。

来自主题: AI资讯
8794 点击    2026-06-18 10:29
GlobalGPT 李焕之:零融资、套壳产品千万美金ARR后,我找到了创业的mission

GlobalGPT 李焕之:零融资、套壳产品千万美金ARR后,我找到了创业的mission

GlobalGPT 李焕之:零融资、套壳产品千万美金ARR后,我找到了创业的mission

GlobalGPT 是一款很典型的 AI 套壳产品,一份订阅访问市面上几乎所有主流 AI 模型,目前全球累计用户超过 300 万,ARR 做到 1000 万美金。创始人李焕之,律师出身,2022 年开始连续创业,经历了 LegalDAO(Web3 法律社区)、LegalNow(AI 法律产品)的两次pivot后,在 2024 年初团队现金流只剩 1 个月时做出了 GlobalGPT。

来自主题: AI资讯
9012 点击    2026-06-17 16:22
CVPR 2026 | GaussianDWM:用3D高斯表示统一自动驾驶场景理解与多模态生成

CVPR 2026 | GaussianDWM:用3D高斯表示统一自动驾驶场景理解与多模态生成

CVPR 2026 | GaussianDWM:用3D高斯表示统一自动驾驶场景理解与多模态生成

自动驾驶世界模型的研究目标已经从单纯预测未来视觉帧,扩展到构建可用于场景理解、空间定位和后续决策的世界表示。如果模型只能生成外观上合理的未来图像,却无法回答场景中有哪些目标、目标位于何处,以及不同视角下的空间结构如何变化,那么它仍然缺少对三维驾驶环境的显式建模能力。

来自主题: AI技术研报
9627 点击    2026-06-15 09:18
一篇综述看懂 agent context compression:怎么压、压什么、谁来压

一篇综述看懂 agent context compression:怎么压、压什么、谁来压

一篇综述看懂 agent context compression:怎么压、压什么、谁来压

LLM Agent 做长任务时,真正让人头疼的往往不是模型不会推理,而是上下文开始失控:前几步还很清楚,后面就忘约束、丢状态、重复试错,最后把任务跑成事故现场。

来自主题: AI技术研报
8938 点击    2026-06-11 14:32
Meta蔡志鹏新作VLM³:全面揭示三维视觉的Bitter Lesson

Meta蔡志鹏新作VLM³:全面揭示三维视觉的Bitter Lesson

Meta蔡志鹏新作VLM³:全面揭示三维视觉的Bitter Lesson

Meta 发布了一项令人震撼的研究工作 VLM³,首次揭示了三维视觉学习的 Bitter Lesson:标准的视觉语言模型 + scale 数据就是最简单有效的范式,针对特定任务的架构、损失函数以及数据增强的设计,甚至是 regression 的 formulation,均不是三维视觉学习的必要条件。

来自主题: AI技术研报
7360 点击    2026-06-09 14:31
独家丨世界模型企业知天下完成天使轮融资,要做「中国版World Labs」

独家丨世界模型企业知天下完成天使轮融资,要做「中国版World Labs」

独家丨世界模型企业知天下完成天使轮融资,要做「中国版World Labs」

空间智能与世界模型初创公司知天下(苏州)人工智能科技有限公司(以下简称“知天下”)近日已完成天使轮融资。知天下是一家专注于高斯泼溅(3D Gaussian Splatting,简称3DGS)三维重建与生成技术的AI企业,于 2024 年初推出 3DGS 免费重建与发布服务

来自主题: AI资讯
9650 点击    2026-06-08 10:13