AI资讯新闻榜单内容搜索-多模态

AITNT-国内领先的一站式人工智能新闻资讯网站
# 热门搜索 #
搜索: 多模态
对话已死,共生永生:颜水成团队发布 VoiceMem,为 AGI 找回「丢掉的昨天」

对话已死,共生永生:颜水成团队发布 VoiceMem,为 AGI 找回「丢掉的昨天」

对话已死,共生永生:颜水成团队发布 VoiceMem,为 AGI 找回「丢掉的昨天」

颜水成团队发布语音领域首个实时“流式双脑架构”记忆框架,左脑记信息,右脑记住你。 编辑丨岑峰 科幻电影曾无数次预演过AI与人类共生的场景。但在2026年的今天,尽管GPT-4o、全双工模型、Inter

来自主题: AI资讯
8263 点击    2026-09-04 10:45
答对了却没看图?EASE给多模态RLVR装上「视线校正器」

答对了却没看图?EASE给多模态RLVR装上「视线校正器」

答对了却没看图?EASE给多模态RLVR装上「视线校正器」

强化学习与可验证奖励(RLVR)已成为提升视觉语言模型(VLM)推理能力的标配手段。但一个隐蔽的问题始终存在:最终答案的奖励信号,只告诉模型「答对了没有」,却从不告诉它「答案应该从图像的哪个区域得出」。答对,可能是因为真的看懂了图,也可能只是语言先验的捷径、数据集的偏差,甚至是一次幸运的瞎猜。

来自主题: AI技术研报
6734 点击    2026-09-03 14:17
0.25秒识破未见攻击,这套检测方法没看过任何越狱样本 | EMNLP'26

0.25秒识破未见攻击,这套检测方法没看过任何越狱样本 | EMNLP'26

0.25秒识破未见攻击,这套检测方法没看过任何越狱样本 | EMNLP'26

大视觉语言模型(LVLM)把语言理解扩展到了图像等多模态输入,同时,也带来了更隐蔽的攻击面。

来自主题: AI技术研报
5488 点击    2026-09-03 09:50
李飞飞发布:全球首个多模态世界模型

李飞飞发布:全球首个多模态世界模型

李飞飞发布:全球首个多模态世界模型

「全球首个」多模态世界模型,来了!

来自主题: AI技术研报
7280 点击    2026-09-02 10:07
DeepSeek V4 多模态开源,我们把它的视觉链路拆了一遍

DeepSeek V4 多模态开源,我们把它的视觉链路拆了一遍

DeepSeek V4 多模态开源,我们把它的视觉链路拆了一遍

图片不只被编码,还直接参与 Attention、MoE 与 Agent 推理。

来自主题: AI技术研报
9800 点击    2026-09-02 09:27
刚刚,DeepSeek-V4多模态模型开源

刚刚,DeepSeek-V4多模态模型开源

刚刚,DeepSeek-V4多模态模型开源

DeepSeek-V4-Flash-Vision-Exp多模态模型正式开源,该模型为DeepSeek-V4系列首个实验性多模态模型,基于DeepSeek-V4-Flash架构集成视觉模块,在真实世界软件工程测试DeepSWE中以59.3%反超Opus-4.8登顶,并在零样本视觉推理测试ZeroBench中击败Opus-4.8。

来自主题: AI资讯
9187 点击    2026-08-31 21:53
专访商汤首席科学家林达华:多模态的涌现时刻会在一两年内到来

专访商汤首席科学家林达华:多模态的涌现时刻会在一两年内到来

专访商汤首席科学家林达华:多模态的涌现时刻会在一两年内到来

商汤首席科学家林达华在专访中判断,未来一两年多模态将迎来能力涌现的"GPT时刻",并阐述商汤以原生理解生成统一模型U系列和多模态智能体模型SenseNova 6.8为核心的长期技术路线。

来自主题: AI资讯
8453 点击    2026-08-31 16:47
HOMIE Gen2全新发布!解锁人类经验的Scaling Law

HOMIE Gen2全新发布!解锁人类经验的Scaling Law

HOMIE Gen2全新发布!解锁人类经验的Scaling Law

新加坡Physical AI公司Ropedia正式发布新一代多模态采集系统HOMIE Gen2,以4目全景360°、十余种模态同步采集与开箱即用的高精度训练级数据,将人类经验规模化为机器人可直接学习的训练数据,推动Physical AI的经验规模化落地。

来自主题: AI资讯
10022 点击    2026-08-31 13:56
ECCV 2026|OmniColor:统一多模态线稿上色框架

ECCV 2026|OmniColor:统一多模态线稿上色框架

ECCV 2026|OmniColor:统一多模态线稿上色框架

在动画和美术生产中,线稿上色是一个看似基础、却极其依赖细节控制的环节。创作者往往不是简单地把线稿涂上颜色,还需要理解角色身份、遵守局部色块约束、参考前后帧风格,并在连续片段中保持服装、发色、妆容和背景的一致性。

来自主题: AI技术研报
8852 点击    2026-08-28 10:01
智谱 5.3-flash 成了新的斩杀线

智谱 5.3-flash 成了新的斩杀线

智谱 5.3-flash 成了新的斩杀线

这几天 ox-alpha 用爽了吧...正如很多人猜的那样,这个模型来自智谱,正式名称为 glm-5.3-flash,支持多模态,但很多人没猜到的是:这个乱杀的模型只有 321B,且与 glm-5.3 不同,是完全的新架构

来自主题: AI资讯
8602 点击    2026-08-27 15:12