豆包大模型团队发布全新Detail Image Caption评估基准,提升VLM Caption评测可靠性
豆包大模型团队发布全新Detail Image Caption评估基准,提升VLM Caption评测可靠性当前的视觉语言模型(VLM)主要通过 QA 问答形式进行性能评测,而缺乏对模型基础理解能力的评测,例如 detail image caption 性能的可靠评测手段。
搜索
当前的视觉语言模型(VLM)主要通过 QA 问答形式进行性能评测,而缺乏对模型基础理解能力的评测,例如 detail image caption 性能的可靠评测手段。
长上下文大模型帮助机器人理解世界。
人会有幻觉,大型语言模型也会有幻觉。近日,OpenAI 安全系统团队负责人 Lilian Weng 更新了博客,介绍了近年来在理解、检测和克服 LLM 幻觉方面的诸多研究成果。
AI 视频圈正杀得你死我活。
Mamba模型由于匹敌Transformer的巨大潜力,在推出半年多的时间内引起了巨大关注。但在大规模预训练的场景下,这两个架构还未有「一较高低」的机会。最近,英伟达、CMU、普林斯顿等机构联合发表的实证研究论文填补了这个空白。
一位已婚男子在AI那里,找到了认同和肯定。MIT研究AI与人类亲密关系先驱称,这只是「亲密幻觉」。
友友们,你们有在闲鱼、转转上有过不好的体验吗?
「与 99% 的财富 100 强企业」合作的可视化协作平台 Miro 曾在疫情期间快速实现 10 倍用户增长。
OpenAI被曝出了新项目「草莓」,据悉能提前计划,自主浏览网页,还能进行深度研究。草莓由大量通用数据上后训练而成,推理能力显著提高。根据OpenAI最近的AGI路线图,草莓疑似已达Level 2。
在瞬息万变的金融市场中,大模型(LLM)作为一种前沿技术,正以前所未有的速度变革着投资和金融行业。凭其强大的数据处理能力和智能分析功能,LLM不仅能够帮助投资者做出更明智的决策,还能预见市场趋势,降低投资风险。
文生图、文生视频,视觉生成赛道火热,但仍存在亟需解决的问题。
AGI 大会前不久,我们跟小红书一拍即合,于是有了活动内容合作平台和独家直播平台的合作。
搜索引擎,长期占据互联网“铁王座”。 AI迅猛崛起后,风向有变。
AI原生互动侦探游戏,刚上线就爆火,服务器一度挤爆。
软银又出手了。
全球共有1600个组织受访,受访者均为组织生成式AI战略或关键部门的数据分析决策者。
OpenAI最新绝密项目曝光!
实现“超人”人工智能?没那么简单。
AI能提供的情绪价值远超出你的想象
当卖点成为了槽点
家长愿意为AI买单吗?
新一年度的中国开发者调查报告出炉
GPT-3 时刻正在进入机器人世界。
2022年,美图CEO吴欣鸿将年度总结的主题,从“居安思危”改成了“居危思危”。
“AIGC+短剧”赛道渐火,到底谁会先拔得头筹呢?AIGC+短剧还有多大可能?现在入局还有哪些赛道可玩?
大模型的船票,哪些公司拿到了?
科技企业忙着在医院“抢先机”,还没真正筹划怎么赚钱
人工智能为什么会让人们在工作中更加孤立?
Kevin Scott表示,过去20年里,人工智能领域最重要的进步都与“规模”有关;OpenAI的潜力在于未来可能成为构建AI平台的基础;数据的质量比数量更重要。
最近,新加坡国立大学联合南洋理工大学和哈工深的研究人员共同提出了一个全新的视频推理框架,这也是首次大模型推理社区提出的面向视频的思维链框架(Video-of-Thought, VoT)。视频思维链VoT让视频多模态大语言模型在复杂视频的理解和推理性能上大幅提升。该工作已被ICML 2024录用为Oral paper。