一种增强多图理解的多模态大模型结构
# 热门搜索 #
大模型
人工智能
openai
融资
chatGPT
验证码登录
×
发送
登录即代表您已同意AITNT
用户协议
和
隐私政策
登录
登录成功后会自动刷新界面
AITNT公众号
AITNT APP
AITNT交流群
搜索
未登录
首页
AI中心
退出
首页
AI资讯
AI技术研报
AI监管政策
AI产品测评
AI商业项目
AI产品热榜
AI 源力市场
寻求报道
一种增强多图理解的多模态大模型结构
申请号:
CN202510901635
申请日期:
2025-07-01
公开号:
CN121033595A
公开日期:
2025-11-28
类型:
发明专利
摘要
本发明公开了一种增强多图理解的多模态大模型结构,包括图片输入模块、图像特征提取模块、增强多图特征模块、特征映射模块、文本输入模块、分词模块、文本向量化模块、特征融合模块和大语言模型。增强多图特征模块通过挖掘关联图片相互间的关系,获取输入的多图的全局表达特征,增强模型的全局感知能力,获取不同图片中的环境、实体之间的相互关系。通过融合每张图的局部特征,减少信息丢失,增强模型对场景中的细节感知能力。
技术关键词
图像特征提取
图片
摘要
文本
输入模块
融合特征
视觉特征
多模态
编码模块
分词
标记特征
大语言模型
编码器
方格
阶段
关系
实体