基于多个文档图像的视觉问答方法和装置

AITNT-国内领先的一站式人工智能新闻资讯网站
# 热门搜索 #
基于多个文档图像的视觉问答方法和装置
申请号:CN202510990516
申请日期:2025-07-17
公开号:CN120508686B
公开日期:2025-11-04
类型:发明专利
摘要
本说明书实施例提供一种基于多个文档图像的视觉问答方法和装置,利用LVLM执行,LVLM包括,多模态编码模型和LLM。方法包括:通过多模态编码模型获取多个文档图像分别对应的各个图像表征以及问题文本对应的文本表征;将各个图像表征和文本表征输入文本监督评分器,得到多个文档图像对问题文本的各个相关性分数;从多个文档图像中选择出属于第一类别的若干个文档图像;第一类别落入按相关性分数划分的多个区间中的相关性分数最高区间;对于任一第一类别的文档图像,将其输入分辨率增强器,得到分辨率提升后的文档图像的图像表征;将各个图像表征和文本表征输入LLM,得到针对多个文档图像和问题文本的答复文本。
技术关键词
分辨率提升 视觉问答方法 多模态 压缩器 文本编码器 注意力 分词 图像块 问答装置 计算机 可读存储介质 存储器 处理器 数值