一种基于预训练模型的视频问答系统及方法

AITNT-国内领先的一站式人工智能新闻资讯网站
# 热门搜索 #
一种基于预训练模型的视频问答系统及方法
申请号:CN202510936451
申请日期:2025-07-08
公开号:CN120853081A
公开日期:2025-10-28
类型:发明专利
摘要
本发明公开了一种基于预训练模型的视频问答系统及方法,系统包括:数据集处理模块、空间特征融合模块、语义增强模块、时序增强模块和视频问答模块;数据集处理模块用于获取数据集中的文本形式的问题,并将问题对应的视频进行视频帧提取,得到若干输入图像;空间特征融合模块用于提取输入图像的全局视觉特征和局部视觉特征,并通过注意力机制进行融合,得到融合视觉特征;语义增强模块用于提取文本形式的问题的文本特征,并基于文本特征和融合视觉特征得到增强文本特征;时序增强模块基于融合视觉特征得到增强视觉特征,并基于增强视觉特征预测后一帧的视觉特征;视频问答模块用于基于增强文本特征和视觉特征输出相关答案,完成视频问答。
技术关键词
融合视觉特征 预训练模型 视频问答方法 输出特征 问答系统 注意力机制 局部视觉特征 全局视觉特征 模块 文本编码器 局部空间特征 时序 语义 视频帧 解码器