摘要
一种基于解耦联合自适应网络的小样本行为识别方法,涉及计算机视觉技术。对视频进行稀疏时间采样获取视频帧序列;经视觉提取器解耦为时间和空间分支,经时序适配器与空间适配器处理后,得到对应的时序特征和空间特征;通过联合适配器融合得到视觉特征;将视频标签嵌入文本模板,经文本特征提取器得到文本特征;利用视频级关系模块增强全局语义关联,获得全局视觉特征与全局文本特征;通过视觉语言融合模块得到融合多模态信息的视频特征;将视觉特征、全局视觉特征、融合视频特征、全局融合视频特征输入预测器,计算损失函数并更新梯度。有效提升小样本条件下的时空建模能力、多模态泛化能力,实验表明,该方法分类性能有所提升。