摘要
本发明涉及人工智能与多媒体技术领域,特别涉及一种基于多粒度跨模态耦合的音频引导视觉分割方法及装置,其中,方法包括:提取目标视频帧的多级视觉特征和音频梅尔频谱特征;对多级视觉特征和音频梅尔频谱特征进行模态内增强,以得到增强后的多级视觉特征和增强后的音频梅尔频谱特征;将增强后的多级视觉特征和增强后的音频梅尔频谱特征进行跨模态融合,以生成语义增强查询向量;利用语义增强查询向量对预先构建的Transformer注意力解码器进行训练,以生成像素级分割掩膜,并将像素级分割掩膜与多级视觉特征进行融合,以得到掩膜预测结果。由此,解决了现有视听分割方法存在模态内噪声干扰、音频引导不足、多源声音纠缠等问题。