一种基于统一架构的声音分离与目标声音提取方法

AITNT-国内领先的一站式人工智能新闻资讯网站
# 热门搜索 #
一种基于统一架构的声音分离与目标声音提取方法
申请号:CN202510940403
申请日期:2025-07-08
公开号:CN120748429A
公开日期:2025-10-03
类型:发明专利
摘要
本发明公开了一种基于统一架构的声音分离与目标声音提取方法,涉及音频信号处理技术领域,包括:在第一训练阶段,采用吸引子网络估计混合音频信号中的声源数量,生成吸引子嵌入;将吸引子嵌入输入到分离主干网络,生成分离后的声音;在第二训练阶段,采用多模态线索处理网络处理多种模态的线索信息,生成线索嵌入;随机选择吸引子嵌入或线索嵌入作为分离主干网络的输入;在训练阶段,计算吸引子嵌入和线索嵌入之间的对齐损失函数;在推理阶段,如果没有线索信息,执行声音分离任务;如果有1至3个线索信息,执行目标声音提取任务。本发明根据输入的线索情况灵活选择执行任务,具有更好的适应性和灵活性,适用于复杂的声音场景。
技术关键词
多模态线索 网络 专用编码器 多头注意力机制 阶段 解码器 音频信号处理技术 声音编码器 掩膜 声音类别 文本编码器 视频编码器 分离器 线性 模块