摘要
本发明公开了一种基于跨模态知识迁移的语音增强方法及系统。本发明采用的语音增强方法,包括:将音频对应文本输入到大型语言模型中,获得上下文相关的语言嵌入特征;进行跨模态知识迁移,将语言嵌入特征融合至语音嵌入特征中,得到跨模态嵌入特征;进行语音增强模型的训练:使用平均绝对误差损失函数计算增强语音频谱与目标语音频谱之间的损失;使用余弦相似度损失函数计算跨模态嵌入特征与大型语言模型输出之间的损失;综合这两种损失,通过梯度下降算法优化语音增强模型的参数;在推理阶段仅使用训练好的语音增强模型进行语音增强处理。本发明能有效提高语音在嘈杂环境中的增强效果,并且在推理阶段无需文本数据或语言模型参与。