摘要
本发明公开了一种基于大语言模型的语音翻译方法和装置,在训练阶段包括:采集训练语料获取音频及对应的文本,以提取音频的频谱特征;对频谱特征提取语义特征以及全局声学特征并编码;通过大量翻译匹配对应文本的语义特征编码训练语义特征翻译大模型,以将语义特征编码生成翻译后的语义特征编码;利用大量文本对应音频的全局声学特征编码和语义特征编码训练声码器基础模型;通过目标说话人的少量音频的全局声学特征信息和语义特征微调声码器基础模型,以得到声码器。本发明解决了传统语音翻译方式存在处理延迟高、上下文理解能力弱、系统集成复杂等问题,即使目标说话人某语种的语料很少也能合成流畅准确的翻译音频该语种语音并能保证音色的一致性。