一种基于大语言模型的音频翻译方法和装置

AITNT-国内领先的一站式人工智能新闻资讯网站
# 热门搜索 #
一种基于大语言模型的音频翻译方法和装置
申请号:CN202510958255
申请日期:2025-07-11
公开号:CN120690183A
公开日期:2025-09-23
类型:发明专利
摘要
本发明公开了一种基于大语言模型的语音翻译方法和装置,在训练阶段包括:采集训练语料获取音频及对应的文本,以提取音频的频谱特征;对频谱特征提取语义特征以及全局声学特征并编码;通过大量翻译匹配对应文本的语义特征编码训练语义特征翻译大模型,以将语义特征编码生成翻译后的语义特征编码;利用大量文本对应音频的全局声学特征编码和语义特征编码训练声码器基础模型;通过目标说话人的少量音频的全局声学特征信息和语义特征微调声码器基础模型,以得到声码器。本发明解决了传统语音翻译方式存在处理延迟高、上下文理解能力弱、系统集成复杂等问题,即使目标说话人某语种的语料很少也能合成流畅准确的翻译音频该语种语音并能保证音色的一致性。
技术关键词
语音翻译方法 大语言模型 声学特征 语义特征提取 声码器 编码 频谱特征提取 特征提取模型 文本 音频翻译方法 语音翻译装置 网络结构 音频特征提取 深度学习网络 翻译方式 特征提取单元