摘要
本发明涉及人工智能领域,可应用于金融、医疗领域,本发明公开了一种语音合成模型的训练方法、装置、设备及介质,该方法包括利用预训练的自动语音识别模型对帧级声学特征序列进行语音识别,得到音素可能性矩阵;根据预设的音素持续时间对齐策略和音素可能性矩阵得到对应的目标音素序列和音素持续时间序列;基于风格特征序列、目标音素序列和音素持续时间序列,通过预设的语音合成模型获取目标声学特征序列;根据帧级声学特征序列、目标声学特征序列和预设的语音合成损失函数获得的语音合成损失对语音合成模型的参数进行调整。本发明基于准确的音素持续时间对语音合成模型进行训练,提高了模型的音素时长对齐精度,提高语音合成质量。