摘要
本发明公开了一种获取语音合成模型的训练数据的方法,包括:从目标语种的语料库中筛选出部分具有高频音节的语料;对筛选得到的语料进行录音采样和标记,得到初始训练集,并通过所述初始训练集训练所述语音合成模型;根据所述语音合成模型对所述语料库中未标记的语料进行语音合成,得到所述语音合成的质量信息;根据所述质量信息确定未标记语料的决策属性,并以所述未标记的语料中的基本字母的出现次数作为条件属性,构造决策表,得到优势粗糙集。本发明有效的解决了目标语种合成任务中由于训练数据样本数量少,录取标记训练数据样本专业性强、成本高、工作量大的问题。