融合年龄特征的跨生命周期端到端人声生成方法及系统

AITNT-国内领先的一站式人工智能新闻资讯网站
# 热门搜索 #
融合年龄特征的跨生命周期端到端人声生成方法及系统
申请号:CN202510951765
申请日期:2025-07-10
公开号:CN120877710A
公开日期:2025-10-31
类型:发明专利
摘要
本发明公开一种融合年龄特征的跨生命周期端到端人声生成方法及系统,属于人工智能与语音技术交叉领域。本发明通过预处理构建含年龄标签的多维度语音数据集,提取MFCC、说话人嵌入(ECAPA‑TDNN)等特征,在FastSpeech 2等端到端语音合成模型中注入年龄条件编码,实现文本驱动下的年龄敏感语音生成。本发明创新融合年龄特征与说话人特征,通过条件化建模基频、时长、共振峰等年龄相关声学参数,结合HiFi‑GAN等神经声码器端到端生成高自然度波形,可精确控制语音的年龄属性并保留个体音色。
技术关键词
年龄 人声 文本编码器 生成方法 声码器 多任务损失函数 MFCC特征 标签 序列 参数 离散余弦变换 对齐工具 深度学习模型 语音技术 数据获取模块 声学特征