融合年龄特征的跨生命周期端到端人声生成方法及系统
# 热门搜索 #
大模型
人工智能
openai
融资
chatGPT
验证码登录
×
发送
登录即代表您已同意AITNT
用户协议
和
隐私政策
登录
登录成功后会自动刷新界面
AITNT公众号
AITNT APP
AITNT交流群
搜索
未登录
首页
AI中心
退出
首页
AI资讯
AI技术研报
AI监管政策
AI产品测评
AI商业项目
AI产品热榜
AI 源力市场
寻求报道
融合年龄特征的跨生命周期端到端人声生成方法及系统
申请号:
CN202510951765
申请日期:
2025-07-10
公开号:
CN120877710A
公开日期:
2025-10-31
类型:
发明专利
摘要
本发明公开一种融合年龄特征的跨生命周期端到端人声生成方法及系统,属于人工智能与语音技术交叉领域。本发明通过预处理构建含年龄标签的多维度语音数据集,提取MFCC、说话人嵌入(ECAPA‑TDNN)等特征,在FastSpeech 2等端到端语音合成模型中注入年龄条件编码,实现文本驱动下的年龄敏感语音生成。本发明创新融合年龄特征与说话人特征,通过条件化建模基频、时长、共振峰等年龄相关声学参数,结合HiFi‑GAN等神经声码器端到端生成高自然度波形,可精确控制语音的年龄属性并保留个体音色。
技术关键词
年龄
人声
文本编码器
生成方法
声码器
多任务损失函数
MFCC特征
标签
序列
参数
离散余弦变换
对齐工具
深度学习模型
语音技术
数据获取模块
声学特征