一种目标人脸的语音分离方法、设备及装置
# 热门搜索 #
大模型
人工智能
openai
融资
chatGPT
验证码登录
×
发送
登录即代表您已同意AITNT
用户协议
和
隐私政策
登录
登录成功后会自动刷新界面
AITNT公众号
AITNT APP
AITNT交流群
搜索
未登录
首页
AI中心
退出
首页
AI资讯
AI技术研报
AI监管政策
AI产品测评
AI商业项目
AI产品热榜
AI 源力市场
寻求报道
一种目标人脸的语音分离方法、设备及装置
申请号:
CN202510999525
申请日期:
2025-07-21
公开号:
CN120510865A
公开日期:
2025-08-19
类型:
发明专利
摘要
本申请公开了一种目标人脸的语音分离方法、设备及装置,涉及语音提取技术领域。方法包括:获取目标说话人的待分离语音视频,并提取待分离语音视频中的混合音频信息及目标说话人的人脸信息与嘴唇信息;通过预训练的多模态编码器中的视觉线索融合模块,对人脸信息与嘴唇信息进行处理,以获得视觉线索;基于视觉线索,通过多模态编码器中的语音分离模块,对混合音频信息进行语音信号分离,以获得目标语音。本申请通过上述方法实现了在视觉线索部分缺失、质量不佳的情况下,依然能够鲁棒、准确地提取目标说话人的语音。
技术关键词
人脸
语音分离器
线索
视觉
音频
语音解码器
语音编码器
样本
多模态
语音提取技术
时序
模块
信号
视频流
融合器