基于音频驱动和混合形状的视频情感虚拟形象实时生成方法
申请号:CN202511004068
申请日期:2025-07-21
公开号:CN120510259B
公开日期:2025-09-19
类型:发明专利
摘要
本发明公开了一种基于音频驱动和混合形状的视频情感虚拟形象实时生成方法,包括:首先,利用3D高斯混合形状构建特定身份的中立情感空间,并与情感、人脸网格和音频驱动的形变进行同步;然后,将3D高斯属性编码成共享的隐式特征表示,并与音频特征、网格位移编码特征、情感和强度编码进行融合;接着,将这些特征输入到空间‑音频‑情感注意力模块中,用于预测每个高斯属性的偏移量,最后通过高斯溅射渲染得到虚拟形象。通过上述步骤,本发明实现了不同音频、不同情感以及不同强度的虚拟人物头像实时生成。
技术关键词
人脸网格
生成方法
音频
溅射技术
透明度
视频
注意力
协方差矩阵
输出特征
生成姿势
颜色
表情模型
文本编码器
参数
处理器
人脸模型
强度