摘要
本发明公开了多模态AI驱动的短视频自动翻译与语音合成系统,本发明涉及音视频技术领域,涵盖视频获取、处理、翻译及合成等模块;视频获取端接收用户提交的各类音视频数据并检测违规内容;初步处理端对合规数据识别格式、转码、分离音频视频流,进一步分离人声与背景音;视频翻译端提取人声信号生成目标语言文本,结合韵律特征和人声模组生成音频流并与背景音拟合;视频合成端对视频帧提取唇部图像帧序列,按音频帧序列生成匹配唇部顶点位移坐标并渲染,最终将音视频同步序列压缩封装输出;各模块运用多种AI技术,实现短视频的自动翻译与语音合成,提升跨语言视频内容的生成效率与质量。