摘要
本发明提供一种视频配音方法、装置、电子设备及存储介质,属于视频处理技术领域,包括:分离待配音视频中的第一音频并进行逐句文本转换,获取带有时间码的第一字幕文本;将第一字幕文本翻译成时间码相同的第二字幕文本;根据第二字幕文本配音时长与字幕显示时长的差异,对第二字幕文本进行规整得到第三字幕文本;生成第三字幕文本对应的第三音频;最后将所有第三音频、待配音视频的背景音频及无声视频合成得到最终的目标视频。本发明在视频配音过程中出现的音频时长与字幕显示时长存在差异的情况下,通过对字幕文本进行规整,从而避免了对原始视频文件的破坏,确保了视频配音的高质量。