一种基于DIT的多模态视频生成方法、装置、设备及介质

AITNT-国内领先的一站式人工智能新闻资讯网站
# 热门搜索 #
一种基于DIT的多模态视频生成方法、装置、设备及介质
申请号:CN202510936145
申请日期:2025-07-08
公开号:CN120602746A
公开日期:2025-09-05
类型:发明专利
摘要
本发明提供的一种基于DIT的多模态视频生成方法、装置、设备及介质,涉及多模态视频生成技术领域。本发明通过Whisper模型与3D卷积层提取出输入的音频信号的音频特征,并与加入噪声的潜层特征进行融合,生成音频嵌入特征;获取嘴巴位置掩码信息与首帧参考掩码信息,分别提取出嘴巴区域的掩码嵌入特征和首帧嵌入特征;将潜层特征、音频嵌入特征与掩码嵌入特征进行加法融合得到第一融合特征,并将首帧嵌入特征与输入的首帧参考图像进行融合得到第二融合特征;将第一融合特征、第二融合特征与输入的提示文本一起输入预训练的DIT口型对齐模型,生成视频。本申请能够实现高质量视频生成与精准口型对齐,解决了现有GAN模型生成视频不连贯及细节控制不足的问题。
技术关键词
嵌入特征 视频生成方法 融合特征 矩形外框 计算机可读指令 平滑方法 图像嵌入 坐标 视频生成设备 视频生成技术 可读存储介质 视频生成装置 音频特征提取 GAN模型 噪声 人脸