摘要
本申请实施例公开了一种视频生成方法、装置、电子设备及计算机可读存储介质,属于视频生成技术领域。本申请实施例通过获取参考图像和提示文本,并将参考图像和提示文本输入视频生成模型,能够得到视频生成模型输出的目标视频;其中,视频生成模型包括图像提示模块和目标生成模块。本申请实施例利用图像提示模块对参考图像和提示文本进行解耦处理,能够更显性地保留图像特征,进而有效避免直接耦合导致语义混淆,实现图文特征的高效对齐与精细化控制,使得目标生成模块能够基于图像提示模块输出的目标图像特征和目标文本特征,生成更为精准、符合用户预期的高质量视频,进而提升用户体验。