摘要
本发明涉及视频剪辑技术领域,解决了现有技术中未涉及如何得到视频片段的问题,提供了一种基于多模态大模型的视频剪辑方法、装置、设备及介质,通过获取用户输入的图像描述信息和待剪辑视频;根据所述图像描述信息对所述待剪辑视频进行语义分割,得到所述待剪辑视频中的多个初始分割片段;针对每个初始分割片段中的每个初始边界帧,若所述待剪辑视频中存在与所述初始边界帧相邻且未被包含于所述初始分割片段内的相邻视频帧,则根据所述相邻视频帧与所述初始边界帧,得到目标边界帧;根据所述初始分割片段中的两个目标边界帧,确定所述待剪辑视频中的目标视频片段。能够实现边界的动态调整和优化,从而精确确定视频中的目标视频片段。