一种基于跨模态对齐机制的可控视频配乐生成方法

AITNT-国内领先的一站式人工智能新闻资讯网站
# 热门搜索 #
一种基于跨模态对齐机制的可控视频配乐生成方法
申请号:CN202510999352
申请日期:2025-07-21
公开号:CN120510556B
公开日期:2025-10-03
类型:发明专利
摘要
本发明公开了一种基于跨模态对齐机制的可控视频配乐生成方法,该方法通过解构视频内容得到具有明确语义与构图属性的对象区域的面积、起始位置、色彩和运动向量特征,并通过特定的编码使上述特征能够进行融合,使得用户能够主动引导模型关注视频中的特定画面区域(如人物、动作、色彩)或实现音乐风格(如情绪、节奏)的定制调整,能够实现个性化创作,还能够在在时间维度(如镜头切换、动态节奏)和空间维度(如画面构图、主体位置)的联合建模,使得音乐在情绪变化与节奏动态方面与视频内容精准匹配。
技术关键词
配乐生成方法 音乐特征 跨模态 运动向量 面积特征 编码 视频 色彩 镜头 融合特征 对象 注意力机制 序列 语义 动态 图片 三通道 红绿蓝