多模态视频特征解耦提取方法、装置、设备及介质

AITNT-国内领先的一站式人工智能新闻资讯网站
# 热门搜索 #
多模态视频特征解耦提取方法、装置、设备及介质
申请号:CN202510945628
申请日期:2025-07-09
公开号:CN120853082A
公开日期:2025-10-28
类型:发明专利
摘要
本发明涉及金融、医疗健康及人工智能技术领域,提供一种多模态视频特征解耦提取方法、装置、设备及介质,基于信息瓶颈损失、生成器损失、反事实损失及时序一致性损失训练因果生成对抗网络得到因果生成对抗特征提取器,并将初始视频特征、初始音频特征、初始文本特征、内容隐变量及上下文隐变量输入至因果生成对抗特征提取器生成解耦特征,能够将因果干预机制嵌入对抗网络的对抗训练过程,并通过双潜在空间架构直接建模以显式拆分内容与上下文的独立生成路径,避免辅助网络引入的偏差,时序一致性损失与信息瓶颈约束的联合优化策略还能确保动态场景下解耦特征的稳定性,从而生成解耦更彻底的解耦特征。
技术关键词
音频特征 特征提取器 视频 变量 生成对抗网络 多模态 融合特征 瓶颈 交叉注意力机制 文本 时序 计算机设备 编码器 可读存储介质 人工智能技术 指令 动态场景 医疗健康 重构 网络结构