使用扩散模型监督视觉语言模型训练的方法

AITNT-国内领先的一站式人工智能新闻资讯网站
# 热门搜索 #
使用扩散模型监督视觉语言模型训练的方法
申请号:CN202511094970
申请日期:2025-08-06
公开号:CN120580446B
公开日期:2025-11-21
类型:发明专利
摘要
本发明公开了一种利用扩散模型监督视觉语言模型训练的方法。该方法输入图像与文本,通过视觉编码器提取多层次图像特征,并结合连接器输出的文本特征,作为条件信息输入至扩散模型中。核心为提出一种混合专家交叉注意力机制:分别对低、中、高层图像特征及文本特征构建独立注意力分支,并通过门控路由机制动态融合这些特征。融合特征用于指导图像逐步重建,输出最终图像结果。通过与原始图像对比的感知损失反向优化视觉编码器和连接器,从而增强视觉语言模型的感知能力与语义表达能力。
技术关键词
交叉注意力机制 线性变换矩阵 视觉 适配器 Softmax函数 多层次监督 文本 输出特征 感知特征 噪声分量 语义 图像重建 分支 融合特征 层级 网络