基于大语言模型先验的多模态融合图像翻译方法及系统

AITNT-国内领先的一站式人工智能新闻资讯网站
# 热门搜索 #
基于大语言模型先验的多模态融合图像翻译方法及系统
申请号:CN202510937899
申请日期:2025-07-08
公开号:CN120430931B
公开日期:2025-09-12
类型:发明专利
摘要
本发明公开了基于大语言模型先验的多模态融合图像翻译方法及系统,该方法包括:获取配准后的红外‑可见光融合图像以及对应的语义掩码和文本描述并进行数据预处理,得到融合图像特征、语义掩码视觉特征与文本语义特征序列;基于文本‑视觉状态空间块与三维选择性扫描块,构建多模态融合图像模态翻译模型;基于多模态融合图像模态翻译模型对融合图像特征、语义掩码视觉特征与文本语义特征序列进行图像翻译处理,得到翻译后的具有可见光分布特性的目标图像。本发明能够通过文本、掩码和图像之间的交互捕捉长期依赖关系,提升多模态融合图像翻译的精度。本发明作为基于大语言模型先验的多模态融合图像翻译方法及系统,可广泛应用于图像处理技术领域。
技术关键词
融合图像特征 图像翻译方法 视觉特征 语义特征 翻译模型 文本 大语言模型 多模态特征融合 可见光 序列 线性 图像重建 图像翻译系统 注意力 检测损失