摘要
本发明提供一种大模型跨模态协同理解方法及装置,可以提升多模态信息的融合效率和理解能力。大模型跨模态协同理解方法包括:对视觉数据、语言数据和声音数据进行预处理,获得预处理后的视觉数据、语言数据和声音数据;其中,预处理包括:对视觉数据进行自适应尺寸调整与归一化,对语言数据进行分词与动态截断,对声音数据进行带通滤波与谱减降噪;基于预处理后的视觉数据、语言数据和声音数据,提取视觉特征、语言特征和声音特征;基于自适应映射网络与混合粒度跨模态注意力机制,将视觉特征、语言特征和声音特征进行特征对齐,获得对齐的特征向量;基于动态路由架构,将对齐的特征向量进行融合,生成统一多模态表示。