摘要
本发明涉及一种多模态的图像分割方法及系统,其中,该方法通过Transformer网络将待分割目标的视觉特征和深度特征进行交互融合,得到全局特征,对LiDAR传感器得到的点云数据进行3D空间偏置计算,以此构建偏置矩阵,通过偏置矩阵对由点云特征和全局特征拼接而成的多模态特征进行特征增强,根据特征增强后的多模态特征和多尺度卷积生成多尺度区域结构特征,以此实现对待分割目标的图像分割。由此,本发明并非简单将视觉特征与深度特征进行拼接得到全局特征,且在全局特征的基础上引入点云特征,引入空间感知,增强空间一致性的同时,弥补在将全局特征与点云特征进行拼接的过程中所造成的空间信息损失和语义漂移,提高图像分割的准确性。