摘要
本发明属于多模态人工智能、语义推理与目标检测分割技术领域,公开了一种用于智能驾驶的多模态推理分割方法及相关装置,包括如下步骤:获取数据,所述数据包括文本提示和云端服务器采集的初始图像数据;利用LLaVA模型对所述文本提示和初始图像数据进行处理,得到推理语言响应;对所述文本提示提取关键词;利用已训练好的Grounded SAM模型对所述关键词和初始图像数据进行处理,得到分割后的图像,实现目标物体的划分。本发明能够融合音频、图像与文本这些多模态输入信息,具备高精度推理能力,能够以满足智能驾驶系统对安全性、准确性与实时性的综合要求。