摘要
本公开属于三维场景理解技术领域,具体涉及一种三维开放词汇语义分割模型的训练方法及装置。所述训练方法包括:获取目标区域的多视角RGB‑D图像,对每个所述图像,通过视觉语言模型进行多阶段推理,生成目标词汇列表并提示二维分割模型建立像素级文本标签,深度映射所述图像生成第一点云,映射所述文本标签至所述第一点云生成逐点文本标签;以所述逐点文本标签为监督信号,预训练具有稀疏编码器‑解码器结构的神经网络模型,在所述第一点云上生成三维分割模型;对目标区域完整场景的第二点云,在共享视觉‑语言特征空间中匹配点特征嵌入与相似度最高的文本嵌入,生成可信点‑文本标签对,并基于此微调所述三维分割模型。