摘要
本发明公开了一种基于多模态大模型的抓取姿态生成方法及系统,当输入语音指令和RGB图像时,将视觉特征与语义特征在多模态大模型中跨模态匹配得到控制函数代码与目标物体的位置信息;当输入带有手绘指令的RGB图像时,得到控制函数代码、目标物体与路径点的位置信息;根据目标物体的位置信息再结合深度信息计算出目标物体的点云数据,预处理后,将目标物体的理想点云输入目标识别网络模型,对目标物体区域的点云进行抓取区域识别,输出高抓取置信度区域,并映射真实坐标系;构建点云包围盒,生成抓取姿态候选集合;通过计算抓取姿态候选分数,选出质量最高的抓取姿态,作为机器人抓取位姿;结合控制函数代码及抓取路径执行目标抓取任务。