摘要
本发明涉及人工智能技术领域,可应用于智慧医疗和金融领域,公开了一种具身智能体的行为决策优化方法、装置、设备及介质,包括:根据图像构建场景图,采用图神经网络对场景图进行处理;将文本转化为语义图,采用图神经网络对语义图进行处理;将场景图和语义图进行融合,获得视觉语言联合图,采用联合图神经网络对视觉语言联合图进行处理;对多模态信息进行分层融合,根据融合后的特征指导具身智能体的行为决策。通过基于图结构进行视觉特征和语言特征的学习,可更深入地理解图像和语言中的语义信息,把握物体之间的空间关系和语义关联,精准构建物体之间的空间关系,并更好地解析文本中的语法结构和语义关系,更准确地理解任务指令。