摘要
本申请涉及一种机器人控制方法、装置、设备及介质。该方法通过将当前视觉信息输入训练好的视觉编码器,将控制指令输入训练好的文本编码器,将当前图像编码输入训练好的适配器,将调节后的当前图像编码和目标文本编码输入训练好的语言模型,控制机器人执行相应动作。本申请可应用于机器人领域,金融科技领域以及智能医疗领域中,通过当前视觉信息得到当前图像编码,根据控制指令得到目标文本编码,根据当前图像编码,得到调节后的图像编码,根据调节后的图像编码和目标文本编码,得到目标预测结果,根据目标预测结果得到第一控制策略并控制机器人。从而全面地对机器人的视觉信息进行处理,以准确得到控制机器人的控制策略。