摘要
本申请实施例提供了一种基于视觉强化学习的模型训练方法、装置、设备及介质。包括:获取样本图像帧及语义类别信息,将语义类别信息输入视觉大语言模型,得到第一卷积核参数,及将样本图像帧输入第一特征卷积核得到第一特征热力图;通过预设视觉强化学习模型得到样本图像帧的第二卷积核参数和第二特征热力图;基于第一卷积核参数与第二卷积核参数构建第一蒸馏损失,及基于第一特征热力图与第二特征热力图构建第二蒸馏损失;通过样本动作数据和样本状态数据预测和计算,构建自监督损失和目标策略损失;基于第一蒸馏损失、第二蒸馏损失、自监督损失和目标策略损失,对预设视觉强化学习模型进行参数调节,得到目标视觉强化学习模型。