摘要
本发明涉及智能决策技术领域,可应用于金融科技、医疗健康等业务系统平台中,公开了一种行为克隆模型训练方法、装置、设备及介质,包括:获取多模态输入,对多模态输入进行特征提取与拼接,得到输入表示;利用预设解码器提取输入表示的潜在表示,利用预设策略头将潜在表示解码为动作数据;利用信息瓶颈原理计算潜在表示的互信息损失函数值,计算动作数据与预设真实动作数据的均方误差损失值;根据互信息损失函数值和均方误差损失值对预设解码器和预设策略头的参数进行迭代更新,得到更新模型;实时检测更新模型中的联合损失函数值是否小于预设阈值;当联合损失函数值小于预设阈值时,停止参数迭代更新,得到优化模型。