摘要
本发明公开了一种基于深度强化学习的无人机着艇方法,涉及控制技术领域;其包括如下步骤,步骤S1:获得无人机与无人艇之间的相对位置;步骤S2:无人机的着艇视觉系统跟踪定位无人艇;步骤S3:设置获得两个奖励函数分别为步长奖励函数和时间奖励函数,用于无人机的控制器约束无人机的降落时间;步骤S4:使用TD3算法,引入噪声以避免收敛到局部最优解;在更新评论者网络时,目标策略网络间断更新;TD3算法通过确定性策略梯度更新参数φ并引入超参数进行软更新;步骤S5:建立自动课程学习机制,将复杂任务分解为一系列更简单的子任务;其通过步骤S1至步骤S5等,实现高效着艇。