摘要
本发明涉及一种基于自适应动态拓扑结构的强化学习驾驶决策方法,属于智能驾驶技术领域。本发明通过搭建强化学习参数优化网络和Typed‑balanced经验池,从经验池中采集样本供强化学习参数优化网络进行学习;根据实时采集环境参数生成和车辆控制参数;通过强化学习参数优化网络优化驾驶决策参数,通过奖励预测网络比较优化的驾驶决策参数和经验参数的奖励值,比较奖励值以选择较优的驾驶决策参数,并进一步计算得到真实车辆控制参数。本发明通过基于强化学习的自适应动态拓扑结构框架进行智能驾驶场景下的运动决策,能够提高强化学习算法的路径规划能力,并提高自动驾驶决策过程的透明性。