一种有序多人Stackelberg纳什博弈的逆强化学习算法
申请号:CN202511024205
申请日期:2025-07-24
公开号:CN120893515A
公开日期:2025-11-04
类型:发明专利
摘要
本发明涉及一种有序多人Stackelberg纳什博弈的逆强化学习算法,包括建立专家玩家的Stackelberg纳什博弈系统,并设计惩罚函数;基于最优化控制理论;建立学习者玩家的Stackelberg纳什博弈系统;设计基于模型的逆强化学习算法;针对异质控制输入问题,设计了部分无模型逆强化学习算法,并给出基于神经网络实现该算法的过程。本发明的优点:提出了基于模型的逆强化学习算法,用于学习专家的奖励函数,有最优控制学习阶段和逆最优控制学习阶段,将IOC作为一个子问题进行求解,开发了适用于异质控制输入的部分无模型逆强化学习算法,学习者的每个玩家的轨迹与专家的轨迹完全相同。
技术关键词
强化学习算法
玩家
非线性动态系统
专家系统
异质
均衡策略
轨迹
理论
阶段
定义
方程
决策
代表