摘要
本发明公开了一种人形机器人运动控制强化学习方法,包括:构建含感知、强化学习、决策及通信模块的智能体架构;通过分层强化学习模型实现高层生成战术级子目标、底层生成具体动作指令的分层动作控制;在对抗环境中,通过对手建模网络预测对抗行为并嵌入奖励函数,采用共享注意力机制优化协同策略;在策略探索与参数更新时,叠加策略熵正则化项并基于经验回放缓冲区更新参数;通过通信模块异步广播信号,接收方动态调整策略。该方法增强了人形机器人系统的通用性与适应性,提升了人形机器人智能体的学习效率与策略优化能力,改善了人形机器人在非配合环境下的性能表现,增强了系统鲁棒性与稳定性,能适应复杂动态环境。