一种基于经验筛选与个体奖励生成的多智能体协同决策方法

AITNT-国内领先的一站式人工智能新闻资讯网站
# 热门搜索 #
一种基于经验筛选与个体奖励生成的多智能体协同决策方法
申请号:CN202510937078
申请日期:2025-07-08
公开号:CN120430339A
公开日期:2025-08-05
类型:发明专利
摘要
本发明公开了一种基于经验筛选与个体奖励生成的多智能体协同决策方法,步骤包括:S1:生成经验缓冲区;经验缓冲区包括多个回合下的经验块;每个回合的经验块中包括相应多个时间步的动作;S2:在经验缓冲区中进行回合采样,并根据个体Q值和总体Q值确认每个回合内多个时间步下的局部最佳状态;S3:根据局部最佳状态确认相应智能体在当前状态下的内在奖励,并根据各个智能体的内在奖励确认全局奖励;S4:根据单个智能体对于全局奖励的贡献程度来对个体奖励进行计算,并用于智能体个体神经网络的更新;本发明能够在稀疏奖励环境下实现对多智能体精确的信用分配,指导策略学习。
技术关键词
决策方法 神经网络参数 策略