摘要
本发明提出了一种基于世界模型的策略决策方法及装置,方法包括:S10,获取策略互动中的态势信息;S20,采用基于Muzero模型网络改进的预测模型网络基于态势信息生成隐向量表征;S30,通过多智能体树搜索算法基于隐向量表征选择确定决策动作,并输出给策略互动中的智能体。本发明的基于世界模型的策略决策方法及装置,首次采用将多智能体强化学习算法与MCTS世界模型规划结合的多智能体模型算法,相比目前最先进的无模型多智能体方法,提升大动作空间中的搜索效率。通过实验证明,与已有的多智能体强化学习算法相比,在策略性能相同的前提下,具有更优样本效率。