一种基于强化学习的大模型推理游戏能力的优化方法

AITNT-国内领先的一站式人工智能新闻资讯网站
# 热门搜索 #
一种基于强化学习的大模型推理游戏能力的优化方法
申请号:CN202510970186
申请日期:2025-07-15
公开号:CN120671852A
公开日期:2025-09-19
类型:发明专利
摘要
本发明涉及一种基于强化学习的大模型推理游戏能力的优化方法,包括以下步骤:采用多人推理游戏的规则和逻辑进行大模型推理游戏能力训练,以搭建环境,环境包括角色分配、游戏阶段以及胜负判定条件,并进行环境奖励;大模型的每一个智能体将被建模为一个Player对象,智能体包含角色类型、存活状态、预定义的各阶段提示词以及游戏历史记录;通过多智能体之间的交互来构造对局数据;采用对局数据训练并优化大模型的推理能力。本发明让大模型在多智能体自主博弈的过程中进行强化学习,以实现在无额外数据的情况下大模型的自主提升,提升大模型在文本推理游戏中的表现,并将逻辑推理能力泛化至其他推理任务中。
技术关键词
游戏 阶段 策略 数据 格式 算法 逻辑 对象 文本