基于强化学习的任务型对话策略学习方法与系统

AITNT-国内领先的一站式人工智能新闻资讯网站
# 热门搜索 #
基于强化学习的任务型对话策略学习方法与系统
申请号:CN202511071737
申请日期:2025-08-01
公开号:CN120910212A
公开日期:2025-11-07
类型:发明专利
摘要
本发明属于智能任务型对话技术领域,具体涉及基于强化学习的任务型对话策略学习方法与系统,采用软演员评论家算法结合行为克隆,以及最大熵逆强化学习,缓解冷启动问题;其中,利用最大熵逆强化学习,计算奖励值,依据人类对话与模拟对话的最大化对数似然估计,精准推断对话中的用户目标;而通过逆强化学习从成功轨迹中提取潜在奖励函数,替代人工设计奖励,在优化策略时不仅追求累积奖励最大化,还鼓励策略的多样性和探索性,避免对话策略过早收敛到单一模式。
技术关键词
对话策略 学习方法 捕捉关键词 追踪器 正则化参数 模拟器 网络 策略更新 轨迹 生成用户 终端 学习系统 文本 信号 超参数 模块 算法