基于强化学习的任务型对话策略学习方法与系统
# 热门搜索 #
大模型
人工智能
openai
融资
chatGPT
验证码登录
×
发送
登录即代表您已同意AITNT
用户协议
和
隐私政策
登录
登录成功后会自动刷新界面
AITNT公众号
AITNT APP
AITNT交流群
搜索
未登录
首页
AI中心
退出
首页
AI资讯
AI技术研报
AI监管政策
AI产品测评
AI商业项目
AI产品热榜
AI 源力市场
寻求报道
基于强化学习的任务型对话策略学习方法与系统
申请号:
CN202511071737
申请日期:
2025-08-01
公开号:
CN120910212A
公开日期:
2025-11-07
类型:
发明专利
摘要
本发明属于智能任务型对话技术领域,具体涉及基于强化学习的任务型对话策略学习方法与系统,采用软演员评论家算法结合行为克隆,以及最大熵逆强化学习,缓解冷启动问题;其中,利用最大熵逆强化学习,计算奖励值,依据人类对话与模拟对话的最大化对数似然估计,精准推断对话中的用户目标;而通过逆强化学习从成功轨迹中提取潜在奖励函数,替代人工设计奖励,在优化策略时不仅追求累积奖励最大化,还鼓励策略的多样性和探索性,避免对话策略过早收敛到单一模式。
技术关键词
对话策略
学习方法
捕捉关键词
追踪器
正则化参数
模拟器
网络
策略更新
轨迹
生成用户
终端
学习系统
文本
信号
超参数
模块
算法