基于大语言模型的上下文偏好学习方法、装置及设备
# 热门搜索 #
大模型
人工智能
openai
融资
chatGPT
验证码登录
×
发送
登录即代表您已同意AITNT
用户协议
和
隐私政策
登录
登录成功后会自动刷新界面
AITNT公众号
AITNT APP
AITNT交流群
搜索
未登录
首页
AI中心
退出
首页
AI资讯
AI技术研报
AI监管政策
AI产品测评
AI商业项目
AI产品热榜
AI 源力市场
寻求报道
基于大语言模型的上下文偏好学习方法、装置及设备
申请号:
CN202511097420
申请日期:
2025-08-06
公开号:
CN120996133A
公开日期:
2025-11-21
类型:
发明专利
摘要
本发明涉及一种基于大语言模型的上下文偏好学习方法、装置及设备,方法包括:配置任务环境并定义性能指标;通过大语言模型自动生成多组初始奖励函数;并行训练多个强化学习代理并采集行为数据;基于加权评分机制自动识别最优与最劣奖励函数;结合对比差异信息驱动大语言模型生成改进函数并迭代优化。本方案能够突破人工设计瓶颈,实现奖励函数的动态权重调节与跨场景泛化;在客服、工业控制等场景中显著提升决策效率与安全性;通过无监督偏好评估降低人工成本,支持策略模型持续自适应优化。
技术关键词
强化学习代理
大语言模型
学习方法
评分机制
指标
情感分析模型
计算机设备
学习装置
人类
策略
处理器
无监督
定义
决策
存储器
控制模块
场景
客服
动态