一种过程奖励模型训练方法及系统
# 热门搜索 #
大模型
人工智能
openai
融资
chatGPT
验证码登录
×
发送
登录即代表您已同意AITNT
用户协议
和
隐私政策
登录
登录成功后会自动刷新界面
AITNT公众号
AITNT APP
AITNT交流群
搜索
未登录
首页
AI中心
退出
首页
AI资讯
AI技术研报
AI监管政策
AI产品测评
AI商业项目
AI产品热榜
AI 源力市场
寻求报道
一种过程奖励模型训练方法及系统
申请号:
CN202510935492
申请日期:
2025-07-08
公开号:
CN120430424B
公开日期:
2025-10-03
类型:
发明专利
摘要
本发明涉及人工智能技术领域,尤其涉及一种过程奖励模型训练方法及系统。本发明计算每个样本中问题文本的置信度分数;基于标注样本中问题文本的各个推理步骤的正确性分数、置信度分数、容忍距离超参数,获取标注样本中问题文本的各个推理步骤的目标正确性分数;基于标注样本中问题文本的各个推理步骤的正确性预测分数与目标正确性分数之间的二元交叉熵损失,对过程奖励模型进行训练,将训练好的过程奖励模型作为目标过程奖励模型。本发明提高了过程奖励模型训练的准确性和可靠性,增强了大型语言模型生成文本精度。
技术关键词
文本
样本
模型训练方法
答案
超参数
模型训练系统
索引
人工智能技术
数据获取模块
校正模块
标签
模板
序列
数学
精度