一种基于强化学习微调的大型语言模型优化方法

AITNT-国内领先的一站式人工智能新闻资讯网站
# 热门搜索 #
一种基于强化学习微调的大型语言模型优化方法
申请号:CN202511024220
申请日期:2025-07-24
公开号:CN120911540A
公开日期:2025-11-07
类型:发明专利
摘要
本发明涉及大型语言模型技术领域,公开了一种基于强化学习微调的大型语言模型优化方法,包括:采集目标模型交互得到的优势值,以大小为T×B的优势矩阵;依据预设窗口对优势矩阵从时间维度进行分割处理,形成m个分片;依据m个分片分别确定优势矩阵的源分布,以及构建代价矩阵;基于源分布和代价矩阵,确定大小为m×m的传输矩阵;基于传输矩阵确定第p个分片的净能量搬运量;根据第p个分片的净能量搬运量、优势矩阵和预设窗口,对优势矩阵进行更新处理,得到更新优势矩阵;基于更新优势矩阵计算损失值,以损失值执行反向传播,更新目标模型。
技术关键词
语言模型优化方法 矩阵 分片 元素 变量 总量 语言模型技术 指数 策略 参数