基于可放缩残差头结构的大语言模型训练方法

AITNT-国内领先的一站式人工智能新闻资讯网站
# 热门搜索 #
基于可放缩残差头结构的大语言模型训练方法
申请号:CN202510897463
申请日期:2025-06-30
公开号:CN120806053A
公开日期:2025-10-17
类型:发明专利
摘要
本发明公开了一种基于可放缩残差头结构的大语言模型训练方法,其包括:S1:准备训练数据,训练数据包括第一训练数据和第二训练数据;S2:在原有大语言模型上添加可放缩残差头结构;S3:定义判别器路由网络,判别器路由网络根据sigmoid函数的输出值来选择是否启用可放缩残差头结构;S4:通过第一训练数据对添加了可放缩残差头结构的大语言模型进行微调训练,得到第一模型权重;S5:将第一模型权重作为初始权重,使用第二训练数据对添加了可放缩残差头结构的大语言模型进行微调训练,得到最终的可放缩残差头结构模型。
技术关键词
头结构 语言模型训练方法 sigmoid函数 问答对数据 大语言模型 网络 解码器 参数 非线性 定义 分块 基础 逻辑