摘要
本发明公开了一种基于可放缩残差头结构的大语言模型训练方法,其包括:S1:准备训练数据,训练数据包括第一训练数据和第二训练数据;S2:在原有大语言模型上添加可放缩残差头结构;S3:定义判别器路由网络,判别器路由网络根据sigmoid函数的输出值来选择是否启用可放缩残差头结构;S4:通过第一训练数据对添加了可放缩残差头结构的大语言模型进行微调训练,得到第一模型权重;S5:将第一模型权重作为初始权重,使用第二训练数据对添加了可放缩残差头结构的大语言模型进行微调训练,得到最终的可放缩残差头结构模型。