训练大语言模型的方法及装置

AITNT-国内领先的一站式人工智能新闻资讯网站
# 热门搜索 #
训练大语言模型的方法及装置
申请号:CN202511054173
申请日期:2025-07-29
公开号:CN120930721A
公开日期:2025-11-11
类型:发明专利
摘要
本说明书实施例涉及训练大语言模型的方法及装置,方法包括:首先,获取大语言模型中各注意力头在预训练版本中的第一权重集合以及在中间版本中的第二权重集合,中间版本针对第一任务对预训练的大语言模型进行全量微调得到;然后,针对任一目标注意力头,分别根据其对应的第一权重集合和第二权重集合,确定第一投影矩阵和第二投影矩阵;接下来,根据第一投影矩阵和第二投影矩阵之间的差异,确定对齐分数;然后,将对齐分数排名靠前的多个注意力头确定为关于第一任务的第一敏感注意力头;最后,利用针对第一任务的第一文本集,对预训练的大语言模型进行第一微调,得到第一模型;第一微调包括,仅调整各第一敏感注意力头的权重。
技术关键词
注意力 大语言模型 矩阵 文本 参数 微调单元 计算机 可读存储介质 存储器 处理器