摘要
本发明涉及神经网络模型技术领域,具体是涉及一种神经网络模型参数压缩方法和推理方法。本发明首先统一神经网络模型的各层参数值,也就是让每层的参数值都统一成相同的,也就是每层都具有相同的初始矩阵,那么只需要存储其中一层参数的初始矩阵,以降低参数存储压力。在此基础上,每层引入一组独立的DoRA(Decomposed Rank Adaptation)参数,以提升层间表达的灵活性。DoRA参数采用低秩矩阵形式,并与幅度因子相结合构建每层的差异化补偿结构。在模型训练过程中,仅对每层的DoRA子矩阵与幅度因子进行更新,从而实现在参数压缩背景下的模型性能保持甚至提升。本发明同时适用于大语言模型的推理部署,具有参数压缩比高、计算效率优、性能保持能力强等优点。