摘要
本发明提供一种模型训练方法、自然语言处理方法及装置,涉及数据处理技术领域,包括:对各个自然语言推理数据进行处理,得到各个正向推理数据,以及各个第一反向推理数据;基于各个正向推理数据,以及各个第一反向推理数据,对学生大语言模型进行训练,得到具备正反向推理能力的第一大语言模型;构建各个自然语言推理数据对应的错误正向推理数据,第二反向推理数据;基于教师大语言模型,对各个目标自然语言推理数据对应的错误正向推理数据,以及第二反向推理数据进行处理,得到正向推理错误且反向推理正确的目标推理数据;根据各个错误正向推理数据,以及目标推理数据,通过直接偏好优化策略,对第一大语言模型进行训练,得到第二大语言模型。