摘要
本发明涉及基于双向回译对抗网络的数据增强方法,属自然语言处理领域。在低资源语言机器翻译中,由于缺乏大规模多样化的训练语料导致机器翻译结果在特定领域内偏差的问题。为缓解在特定领域内偏差带来的影响,提供了本发明,本发明通过结合对抗训练和双向回译技术,利用预训练的遮蔽语言模型生成高质量的对抗样本和多样化的训练数据以此增强模型的鲁棒性。先使用对抗训练对数据集进行数据增强,再利用双向翻译方法生成语义相似但表达不同的文本,然后使用预训练遮蔽语言模型生成语义合理的文本变体,最后融合双向翻译和MLM生成更合理且多样化的增强数据,并用这些数据对模型再训练。本发明在数据层面上显著增强NMT模型的鲁棒性和性能。