一种集成预训练NLP模型的文本数据自动化标注方法及系统

AITNT-国内领先的一站式人工智能新闻资讯网站
# 热门搜索 #
一种集成预训练NLP模型的文本数据自动化标注方法及系统
申请号:CN202510896609
申请日期:2025-07-01
公开号:CN120407775B
公开日期:2025-09-05
类型:发明专利
摘要
本发明提供一种集成预训练NLP模型的文本数据自动化标注方法及系统,涉及人工智能技术领域,所述方法包括:获取待标注的原始文本数据,所述文本数据包括客户咨询、投诉或反馈的对话记录、评价及工单;对原始文本数据进行分词、停用词过滤及词性标注处理,生成结构化文本数据;将结构化文本数据输入预训练NLP模型,通过领域适配层对模型输出的语义特征进行修正,以得到修正后的语义特征;对修正后语义特征进行少样本学习,通过对比学习机制强化对低频文本模式的识别能力,生成抗长尾干扰的增强特征向量。本发明通过自动化处理数据获取与预处理,集成预训练NLP模型实现文本数据自动化标注。
技术关键词
文本 语义特征 标注方法 样本 词语 数据 低频标签 术语 生成标签 关键词 原型 实体 注意力机制 分类器 序列 分词 自然语言 决策