基于错误反馈的NL2SQL大模型训练数据合成方法、系统及存储介质
申请号:CN202510977089
申请日期:2025-07-16
公开号:CN121009104A
公开日期:2025-11-25
类型:发明专利
摘要
本发明提供了一种基于错误反馈的NL2SQL大模型训练数据合成方法、系统及存储介质,该方法包括:步骤1:识别种子问答对中的实体,这些实体包括数据库中的Schema区域以及自然语言中的实体;步骤2:利用RAG技术在知识库中匹配与问题和实体相关的知识;步骤3:根据获得的知识和实体信息生成相应的SQL查询,并将其转化为自然语言问题;步骤4:对生成的SQL问答对进行质量评估,确保NL‑SQL问答对加入训练集,而出现错误的NL‑SQL问答对将反馈至NL‑SQL问答生成环节。本发明的有益效果是:提升了自然语言问题的流畅性和可理解性,确保生成的SQL语句的准确性和与问题的契合性。
技术关键词
自然语言
实体
语句
向量检索技术
合成器
错误检测
数据
语义
可读存储介质
大语言模型
训练集
处理器
表格
阶段
种子
存储器
计算机
条目
分词
记忆