摘要
本发明公开了一种基于知识图谱的领域大模型有害提示词生成方法,包括:基于构建的风险知识图谱对通用有害提示词数据集进行筛选得到种子有害提示词库;对领域语料库进行处理得到嵌入式上下文;基于种子有害提示词、风险实体、嵌入式上下文和示例,通过合成模型生成候选有害提示词,并通过毒性指标进行清洗增强得到高风险有害提示词加入种子有害提示词库;基于种子有害提示词与风险实体的语义相关度、以及种子有害提示词的毒性评分筛选出下一轮的提示词输入,构建迭代更新的领域有害提示词数据集。本发明具备高自动化、多维评估、可控生成等特性,可实现多轮人机协同提示词构造,显著提升大语言模型在特定应用领域的红队演练效率与安全测试质量。