一种大模型安全防护方法、装置及存储介质

AITNT-国内领先的一站式人工智能新闻资讯网站
# 热门搜索 #
一种大模型安全防护方法、装置及存储介质
申请号:CN202510997127
申请日期:2025-07-18
公开号:CN120930134A
公开日期:2025-11-11
类型:发明专利
摘要
本发明公开了一种大模型安全防护方法:准备对抗性提示数据样本:定义对抗性提示的特征,包括提示泄漏和越狱攻击两种类型;从公开数据集和社区分享中提取已知的对抗性提示,通过人工构造和算法微调正常提示生成对抗性提示,整合成数据集并划分训练集和测试集;模型选择与训练:选择适合文本分类任务的机器学习模型;利用所述对抗性提示数据样本对模型进行对抗训练;设计代理逻辑,构建对抗提示检测器中间模块,该模块:通过前端接口接收用户请求;对接收到的请求进行解析;调用对抗性提示检测模块评估请求安全性;根据评估结果选择转发至大模型或直接返回错误响应;测试与迭代,验证对抗提示检测器中间模块功能并根据新增数据重新训练模型。
技术关键词
对抗性 防护方法 检测器 机器学习模型 代表训练数据 样本 大语言模型 处理器 逻辑模块 索引 文本 分析单元 非标准 算法 防护装置 定义 可读存储介质