一种面向大语言模型的隐蔽后门攻击和有效防御方法
# 热门搜索 #
大模型
人工智能
openai
融资
chatGPT
验证码登录
×
发送
登录即代表您已同意AITNT
用户协议
和
隐私政策
登录
登录成功后会自动刷新界面
AITNT公众号
AITNT APP
AITNT交流群
搜索
未登录
首页
AI中心
退出
首页
AI资讯
AI技术研报
AI监管政策
AI产品测评
AI商业项目
AI产品热榜
AI 源力市场
寻求报道
一种面向大语言模型的隐蔽后门攻击和有效防御方法
申请号:
CN202511000667
申请日期:
2025-07-21
公开号:
CN120874059A
公开日期:
2025-10-31
类型:
发明专利
摘要
本发明属于人工智能安全技术领域,涉及一种面向大语言模型(Large Language Model,LLM)的后门攻击与防御方法,开发了一种隐蔽性更强的后门攻击方法和优化防御技术,揭示并解决大语言模型在预训练和微调阶段存在的安全漏洞,从而提升模型的鲁棒性与可解释性。本发明通过API改写实现语义保留的后门植入,避免了传统触发器的显式特征,提高了攻击的隐蔽性;通过优化困惑度逻辑,增强了后门词的识别能力,显著降低了误报率;通过改进代码框架,提高了开发效率,减少了冗余流程,使系统更加简洁高效。
技术关键词
大语言模型
后门
文本
训练语言模型
数据
防御算法
风格
代码结构
语义
加载器
样本
定义
鲁棒性
框架
冗余
批量
逻辑
标记
阶段
接口