摘要
本发明公开了一种大语言模型越狱攻击防御方法及系统,属于人工智能安全技术领域,该方法的实现包括以下步骤:步骤1:接收用户文本提示;步骤2:计算输入文本与历史攻击文本的相似度;步骤3:高相似度直接拒绝处理,低相似度进入压缩流程;步骤4:提取文本特征并计算令牌保留概率;步骤5:选择高概率令牌形成压缩提示;步骤6:将意图信息传递给目标模型;步骤7:生成安全响应。本发明解决现有技术中计算开销大、成本高、防御规则滞后性、用户体验不一致的技术问题,其实现仅需要少量的额外计算开销和令牌成本,并能有效防御恶意攻击且不会影响大语言模型的实用性。