SAID: Empowering Large Language Models with Self-Activating Internal Defense

文章核心总结与创新点

一、主要内容

该研究针对大型语言模型(LLMs)易受越狱攻击的安全隐患,提出了一种无需训练的内部激活防御框架SAID(Self-Activating Internal Defense)。现有防御方法多依赖外部干预(如输入过滤、输出修改),存在泛化能力弱、损害模型可用性或计算开销大等问题,而SAID通过激活模型内在安全机制,将防御从“外部修正”转向“内部能力激活”。

SAID包含三阶段核心流程:

  1. 模型原生意图蒸馏:从可能存在混淆或对抗性的输入中提取核心语义,长输入采用分层蒸馏策略确保意图捕捉完整性;
  2. 最优安全前缀探测:通过实证优化的安全前缀激活模型潜在安全意识,该前缀经结构化搜索筛选,在强化安全性的同时不损害良性任务性能;
  3. 保守聚合策略:整合多个探测结果,若任一核心意图被标记为不安全则拒绝响应,确保对多维度威胁的鲁棒防御。

实验在5个开源LLM(Vicuna-7B/13B、Llama2-7B、Guanaco-13B、Llama-3-8B-Instruct)上展开,针对6种先进越狱攻击(GCG、AutoDAN、PAIR等),结果显示SAID在降低有害输出方面显著优于现有防御方法,同时保持良性任务性能,且计算开销极小。

二、创新点

  1. 提出首个无需训练的内部激活防御框架SAID,通过意图蒸馏、安全探测和保守聚合的三阶段流程,利用模型自身推理能力实现主动越狱防御;<
评论
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包

打赏作者

UnknownBody

你的鼓励将是我创作的最大动力

¥1 ¥2 ¥4 ¥6 ¥10 ¥20
扫码支付:¥1
获取中
扫码支付

您的余额不足,请更换扫码支付或充值

打赏作者

实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值