公司动态
[论文学习]JBShield:通过激活概念分析与操纵防御大语言模型越狱攻击
JBShield: Defending LLMs from Jailbreak Attacks through Activated Concept Analysis and Manipulation (USENIX Security 2025)论文重点本文基于线性表征假说Linear Representation Hypothesis, LRH系统揭示了大语言模型越狱攻击的内在机制并提出了一套名为JBShield的防御框架。该框架通过识别输入提示中是否同时激活了“有毒概念”和“越狱概念”来检测越狱攻击并通过增强有毒概念、削弱越狱概念来操纵模型的隐藏表征从而实现安全输出。实验表明JBShield在五个开源LLM上对九种越狱攻击的平均检测F1-Score达到0.94将平均攻击成功率从61%降至2%。核心研究內容问题定义尽管大语言模型已通过RLHF等对齐策略嵌入了安全护栏但它们仍然容易受到越狱攻击的威胁——攻击者通过巧妙构造的输入提示绕过安全机制使模型输出本应被拒绝的有害内容。已有的防御方法或依赖表面模式检测或采用固定拒绝输出策略均未能从根本上理解越狱攻击为何能操纵模型行为。本文提出两个核心研究问题RQ1——对齐后的LLM能否识别越狱提示中的有害语义RQ2——越狱攻击如何将LLM的输出从拒绝转变为顺从创新方法一概念分析与提取算法。基于线性表征假说——神经网络将高层概念编码为隐藏表征中的子空间——本文将有害提示和越狱提示中的有害语义定义为“有毒概念”toxic concept将越狱提示中操纵LLM顺从恶意请求的语义定义为“越狱概念”jailbreak concept。概念提取采用反事实配对方法从两类提示中各取一个样本配对计算其最后一词隐藏表征的差值矩阵再通过截断奇异值分解SVDrank1提取主奇异向量作为概念子空间。该子空间还可通过输出嵌入矩阵映射为可读token进行解释。二JBShield双组件防御框架。JBShield-D检测通过单次前向传播判断输入是否同时激活了有毒概念和越狱概念。具体而言先将输入与良性样本比较提取“测试有毒概念”与锚定有毒概念子空间进行余弦相似度比较再提取“测试越狱概念”与锚定越狱概念子空间比较。若两个概念均被激活则判定为越狱提示。JBShield-M缓解对于检测到的越狱提示在隐藏表征层面进行操纵——增强有毒概念的锚定向量的同时削弱越狱概念的锚定向量。与现有方法输出固定拒绝内容不同这使得LLM能够自主生成有针对性的安全内容。三关键发现。概念分析揭示了两个重要结论第一对齐后的LLM能够识别越狱提示中的有害语义有毒概念被激活第二越狱攻击并非绕过毒性检测而是通过引入“越狱概念”这一新的语义成分来主动操纵模型的顺从行为。例如Mistral-7B中IJP、GCG、PAIR等越狱方法对应的可解释token包括“understood”“sure”“yes”等顺从相关词汇。研究成果检测性能在五个开源LLM上针对九种越狱攻击JBShield-D的平均F1-Score达到0.94。缓解性能JBShield-M将平均攻击成功率从61%降至2%。数据效率仅需30个越狱提示即可完成校准。效率优势检测仅需单次前向传播缓解仅涉及少量线性运算。实际落地应用的可能性JBShield具有较高的实际应用价值首先它仅需少量校准数据即可部署适合快速适配新型越狱攻击其次它不要求白盒访问攻击者模型仅依赖目标LLM自身的隐藏表征最后其概念可解释性通过可读token展示为安全运维人员提供了攻击意图的可视化分析能力。适用于需要高安全性保障的LLM部署场景如金融、医疗、政务等领域的对话系统。技术细节1. 隐藏表征形式化对于输入提示 x第 l 层Transformer层的隐藏表征为Hl(x)TFLayerl(Hl−1(x))H_l(x) \text{TFLayer}_l(H_{l-1}(x))Hl(x)TFLayerl(Hl−1(x))其中Hl(x)∈Rm×dH_l(x) \in \mathbb{R}^{m \times d}Hl(x)∈Rm×dm为输入token数d为嵌入维度。取最后一个token的隐藏表征ele_lel作为整句的句嵌入。2. 概念提取以有毒概念为例步骤一反事实配对。设有害提示集Xh{xih}i1NX^h \{x^h_i\}^N_{i1}Xh{xih}i1N良性提示集Xb{xib}i1NX^b \{x^b_i\}^N_{i1}Xb{xib}i1N随机配对形成(xih,xib)(x^h_i, x^b_i)(xih,xib)。步骤二线性分解。计算差值矩阵Dtoxic[el(x1h)−el(x1b)el(x2h)−el(x2b)⋮el(xNh)−el(xNb)]D_{\text{toxic}} \begin{bmatrix} e_l(x^h_1) - e_l(x^b_1) \\ e_l(x^h_2) - e_l(x^b_2) \\ \vdots \\ e_l(x^h_N) - e_l(x^b_N) \end{bmatrix}Dtoxicel(x1h)−el(x1b)el(x2h)−el(x2b)⋮el(xNh)−el(xNb)对DtoxicD_{\text{toxic}}Dtoxic进行截断SVDrank1取V矩阵的第一列 v 作为概念子空间。步骤三映射为可读token。使用输出嵌入矩阵WoeW_{oe}WoescoresWoe⊤⋅v\text{scores} W^\top_{oe} \cdot vscoresWoe⊤⋅v取top-k token作为概念的可解释表示。3. 检测与缓解检测计算测试概念子空间与锚定概念子空间的余弦相似度若同时超过阈值则判定为越狱。缓解H~Hα⋅vtoxic−β⋅vjailbreak\tilde{H} H \alpha \cdot v_{\text{toxic}} - \beta \cdot v_{\text{jailbreak}}H~Hα⋅vtoxic−β⋅vjailbreak研究设定实验配置目标LLM五个开源模型包括Mistral-7B、Llama-2-7B等越狱攻击九种攻击方法涵盖人工设计IJP、优化型GCG、SAA、模板型MasterKey、PAIR、TAP、语言型DrAttack、Puzzler和编码型Zulu、Base64五大类评估指标检测采用F1-Score缓解采用攻击成功率ASR校准数据仅需30个越狱提示代码与数据论文代码和数据集已开源https://github.com/NISPLab/JBShield综合分析理论贡献。本文最核心的贡献在于从线性表征的角度为越狱攻击提供了可解释的机理分析。过往研究虽观察到有害与良性输入在隐藏表征上的差异并称之为“拒绝方向”但本文进一步通过概念提取揭示了越狱攻击的双重概念激活本质——有毒概念和越狱概念可以同时存在而越狱概念会覆盖有毒概念的警告效应驱使模型从拒绝转向顺从。这种“叠加而非绕过”的视角为理解越狱攻击的本质提供了新的理论框架。方法创新。JBShield将检测与缓解统一在同一个概念分析框架下避免了以往方法中检测和缓解相互割裂的问题。值得注意的是JBShield-M通过操纵隐藏表征而非修改输入或输出使模型能够自主生成安全内容而非输出固定拒绝模板——这在用户体验上是一个显著改进。此外仅需30个校准样本即可部署的特性使其在实际场景中具备快速适配新攻击的能力。局限与展望。该方法依赖对目标LLM隐藏表征的访问因此主要适用于开源模型或提供内部表征访问接口的闭源模型。对于完全黑盒的API模型如何应用类似思路仍需进一步探索。此外概念提取依赖于SVD的线性假设对于高度非线性的语义特征可能存在表征不充分的问题。实践应用建议1. 部署场景选择。JBShield适用于对开源LLM进行安全加固的场景。如果您的应用基于Llama、Mistral等开源模型部署可直接集成JBShield的检测与缓解模块。建议优先在金融客服、医疗咨询、政务问答等高风险场景中部署。2. 校准数据准备。JBShield仅需30个越狱提示即可完成校准。建议从以下来源收集校准数据a公开越狱数据集如IJPb针对自身业务场景的红队测试结果c历史安全事件中记录的恶意输入。3. 关键层选择。论文指出并非所有层对识别有毒概念和越狱概念贡献相同。部署时建议通过验证集选择最能区分正常与越狱输入的层以优化检测精度和计算效率。4. 与现有安全机制集成。JBShield可部署在现有安全过滤流程中作为补充层先由规则或轻量级分类器快速过滤明显恶意输入再由JBShield对可疑输入进行深度检测和缓解以平衡安全性与响应速度。5. 监控与迭代。利用JBShield概念提取的可解释性映射为可读token安全团队可定期分析新出现的越狱攻击所对应的概念token模式及时发现新型攻击手法并更新锚定概念子空间。参考资料来源原始论文Zhang, S., Zhai, Y., Guo, K., Hu, H., Guo, S., Fang, Z., Zhao, L., Shen, C., Wang, C., Wang, Q. (2025). JBShield: Defending Large Language Models from Jailbreak Attacks through Activated Concept Analysis and Manipulation.34th USENIX Security Symposium. https://arxiv.org/abs/2502.07557代码仓库https://github.com/NISPLab/JBShield