公司动态

用SingGuard-NSFA-9B增强Llama Guard 3:F1提升17.6点的扩展方案

📅 2026/8/18 15:31:22
用SingGuard-NSFA-9B增强Llama Guard 3:F1提升17.6点的扩展方案
用SingGuard-NSFA-9B增强Llama Guard 3F1提升17.6点的扩展方案【免费下载链接】SingGuard-NSFA-9B项目地址: https://ai.gitcode.com/hf_mirrors/inclusionAI/SingGuard-NSFA-9BSingGuard-NSFA-9B 是一款面向 Agent 智能体的开源 AI 安全护栏Guardrail模型采用生成式推理 实时分类双模式架构其核心亮点在于可插拔分类头设计只需在 Llama Guard 3 的冻结骨干上挂载 NSFA 分类头就能把查询侧检测 F1 直接提升 17.6 个点让 Llama Guard 3 一跃成为外部护栏中的性能冠军。这篇文章将用最通俗的语言带你理解这条低成本、高收益的扩展路径。为什么 Llama Guard 3 需要一次能力扩展️Llama Guard 3 是业界知名的开源内容安全分类器擅长判断模型说了什么文本合规。但随着 AI Agent 从聊天走向干活真正的危险早已转移到模型做了什么——也就是操作性风险提示词注入与越狱攻击者让 Agent 忽略原有指令恶意代码与网络攻击诱导 Agent 生成攻击脚本敏感信息窃取套取系统提示词、内部数据危险操作与工具滥用诱导 Agent 执行危险工具调用资源耗尽让 Agent 陷入死循环拖垮服务面对这五类Agent 专属威胁Llama Guard 3 显得力不从心。而 SingGuard-NSFA-9B 给出的方案不是推翻重来而是在 Llama Guard 3 之上做加法。NSFA 是什么先看懂这套风险分类体系NSFA 全称Not Secure For Agents是一套以 CIA 三元组机密性、完整性、可用性为基础、经过 OWASP 指南交叉验证的层级化风险分类体系共覆盖185 个风险变体检测侧Level-1 风险域说明查询侧输入护栏Prompt Injection Jailbreak提示词注入与越狱横跨全部 CIA 属性查询侧输入护栏Malicious Code Cyberattack恶意代码与网络攻击查询侧输入护栏Sensitive Information Stealing敏感信息窃取查询侧输入护栏Dangerous Operations Tool Abuse危险操作与工具滥用查询侧输入护栏Resource Abuse资源滥用响应侧输出护栏Hazardous Action Generation危险动作生成响应侧输出护栏Sensitive Information Leakage敏感信息泄露这套体系支持133 种语言模型基于 Qwen3.5Base 版微调遵循 Apache 2.0 开源协议全部配置可参考 config.json 与 tokenizer_config.json。F1 提升 17.6 点的秘密可插拔分类头架构 SingGuard-NSFA-9B 的杀手锏是把微调大模型和轻量分类头解耦冻结骨干大模型本体backbone保持冻结只负责把文本编码成向量轻量分类头在骨干最后一层 token 的 embedding 上接一个 MLP 分类头输出每个风险域的概率分数单次前向传播一次推理同时跑完所有分类头单条样本耗时约50msA100 上实测完全扛得住线上高并发更关键的是——分类头可以训练在任何冻结的护栏骨干之上Llama Guard 3 自然也不例外。官方实验显示给 Llama Guard 3 挂上 NSFA 分类头后查询侧检测 F1 提升17.6 个点并跃居所有外部护栏性能榜首。这就是标题里那个数字的由来。本仓库已内置 7 个开箱即用的分类头存放在 nsfa_heads/ 目录nsfa_heads/ ├── NSFA-Prompt_Injection_and_Jailbreak_head.pth ├── NSFA-Malicious_Code_and_Cyberattack_head.pth ├── NSFA-Sensitive_Information_Stealing_head.pth ├── NSFA-Dangerous_Operations_Tool_Abuse_head.pth ├── NSFA-Resource_Abuse_head.pth ├── NSFA-Hazardous_Action_Generation_head.pth └── NSFA-Sensitive_Information_Leakage_head.pth每个.pth文件里都打包好了head_state_dict权重、head_config结构配置、taskquery 或 response、sub_task_name等元信息加载时自动识别无需手动匹配。最简单的扩展步骤三步挂载分类头 ⚙️整个流程比想象中简单核心就三步准备环境安装vllm、transformers、torch用 embedding 模式加载冻结骨干加载分类头指向 nsfa_heads/ 目录框架会自动扫描全部.pth文件读取权重与配置批量推理文本先按untrusted_input查询或untrusted_output响应包裹再送入模型得到每个风险域的概率分数推理时所有分类头通过torch.vmap并行执行输入一批文本就能同时拿到 7 个风险域的判定结果prob[:, 1]即该风险域的不安全概率大于 0.5 判定为 unsafe。整个过程无需重新训练骨干模型原有检测能力也不受干扰。双模式各显身手何时用哪种SingGuard-NSFA-9B 提供两种互补的推理模式你可以按场景自由切换模式适用场景特点实时分类分类头线上拦截、高并发流量约 50ms 单次前向可设分域阈值生成式推理SFT 模型离线审计、事件调查输出链式推理 结构化风险判断完全可解释日常流量用分类头快速筛风险出了安全事故再用生成式推理回溯为什么判它有风险两条腿走路既快又透明。实测基准用数据说话 官方使用三个多语言基准评估正负样本均衡、覆盖 133 种语言并做了严格的训练-评测去重基准样本量风险域NSFA_Query_Multilingual63,4315 个160 个变体NSFA_Response_Multilingual29,9722 个25 个变体NSFA_CrossSource_Query_Multilingual3,4355 个来自 5 个公开数据集其中跨源基准完全独立于训练数据来自 AgentDojo、InjecAgent 等公开数据集可信度更高。SingGuard-NSFA 全系列模型在自有基准上均超过94% F1比最强竞品高出 612 个绝对 F1 点。不止 Llama Guard 3这套架构还能怎么玩✨分类头架构最大的价值是可扩展性新增风险域只需在冻结骨干上多训练一个轻量分类头无需重训骨干、不影响既有能力跨界到内容安全官方在 9B 骨干上训练的内容安全头在内容审核基准上已达到接近 SOTA 的水平边缘部署0.8B 小尺寸版本在保持 94% F1 的同时可跑在资源受限的边缘设备上换句话说你手上的护栏从此有了无限扩容的能力。使用前必读的 4 条建议 单轮护栏定位NSFA 只处理单轮文本多轮轨迹中的渐进式目标劫持需要配合轨迹分析工具阈值按需调各风险域的置信度阈值应根据业务风险容忍度单独调整低资源语言补测部署到小语种场景前建议用本地语言数据做补充评测仅限防御用途模型只用于检测不可用于生成或绕过有害 Agent 输入总结SingGuard-NSFA-9B 用一套优雅的可插拔分类头架构为 Llama Guard 3 这类成熟护栏提供了即插即用的能力扩展通道——F1 提升 17.6 点不是魔法而是冻结骨干 轻量分类头设计带来的红利。如果你正在为 Agent 应用的安全护栏发愁不妨从 nsfa_heads/ 里这 7 个头开始给你的 Llama Guard 3 做一次免费升级。【免费下载链接】SingGuard-NSFA-9B项目地址: https://ai.gitcode.com/hf_mirrors/inclusionAI/SingGuard-NSFA-9B创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考