公司动态
[论文阅读] (52)NDSS26 Chimera:利用多智能体大模型自动模拟内部威胁和ATTCK映射
《娜璋带你读论文》系列主要是督促自己阅读优秀论文及听取学术讲座并分享给大家希望您喜欢。由于作者的英文水平和学术能力不高需要不断提升所以还请大家批评指正非常欢迎大家给我留言评论学术路上期待与您前行加油。前一篇博客介绍了基于启发式优化器的入侵检测系统。本文将带来NDSS 2026的一篇论文该论文提出 Chimera一个基于多智能体大语言模型的内部威胁自动仿真框架将企业员工、组织协作、正常业务流程和内部攻击行为统一建模并生成包含六类日志模态、约250亿条日志的 ChimeraLog 数据集用于支持内部威胁检测方法的训练、评测和分布偏移研究。注意由于我们团队还在不断成长和学习中写得不好的地方还请海涵未来希望能多读多分享这些大佬真值得我们学习。fighting欢迎关注作者新建的『网络攻防和AI安全之家』知识星球文章末尾文章目录一.摘要二.研究背景为什么需要 Chimera1.内部威胁检测的核心难点2.现有内部威胁数据集的四类瓶颈三.核心思想不是“生成攻击日志”而是“模拟一个企业社会”四.Chimera 方法框架1.Overview2.组织画像将业务语境映射为可执行环境3.Agent 社会4.威胁场景仿真5.记忆机制6.多模态日志采集从用户动作到系统痕迹五.ChimeraLog 数据集六.实验设计与评价指标1.评测协议2.数据真实性3.行为分布4.检测难度5.分布偏移泛化能力七.总结与读后感原文作者Jiongchi Yu, Xiaofei Xie, Qiang Hu, Yuhan Ma, Ziming Zhao原文标题Chimera: Harnessing Multi-Agent LLMs for Automatic Insider Threat Simulation作者机构Singapore Management UniversityTianjin UniversityZhejiang University原文链接https://www.ndss-symposium.org/ndss-paper/chimera-harnessing-multi-agent-llms-for-automatic-insider-threat-simulation/发表会议NDSS 2026笔记作者贵州大学 杨子轩 杨秀璋一.摘要内部威胁是一类重大且持续存在的安全风险但在复杂企业环境中仍然难以检测因为恶意活动通常隐藏在细微的用户行为之中。尽管基于机器学习的内部威胁检测Insider Threat Detection, ITD技术已经显示出良好效果但其有效性从根本上受到高质量、真实训练数据缺乏的制约。这一挑战源于企业内部数据的高度敏感性使其很少能够被获取同时也源于现有数据集的局限性即公开数据集通常规模较小而合成数据集往往缺乏充分的泛化能力、丰富的语义上下文和真实的行为模式。为应对这一挑战我们提出了 Chimera一个基于大语言模型LLM的多智能体框架能够自动模拟良性和恶意内部人员活动并监控多样化企业环境中的综合系统日志。Chimera 将每个智能体建模为具有细粒度角色的个体员工并结合小组会议、双人交互和自主日程安排以捕捉真实的组织动态。基于从真实事件中抽象出的 15 类内部攻击类型我们将 Chimera 部署在三种具有代表性的数据敏感型组织场景中并构建了一个新的数据集 ChimeraLog用于支持内部威胁检测方法的开发与评估。我们通过全面的人工研究和定量分析对 ChimeraLog 进行评估证明了其多样性和真实性。针对现有内部威胁检测方法的实验表明这些方法在 ChimeraLog 上的检测性能显著低于在现有内部威胁检测数据集上的表现说明 ChimeraLog 是一个更具挑战性且更接近真实环境的基准数据集。尽管存在分布偏移在 ChimeraLog 上训练的内部威胁检测模型仍表现出较强的泛化能力突出了基于大语言模型的多智能体仿真在推动内部威胁检测研究方面的实际价值。二.研究背景为什么需要 Chimera1.内部威胁检测的核心难点内部威胁是企业安全中长期存在且难以检测的问题。与外部攻击者不同内部人员通常拥有合法账号、熟悉业务流程和系统权限其恶意行为往往混杂在正常工作活动之中。论文指出内部威胁可以表现为横向移动、数据外泄、IT破坏、欺诈、窃取活动和权限提升等多种形式具有合法权限掩护、行为隐蔽、攻击链持续时间长等特点。论文关注的是日志驱动的内部威胁检测即通过登录、邮件、网页浏览、文件操作、网络流量和系统调用等日志识别异常行为。现有机器学习方法虽然在内部威胁检测中取得了一定效果但其性能高度依赖大规模、高质量、细粒度标注的数据集。2.现有内部威胁数据集的四类瓶颈论文将内部威胁检测数据集的不足概括为四个方面。隐私约束企业内部日志包含业务、人员和资产信息难以对外共享。公开数据不够真实典型合成数据集如 CERT多由规则和人工脚本产生语义上下文、角色差异与真实协作过程不足不少数据集也缺少网络流量、系统调用等系统层日志。采集与标注成本高真实企业每天可产生海量活动长期采集、标注、脱敏和维护成本很高。适应性差组织软件栈、人员行为和业务流程会变化导致旧数据上的检测器遇到分布偏移而失效。因此论文的核心问题是能否在不接触真实企业敏感数据的前提下自动生成既真实、又可标注、还可随组织场景变化而更新的内部威胁日志数据三.核心思想不是“生成攻击日志”而是“模拟一个企业社会”Chimera 的创新点不在于简单让 LLM 编写几条攻击日志而是构建一个可运行的企业仿真环境。每个员工都由 LLM Agent 表示具有角色、人格、任务、工具和记忆多个员工之间可以开会、通信、浏览网页、编辑文件、执行代码恶意 Agent 则在正常工作流中嵌入攻击行为。作者认为一个实用的自动数据生成框架应同时具备四项能力根据领域软件、通信协议和组织目标灵活配置场景生成符合真实工作节奏的良性员工行为让攻击者根据上下文自适应地实施不同内部威胁采集完整日志并自动产生准确标签避免大规模人工标注。这种思路使生成日志具有更强的组织上下文、时序连续性和跨模态一致性。论文图1展示了自动化内部威胁仿真的总体场景管理者分派任务员工 Agent 在 OA 系统、邮件系统、数据库和服务器中执行活动同时日志系统采集登录、邮件、网页、文件、网络流量和系统调用等痕迹组织与日志模型员工按开发者、分析师、管理员等明确角色运行受基于角色的访问控制约束。记录四类应用层日志登录、邮件、网页浏览、文件操作以及两类系统层日志网络流量、系统调用。每个恶意动作都映射至 MITRE ATTCK 战术与技术保证行为和日志之间的可追溯关系。四.Chimera 方法框架1.Overview图2和算法1给出了Chimera 的完整工作流主要包括三个阶段组织画像、Agent 社会构建和威胁场景仿真。算法 1 进一步形式化为四个环节组织画像、Agent 社会构建、威胁场景仿真、统一日志采集。组织画像Organization Profiling若用户未给出完整配置LLM 根据组织类型和业务目标补全员工、角色、服务和系统环境。Agent 社会构建Agent Society Construction为每位员工建立 Agent bundle注入职位、人格、账户与工具为攻击者额外分配攻击目标。威胁场景仿真Threat Scenario Simulation以天为单位生成计划以时隙为单位并行执行员工在沟通后会更新后续日程攻击者也会据此调整攻击时机。统一日志Unified Logging集中采集日志关联活动、时间戳和攻击标签。Chimera 的输入为X (E, R, S, G, T) E员工集合R员工角色S系统环境G组织目标T仿真时长输出是应用层和系统层日志以及其对应的攻击标签与上下文。2.组织画像将业务语境映射为可执行环境组织结构包含员工数量、岗位分配和高层业务目标系统设置则包含操作系统、邮件服务器、办公协作栈、浏览器等。作者强调即使是软件版本或系统配置的微小差异也会改变系统层日志的表现。Chimera 支持两种模式用户指定配置用于复现某一领域或组织的具体环境LLM 自动生成画像当细节缺失时使用结构化模板补足合理的组织设定。为控制实验组织被部署到预配置企业服务的标准化容器中。这样既能保证可复现性也为后续改变组织环境、研究分布偏移提供了可配置接口。3.Agent 社会Chimera 并非由一个 Agent 直接扮演员工而是为每个员工配置一组协作 AgentUser Agent负责生成和维护工作计划Assistant Agent调用终端、浏览器、文件操作等工具将计划转化为环境内的具体活动。每个 bundle 持有统一的员工画像姓名、部门、角色、容器 ID 与账户等。攻击员工在此基础上获得攻击目标但仍须继续完成常规职责从而让恶意迹象自然地混入正常工作流。为引入受控的个体差异作者采用 MBTI 轻量人格描述影响决策倾向、沟通频率、写作口吻与风险偏好。这里的人格并不是心理测量结论而是让 Agent 的协作节奏和行为分布不至于完全同质。4.威胁场景仿真Chimera 的威胁仿真不是先生成攻击、再补正常日志而是让所有 Agent 在统一组织目标下推进工作。正常员工生成日计划并执行任务沟通发生后后续计划会被动态更新攻击 Agent 则根据目标员工的日程和上下文选择合适时机嵌入攻击活动。论文将计划划分为多层次结构月计划 → 周计划 → 日计划 → 时隙任务执行每个时间步中Agent 根据当前任务、系统状态和历史记忆执行操作。攻击行为在日志采集时自动标注因此无需事后人工逐条标注。5.记忆机制为避免 Agent 每天“失忆”Chimera 使用长短期混合记忆长期记忆每位 Agent 在每日结束时生成报告记录已完成任务、未完成目标和沟通内容摘要在次日输入用于延续工作策略。短期记忆保留最近 5 轮交互日程变更、沟通、工具调用的滑动窗口。这种设计的作用是让月度仿真中出现持续项目、迭代讨论和逐步推进的攻击链而不是每天重复无关的独立行为。6.多模态日志采集从用户动作到系统痕迹论文图3展示了 ChimeraLog 的多模态日志采集过程。日志分为应用层和系统层两类。层次日志类型主要内容应用层登录日志用户、容器、登录/登出时间应用层邮件通信发件人、收件人、主题、正文、附件应用层网页浏览URL、访问时间、网页内容应用层文件操作文件创建、读取、写入、修改内容系统层网络流量pcap 数据包、协议字段、流量痕迹系统层系统调用Sysdig/scap 记录的进程、系统调用和参数此外Chimera 还可以记录 Agent 的内部操作例如工具调用、中间产物、生成代码片段、文档修改和 LLM 回复。这使得日志不仅有外部行为痕迹还有可追溯的上下文链条。五.ChimeraLog 数据集论文在三个数据敏感型组织中部署 Chimera。每个场景包含 20 名员工 Agent连续仿真一个月。这三个场景覆盖了科技、金融、医疗三类高敏感数据环境对应不同业务流程、访问模式和内部风险。场景组织目标典型内部威胁Technology Company开发第三人称射击游戏源码窃取、IT破坏Financial Corporation设计市场中性统计套利基金交易算法窃取、欺诈、未授权交易Medical Institution采集电子健康记录并分析季节性流感趋势非法访问病历、出售健康信息、破坏医疗系统ChimeraLog 总计约 250 亿条日志包括约 200 亿条良性日志 和 50 亿条攻击日志。论文中进一步给出了各类日志规模日志类型数量登录记录约 0.2 billion邮件记录约 0.6 billion网页浏览记录约 0.8 billion文件操作记录约 0.4 billion网络数据包约 4.5 billion系统日志/系统调用约 18.2 billion总计约 25 billion数据集使用 5W1H 内部威胁分类框架从公共案例中抽象12 类攻击并加入3 个混合攻击场景。总体覆盖恶意内部人员IP 窃取与系统/应用破坏冒充者欺诈、IP 窃取与跨内部/外部的凭据滥用非故意内部人员数据泄露、权限控制错误和相关风险混合场景数据外泄与系统接管等持续、多步骤行为。每个攻击都映射为 MITRE ATTCK Enterprise TTP如表3所示。论文以 IP 窃取为例给出三阶段链条利用同事或凭据取得访问、通过内部邮件等社会工程谋求高权限、再通过物理介质等方式外传敏感文件。该映射同时指定可观测痕迹和对应数据源邮件、登录、文件操作、网络流量、系统日志。六.实验设计与评价指标1.评测协议质量评测与 CERT v6.2、TWOS 比较每个数据集抽取 100 条应用层日志覆盖登录、邮件、网页历史和文件操作每组样本包含 50 条良性与 50 条攻击日志5 位具有至少 5 年安全与 AI 经验的独立专家按 5 分 Likert 量表评估真实性和实用性。ITD 基线评测每个数据集保留 10% 测试集其余样本按 80:20 划分训练和验证以用户-日user-day行为特征统一不同数据集评估 SVM、Temporal CNN、GCN 与 DS-IIDLSTM Autoencoder四种代表性检测方法重复 5 次实验并报告均值采用 Precision、Recall 与 F1-score。底层模型与实现作者在实验中使用 Gemini-2.0-Flash、GPT-4o、DeepSeek V3并基于 CAMEL 与 OWL 实现 Agent 协作架构。2.数据真实性图5 展示了专家真实性评分结果。ChimeraLog 的平均真实性得分为 4.20TWOS 为 4.25CERT 为 1.78。专家一致性较高Krippendorff’s alpha 为 0.87。这说明 ChimeraLog 在可读应用层日志的真实感上接近由真实人类参与生成的 TWOS而明显优于规则合成的 CERT。图6给出了三类数据集中邮件通信内容的对比。Chimera 生成的邮件具有明确业务语境、专业沟通语气和连续上下文CERT 邮件虽然语法可读但语义浅、上下文弱TWOS 邮件来自真实交互但由于脱敏处理内容较短且碎片化。3.行为分布图7 比较了 ChimeraLog、TWOS 和 CERT 的日常良性员工活动分布。ChimeraLog 呈现明显工作日节律包括早晨启动、午间下降和晚间收敛。相比之下TWOS 受竞赛环境影响更强CERT 则呈现较明显的规则化模式。4.检测难度Table IV 给出了四种 ITD 方法在 ChimeraLog 三个场景和 CERT 上的检测结果。可以看出四种模型在 CERT 上普遍取得很高 F1但在 ChimeraLog 上明显下降。金融场景尤其困难说明金融业务中的内部威胁更容易与正常行为混淆。5.分布偏移泛化能力Table V 展示了跨数据集分布偏移实验。论文发现当模型从一个数据集迁移到另一个数据集时性能显著下降。尤其是仅在 CERT 上训练的模型迁移到 Chimera 场景时往往产生接近 100% 的误报率。Table VI 比较了不同基础模型生成数据的统计特征。论文发现GPT-4o 生成的事件更多、通信更丰富整体质量最好。Gemini 在原子任务首次执行中失败率最高论文报告其初次失败率为 22.5%且约 85% 的失败来自错误工具调用或虚构工具名。DeepSeek 则可能出现反复修改文档、工作延续到深夜的非收敛推理循环。七.总结与读后感Chimera 提出了一种基于多智能体大语言模型的内部威胁自动仿真框架。其核心思想不是简单生成攻击日志而是先构建一个包含组织目标、员工角色、人格特征、任务日程、群体会议和工具执行的企业仿真环境再让恶意内部人员、冒充者或非故意内部人员在正常业务流程中嵌入攻击行为。论文最终构建了 ChimeraLog 数据集覆盖科技、金融和医疗三类数据敏感组织场景包含登录、邮件、网页浏览、文件操作、网络流量和系统调用六类日志模态并基于 15 类真实内部攻击场景生成约 250 亿条带细粒度标签的日志数据。未来工作认知与组织层级真实性智能体层面的真实性人格、记忆与动机建模 组织层级结构 部门、分支机构与跨团队动态协作。自适应自主红队完全自动化的对抗智能体、自适应多阶段攻击策略演化例如 APT 攻击。协同演化防御集成防御智能体用于自演化的攻防动态建模分析员反馈与交互式干预。本论文值得我们借鉴的地方包括1多智能体可用于构建“组织级安全仿真环境”Chimera 将员工建模为具有角色、人格、记忆和工具能力的 Agent并通过会议、邮件、日程更新和任务执行模拟真实组织协作。这种设计启发我们在安全和威胁情报领域不能只模拟单个攻击行为而应构建“组织目标—业务流程—用户行为—攻击嵌入—日志采集”的完整场景。对于靶场建设、APT溯源、供应链攻击仿真和内部威胁检测这种多智能体组织仿真模式具有较强借鉴价值。(2) 多智能体适合生成带上下文的安全与威胁情报数据Chimera 的攻击行为不是孤立插入而是与员工日常工作、权限边界、沟通内容和系统操作共同演化并进一步映射到 MITRE ATTCK TTP。这个思路可拓展到威胁情报知识图谱构建中由不同 Agent 扮演攻击者、防御者、情报分析员和业务用户自动生成攻击链、行为证据、日志痕迹、IOC、TTP 和处置建议从而形成可解释、可追溯、可标注的安全数据资产。(3) 实验评估设计和框架图值得参考论文没有只做单一模型性能比较而是从数据真实性、行为复杂度、检测难度、跨场景泛化和基础模型影响多个角度进行评估。例如专家评分用于验证日志真实性行为熵和序列复杂度用于衡量行为多样性SVM、CNN、GCN、DS-IID 用于评估检测难度跨数据集实验用于分析分布偏移OpenAI、Gemini、DeepSeek 对比用于分析基础模型对数据质量的影响。这个评估框架对安全数据集、威胁情报生成和智能体安全系统研究都很有参考价值。(4) 未来可拓展方向后续可以进一步构建攻防共演化的多智能体威胁情报仿真平台。在 Chimera 现有员工 Agent 和攻击 Agent 基础上引入防御 Agent、SOC 分析员 Agent 和威胁情报 Agent使系统不仅能生成攻击行为和日志还能自动完成告警研判、攻击链还原、TTP 标注、处置建议生成和防御策略调整。这样可将多智能体从“内部威胁数据生成”拓展到“攻击—检测—溯源—响应—情报推理”的闭环安全智能体系统。2024年4月28日是Eastmount的安全星球——『网络攻防和AI安全之家』正式创建和运营的日子该星球目前主营业务为 安全零基础答疑、安全技术分享、AI安全技术分享、AI安全论文交流、威胁情报每日推送、网络攻防技术总结、系统安全技术实战、面试求职、安全考研考博、简历修改及润色、学术交流及答疑、人脉触达、认知提升等。下面是星球的新人券欢迎新老博友和朋友加入一起分享更多安全知识比较良心的星球非常适合初学者和换安全专业的读者学习。目前收到了很多博友、朋友和老师的支持和点赞尤其是一些看了我文章多年的老粉购买来感谢真的很感动类目。未来我将分享更多高质量文章更多安全干货真心帮助到大家。虽然起步晚但贵在坚持像十多年如一日的博客分享那样脚踏实地只争朝夕。继续加油再次感谢(By:Eastmount 2026-08-27 周四夜于贵阳 http://blog.csdn.net/eastmount/ )前文赏析[论文阅读] (01)拿什么来拯救我的拖延症初学者如何提升编程兴趣及LATEX入门详解[论文阅读] (02)SP2019-Neural Cleanse: Identifying and Mitigating Backdoor Attacks in DNN[论文阅读] (03)清华张超老师 - GreyOne: Discover Vulnerabilities with Data Flow Sensitive Fuzzing[论文阅读] (04)人工智能真的安全吗浙大团队外滩大会分享AI对抗样本技术[论文阅读] (05)NLP知识总结及NLP论文撰写之道——Pvop老师[论文阅读] (06)万字详解什么是生成对抗网络GAN经典论文及案例普及[论文阅读] (07)RAID2020 Cyber Threat Intelligence Modeling Based on Heterogeneous GCN[论文阅读] (08)NDSS2020 UNICORN: Runtime Provenance-Based Detector for Advanced Persistent Threats[论文阅读] (09)SP2019 HOLMES Real-time APT Detection through Correlation of Suspicious Information Flow[论文阅读] (10)基于溯源图的APT攻击检测安全顶会总结[论文阅读] (11)ACE算法和暗通道先验图像去雾算法Rizzi | 何恺明老师[论文阅读] (12)英文论文引言introduction如何撰写及精句摘抄——以入侵检测系统(IDS)为例[论文阅读] (13)英文论文模型设计Model Design如何撰写及精句摘抄——以入侵检测系统(IDS)为例[论文阅读] (14)英文论文实验评估Evaluation如何撰写及精句摘抄上——以入侵检测系统(IDS)为例[论文阅读] (15)英文SCI论文审稿意见及应对策略学习笔记总结[论文阅读] (16)Powershell恶意代码检测论文总结及抽象语法树AST提取[论文阅读] (17)CCS2019 针对PowerShell脚本的轻量级去混淆和语义感知攻击检测[论文阅读] (18)英文论文Model Design和Overview如何撰写及精句摘抄——以系统AI安全顶会为例[论文阅读] (19)英文论文Evaluation实验数据集、指标和环境如何描述及精句摘抄——以系统AI安全顶会为例[论文阅读] (20)USENIXSec21 DeepReflect通过二进制重构发现恶意功能恶意代码ROI分析经典[论文阅读] (21)SP21 Survivalism: Systematic Analysis of Windows Malware Living-Off-The-Land (经典离地攻击)[论文阅读] (22)图神经网络及认知推理总结和普及-清华唐杰老师[论文阅读] (23)恶意代码作者溯源(去匿名化)经典论文阅读二进制和源代码对比[论文阅读] (24)向量表征从Word2vec和Doc2vec到Deepwalk和Graph2vec再到Asm2vec和Log2vec一[论文阅读] (25)向量表征经典之DeepWalk从Word2vec到DeepWalk再到Asm2vec和Log2vec二[论文阅读] (26)基于Excel可视化分析的论文实验图表绘制总结——以电影市场为例[论文阅读] (27)AAAI20 Order Matters: 二进制代码相似性检测腾讯科恩实验室[论文阅读] (28)李沐老师视频学习——1.研究的艺术·跟读者建立联系[论文阅读] (29)李沐老师视频学习——2.研究的艺术·明白问题的重要性[论文阅读] (30)李沐老师视频学习——3.研究的艺术·讲好故事和论点[论文阅读] (31)李沐老师视频学习——4.研究的艺术·理由、论据和担保[论文阅读] (32)南洋理工大学刘杨教授——网络空间安全和AIGC整合之道学习笔记及强推InForSec[论文阅读] (33)NDSS2024 Summer系统安全和恶意代码分析方向相关论文汇总[论文阅读] (34)EWAS2024 基于SGDC的轻量级入侵检测系统[论文阅读] (35)TIFS24 MEGR-APT基于攻击表示学习的高效内存APT猎杀系统[论文阅读] (36)CS22 MPSAutodetect基于自编码器的恶意Powershell脚本检测模型[论文阅读] (37)CCS21 DeepAID基于深度学习的异常检测解释[论文阅读] (38)基于大模型的威胁情报分析与知识图谱构建论文总结读书笔记[论文阅读] (39)EuroSP25 CTINEXUS基于大模型的威胁情报知识图谱自动构建[论文阅读] (40)CCS24 PowerPeeler一种通用的PowerShell脚本动态去混淆方法[论文阅读] (41)JISA24 物联网环境下基于少样本学习的攻击流量分类[论文阅读] (42)ASC25 基于大语言模型的未知Web攻击威胁检测[论文阅读] (43)ESWA25 评估大模型在真实攻击活动的恶意代码解混淆能力[论文阅读] (44)一种基于LLM少样本多标签的Android恶意软件检测方法[论文阅读] (45)CS24 AISL: 基于攻击意图驱动与序列学习方法的APT攻击检测[论文阅读] (46)IDS-Agent: 一种用于物联网可解释入侵检测的大模型Agent[论文阅读] (47)LAMD: 基于大模型上下文驱动的Android恶意软件检测与分类[论文阅读] (48)TIFS24 基于注意力的恶意软件API定位技术[论文阅读] (49)JNCA24 网络威胁狩猎演化技术综述[论文阅读] (50)TDSC23 T-Trace基于多源系统日志关联的APT溯源图构建[论文阅读] (51)ESWA25 基于启发式优化器的入侵检测系统[论文阅读] (52)NDSS26 Chimera利用多智能体大模型自动模拟内部威胁和ATTCK映射