公司动态

从CVE到CWE:基于系统调用的主机入侵检测系统泛化研究

📅 2026/7/21 23:28:41
从CVE到CWE:基于系统调用的主机入侵检测系统泛化研究
大家读完觉得有帮助记得关注和点赞摘要基于系统调用追踪的主机入侵检测系统HIDS通常在单个通用漏洞披露CVE实例上进行训练和评估。然而在实际运行环境中防御者需要识别出已知弱点类型的新型攻击利用。我们通过实证研究检验了一个核心问题在一个共享通用弱点枚举CWE类别的CVE集合的正常行为上训练的单类异常检测器能否泛化到同一类别内未见过的不同CVE上。我们从LID-DS-2021数据集中选取了六个场景归入三个CWE家族CWE-307 身份验证绕过、CWE-89 SQL注入、CWE-434 无限制文件上传为每个滑动窗口提取了66维Peng-Guo风格的特征向量并训练了孤立森林Isolation Forest和随机梯度下降单类支持向量机SGD One-Class SVM检测器其仅基于正常样本的阈值针对固定的目标误报率进行校准。我们定义并回答了四个研究问题涵盖自检测、非对称跨CVE迁移、组合CWE级正常轮廓的价值以及特征过滤对可迁移性的影响。组合CWE-307检测器在目标误报率 FPR0.05下达到了 F10.6976精确率 0.8994召回率 0.5698而CWE-89和CWE-434在相同协议下F1 ≤0.21。跨CVE迁移被发现具有强烈的方向依赖性且由源正常轮廓的广度主导而非由CWE标签本身决定。我们得出结论使用当前的系统调用特征HIDS中的CWE级泛化在某些弱点家族中是可以实现的但并非所有家族都能实现我们认为在校准的FPR下进行报告是此场景下诚实评估的方法论前提。关键词主机入侵检测、系统调用、异常检测、通用弱点枚举、单类学习、校准、容器安全、LID-DS-20211 引言Linux容器上的主机入侵检测目前主要由将每个已知漏洞视为独立检测目标的方法主导。Forrest关于短系统调用序列的开创性工作[1]开启了一系列分类器的研究现代形式下通常为每个场景或应用程序学习一个模型[3, 6, 7, 8]。然而在实践中两个运行现实阻碍了这种设计。首先新CVE条目[30]的涌现速度快于生产模型重新训练的速度[28, 29]。其次安全运营分析师很少需要知道具体是哪个CVE被利用他们需要知道触发了哪类弱点因为适当的缓解措施——输入净化、文件上传验证、身份验证尝试节流——是由CWE类别而非CVE标识符决定的。本文研究容器化应用程序的运行时行为是否在系统调用追踪中暴露出足够强的CWE级不变量以支持覆盖同一类别多个CVE的单一检测器。这个问题的动机源于SecQuant[18]中的一个实证观察共享缺陷类型的不同CVE往往在系统调用上产生视觉上相同的风险权重向量。作者使用该观察来量化暴露程度但并未构建检测器。北卡罗来纳州立大学NCSU的密切相关工作[14, 15, 16, 17]根据影响如“任意代码执行”、“凭证泄露”对攻击利用进行分组而非根据底层缺陷的CWE类别。我们将问题构建为基于Peng Guo的HIDS流水线[11]改编的每窗口特征上的单类异常检测然后询问所得模型在跨CVE和组合CWE协议下的表现。至关重要的是阈值不是在标记的攻击利用数据上选择的它们是在仅包含正常样本的验证分割上针对固定的目标误报率进行校准的[10, 9, 26]。这种校准使得方向依赖的迁移效应变得可见否则这些效应会被标签调优的阈值所掩盖。本文的贡献如下一种用于CWE级HIDS的评估协议其中阈值选择与攻击利用标签解耦并在报告精确率、召回率和F1的同时报告实际达到的FPR。在三个CWE家族CWE-307、CWE-89、CWE-434和六个场景第5节上的实证证据表明跨CVE的可迁移性具有强烈的不对称性并且由源正常轮廓的广度主导而非由共享的CWE标签主导。关于特征过滤的定量结果与直觉“选择稳定特征以获得更好的迁移”相矛盾最激进的正常域稳定性过滤器破坏了我们观察到的最强迁移方向。三个伪代码算法第4-5节完整指定了研究中使用的校准检测、跨CVE迁移和特征选择流程。本文其余部分组织如下第2节综述相关文献。第3节陈述假设和研究问题。第4节描述数据集、特征表示、单类模型和校准协议。第5节报告实验结果。第6节讨论为什么CWE-307泛化良好而CWE-89和CWE-434不能第7节总结。2 相关工作基于系统调用的HIDS。​ 作为行为信号的系统调用序列可追溯至STIDE[1, 2]并已通过n-gram和语言模型[3, 4]发展到语义和基于图的表示[6, 5]。LID-DS-2019和LID-DS-2021数据集[7, 8]标准化了在容器化应用程序上对HIDS的评估也是本文的实证基础。Peng Guo的最新工作[11]用参数、返回值和资源统计丰富了序列特征我们将其采纳为特征主干。Khairi等人[12]CHIDS以及Sommer和Paxson的经典评述[13]阐述了我们尝试避免的方法论陷阱隐藏的标签泄露和在测试数据上调优阈值。容器攻击利用检测。​ NCSU系列工作[14, 15, 16, 17]根据影响类别对容器攻击利用进行分类。CDL[15]根据正常行为对应用程序聚类SHIL[16]增加了自监督混合学习最新框架[17]覆盖了46个CVE。这些工作均未根据CWE对攻击利用进行分组本文恰好为此类运行时检测贡献了这种分组。静态和文本CVE到CWE映射。​ ThreatZoom[19]、V2W-BERT[20]、TREE-VUL[21]和VulANalyzeR[22]从文本、补丁或二进制文件中预测CWE。Atiiq等人[23]表明CWE专用分类器优于单一二元分类器。这些工作确认了CWE粒度的重要性但它们在设计时运行而非运行时。异常检测方法学。​ 孤立森林[9]和单类SVM[10]是我们使用的两类模型。在固定误报率下校准阈值是生物识别和入侵检测工作中的长期标准[26, 27]。网络入侵的分层分类[24]、多通道对比学习[31]和基于原型的对比学习[25]为未来的CWE感知模型提供了方法论模板但尚未有应用于带有CWE标签的容器系统调用追踪。此类工作中二元分类指标的选择和报告遵循Canbek等人[32]综述的惯例。本工作的定位。​ 与[17]相比我们按原因CWE分类而非按影响与[19, 21, 22]相比我们在运行时追踪上运行而非源代码或二进制文件与[11]相比我们重用特征空间但提出了不同的评估问题——相同的特征空间是否能在共享CWE类别的CVE之间进行迁移3 问题表述与假设令 T为容器化应用程序的滑动窗口系统调用追踪ϕ:T→Rd为特征提取器。令 C为一个CWE类别{v1​,…,vk​}⊂C为共享类别 C的一组CVE。C类别的检测器是一个函数 hC​:Rd→{0,1}它从 C中任意子集 V⊂C的追踪中训练使得对于任何新的 v⋆∈C∖V以及任何包含 v⋆攻击利用的追踪 T⋆都有 hC​(ϕ(T⋆))1的概率很高同时 C中任何应用程序的正常行为上的误报率保持在用户指定的目标 α以下。这个表述明确了两个假设。第一检测器是单类的它仅基于正常追踪训练。第二正常轮廓本身是应用程序的属性而非CWE的属性因此CWE级检测器必须组合或以其他方式调和多个应用程序特定的正常轮廓。假设操作形式。​ 如果两个CVE va​,vb​∈C共享相同的CWE类别那么在 α≤0.05的校准误报率下在 {va​,vb​}的正常窗口并集上训练的单类检测器应用于 {va​,vb​}的测试帧并集时实现的F1严格优于在相同 α下评估的两个按场景自检测器中最好的那个同时将实际达到的FPR保持在 α的一个数量级内。如果两个条件都成立则该假设对 C成立如果任一条件失败实际FPR过大或无F1增益则被证伪。这是一个可直接检验的标准避免了模糊的“与自检测相当”的表述组合CWE-307满足它第5节CWE-89和CWE-434不满足。研究问题。​ 我们将假设分解为四个研究问题。RQ1.​ 在单个CVE场景上进行仅正常训练能否在校准的FPR下产生可用的自检测器——这是下限没有它CWE级扩展毫无希望。RQ2.​ 在CVE va​的正常轮廓上训练的异常模型能否迁移到同一CWE类别中未见过的CVE vb​上迁移是对称的吗RQ3.​ 将 {va​,vb​}的正常轮廓池化为一个单一的CWE级检测器在固定的目标FPR下是否优于自检测和跨CVE检测器RQ4.​ 最大化 {va​,vb​}之间正常域稳定性的特征过滤器能否改善跨CVE的可迁移性4 方法学4.1 数据集与特征空间表1总结了六个场景。它们取自LID-DS-2021[8]该数据集已附带CWE标签的场景名称并归入三个CWE类别。表1特征提取后每场景的行数。train normal仅包含正常窗口test混合了正常和攻击利用窗口。CWE场景训练正常测试正常测试攻击利用特征数CWE-307Bruteforce_CWE-30726,857103,2784,52866CWE-307CVE-2012-212229,473112,723233,42566CWE-89CWE-89-SQL-injection30,741115,2799,59966CWE-89Juice-Shop26,13534,9363,77766CWE-434EPS_CWE-43426,82037,6281,53066CWE-434PHP_CWE-43430,703114,3284,29666特征提取器 ϕ产生每窗口66维向量。遵循Peng Guo[11]和LID-DS-2021的报告惯例[8]窗口长度为1秒步长为300毫秒。我们在本研究中有意不改变这些窗口参数目的是将CWE级泛化问题与特征工程选择隔离开来因此窗口大小固定为参考HIDS流水线在LID-DS-2021上使用的数值。跨CVE迁移对窗口大小的敏感性是一个已知的开放性问题留待未来工作。66个特征分为六组(i) 未见参数和未见系统调用影响UAI, USI(ii) 返回值为负的系统调用计数(iii) 每窗口系统调用频率FI(iv) 资源相关系统调用的最大数据量特征SRF(v) PID/TID统计(vi) 事件间时间间隔直方图。4.2 模型与校准我们使用两种具有正交归纳偏置的单类模型。孤立森林[9]依赖随机划分对缩放和高维具有鲁棒性。SGD单类SVM[10]通过Rahimi和Recht[33]的随机特征展开近似RBF核并使用随机梯度下降在类铰链的单类损失上训练。两种模型均与StandardScaler或RobustScaler预处理配对每个场景产生六个候选模型。校准步骤在不接触标记攻击利用的情况下将异常分数转化为二元决策。算法1阐述了该协议它是本文核心的方法论工具也是唯一应用于组合CWE检测器第4.4节的协议。算法1 仅正常样本的校准单类检测1: 正常训练帧 Dn​混合测试帧 Dt​候选模型 M目标误报率 α随机数种子 s2: 阈值 τ决策函数 h指标 M3: Dn_fit​,Dn_cal​←TrainTestSplit(Dn​,0.3,s)4: Σ←FitScaler(Dn_fit​)5: M←FitModel(Σ(Dn_fit​),s)6: Sc​←AnomalyScores(M,Σ(Dn_cal​))7: τ←Quantile(Sc​,1−α)// 分数越高越异常8: St​←AnomalyScores(M,Σ(Dt​))9: y^​←[s≥τ:s∈St​]10: M←Metrics(y^​,yt​)// 精确率、召回率、F1、实际FPR11: return​ τ,h:x↦[AnomalyScore(M,Σ(x))≥τ],M对于每个场景我们在三个目标FPR α∈{0.001,0.01,0.05}下为每个候选运行算法1并报告在每个 α下对应测试帧上F1最大的候选模型。最佳候选模型的选择因此基于测试帧但该候选模型的阈值是算法1在仅包含正常样本的校准分割上设定的从未接触攻击利用标签。我们注意到该协议对于自检测和组合CWE检测器仍然允许一种温和的形式选择偏差因为架构/缩放器是在我们报告结果的同一标记测试帧上挑选的。在当前设定下这种偏差是有限的——候选池仅有六个成员两个模型 × 两个缩放器加上孤立森林的一个超参数变体且同一个候选sgd_ocsvm_rbf在所有三个 α值下赢得了所有组合检测器的胜利因此选择是鲁棒的。在第4.3节的跨CVE迁移协议中这种偏差在设计上是不存在的因为最佳候选是在源测试帧上选择的然后不加改变地应用到目标帧。因此表4中的跨CVE F1数值是更保守的测量也是我们讨论的主要锚点。4.3 跨CVE迁移协议迁移协议如算法2所示。校准集始终是源场景的仅正常分割因此阈值从未暴露于目标正常分布。在目标测试帧上的实际FPR独立于目标FPR进行报告它直接衡量了迁移阈值在新正常轮廓上付出的误报代价。算法2 跨CVE迁移评估1: 源场景 s目标场景 t目标FPR α2: 迁移指标 Mt​3: τ,h,⋅←Algorithm 1(Dn​(s),Dt​(s),M⋆,α)// M⋆是 s的最佳候选4: y(t)←labels of Dt​(t)5: y^​(t)←h(Dt​(t))6: Mt​←Metrics(y^​(t),y(t))7: return​ Mt​4.4 组合CWE检测器组合检测器将CWE类别视为单一的训练分布。其拟合、校准和测试帧是该类别中所有CVE对应帧的并集。模型、缩放器和阈值通过算法1在合并后的数据上选择。这是对第3节所述假设在操作上最有利的实现。4.5 特征选择为了回答RQ4我们构建了六个特征集列于表2。算法3计算了最重要的构造带有可调偏移惩罚的联合稳定性/重要性分数。表2用于CWE-307的特征集见第4.5节。名称大小构造all66每个数值特征clean53移除低方差和相关特征stable26两个CVE正常样本上的双样本KS距离 0.2stable_imp20stable 与重要性前20的交集score_l0p0_top2020仅按重要性排名前20 (λ0)score_lλ_top2020按重要性排名前20带KS偏移惩罚 λ∈{0.25,0.5,1}算法3 重要性-稳定性特征评分1: 源正常样本 Ns​目标正常样本 Nt​源标记样本 Ls​前k个惩罚系数 λ2: 排序特征列表 F3: I←PermutationImportance(Ls​)// 归一化到 [0,1]4: for each​ feature fdo5: df​←KSDist(Ns​[f],Nt​[f])6: end for7: for each​ feature fdo8: rf​←If​−λ⋅df​9: end for10: F←特征按 rf​降序排序取前k个11: return​ F算法3表达了RQ4的方法论问题一个在正常域有较大偏移的特征应该因为无法迁移而被丢弃还是因为它携带攻击信号而被保留设置 λ0保留所有重要特征无论偏移如何λ→∞强制选择仅与稳定集重合。5 实验结果图1展示了校准检测流水线。所有实验使用种子42和requirements.txt中列出的python包版本完整报告存储为CSV文件以便任何报告的指标都可以追溯到模型、缩放器、阈值分位数和种子。图1校准的单类CWE检测流水线。左侧为仅正常训练与校准目标FPR设定阈值右侧为窗口级的二元决策支持自检测、跨CVE和组合评估。图2对比了我们比较的两种HIDS模式左侧是每个CVE一个单独的检测器右侧是CWE级检测器。RQ2和RQ3量化了右侧模式在实证上是否可达。图2按CVE检测左与本论文研究的CWE级检测器右。右侧面板将共享一个CWE类别的几个CVE的正常轮廓汇集到一个组合检测器中。5.1 RQ1校准FPR下的自检测表3报告了三个目标FPR下每个场景的最佳自检测候选。自检测始终较弱即使是最宽松的操作点α0.05所有六个场景的F1 ≤0.31。当实际FPR较低时CWE-307场景达到更高的精确率例如在 α0.01下CVE-2012-2122为0.9301但代价是召回率低于7%。这幅图景与先前关于LID-DS[8]的报告一致当阈值不在标签上调整时按场景的单类HIDS仅能恢复一小部分攻击利用窗口。解读F1数值。​ 两个设计因素压低了表3的F1必须牢记于心。首先阈值分位数仅由 α在正常样本上固定因此操作点在构造上并非F1最优这是在阈值选择期间不看攻击利用标签所付出的代价。其次几个测试帧严重不平衡例如表1中CVE-2012-2122在112,723个正常窗口中有233,425个攻击利用窗口因此即使完美校准的 FPR0.01在低召回率下也只产生 ∼1,000个假阳性而假阴性数以万计。因此较低的F1数值衡量的是通过这个固定操作点单个CVE的正常样本能看到多少攻击信号而非底层检测器的上限我们将其视为RQ2和RQ3比较的方法论基线。表3三个校准目标FPR下的自检测每行的最佳候选。CWE场景α实际FPR精确率召回率F1CWE-307Bruteforce_CWE-3070.010.03150.18700.16520.1754CWE-307Bruteforce_CWE-3070.050.08340.12220.26460.1671CWE-307CVE-2012-21220.010.00990.93010.06370.1192CWE-307CVE-2012-21220.050.04980.84430.13040.2259CWE-89CWE-89-SQL-injection0.050.05120.35460.21970.2713CWE-89Juice-Shop0.050.05180.18090.10590.1336CWE-434EPS_CWE-4340.050.08990.06650.15750.0935CWE-434PHP_CWE-4340.050.04870.12020.17690.14315.2 RQ2跨CVE迁移具有方向依赖性图3可视化了每个CWE家族内部的迁移F1。对角线条目是自检测未校准基线非对角线条目是使用源调优候选的跨CVE迁移。CWE-307的不对称性非常显著Bruteforce_CWE-307 →CVE-2012-2122 产生 F1 0.8054而反向则崩溃至 0.0782。图3每个CWE家族内部的跨CVE迁移F1。对角线显示自检测未校准。非对角线单元格显示拟合在源CVE上并应用于目标CVE的异常模型的F1。由此得出两点观察。首先迁移可以非常强暴力破解尝试的并集包含了CVE-2012-2122暴力破解场景的行为足迹因此源正常轮廓是目标正常轮廓的超集。其次反之则不成立CVE-2012-2122的正常轮廓要窄得多将其应用于Bruteforce的正常样本基本上会将所有东西都置于阈值之上这解释了表4中高召回率但极低精确率的原因。表4CWE-307的校准跨CVE迁移。实际FPR是目标正常窗口中高于源集阈值的份额。标†的行在操作上不可用目标正常上的实际FPR ≥0.6这些行的F1值仅报告为使不对称性可见不应解读为检测器性能。源 →目标模型α实际FPR精确率召回率F1Brute →CVE-2012-2122IF0.0010.9831†0.64260.85340.7331Brute →CVE-2012-2122SGD-OCSVM0.010.6331†0.73790.86080.7946Brute →CVE-2012-2122SGD-OCSVM0.050.7814†0.71370.94050.8115CVE-2012-2122 →BruteSGD-OCSVM0.0010.02280.04000.02160.0281CVE-2012-2122 →BruteIF0.010.6510†0.04670.72770.0878CVE-2012-2122 →BruteIF0.050.9257†0.04130.90920.07905.3 RQ3组合CWE-307检测器带来回报将两个CWE-307的正常样本合并为一个拟合/校准/测试池得到了整个研究中最强的检测器。在 α0.01下组合检测器达到精确率 0.9642召回率 0.4368F1 0.6013实际FPR为 0.0179。将 α提高到 0.05则以实际FPR 0.0702换取 F1 0.6976。表5对比了相同目标FPR下三个CWE家族的表现。CWE-307以数量级优势占据主导。CWE-89和CWE-434崩溃至F1 ≤0.21在 α0.05下精确率分别降至 0.28和 0.12。因此组合检测器证实了CWE-307的假设但使用当前特征否定了CWE-89和CWE-434的假设。表5三个校准目标FPR下的组合CWE级检测器。CWEα实际FPR精确率召回率F1假阳性假阴性CWE-3070.0010.00170.99020.15890.2739376200,142CWE-3070.010.01790.96420.43680.60133,859134,010CWE-3070.050.07020.89940.56980.697615,163102,369CWE-890.0010.00100.69300.02430.046914413,051CWE-890.010.00790.50020.08930.15161,19412,181CWE-890.050.03810.28100.16740.20985,72811,137CWE-4340.0010.00260.30210.02990.05444025,652CWE-4340.010.01590.20230.10540.13862,4215,212CWE-4340.050.05600.11680.19330.14568,5174,700图4跨协议和CWE家族的F1。“最佳迁移”取自表2的七个特征集“组合未校准”是通过在联合测试帧上扫描异常分数分位数可达到的最高F1标签调优上限仅供参考“组合校准”是算法1下最佳目标FPR处的值。图5三个目标FPR下的组合CWE-307检测器。实际FPR紧密跟踪目标FPR这是算法1的期望行为。召回率和F1随 α增长而精确率平稳下降。5.4 RQ4稳定性过滤器可能损害迁移图6按两个CWE-307场景正常窗口分布的双样本KS距离对66个特征中的16个进行了排名。稳定组主要由在两个场景中基本恒定的资源特征lseek、pread、sendto的sc_size计数器和事件间时间间隔直方图的箱组成。偏移组主要由数据量特征pwrite、writev、read、brk的sc_size计数器和PID切换频率主导。图6两个CWE-307场景正常窗口分布之间的双样本KS距离。资源大小和PID切换特征主导了偏移组lseek和pread字节计数器在两个正常样本中基本相同。如果RQ4是肯定的将模型限制在稳定集应改善迁移。图7显示了相反的情况。稳定集将强方向上的迁移F1从 0.8054使用全部特征崩溃至 0.0348stable_important子集恢复了一些信号但仅在弱方向上F1 0.1357vs. 使用全部特征时的 0.0782。带有 λ0的分数族算法3——仅重要性无偏移惩罚——给出了20维特征集中的最佳表现保留了大部分强方向信号。图7特征过滤器对CWE-307内部跨CVE迁移F1的影响。最激进的正常域稳定性过滤器stable破坏了强方向仅重要性的前20score_l0p0保留了大部分信号。解释是具有最大正常域偏移的特征也可能携带攻击信号数据量特征在两个正常工作负载之间发生变化但在任一工作负载的正常和攻击利用窗口之间也会发生变化。因此稳定性过滤器同时移除了讨厌的偏移和有用的信号对迁移F1的净效应是负的。6 讨论为什么CWE-307能泛化。​ 两个CWE-307场景共享一个强烈重复的行为足迹在身份验证端口上的短连接-读取-写入-关闭循环。暴力破解流量在Bruteforce场景的正常轮廓中占据主导地位以至于模型在正常训练期间有效地看到了攻击信号。CVE-2012-2122重用该行为类别只是进程名称和参数不同因此在缩放器平滑掉应用层面的表面差异后源拟合检测器仍能识别攻击模式。量化不对称性。​ 审稿人驱动的后续问题是“Bruteforce正常样本是CVE-2012-2122正常样本的超集”能否得到定量支持。我们计算了每个CWE家族在66个特征的每一个上两个场景正常窗口分布的双样本KS距离然后总结该分布。表6报告了最小、平均和中位数KS距离以及稳定特征KS 0.2的数量。对比非常鲜明CWE-307有18个这样的特征最小KS为 6×10−4而CWE-89仅有2个最小KS 0.149CWE-434有5个最小KS 0.139。两个CWE-307正常样本共享一个几乎相同的子空间而CWE-89和CWE-434的正常样本则不然。因此“超集”解释与KS偏移轮廓一致而CWE-89和CWE-434中有限的正常轮廓重叠本身就足以预测其较弱的组合检测器性能。表6每个CWE家族两个正常窗口分布之间的双样本KS距离摘要取自清理后过滤器特征集CWE-307/89为 d53CWE-434为 d54。“稳定”计数KS 0.2的特征。CWE场景配对最小KS平均KS中位数KS#稳定CWE-307Bruteforce vs. CVE-2012-21220.00060.4570.47718CWE-89SQL-injection vs. Juice-Shop0.14920.5950.5602CWE-434EPS vs. PHP0.13900.5870.6055为什么CWE-89和CWE-434不能。​ 对于CWE-89SQL注入每窗口特征空间由HTTP请求量特征主导这些特征在Juice-Shop和独立SQL注入场景之间变化剧烈对于CWE-434EPS和PHP场景共享逻辑模式上传然后执行但在哪些系统调用承载该模式上存在分歧例如PHP中不同的execve链。表6中的KS分析证实了这些定性解释CWE-89偏移最大的特征是tid_countKS 0.999、pid_switch_frequency0.983和pid_count0.974这些是应用身份代理而非CWE特定信号。对于CWE-434领导者是munmap、mmap、brk和pread的sc_size字节计数器所有这些都编码了运行时PHP vs. EPS特定的内存管理模式而非上传-执行主题。特征提取器未能揭示单一的上传-执行时间模式因此相对于应用级偏移残留的CWE不变量信号很小。校准很重要。​ 表4表明未校准的跨CVE迁移可能显得欺骗性地强仅源模型几乎将每个目标正常窗口标记为异常这夸大了召回率但在操作上无用。实际FPR是首先要检查的数字如果它比目标FPR高出一个数量级即使召回率看起来很高迁移也已经失败。我们建议在CWE级评估中始终在实际FPR旁边报告精确率/召回率/F1。稳定性不等于可迁移性。​ RQ4与“特征在两个正常样本间越稳定其迁移性越好”的直觉相矛盾。如第5.4节所述有用的信号可能存在于特征分布的偏移尾部。因此CWE级HIDS的一个合理的特征选择标准必须结合跨CVE攻击重要性和受控的偏移惩罚算法3是其最简单的形式。局限性。​ 本研究涵盖三个CWE家族每个家族两个CVE需要更广泛的CWE覆盖才能声称普遍的经验结论。我们总共使用了LID-DS-2021的六个场景LID-DS-2021还提供了标有额外CWE类别的其他场景如CWE-22路径遍历、CWE-94代码注入此处尚未覆盖。我们的特征提取器遵循Peng Guo[11]更丰富的表示——进程系统调用序列的图模型PSSG、进程间图或对比嵌入[25, 31]——很可能是使CWE-89和CWE-434起效所必需的。阈值校准假设校准正常样本代表了运行时的正常情况在生产中必须定期重新审视这一假设。当前草稿中作者身份已被隐去标题页使用占位符名称最终正式版本将恢复真实的作者元数据。7 结论在基于系统调用的HIDS中从CVE级检测到CWE级检测的过渡在实证上是可行的但在弱点类别上并不均匀。使用Peng-Guo风格的66维特征向量、校准的单类学习和仅正常样本的阈值协议CWE-307的单一组合检测器在实际FPR 0.0702下实现了F1 0.6976可与强大的按场景基线相媲美。相同的协议在CWE-89和CWE-434上失败最佳F1 ≤0.21。跨CVE迁移具有强烈的方向依赖性并由源正常轮廓的广度主导而非由共享的CWE标签主导。最大化两个CVE间正常域稳定性的特征过滤器可能会破坏可迁移的信号带有受控偏移惩罚的重要性驱动选择更为可取。由此得出两项方法学建议。首先阈值校准必须与攻击利用标签解耦任何在真实FPR报告下消失的明显CWE级迁移都是标签调优阈值的产物。其次未来的CWE级HIDS应要么用对应用身份不变的结构模式来丰富特征空间——基于图的系统调用模型[11]和对比原型嵌入[25]是具体的候选方案——要么采用显式的多任务公式[22, 24]在标记数据上训练表示使其具有CWE判别性。这两个方向都为未来工作敞开。