公司动态
Large Language Models Cannot Reliably Detect Vulnerabilities in JavaScript: The First Systematic ...
文章核心总结与创新点一、主要内容该研究聚焦大型语言模型(LLMs)在JavaScript漏洞检测中的实际能力,指出当前LLMs在该任务中存在可靠性不足的问题,并针对现有基准测试的三大缺陷(覆盖不全面、低估模型能力、高估模型能力),提出了一套系统性解决方案:基准测试构建原则:确立"全面性"(覆盖广泛CWE类型、评估维度和数据源)、“不低估”(通过CWE等价类、模糊匹配兼容模型输出差异)、“不高估”(基于完整项目评估、量化误报成本)三大核心原则。核心框架开发:FORGEJS:自动化基准生成框架,支持218种CWE类型,涵盖前端/后端/全栈场景,提供原始、噪声注入、混淆等5类数据集变体。ARENAJS:首个系统性JavaScript漏洞检测基准,包含1437个真实GitHub项目(527个前端、689个后端、221个全栈),区分完整数据集和去噪数据集。JUDGEJS:自动化评估框架,支持项目级(漏洞存在性+CWE类型)和函数级(漏洞存在性+CWE类型+文件定位+函数定位)双粒度评估,引入VD-S等工业级指标。实验评估:对GPT-5、Claude-4.5等7款主流商业LLM进行测试,发现LLMs存在推理路径缺失、鲁棒性不足、工业场景可用性低三大关键问题,在FPR≤0.5%的约束下,漏报率超75%。二、创新点