公司动态

VRSA: Jailbreaking Multimodal Large Language Models through Visual Reasoning Sequential Attack

📅 2026/8/28 8:15:32
VRSA: Jailbreaking Multimodal Large Language Models through Visual Reasoning Sequential Attack
文章主要内容与创新点总结一、主要内容该研究聚焦多模态大语言模型(MLLMs)在视觉推理任务中的安全风险,提出一种名为视觉推理序列攻击(VRSA)的越狱攻击方法,旨在通过结构化的图像序列诱导MLLMs输出有害内容。研究背景:MLLMs因强大的跨模态理解与生成能力被广泛应用,但多模态特性也带来新的安全漏洞。现有越狱攻击多集中于文本模态或单张图像优化,忽视了复杂视觉场景的推理风险,而MLLMs在实际应用中常需处理连续视觉序列,相关安全评估尚属空白。核心挑战:构建有效的视觉推理越狱攻击需解决三大问题:图像序列的场景合理性、语义连续性,以及文本与图像的语义一致性。攻击框架:首先将原始有害文本分解为多个相关子文本,结合优化后的场景生成对应图像序列;通过预定义文本提示引导MLLMs进行视觉推理,最终诱导其输出有害内容;支持单轮(图像拼接+提示)和多轮(逐图输入+推理)两种攻击模式。关键技术:自适应场景优化(Adaptive Scene Refinement):从场景库中筛选匹配场景,基于LLM反馈迭代优化,确保场景与有害意图高度相关;语义连贯补全(Semantic Coherent