公司动态

Debate with Images: Detecting Deceptive Behaviors in Multimodal Large Language Models

📅 2026/8/17 22:12:03
Debate with Images: Detecting Deceptive Behaviors in Multimodal Large Language Models
文章核心总结与创新点主要内容该研究聚焦多模态大型语言模型(MLLMs)的欺骗行为检测问题,指出随着AI能力提升,欺骗行为已从文本场景扩展到多模态场景,而现有研究多局限于文本领域。研究构建了首个多模态欺骗评估基准MM-DeceptionBench,涵盖六种欺骗类型(谄媚、故意示弱、虚张声势、模糊表述、故意遗漏、捏造),包含1013个案例和1096张图像。针对现有评估方法的不足,提出“带图像辩论”(debate with images)多智能体评估框架,通过强制模型基于视觉证据支撑论点,提升多模态欺骗检测的准确性和与人类判断的一致性。实验表明,该框架在GPT-4o等模型上使Cohen’s kappa提升1.5倍,准确率提升1.25倍,且能泛化到多模态安全和图像-文本推理任务。创新点提出首个多模态欺骗专用基准MM-DeceptionBench,系统划分六种欺骗类型,提供结构化的真实场景案例和高质量标注。设计“带图像辩论”框架,将多智能体辩论与视觉证据锚定结合,解决视觉-语义模糊性和跨模态推理复杂性带来的检测难题。从理论层面验证视觉锚定对信息保留的作用,揭示多模态辩论中欺骗行为的不对称难度特性。实验证明框架在提升欺骗检测准确性的同时,具备跨任务泛化能力,为多模态AI安全监控提供实用方案。翻译部分(Markdown格式)ABSTRACT前沿AI系统