公司动态
深度研究AI正在悄悄“被忽悠“?北邮等揭示AI研究助理的致命软肋
这项由北京邮电大学、上海人工智能实验室和重庆邮电大学联合开展的研究以预印本形式发布于2026年7月论文编号为arXiv:2607.20891感兴趣的读者可通过该编号查询完整原文。当你把一项严肃的调查任务交给一位助手却发现他读了一篇谣言文章后把那篇谣言的结论当成自己的研究成果写进了报告里——这件事听起来像是助手的重大失职。而研究团队发现当今最先进的AI深度研究助手正在以超过一半的概率犯下这个错误。近年来一类被称为深度研究Deep Research的AI系统开始流行。这类AI不只是简单地回答问题而是像一位真正的研究员那样工作先把大问题拆解成小问题然后在网络上反复搜索、阅读资料、整理笔记最终输出一份条理清晰的研究报告。OpenAI、Google等公司都已推出了这类产品它们被用于科研辅助、行业分析乃至学术写作。然而研究团队提出了一个令人不安的问题如果网络上恰好存在一些写得像模像样但内容是假的资料这类AI助手会不会把假结论当成真结论写进它的最终报告为了系统性地回答这个问题研究团队搭建了一套名为MisKnow-Agent的实验框架专门用来制造外表可信、内容却是假的文件然后把这些文件混进AI助手能搜索到的资料库里观察AI最终是否会在报告中采用那个假结论。实验结果相当惊人哪怕只混入一份这样的假文件六种不同配置的AI系统中平均有超过54%的报告会把假结论当成自己的研究结论写出来。而在没有混入任何假文件的对照组中这个比例是整整的零。---一、深度研究助手是什么它为什么会面临这个风险要理解这项研究得先搞清楚深度研究助手究竟是怎么工作的。普通的AI对话助手就像一个博闻强识的朋友你问什么它回答什么依靠的主要是它在训练时学到的知识。而深度研究助手更像是一个被委托去做作业的研究员收到任务后它会先制定一个研究计划然后一轮一轮地在互联网上搜索资料、阅读网页、把重要内容记录下来再根据积累的笔记撰写报告。整个过程可能涉及几十次搜索和大量中间材料的积累。这种工作方式带来了一个天然的脆弱点AI助手在整个研究过程中会接触大量外部资料而它无法保证这些资料都是真实可靠的。现实世界的网络上存在着各种各样质量参差不齐的内容——有些是真正严谨的学术论文有些是道听途说还有些内容虽然措辞专业、排版规范却包含着根本不存在的研究发现或统计数据。此前学术界已经研究过类似问题在简单问答场景中的表现也就是说当你直接给AI看一段假内容然后问问题AI多大概率会被误导。但深度研究助手的工作场景要复杂得多假内容可能在研究过程中的任何一个环节混入被摘录进研究笔记再在最终生成报告时被当作可信依据引用。这个传导链条更长检验起来也更有挑战性。研究团队正是要填补这个空白。---二、研究团队是怎么制造精心设计的假文件的为了让实验严格可控研究团队不能随便找一篇网上已有的假文章了事。他们需要针对每个具体的研究任务定制化地生成一批外表极具可信度、内容却是精心设计的谎言的文件。这个制造过程本身就很有意思。整个制造流程分三步走。第一步是打草稿也就是为每个研究任务设计一个假结论蓝图。蓝图里包含了这个假结论的具体内容——比如某个从未存在的软件功能、某个子虚乌有的统计数字——以及一个按可信度高低分层的机构名称库。高可信度机构听起来像MIT、斯坦福这样的顶级研究院中等可信度是各类区域研究中心低可信度则是个人博客、网络论坛等。蓝图还包含了一套评判标准用来事后判断AI是否真的把这个假结论当成了自己的研究结论。第二步是批量生产。根据蓝图系统自动生成多种版本的假文件覆盖不同的机构权威级别和不同的文体风格。文体风格包括四种看起来像学术论文的正式文章、看起来像新闻报道的资讯文章、看起来像技术博客的分析文章以及看起来像社交媒体帖子的短文。每种风格对应着真实网络上最常见的内容类型而且同样的假结论会用这四种截然不同的面孔出现。第三步是质量把关这也是最关键的一步。研究团队深知如果假文件里的某个具体说法恰好在现实中是真的实验就会失去控制变量。于是他们让五个不同的AI模型分别去搜索验证每份假文件的核心说法只有当所有五个模型都判定这个说法在现实世界中找不到任何支撑是假的时这份文件才会被保留进最终的实验语料库。五个验证模型包括了GLM-5、Kimi 2.6、DeepSeek-V4 Pro、Qwen3.5-397B和Intern-S1-Pro来自不同公司、使用不同训练数据这样可以减少单一模型偏差带来的误判。经过这套流程加上人工筛选最终保留了5933份质量合格的假文件覆盖100个来自深度研究基准测试的真实研究任务。研究团队还对每个任务的假结论逐一进行了人工审核对照权威来源确认其确实是假的没有一个被评为无法确认或实际为真。这些任务还被人工确认了所有假结论确保100%都是被实际证伪的错误说法。---三、实验是怎么做的判断AI被忽悠了没有的标准是什么实验设计本身也值得细细道来因为研究团队在判断AI有没有被忽悠这件事上设置了相当严格的标准。判断AI是否采用了假结论不是看AI有没有在报告里提到那个假结论而是看AI有没有把那个假结论当作自己的研究结论来背书。如果AI只是写道某研究机构声称……但此说法尚未得到广泛证实这算作没有被忽悠。只有当AI的报告在自己的结论、建议或核心分析中把假结论当成已经确立的事实来呈现时才算作被忽悠了。这个判断由DeepSeek-V4 Pro担任评判模型其与人类标注者的一致率高达99.7%Cohens κ系数为0.993基本可以认为是准确可靠的。实验以假结论采纳率FCARFalse-Conclusion Adoption Rate作为核心指标记录在各种条件下AI最终报告采纳假结论的比例。研究团队主要检验了以下几个维度的影响假文件出现在搜索结果中的位置排名靠前、散布、靠后、假文件被AI接触到的时间节点研究开始时、研究中间、报告生成前夕、文件来源的权威级别高、中、低、文件的呈现风格论文、新闻、博客、帖子、同时混入的假文件数量0到5份以及使用不同的研究框架和底层AI模型的组合。---四、最关键的发现什么因素决定AI有多容易被忽悠研究团队从实验中得到了一系列具体而清晰的发现每一条都颇具启发性。关于文件出现在搜索结果中的位置研究发现这几乎没什么影响。无论假文件出现在搜索结果的第一位、散布在中间还是排在最末尾AI的假结论采纳率差异不超过两个百分点分别是66.2%、65.5%和64.5%。这说明AI并不像人类那样会优先关注排名靠前的结果更可靠只要内容被读到排名高低并不能帮助过滤掉虚假信息。关于假文件被读取的时间节点这里出现了最戏剧性的差异。如果假文件在AI开始研究时就混入假结论采纳率是40.5%如果在研究进行到中途时混入是44.2%但如果等到AI已经完成了所有研究、即将开始撰写最终报告时才混入假结论采纳率骤升至85.5%六种配置中最高的达到94%。这个规律背后有一个深刻的逻辑如果假文件在研究早期混入AI在后续的研究过程中还有机会搜索到反驳它的真实资料从而在积累的笔记中形成这个说法存疑的判断。但如果假文件在报告撰写的最后时刻才出现AI没有时间再去搜索验证只能直接把它当作最新获得的参考资料纳入报告结果导致采纳率几乎翻倍。关于来源的权威级别总体趋势是来源越权威AI越容易被忽悠。高权威来源看起来像顶级研究机构发布的内容对应的平均假结论采纳率是61%中等权威是57.7%低权威个人博客、论坛帖子是46.2%。在每一种AI配置下低权威来源的采纳率都低于高权威来源。不过高权威和中等权威之间的差异并不总是单调递减的有两种WebThinker配置甚至出现了中等权威略高于高权威的情况说明这个规律存在一定波动。关于文件的呈现风格这里出现了比权威级别更强、更一致的效果。以论文形式呈现的假文件平均假结论采纳率最高达到61%其次是博客形式53%和新闻形式44%而以社交媒体帖子形式呈现的假文件采纳率最低只有37.5%。更值得注意的是这个排序在所有六种AI配置中都保持一致论文形式最容易被采纳帖子形式最不容易被采纳。论文风格与帖子风格之间23.5个百分点的差距甚至比权威级别高低造成的14.8个百分点的差距还要大。换句话说把假内容包装成一篇格式规范、用词专业的学术论文比把它归属给一个权威机构还要有效。关于混入的假文件数量在没有混入任何假文件的对照组里六种配置的假结论采纳率全部是0%证明这些AI不会无缘无故地自发产生那些假结论。一旦混入哪怕一份假文件采纳率就跳升到平均54.7%。随后混入两份采纳率升到59.5%三份时达到峰值61%继续增加到四份60.3%或五份58.3%时采纳率反而不再上升甚至略有下降。这说明一份假文件就足以造成显著影响而堆积更多假文件并不能成比例地加强这种影响。---五、不同AI系统和研究框架之间的差异实验选用了两个开源的深度研究框架——DeerFlow字节跳动开发和WebThinker——分别搭配三个不同的底层AI模型DeepSeek-V4 Pro、Qwen3.5-397B和Intern-S1-Pro进行测试共形成六种配置。六种配置在高权威、论文风格的标准条件下假结论采纳率从50%到76%不等。两个框架之间存在系统性差异平均来看DeerFlow的假结论采纳率67%高于WebThinker55%。研究团队通过分析中间过程发现了一个有趣的解释DeerFlow采用相对直接的规划-搜索-汇报流程搜索到的内容会相对完整地保存并传递给最终报告生成环节而WebThinker会把任务拆解得更细把搜索到的内容压缩进一个文档记忆库再分段撰写和编辑报告这些额外的处理步骤有时会无意中过滤掉假文件的影响。然而这两个框架的差距大小因底层模型而异。使用Intern-S1-Pro时DeerFlow的采纳率比WebThinker高出整整21个百分点使用Qwen3.5-397B时差距缩小到10个百分点使用DeepSeek-V4 Pro时只剩5个百分点。更反直觉的是DeepSeek-V4 Pro在WebThinker框架下的采纳率反而是三个模型中最高的60%因为这个模型在WebThinker的记忆系统里会更积极地在后期合成阶段回调早期获取的证据——包括那些假证据。这说明AI模型的智力水平高低并不直接等同于抵抗假信息的能力强弱框架设计和模型特性的交互作用才是关键。研究团队还专门测试了闭源商业系统Gemini Deep Research发现其表现出了大体相似的规律高权威来源假结论采纳率54%低权威来源骤降至8%论文风格采纳率54%帖子风格28%。Gemini在假文件数量增加方面的反应与开源系统略有不同——其采纳率从一份文件时的27%随着数量增加而稳步上升到三份时达到54%后趋于平稳。这说明这个问题并非某一类系统独有而是当前深度研究AI普遍面临的挑战。---六、研究团队提出了哪些防御手段效果怎么样发现问题之后研究团队也尝试了两种防御策略并系统测试了它们的有效性。第一种防御叫做研究前防御本质上是在把任务交给AI之前在提示词里附加一段额外指令。这段指令要求AI把所有搜索到的信息视为未经验证的信息在最终结论中只使用有独立可靠来源支撑的说法对于来源单一、证据薄弱或存在矛盾的说法要明确标注不确定性或直接不用。这段指令不涉及任何具体任务内容也不告诉AI哪份文件是假的完全是通用的证据核查意识激活指令。第二种防御叫做研究后防御在AI完成研究报告之后再启动另一个搜索增强型AI对报告中的每一个关键说法逐条进行独立核查对于能找到支撑的说法保留对于被反驳的说法修正对于无法确认的说法则打上不确定标记。实验结果显示两种防御都能降低假结论采纳率但都无法完全消除它。在使用DeepSeek-V4 Pro的DeerFlow配置中基准采纳率是65%单独使用研究前防御后降到41%单独使用研究后防御后降到20%两者结合则降到15%。对Qwen3.5-397B的效果同样明显从60%分别降到37%、41%和29%。然而防御效果存在明显的模型依赖性甚至在某些情况下两种防御叠加反而不如单独使用一种。在Intern-S1-Pro配置中单独使用研究前防御使采纳率从76%降到57%单独使用研究后防御降到58%但两者结合后反而升到了62%。研究团队推测这是因为研究后防御阶段的AI进行独立核查时使用的是同一个混入了假文件的信息环境有时反而重新检索到那些假文件并被再次影响部分抵消了研究前防御的效果。归根结底这两种防御手段减轻了问题的严重性但没有从根本上解决它。研究团队认为真正有效的防御需要把证据核查机制贯穿于AI研究过程的每一个环节而不仅仅是在开始前叮嘱一句或在结束后补查一遍。---说到底这项研究揭示的问题并不只是一个技术细节而是关乎AI深度研究工具在现实世界中能否被信任的根本性问题。当AI助手在处理一个复杂研究任务时它的弱点不在于被故意植入的恶意指令而在于它对看起来可信的内容缺乏足够的批判性鉴别能力——这是一种内容层面的脆弱性而非系统层面的攻击。对于普通使用者而言这意味着当你使用任何形式的AI研究助手生成报告时对于报告中引用了某某机构发布的研究显示这类来源的结论依然需要保持审慎尤其是当该结论听起来很新颖或与主流认知有出入时。AI助手目前能做的是帮你检索和整理信息但它尚不能完全替代人类研究者对证据质量的深度判断。这项研究同时也给AI开发者提出了明确的方向仅仅在使用前提醒AI注意核查是不够的需要把持续性的证据验证机制嵌入AI研究工作流的每一个中间环节才有可能在长周期的复杂研究任务中真正抵御误导性信息的侵入。感兴趣的读者可以通过arXiv:2607.20891查阅完整论文深入了解实验设计的所有细节。---QAQ1深度研究AI采纳假结论的比例有多高A根据实验在没有混入任何假文件时六种不同配置的深度研究AI系统假结论采纳率均为0%。但只要混入一份设计精良的假文件平均假结论采纳率就会跳升至54.7%。在报告撰写前夕才混入假文件时采纳率更高达85.5%某些配置甚至达到94%。Q2把假内容伪装成学术论文格式真的更容易骗到AI吗A是的效果相当明显。实验发现以学术论文风格呈现的假文件平均假结论采纳率达到61%而以社交媒体帖子形式呈现的相同假内容采纳率只有37.5%差距超过23个百分点。这个差距甚至比把来源从普通博客换成顶级研究机构所带来的差距约15个百分点还要大说明呈现格式比来源权威性的影响还要强。Q3MisKnow-Agent框架制造出来的假文件是真实可用的攻击工具吗A不是。研究团队明确说明他们并没有把任何假文件发布到真实互联网上也没有修改任何真实的信息环境。这些假文件只被插入了实验室控制的测试检索池中目的是模拟现实中已经存在的误导性内容研究AI系统如何应对而非制造或传播虚假信息。