公司动态

Large Language Models for Full-Text Methods Assessment: A Case Study on Mediation Analysis

📅 2026/9/1 8:08:57
Large Language Models for Full-Text Methods Assessment: A Case Study on Mediation Analysis
该研究以因果中介分析为案例,评估了当前最先进的大型语言模型(LLMs)在系统综述中提取方法学信息的能力,发现LLMs在明确方法学特征识别上表现接近人类,但复杂推理任务仍需人工监督,同时提出了人机协作提升证据合成效率的新路径。一、文章主要内容总结1. 研究背景与目标系统综述是循证医学的核心,但人工提取方法学信息耗时且需专业知识,尤其像中介分析这类需评估因果假设的领域,人工审查常需数月。现有LLMs多聚焦摘要筛选,缺乏对全文复杂方法学(如中介分析假设评估)的能力验证,研究旨在填补这一空白,以180篇心理学和精神病学领域的中介分析论文为数据集,对比LLMs与人类专家的评估表现。2. 研究方法数据集构建:采用2013-2018年15本高影响因子期刊中,通过PsycInfo数据库检索“mediation analys*”获得的180篇论文,以人类专家达成共识的14项二元方法学标准(如随机化、时间顺序、混杂控制等)为金标准。模型与评估设计:测试4个GPT系列模型(GPT-4o、GPT-4o-mini、GPT-o3、GPT-5),采用两种提示策略(BASIC仅需二元回答,DETAILED含解释与示例),评估准确率、F1值、AUC等6项指标,并分析文章字数、发表年份等对模型表现的影响。3. 核心研究结果性能对比