核心结论

AI 可以辅助系统综述中的检索词扩展、记录去重、标题摘要优先排序、候选数据提取和一致性检查,但不能替代预先定义的协议、最终纳排决定、偏倚评价和统计解释。任何自动化都必须在当前综述的数据上验证,并保留模型版本、提示、输入、输出、人工修正和漏检结果。

系统综述与普通文献整理的区别在于方法预先规定、过程可追溯、选择偏倚受到控制。把大量 PDF 交给 AI 生成一篇“系统综述”,即使文字完整,也没有形成系统方法。

先冻结协议,再选择自动化位置

在运行 AI 之前,团队要确定综述问题、纳入排除标准、信息来源、检索策略、筛选流程、提取字段、偏倚工具、综合方法和偏离协议的处理方式。PRISMA 2020提供的是报告清单,不替代综述方法本身;具体方法应参考与研究类型匹配的手册和预先方案。

AI 不能根据已经看到的结果悄悄改变纳排规则。例如初筛发现某类研究结果更积极,就把原本排除的设计加入;或者因为全文难以解析,自动删除这些研究。所有变化必须说明原因、时间和影响。

按错误后果分配AI角色

系统综述不同环节的错误成本不同:

环节AI可做的辅助主要风险人工控制
问题与协议检查字段遗漏、生成候选同义词把常见框架当成唯一方案方法团队批准协议
检索扩展词、翻译语法、比较检索式漏检、伪造来源、数据库语法错误信息专家审查并实际运行
去重按标识和元数据标记疑似重复合并同题不同研究或多报告人工确认疑难记录
标题摘要筛选优先排序、第二读者或排除候选漏掉真正符合研究在当前数据验证高敏感性并保留人工复核
全文筛选定位纳排证据误读方法、把未报告当不符合人类作最终决定并记录理由
数据提取提取候选字段和证据位置数值、分母、单位、表格错位独立核对关键字段
偏倚评价定位相关报告段落把报告完整当低偏倚训练过的评审者判断
Meta分析生成或检查代码效应量、方向、模型选择错误统计负责人验证与解释

这张表避免“AI辅助系统综述”成为一个不可审计的整体说法。

教学案例:干预性综述的人机分工

**教学模拟案例:**一个医疗研究团队开展教学模拟系统综述,评估短信提醒对慢性病门诊随访出席率的影响。数据库检索和去重后有 2,480 条记录,过去的综述经验显示最终纳入比例很低。团队希望用 AI 减少标题摘要筛选工作。

团队先人工双人筛选 300 条,形成经过讨论的参考集,确保包含边界样本:只有预约提醒但无短信、只报告用药依从、不含对照、会议摘要信息不足等。

AI 在这 300 条上运行后,团队不只计算准确率,而是建立混淆表:

实际/AI建议纳入建议排除
人工纳入423
人工排除28227

3 条漏检都与摘要没有明确写出短信媒介有关。对系统综述而言,漏掉符合研究可能比多筛几十条代价更大。团队因此没有允许 AI 独立排除,而是把它用于排序:高相关记录优先筛选,低相关记录仍由一名研究者检查,并对随机样本做第二人复核。

这项安排在工作量上未必是最大节省,却符合当前验证结果。模型更换、纳排标准变化或进入不同语言记录时,需要重新验证。

筛选自动化要报告什么

至少保存:

  • 模型或工具名称、版本、访问日期和运行环境;
  • 提示、字段、温度等会影响输出的设置;
  • 用于校准和验证的记录怎样抽样;
  • 参考答案由谁产生、分歧怎样解决;
  • 灵敏度、特异度、精确度和漏检的实际内容;
  • AI 是排序、第二读者还是自动排除;
  • 人工抽查比例和停止自动化的阈值;
  • 运行失败、无法解析和语言差异怎样处理。

近期研究显示,大语言模型在筛选和提取任务中的表现会随数据集、类别比例、变量类型和模型变化,不能把一次实验的结果复制到另一项综述。例如一项多语言系统综述任务研究发现,表面准确率会受到类别不平衡影响,调整后筛选和提取表现明显下降(DOI: 10.1002/jrsm.1715)。

数据提取要把“缺失”分成不同状态

系统综述提取字段常出现:原文明确报告为零、未报告、只在图中出现、仅补充材料报告、单位无法转换、多个时间点不知取哪一个。AI 若用一个空白处理所有情况,会破坏后续分析。

应在提取表中定义状态,并要求每个关键值带证据位置。对效应量计算,需要同时核对组别、时间、分母、方差形式和方向。模型从图中估读或进行单位换算时,必须记录方法和人工验证,不能与原文直接报告值混为一谈。

Cochrane 的数据收集章节建议重复提取结局数据,以降低错误和单一提取者选择偏倚。AI 可以成为候选提取者或差异检查者,但不能因为速度快就取消独立确认。

偏倚评价不能自动打总分

偏倚评价通常要求根据研究实际发生了什么,对不同领域作判断。报告没写随机化细节,可能是未报告,也可能是未实施;两者都需要谨慎,但不是同一个事实。AI 可以找到论文中涉及随机、盲法、失访和预注册的段落,最终判断仍要由熟悉工具和研究设计的人完成。

不要把多个偏倚领域简单加总成一个“质量分”,再由 AI 按分数决定纳入。系统综述是否纳入由预先标准决定,偏倚评价用于解释证据可信度和综合结果。

Meta分析前先确认数据能否合并

AI 很容易根据一张数据表生成森林图和模型代码,但统计代码正确不等于合并合理。团队要先确认研究问题、对象、干预、结局、时间和效应量的可比性;明确同一研究的多组、多时间点和重复报告怎样处理;决定固定或随机效应模型、异质性和敏感性分析的依据。

AI 生成代码后,至少用人工可计算的小样本或已知结果验证方向和效应量;检查权重、置信区间、异质性和排除研究后的变化。阴性或无法合并的研究仍需透明报告,不能只保留能进入森林图的数据。

填写完成的人机分工与抽检方案

综述阶段:标题摘要筛选
AI角色:按相关性排序,并给出候选纳排理由;不自动作最终排除
参考集:300条,双人独立筛选后解决分歧
关键指标:纳入记录灵敏度、漏检数量和漏检类型
当前结果:45条人工纳入中漏检3条
控制措施:全部记录仍由至少一人筛选;低相关区每100条随机第二人复核20条
停止条件:发现连续漏检、特定语言或研究设计系统性漏检、模型版本改变
记录:版本、提示、每条输出、人工决定、排除理由和运行日期
负责人:两名综述者;方法负责人批准流程变化

方案必须针对当前综述填写,不应把示例中的抽查比例当作通用标准。

什么时候不能继续自动化

  • 没有稳定、可操作的纳排标准;
  • 没有人工参考集,或参考集不包含边界样本;
  • 类别极不平衡,却只报告整体准确率;
  • 漏检集中在某种语言、设计、人群或信息不完整记录;
  • 模型无法提供记录级输出和版本,过程不能重建;
  • 关键表格、单位和分母持续解析错误;
  • 团队无人能够审查偏倚工具或统计合并;
  • 自动化导致偏离协议,但没有记录和解释。

此时应退回人工筛选、提取或统计,并把失败作为方法记录保留。

每换一个阶段,都要重新验证

标题摘要筛选表现良好,不能推断全文筛选也同样可靠;从英语随机试验上验证过,不能直接用于中文观察研究;从二分类纳排任务上验证过,也不能直接承担连续数值提取。每个阶段的输入、错误类型和后果不同,因此需要新的参考样本与通过标准。

全文筛选的边界样本尤其重要:干预名称只在方法中出现、同一研究有多个报告、结局符合但随访时间不符合、会议摘要后来有正式论文。AI 可以把相关段落与候选理由并排展示,最终排除理由要按协议由综述者确认。数据提取则应专门测试多臂研究、多时间点、不同方差形式和图表数据,不能只抽取格式规整的论文。

模型更新也算流程变化。即使工具名称相同,底层版本、解析器或默认设置改变,都可能影响排序和提取。无法固定版本时,应记录运行日期,并在关键批次前用稳定参考集复测。性能跌破项目预设阈值,立即退回人工或上一种已验证流程。

在综述报告中说明AI改变了什么

透明报告不应止于“本研究使用 AI 辅助筛选”。读者需要知道 AI 看到了哪些字段、产生排序还是纳排建议、人工是否仍查看全部记录、参考答案怎样建立、漏检怎样处理,以及自动化是否造成协议偏离。若使用 AI 只是生成检索同义词,也要区分候选词与最终由信息专家确认的检索式。

PRISMA 2020 核对表要求清楚报告检索、选择、数据收集、偏倚评价和综合方法。AI 并不会取代这些项目;它新增了需要报告的工具版本、验证和人工控制。流程图中的记录数量也必须来自实际数据库和去重筛选记录,不能让模型估算或补齐。

最终材料应足以让另一团队重建人机分工:哪些记录被模型处理、哪些被人查看、每个排除决定由谁确认、哪些数值经过双重提取、代码和提示保存在哪里。无法重建时,节省的时间不能抵消证据链缺失。

可直接复用的系统综述AI使用记录

综述注册或协议版本:
当前阶段与预先方法:

AI工具、模型、版本、日期和环境:
输入字段与数据范围:
提示和关键设置:
AI角色:排序/候选提取/差异检查/代码草稿

参考答案怎样形成:
验证样本和边界样本:
分阶段性能指标:
漏检、错提取和无法解析记录:

人工最终决定位置:
抽查或重复处理规则:
停止与重新验证条件:
偏离协议及理由:

保存的输入、输出、修改和代码:
方法部分拟披露内容:
负责人和核验日期:

系统综述使用 AI 的合格标准不是“节省了多少小时”,而是在不隐藏漏检和错误的前提下,完整说明自动化怎样改变了工作、怎样被验证,以及人类在哪些关键决定上保持了责任。