核心结论
AI 可以辅助系统综述中的检索词扩展、记录去重、标题摘要优先排序、候选数据提取和一致性检查,但不能替代预先定义的协议、最终纳排决定、偏倚评价和统计解释。任何自动化都必须在当前综述的数据上验证,并保留模型版本、提示、输入、输出、人工修正和漏检结果。
系统综述与普通文献整理的区别在于方法预先规定、过程可追溯、选择偏倚受到控制。把大量 PDF 交给 AI 生成一篇“系统综述”,即使文字完整,也没有形成系统方法。
先冻结协议,再选择自动化位置
在运行 AI 之前,团队要确定综述问题、纳入排除标准、信息来源、检索策略、筛选流程、提取字段、偏倚工具、综合方法和偏离协议的处理方式。PRISMA 2020提供的是报告清单,不替代综述方法本身;具体方法应参考与研究类型匹配的手册和预先方案。
AI 不能根据已经看到的结果悄悄改变纳排规则。例如初筛发现某类研究结果更积极,就把原本排除的设计加入;或者因为全文难以解析,自动删除这些研究。所有变化必须说明原因、时间和影响。
按错误后果分配AI角色
系统综述不同环节的错误成本不同:
| 环节 | AI可做的辅助 | 主要风险 | 人工控制 |
|---|---|---|---|
| 问题与协议 | 检查字段遗漏、生成候选同义词 | 把常见框架当成唯一方案 | 方法团队批准协议 |
| 检索 | 扩展词、翻译语法、比较检索式 | 漏检、伪造来源、数据库语法错误 | 信息专家审查并实际运行 |
| 去重 | 按标识和元数据标记疑似重复 | 合并同题不同研究或多报告 | 人工确认疑难记录 |
| 标题摘要筛选 | 优先排序、第二读者或排除候选 | 漏掉真正符合研究 | 在当前数据验证高敏感性并保留人工复核 |
| 全文筛选 | 定位纳排证据 | 误读方法、把未报告当不符合 | 人类作最终决定并记录理由 |
| 数据提取 | 提取候选字段和证据位置 | 数值、分母、单位、表格错位 | 独立核对关键字段 |
| 偏倚评价 | 定位相关报告段落 | 把报告完整当低偏倚 | 训练过的评审者判断 |
| Meta分析 | 生成或检查代码 | 效应量、方向、模型选择错误 | 统计负责人验证与解释 |
这张表避免“AI辅助系统综述”成为一个不可审计的整体说法。
教学案例:干预性综述的人机分工
**教学模拟案例:**一个医疗研究团队开展教学模拟系统综述,评估短信提醒对慢性病门诊随访出席率的影响。数据库检索和去重后有 2,480 条记录,过去的综述经验显示最终纳入比例很低。团队希望用 AI 减少标题摘要筛选工作。
团队先人工双人筛选 300 条,形成经过讨论的参考集,确保包含边界样本:只有预约提醒但无短信、只报告用药依从、不含对照、会议摘要信息不足等。
AI 在这 300 条上运行后,团队不只计算准确率,而是建立混淆表:
| 实际/AI | 建议纳入 | 建议排除 |
|---|---|---|
| 人工纳入 | 42 | 3 |
| 人工排除 | 28 | 227 |
3 条漏检都与摘要没有明确写出短信媒介有关。对系统综述而言,漏掉符合研究可能比多筛几十条代价更大。团队因此没有允许 AI 独立排除,而是把它用于排序:高相关记录优先筛选,低相关记录仍由一名研究者检查,并对随机样本做第二人复核。
这项安排在工作量上未必是最大节省,却符合当前验证结果。模型更换、纳排标准变化或进入不同语言记录时,需要重新验证。
筛选自动化要报告什么
至少保存:
- 模型或工具名称、版本、访问日期和运行环境;
- 提示、字段、温度等会影响输出的设置;
- 用于校准和验证的记录怎样抽样;
- 参考答案由谁产生、分歧怎样解决;
- 灵敏度、特异度、精确度和漏检的实际内容;
- AI 是排序、第二读者还是自动排除;
- 人工抽查比例和停止自动化的阈值;
- 运行失败、无法解析和语言差异怎样处理。
近期研究显示,大语言模型在筛选和提取任务中的表现会随数据集、类别比例、变量类型和模型变化,不能把一次实验的结果复制到另一项综述。例如一项多语言系统综述任务研究发现,表面准确率会受到类别不平衡影响,调整后筛选和提取表现明显下降(DOI: 10.1002/jrsm.1715)。
数据提取要把“缺失”分成不同状态
系统综述提取字段常出现:原文明确报告为零、未报告、只在图中出现、仅补充材料报告、单位无法转换、多个时间点不知取哪一个。AI 若用一个空白处理所有情况,会破坏后续分析。
应在提取表中定义状态,并要求每个关键值带证据位置。对效应量计算,需要同时核对组别、时间、分母、方差形式和方向。模型从图中估读或进行单位换算时,必须记录方法和人工验证,不能与原文直接报告值混为一谈。
Cochrane 的数据收集章节建议重复提取结局数据,以降低错误和单一提取者选择偏倚。AI 可以成为候选提取者或差异检查者,但不能因为速度快就取消独立确认。
偏倚评价不能自动打总分
偏倚评价通常要求根据研究实际发生了什么,对不同领域作判断。报告没写随机化细节,可能是未报告,也可能是未实施;两者都需要谨慎,但不是同一个事实。AI 可以找到论文中涉及随机、盲法、失访和预注册的段落,最终判断仍要由熟悉工具和研究设计的人完成。
不要把多个偏倚领域简单加总成一个“质量分”,再由 AI 按分数决定纳入。系统综述是否纳入由预先标准决定,偏倚评价用于解释证据可信度和综合结果。
Meta分析前先确认数据能否合并
AI 很容易根据一张数据表生成森林图和模型代码,但统计代码正确不等于合并合理。团队要先确认研究问题、对象、干预、结局、时间和效应量的可比性;明确同一研究的多组、多时间点和重复报告怎样处理;决定固定或随机效应模型、异质性和敏感性分析的依据。
AI 生成代码后,至少用人工可计算的小样本或已知结果验证方向和效应量;检查权重、置信区间、异质性和排除研究后的变化。阴性或无法合并的研究仍需透明报告,不能只保留能进入森林图的数据。
填写完成的人机分工与抽检方案
综述阶段:标题摘要筛选
AI角色:按相关性排序,并给出候选纳排理由;不自动作最终排除
参考集:300条,双人独立筛选后解决分歧
关键指标:纳入记录灵敏度、漏检数量和漏检类型
当前结果:45条人工纳入中漏检3条
控制措施:全部记录仍由至少一人筛选;低相关区每100条随机第二人复核20条
停止条件:发现连续漏检、特定语言或研究设计系统性漏检、模型版本改变
记录:版本、提示、每条输出、人工决定、排除理由和运行日期
负责人:两名综述者;方法负责人批准流程变化
方案必须针对当前综述填写,不应把示例中的抽查比例当作通用标准。
什么时候不能继续自动化
- 没有稳定、可操作的纳排标准;
- 没有人工参考集,或参考集不包含边界样本;
- 类别极不平衡,却只报告整体准确率;
- 漏检集中在某种语言、设计、人群或信息不完整记录;
- 模型无法提供记录级输出和版本,过程不能重建;
- 关键表格、单位和分母持续解析错误;
- 团队无人能够审查偏倚工具或统计合并;
- 自动化导致偏离协议,但没有记录和解释。
此时应退回人工筛选、提取或统计,并把失败作为方法记录保留。
每换一个阶段,都要重新验证
标题摘要筛选表现良好,不能推断全文筛选也同样可靠;从英语随机试验上验证过,不能直接用于中文观察研究;从二分类纳排任务上验证过,也不能直接承担连续数值提取。每个阶段的输入、错误类型和后果不同,因此需要新的参考样本与通过标准。
全文筛选的边界样本尤其重要:干预名称只在方法中出现、同一研究有多个报告、结局符合但随访时间不符合、会议摘要后来有正式论文。AI 可以把相关段落与候选理由并排展示,最终排除理由要按协议由综述者确认。数据提取则应专门测试多臂研究、多时间点、不同方差形式和图表数据,不能只抽取格式规整的论文。
模型更新也算流程变化。即使工具名称相同,底层版本、解析器或默认设置改变,都可能影响排序和提取。无法固定版本时,应记录运行日期,并在关键批次前用稳定参考集复测。性能跌破项目预设阈值,立即退回人工或上一种已验证流程。
在综述报告中说明AI改变了什么
透明报告不应止于“本研究使用 AI 辅助筛选”。读者需要知道 AI 看到了哪些字段、产生排序还是纳排建议、人工是否仍查看全部记录、参考答案怎样建立、漏检怎样处理,以及自动化是否造成协议偏离。若使用 AI 只是生成检索同义词,也要区分候选词与最终由信息专家确认的检索式。
PRISMA 2020 核对表要求清楚报告检索、选择、数据收集、偏倚评价和综合方法。AI 并不会取代这些项目;它新增了需要报告的工具版本、验证和人工控制。流程图中的记录数量也必须来自实际数据库和去重筛选记录,不能让模型估算或补齐。
最终材料应足以让另一团队重建人机分工:哪些记录被模型处理、哪些被人查看、每个排除决定由谁确认、哪些数值经过双重提取、代码和提示保存在哪里。无法重建时,节省的时间不能抵消证据链缺失。
可直接复用的系统综述AI使用记录
综述注册或协议版本:
当前阶段与预先方法:
AI工具、模型、版本、日期和环境:
输入字段与数据范围:
提示和关键设置:
AI角色:排序/候选提取/差异检查/代码草稿
参考答案怎样形成:
验证样本和边界样本:
分阶段性能指标:
漏检、错提取和无法解析记录:
人工最终决定位置:
抽查或重复处理规则:
停止与重新验证条件:
偏离协议及理由:
保存的输入、输出、修改和代码:
方法部分拟披露内容:
负责人和核验日期:
系统综述使用 AI 的合格标准不是“节省了多少小时”,而是在不隐藏漏检和错误的前提下,完整说明自动化怎样改变了工作、怎样被验证,以及人类在哪些关键决定上保持了责任。