核心结论

AI 可以参与系统综述的检索词扩展、去重、筛选排序、候选数据提取和代码检查,但每一个阶段都需要用当前综述的材料单独验证。标题摘要筛选表现良好,不代表它能正确读全文、提取数值或决定研究能否合并。

协议要在自动化之前确定。最终纳排、偏倚判断和统计解释仍由综述者负责;工具版本、参考答案、漏检、人工修正和流程变化要保存。否则,一篇文字完整的“AI 系统综述”也无法说明证据是怎样进入结论的。

团队想省下筛选时间,却先发现三条漏检

下面是一项教学综述,研究短信提醒能否提高慢性病门诊随访出席率。数据库检索和去重后有 2480 条记录,预期真正纳入的比例很低。团队希望用 AI 缩短标题摘要筛选,但没有打算把最终排除权交给模型。

他们先按冻结的纳排标准,由两名综述者独立筛选 300 条记录,解决分歧后形成参考集。样本特意包含几个难点:只写“预约提醒”而没在摘要注明短信、只报告用药依从、没有对照,以及信息不足的会议摘要。

AI 在参考集上的结果如下:45 条人工纳入中,有 42 条建议纳入,3 条建议排除;255 条人工排除中,有 28 条被建议纳入,227 条建议排除。整体数字看起来不错,三条漏检却集中在摘要没有明确写出短信媒介的研究。

参考答案
人工纳入 45 条,人工排除 255 条。

AI 建议
纳入中命中 42 条,漏掉 3 条;
排除中正确识别 227 条,多留 28 条。

决定
AI 只负责排序和给出候选理由;
全部记录仍由至少一名研究者查看,低相关区继续抽取第二人复核。

对这项综述,漏掉符合研究的代价高于多看几十条。团队没有用一个总体准确率给工具放行,而是查看错误内容,并把三条漏检变成新的停止条件:同类媒介描述再次被系统性漏掉,就暂停排序流程并回查。

参考集也不能只从最容易判断的前 300 条取。团队按数据库来源、年份、语言和模型排序区间抽样,并故意加入信息不足的记录。否则验证样本全是摘要写得清楚的随机试验,得到的表现无法说明模型怎样处理真实筛选中的边界项。

类别不平衡会使总体准确率看起来很高。2480 条中大部分本来就会排除,一个把几乎所有记录都判为排除的工具,也可能获得漂亮数字。团队把纳入记录的漏检数量、错误类型和人工额外工作放在首位,同时保留其他指标,不用单一百分比作放行决定。

人机分工记录跟着综述阶段变化

团队把当前做法写进一条使用记录。它不是适用于所有综述的抽查模板,只说明本项目在当前阶段怎样控制错误。

记录项目当前综述的决定
协议与阶段已冻结问题、纳排、来源、主要结局和分析原则;当前为标题摘要筛选
AI 角色按相关性排序并给候选理由,不作最终排除
参考集300 条,双人独立判断并解决分歧,包含边界样本
关键结果45 条人工纳入中漏检 3 条;记录漏检内容,不只报比例
人工控制全部记录至少由一人查看;低相关区按预定办法由第二人复核
停止条件连续漏检;特定语言或设计集中漏检;模型、解析器或纳排规则改变
保存内容工具与版本、运行日期、输入字段、提示、逐条输出、人工决定和排除理由
下一阶段全文筛选、数据提取和分析分别建立新参考样本,不继承本阶段表现

协议先冻结,是为了避免工具的困难反过来改变研究问题。例如某类全文难解析,不能因此静默排除;初筛时发现某种设计结果更积极,也不能在看到结果后把它加进纳入标准。确需修改协议时,要记录修改发生在何时、为什么、影响哪些记录,并重新筛选受影响范围。

若纳排标准本身仍会让两名人工综述者频繁分歧,先解决规则,不急着训练模型模仿不稳定答案。分歧记录可以暴露“短信提醒是否必须单独存在”“会议摘要怎样处理”等边界;团队写清口径后,重新建立受影响的参考答案。AI 不应被用来替代尚未完成的方法决定。

PRISMA 2020 核对表提供系统综述报告项目和扩展说明。它不会替团队决定方法,却要求检索、选择、数据收集、偏倚评价和综合过程能够被说明。加入 AI 后,只是多了工具版本、验证和人工控制等需要报告的事实。

全文筛选不能照搬标题摘要的成绩

进入全文后,输入和错误类型已经改变。短信媒介可能只在方法中出现;一项研究可能有会议摘要、注册和正式论文多份报告;结局符合但随访时间不符合;文中“常规护理”又可能包含其他提醒方式。

AI 可以把涉及纳排的段落与候选理由并排展示,最终决定由综述者按协议作出,并记录可复核的排除理由。全文没有写清楚,不等于不符合;需要联系作者或等待其他报告时,状态与“明确排除”分开。

同一研究的多份报告也要连接。Cochrane 数据收集章节把研究而非报告作为主要单位,并指出多份报告可能分别提供设计和结果信息。本案例若把会议摘要和正式论文当成两项试验,筛选数量和后续 Meta 分析都会被重复计算。

团队为全文阶段另选参考样本,包含多报告、信息不清和边界随访时间。标题摘要阶段 42/45 的结果不会写进全文阶段的放行理由。工具名称相同,也不表示任务相同。

其他语言记录也单独检查。模型在英文摘要上的表现不能直接外推到中文、法文或机器翻译文本;术语、否定表达和摘要结构都可能改变错误。若团队没有能力验证某种语言,处理方式应按协议与专业资源决定,不能让“模型能翻译”成为自动排除或纳入的依据。

数据提取时,一个空白可能代表四件事

纳入研究确定后,团队让 AI 候选提取随访出席人数、分母、时间点和短信方案。试跑中,一篇论文的结果只出现在图里,模型把空白记成 0;另一篇未报告方差,模型根据常见格式补了一个字段。

研究者把状态明确分开:原文明示为零、原文未报告、只在图或附件出现、当前解析失败。四者都不能用同一个空白表示。效应量需要的组别、分母、时间、方差形式和方向都带证据位置;从图中估读或进行单位换算时,另记方法与人工核验。

原文状态
随访出席人数只在图 2;正文未给表格数值。

AI 第一次提取
attendance = 0

人工核对
0 不是原文结果;当前自动解析失败。

可用记录
attendance = 待人工从图 2 核验
source_state = figure_only

Cochrane 的数据收集指导建议对结局数据进行重复提取,以减少错误和单一提取者选择。团队让 AI 先提候选,关键结局由两名人员独立核对或由第二人核对原记录。模型在多个研究中持续混淆分母时,相关字段全部退回人工,不用后续“总体复核”兜底。

偏倚评价也不由模型自动打总分。它可以定位随机、盲法、失访和预注册信息;熟悉工具与研究设计的人判断实际发生了什么。报告没有写随机化细节,可能是未报告,也可能没有实施,两者都需要证据,不能由语言完整程度直接判为低风险。

当两名评审者对偏倚领域有分歧时,保存各自依据和裁决理由。模型给出的段落定位可以帮助更快返回原文,但不能用“AI 也判为高风险”增加一票。评价工具的规则、研究实际发生的过程和评审者判断才构成依据。

代码能画出森林图,不表示研究应该合并

进入 Meta 分析前,团队先确认对象、干预、对照、出席率定义、随访时间和效应量是否足够可比。短信提醒若有的在预约前一天发送,有的持续数周并附带行为支持,合并后的数字需要明确解释;不同分母、多个时间点和同一研究多组也要按协议处理。

AI 可以起草效应量转换和模型代码。团队用一组可以人工计算的小数据核对方向、权重和区间,再与已知软件结果比较。代码运行成功不证明参照组没有翻转,也不证明随机效应模型就是合理选择。

无法合并的研究继续留在综述中,说明为什么不能进入相同综合。结果不显著也不能被自动理解为没有效应;区间、精确性、异质性和偏倚共同决定解释。统计负责人对代码和模型负责,领域与方法团队决定临床和方法上的可比性。

团队还检查效应方向。若一篇研究把“未出席”作为事件,另一篇把“出席”作为事件,代码可以无报错地把方向相反的指标放在一起。提取表预先记录有利方向,测试数据故意包含一项反向编码;合并前由人工确认转换。这个错误若进入森林图,图形仍然完整,却会把结论翻转。

多臂研究和多个随访时间点也按协议处理,不能让 AI 默认选最显著的一项。团队在看到结果前规定主要时间点与组别合并方式;方案之外的分析标为探索,并说明为什么进行。选择隐藏在代码里,报告再透明也无法恢复预先方法。

若模型或工具更新,团队使用稳定参考集复测。无法固定版本时记录运行日期和环境;性能跌破项目预先标准,退回人工或上一种已验证流程。筛选阶段的成功,不给分析代码附带任何信誉额度。

方法部分要写清 AI 实际改变了什么

综述完成后,团队能说明 AI 看过哪些字段、产生的是排序还是排除建议、所有记录是否仍由人查看、参考答案怎样形成、三条漏检怎样处理,以及数据提取中哪些字段转回人工。流程图中的记录数量来自数据库、去重和逐条决定,不让模型补齐。

透明报告也包括失败。若某种语言记录漏检较多,团队写明自动化范围被缩小;若表格解析多次错位,就说明关键数据由人工提取。只报告节省了多少时间,会把决定证据可信度的信息全部藏掉。

保存逐条输出还有一个作用:流程图数量能与实际记录对账。某批运行失败或重复发送时,团队能识别哪些记录没有得到建议、哪些记录被处理两次。缺少记录级日志,最终的 2480 条只能靠模型或人工回忆拼数,系统综述的可追踪性已经断开。

本案例最后保留 AI 的筛选排序和候选提取作用,没有把最终排除、偏倚判断或合并决定交出去。那 3 条漏检没有被当作调参后可以忘记的插曲,而是成为人工查看和停止规则的依据。另一团队读取协议、使用记录和逐条结果后,能够重建每项证据怎样进入综述,这才是自动化能够被接受的条件。