核心结论

参考文献有 DOI、格式完整,只能说明它看起来像一条正式记录。核验还要继续问:题名、作者与 DOI 是否属于同一成果;当前读到的是哪个版本;稿件中的具体主张位于原文哪里;研究设计和样本又允许把这句话说到多强。

最省返工的做法,是把“稿件中的句子”与来源身份、版本、原文位置和支持关系放进同一条引用台账。AI 可以帮助查找冲突、定位候选段落和整理格式,却不能给自己推荐的文献作担保。

十五条推荐文献,问题并不都在“真假”

下面是一项教学核验。研究生写了一段关于睡眠与学习表现的引言,AI 为它提供了 15 条参考文献。清单有作者、年份、期刊和统一格式,多数还带 DOI。研究生原本准备全部导入文献管理软件。

人工抽查前五条后,错误已经分成几种:R01 的 DOI 能打开,却指向另一篇相似题名论文;R02 是真实系统综述,研究对象为青少年,稿件却写成全部成年人;R03 是真实队列研究,可以支持关联,不能支持“睡眠不足导致成绩下降”;R04 只有会议摘要,方法和完整结果不足;R05 后来发布过更正,样本数发生变化。

AI 配出的句子
大量研究证明,睡眠不足会直接导致大学生成绩下降。

核验后
多项观察研究在特定学生样本中报告睡眠时长或质量
与学习表现相关;测量差异和潜在混杂限制了因果解释。

核验改变的不只是参考文献列表,也改变了句子本身。真实来源若只支持更窄的人群或关系,作者要缩小主张;来源不存在或无法确认,则删除或换用真正读过、确实适合的证据,不能为了保住原句去找一篇“意思差不多”的论文。

其余十条也按同一逻辑处理,而不是先判断格式是否统一。研究生把每条来源分配到稿件中的具体句子,发现有两条虽真实,却只在背景段落重复承担“睡眠很重要”这一宽泛主张;另有一条被列在参考文献中,正文并没有任何句子使用。删除装饰性引用后,清单变短,却更容易说明每条来源为什么存在。

她还把“尚未取得全文”与“不支持”分开。前者说明当前证据不足,可能通过图书馆或作者补充;后者说明已经读到的内容与主张不匹配。把两者都标红并删除,会让核验者不知道问题是访问限制还是内容不合适。

台账从稿件中的一句话开始

研究生没有为每篇论文写一段摘要,而是记录每个准备进入稿件的主张。R03 的当前台账如下:

台账项目R03 的核验结果
稿件中的主张在该大学生样本中,较短睡眠与较低课程成绩相关
来源身份正式题名、作者、期刊、年份和 DOI 经数据库与出版方页面对应
实际版本出版方正式版本;记录核验日期和当时的更正/撤稿状态
研究设计观察性队列研究
原文位置结果第 3 段、表 2 模型 B;保留全文版本
关键结果按原文记录估计值、区间、单位、样本数、参照和调整变量
支持关系直接支持当前样本中的“关联”,不支持“导致”
适用范围该学校、年龄与随访条件;不自动外推全部学生
最终处理保留来源,修改稿件动词与范围;由作者在 2026-08-07 核验

台账把来源与句子绑定,是为了防止后续改稿发生“引用漂移”。如果作者把这句话改成“睡眠不足普遍损害学习能力”,引用编号虽然还在,研究对象、结局和因果强度都已经越过 R03。只保存一个 DOI,无法发现这种变化。

Crossref 的元数据检索说明展示了如何取得成员登记的题名、作者、出版物、标识和更新等元数据。它适合回答“这条记录是什么”,通常不提供足以判断当前句子是否成立的全文证据。身份核对通过以后,仍要阅读实际来源。

DOI 打开以后,核验才走到一半

R01 的 DOI 解析成功,但页面题名与 AI 给出的题名不同。研究生没有把“链接可访问”记为通过,而是比较题名、作者、年份和期刊。四项无法组成同一条记录,R01 被标记为标识错配,停止正文核验。

没有 DOI 也不自动等于虚假。书籍、机构报告、早期论文和部分数据库可能使用其他永久标识。核验依据应与来源类型相称。反过来,任何成果拥有 DOI,都不会自动证明其设计可靠、结论适合当前稿件或已经同行评审。

版本同样会改变引用。预印本、会议摘要、正式论文、勘误和撤稿声明需要分别记录。R04 可以作为寻找正式报告的线索,却不能被静默写成已经完整发表的研究;R05 的更正改变关键数字,作者要用更正后的版本重核所有依赖该数字的句子。

研究生在数据库中找到 R04 的正式论文后,也没有直接把会议摘要替换成新 DOI。她先确认两份报告是否来自同一研究、正式版的样本和结局是否与摘要一致,再以正式版重新核验稿件句子。若两版结果有差异,台账保留差异和实际采用的版本,而不是让文献管理软件的自动合并替团队作决定。

出版方页面若显示 correction、expression of concern、retraction 或 update,不宜只在台账上加一个图标。研究者要判断变化影响元数据、局部数字还是整项结论,并追踪已经引用到摘要、正文和图表的地方。必要时暂停使用并请信息专家或领域人员协助。

一条数字要连同分母和模型一起检查

AI 很容易保留最易读的百分比,却丢掉它代表谁。原文若写“120 名完成随访者中 42 人达到标准”,35% 的分母是完成者;若最初招募 180 人,失访信息同样会影响解释。台账同时记录招募数、分析数、时间点和缺失,而不是只复制 35%。

效应指标还要带方向、参照组、模型、调整变量和区间。表格列错位、负号丢失或把未调整模型与完全调整模型混用,都会让一条真实数值支持错误句子。PDF 解析不可靠时,转回原始页面人工核对,不能根据讨论段的“结果一致”倒推表格。

原始位置
表 2,模型 B;脚注说明分析样本和调整变量。

AI 提取
睡眠不足使成绩下降,n 为全文总样本。

人工修正
保留原效应指标与区间;n 使用模型 B 实际分析样本;
句子写观察到关联,并注明研究情境。

一次抽查若发现多个数字都取自错误列,问题不再是某一格抄错。研究者应暂停其余自动提取,回查同类字段和已经写出的句子。整体“多数正确”不能抵消关键数字的系统性错配。

数字从正文移动到摘要时也要重核。摘要往往删去方法限定,原本写在结果段附近的分母和时间点不再可见。如果保留空间不足,作者宁可减少数字,也不把一个只适用于完成随访者的比例写成全样本结论。

文献真实,也可能不支持眼前这句话

R02 的系统综述真实存在,元数据也完全对应,但它只研究青少年。若稿件讨论成年人,最多把它作为相邻人群的有限证据,并明确范围;不能删除年龄限制后继续称为直接支持。

研究设计也决定动词。一篇横断面研究可支持特定样本中的关联,通常不能证明干预效果;动物实验不能单独证明临床有效;观点文章可以证明“作者提出了某种观点”,不能替代实证结果。台账把支持关系记为直接、有限、背景或不支持,具体理由写在旁边,而不是给来源一个永远不变的质量标签。

作者解释与研究结果也要分开。论文讨论中提出一种可能机制,稿件可以写“作者提出”,不能改成“研究揭示”。未达到统计显著不等于证明没有作用;区间很宽时,证据可能同时容纳重要效应和无效结果。

二手引文也会制造一种“身份正确、阅读错误”的情况。若综述 A 转述早期论文 B,研究生实际只读了 A,却让 AI 把句末引文替换成 B,台账会显示她无法给出 B 的原文位置。正确做法是取得并阅读 B,或如实引用当前读过的 A;不能用更接近原始来源的格式掩盖实际没有核验。

ICMJE 关于出版中使用 AI 的建议把正确引用、必要许可和避免抄袭的责任留给人类。AI 改写过一段来源文字,不会取消思想与事实的归属;模型给出的链接,也不会自动完成引用核验。

改稿以后,再从句子和文献两个方向检查

引言经过几轮修改后,研究生做了双向审计。她先逐条查看参考文献在正文承担什么主张,发现一条只与主题相关、并未支持紧邻句子的装饰性引用;再逐条查看可核查主张是否有适合的来源,发现一处扩大人群范围后没有重新核验。

AI 可以比较台账里的“已核验句”与当前稿,标记人群、因果词、数字和范围词变化。作者随后返回原文决定是否需要换来源、缩小句子或重新计算。格式软件仍负责作者顺序、期刊缩写和参考文献样式,它不判断来源是否被正确理解。

她还检查了同一主张是否堆了多条彼此不独立的来源。几篇论文可能来自同一个队列或重复引用同一数据,参考文献数量不会因此变成更多独立证据。台账记录研究身份和用途,帮助作者避免用长串引文制造证据很丰富的印象。

临近投稿,承担主要结论的来源还要再看版本与状态。核验日之后可能出现更正或撤稿,预印本也可能已有正式版本。更新台账时保留实际读过的版本,不能把元数据自动替换成新版本后假装正文已经重核。

最终,15 条推荐没有被简单分成“真”和“假”。有的删除,有的只作线索,有的保留但缩小句子,有的因版本变化重新核数值。每一条留下的引用都能回答:这是什么来源,我读的是哪个版本,原文哪一处支持稿件哪一句,作者为何允许这句话保持当前强度。

当任何一问答不上来时,稿件先停在当前版本。研究生可以删句、降级表述、补全文或请信息专家协助;唯一不能做的是让同一个模型再保证一次“这些文献都是真实可靠的”,然后把自我确认当成核验完成。