核心结论

用 AI 做科研的合规问题不能归结为“能不能用”。真正需要判断的是:什么材料进入了什么工具,工具怎样保存和使用材料,AI 具体参与了哪项研究活动,研究者如何验证输出,以及学校、伦理批准、资助方和目标期刊要求怎样披露。

安全与学术诚信应在使用前落实为一张登记表,而不是论文写完后补一段免责声明。任何未公开手稿、同行评审材料、可识别参与者数据、商业机密或潜在专利内容,在没有明确授权和合适环境之前,都不应上传到通用外部 AI 服务。

先把“内容”和“工具环境”分开判断

同一份材料在不同环境中的可用性可能不同。去除姓名不一定等于完成匿名化;基因组、罕见病、地理位置、影像和自由文本可能仍能组合识别个人。相反,一篇已经公开发表的论文通常可以用于摘要练习,但模型生成的摘要仍需回到原文核验。

开始任务前至少判断四层规则:

  1. **研究承诺:**知情同意、伦理审批和数据使用协议允许什么;
  2. **机构要求:**学校、医院、实验室或合作单位允许使用哪些工具;
  3. **工具条款:**数据是否保存、是否用于改进服务、谁能访问、能否删除;
  4. **发表要求:**目标期刊怎样要求声明 AI 辅助、图像、代码和写作活动。

任何一层不清楚,都不能用“资料已经去掉姓名”直接放行。NIH 的 AI 研究政策说明特别提醒,研究数据发送给外部 AI 提供方可能造成未经授权的披露。这个风险发生在输入阶段,无法靠事后修改论文补救。

一张数据分级表先决定能否输入

可以把科研材料分成四级。分级名称可以按机构要求调整,关键是为每一级规定允许环境和批准人。

级别教学示例默认处理
公开已发表论文、公开数据字典、公开指南可在批准工具中使用,仍需遵守版权与引用要求
内部未公开方案、实验室会议记录、普通分析代码仅在机构允许的账号或环境中使用,不向外公开
敏感去标识化参与者数据、未发表结果、合作方材料需要伦理、协议和安全环境共同允许,最小化输入
严格限制可识别健康信息、保密评审稿、密钥、受限数据库默认禁止进入通用AI;只能按正式批准方案处理

“最小化输入”意味着只提供完成当前任务需要的字段和片段。例如检查变量命名不需要上传整张受试者表;润色方法段落不需要附上未脱敏的病例记录;让 AI 检查代码时,可以使用结构相同的模拟数据和预期结果。

教学案例:未发表手稿能不能上传

**教学模拟案例:**临床研究者顾宁收到合作者发来的一篇未发表手稿和一份去标识化数据摘要,希望使用 AI 检查方法与结果是否一致。手稿包含罕见病亚组、医院时间范围和若干小样本描述。

顾宁没有直接上传,而是填写使用登记:

字段记录内容
任务检查方法段落声明的分析与结果表是否一致
材料级别未发表手稿:内部;小样本摘要:敏感
权利与承诺合作协议未说明可向第三方AI服务提供材料
工具环境个人通用账号,保存和训练设置尚未核实
初步决定不上传原稿和数据摘要
替代做法用人工构造的字段清单和模拟结果测试检查流程;向数据负责人申请批准的机构环境
放行人项目负责人和数据保护负责人
留痕保存登记、批准范围、工具版本和最终人工核验记录

这里的正确结果不是“完全不能用 AI”,而是改变材料和环境。顾宁可以先用模拟表验证检查逻辑;得到批准后,也只输入与一致性检查有关的最少字段。AI 输出仍是问题清单,不能自动修改手稿或重新计算结果。

署名与贡献:AI不能成为作者

作者身份不仅意味着写过文字,还意味着能够对工作的准确性、完整性和伦理承担责任。ICMJE明确提出,AI 和 AI 辅助技术不应列为作者;人类作者必须核查 AI 辅助内容,保证正确引用并透明说明使用情况。

团队内部可以用 CRediT 贡献者角色分类记录概念形成、数据整理、正式分析、软件、验证、可视化、初稿和修改等人类贡献。AI 的使用另行登记工具、版本、目的和审核,不应挤占真实贡献者的署名,也不能用“AI 完成分析”掩盖无人能够解释分析的事实。

当一个团队成员只把材料交给 AI 并转发输出,这本身不自动构成方法学或正式分析贡献。署名仍应按照期刊和机构的作者标准,由团队讨论并记录。

披露要说明用途,不是只报一个工具名

有效披露通常回答五个问题:

  • 使用了什么工具和可识别的版本或访问日期;
  • 在研究或写作的哪个环节使用;
  • 输入材料的范围是什么;
  • 输出怎样由人核查和修改;
  • AI 输出是否影响数据、方法、图表或最终文字。

例如:“作者于 2026 年 8 月使用经机构批准的生成式 AI 工具,根据作者撰写的中文初稿提出英文句式修改建议。所有建议由作者逐句核对;研究问题、分析、结果解释、引用和最终文字均由作者确认。”这比“本文使用 AI 辅助”更有解释力。

披露位置和粒度必须以目标期刊的最新规则为准。不同出版方对普通语言润色、内容生成、图像生成和评审材料的要求可能不同。Nature Portfolio 的 AI 政策会随着技术变化更新,因此不能把某一家期刊的当前规则写成适用于所有论文的永久标准。

版权、引用和“AI说它来自哪里”

AI 生成一段文字,不代表研究者自动拥有无限制使用权,也不代表段落中的事实无需引用。研究者仍需确认:表达是否过度接近来源;图像和材料是否有许可;事实主张应引用哪一份原始研究;模型给出的参考文献是否真实。

不能把聊天记录中的链接当作来源核验。引用进入论文前,应通过数据库、DOI 登记机构或出版方页面确认元数据,再阅读原文判断它是否支持当前句子。事实与引用核验的完整方法由“怎样核验AI给出的事实和参考文献”一文处理。

同行评审材料是特别情形

收到评审邀请意味着获得了受保密义务约束的未公开材料。即使删除作者姓名,研究构想、结果、图表和附件仍可能具有识别性或知识产权价值。ICMJE要求编辑和审稿人在无法保证保密时,不应把投稿材料上传到 AI 系统;Nature 和 Elsevier 等出版方也有各自的审稿人 AI 规则。

因此,审稿人必须先查目标期刊政策和编辑许可。没有明确允许时,不把原稿、摘要、图表或审稿意见输入外部生成式 AI。作者使用 AI 整理自己收到的评审意见,也要注意意见和稿件仍可能受投稿流程保密规则约束。

必须立即停止的情况

  • 不知道材料是否包含可重新识别个人的信息;
  • 数据使用协议、伦理批准或合作合同没有覆盖当前用途;
  • 工具的保存、训练、访问和删除规则无法确认;
  • 目标期刊明确禁止相应用法;
  • 团队无人能够验证 AI 生成的分析、代码、图像或引用;
  • AI 已经改变原始记录,而没有独立版本和变更日志;
  • 准备通过 AI 隐瞒真实贡献、伪造数据或规避学术审查。

停止后可以改用模拟数据、本地批准环境、人工检查或正式咨询伦理和数据保护人员。不要用“别人也这样做”代替项目本身的授权。

如果已经误传或误用,先处理事件而不是掩盖

安全边界有时是在上传后才被发现。此时不要只删除本地聊天记录并继续工作,也不要因为“模型没有输出敏感内容”就判断没有风险。研究者应立即停止继续输入,保存发生时间、工具账号、输入范围和已采取动作,并按机构流程联系项目负责人、数据保护、信息安全或伦理管理人员。是否需要撤回共享、通知服务商、评估重新识别风险或报告事件,应由有权限的人员决定。

同时隔离受影响输出。由不合规输入产生的摘要、代码或表格,在完成事件评估前不应继续进入分析和论文,因为团队既要确认数据风险,也要确认输出是否已经混入不应使用的信息。事件记录必须如实保留;为了避免追责而改写记录,会把一次操作错误升级为诚信问题。

如果发现 AI 生成了不存在的引文、改动了图像内容或替团队成员虚构贡献,处理逻辑类似:暂停使用相关产物,确定影响范围,回到原始材料重建结果,并按机构与期刊要求更正或披露。错误发生在投稿后时,应及时联系编辑,而不是等待审稿人发现。

投稿前做一次AI使用审计

论文准备提交时,可以把项目登记表与最终稿逐项对照。至少核查:所有进入稿件的 AI 辅助文字是否由作者确认;关键事实、数字和引用能否回到原始来源;图像是否只进行了期刊允许的处理;分析代码及结果是否由具备能力的人运行和解释;方法、致谢或声明中的披露是否与实际使用一致;作者贡献是否只列人类真实完成的工作。

审计还要覆盖“没有进入正文”的环节。AI 若参与文献筛选、数据提取、翻译访谈材料、生成代码或选择期刊,即使最终文字由人撰写,也可能影响研究过程,是否披露要按目标期刊和机构的最新要求判断。不要只搜索稿件中是否出现某个工具名。

一个合格的审计结果不是宣称“本项目没有风险”,而是给出可核查链条:输入受到什么控制,关键输出怎样验证,哪些建议被拒绝,最终决定由谁作出。规则如果在项目中途变化,应记录核验日期并按新要求评估,不应假设立项时查过一次就永久有效。

可直接复用的AI使用与数据处理登记表

项目与任务:
使用日期:
工具、版本或服务环境:

输入材料:
材料分级:公开/内部/敏感/严格限制
伦理、合同与机构依据:
是否最小化、去标识化或改用模拟材料:

AI执行的具体动作:
AI不得执行的动作:
输出进入下一步前的核验依据:
核验人和批准人:
保存的版本与记录:

目标期刊或传播场景:
需要披露的工具、用途和审核方式:
政策核验链接与日期:

停止条件与替代方案:

这张表的价值不是制造手续,而是让团队能够回答一个最基本的问题:如果有人质疑这次 AI 使用,团队能否说明输入为什么被允许、输出怎样被验证、谁作出了最终决定。不能回答时,就还没有达到科研可用的条件。