核心结论
用 AI 做科研时,安全与学术诚信不是等论文写完以后补一段声明。真正的控制点在材料进入工具之前:这份内容受什么承诺约束,当前账号和服务环境是否获准,完成任务是否一定需要这些材料,输出又由谁核对。
一份简短的 AI 使用与数据处理记录,可以把这些问题留在同一个地方。它既不是免责条款,也不是“使用过哪些工具”的流水账,而是让团队以后能够说明:为什么允许这次输入,AI 做了哪一步,哪些东西没有交给它,最终文字和研究决定由谁负责。
一份未发表手稿,不能因为去掉姓名就直接上传
下面使用一个教学场景。一位临床研究者收到合作者发来的未发表手稿,准备检查方法段描述的分析是否与结果表一致。手稿附有一份去标识化数据摘要,其中仍有罕见病亚组、医院时间范围和很小的样本分组。
研究者原计划把两份文件上传到个人使用的通用 AI 账号,让模型列出前后矛盾。文件中没有患者姓名,看起来已经做过隐私处理。但“没有姓名”只能回答一个字段是否被删除,不能回答组合信息能否重新识别人,也不能回答合作协议是否允许把未公开材料交给第三方服务。
他没有先上传,而是建立了下面这条记录。之后关于署名、披露和最终核验的决定,也继续写在同一条记录里。
| 记录项目 | 当前决定 |
|---|---|
| 任务 | 检查方法段声明的分析与结果表是否一致 |
| 输入材料 | 未发表手稿;含小样本信息的去标识化数据摘要 |
| 已知约束 | 合作协议未写明可向外部 AI 服务提供材料;个人账号的保存与训练设置尚未核实 |
| 上传前决定 | 不上传原稿和数据摘要 |
| 替代做法 | 先用人工构造的字段清单和模拟结果测试检查方法;申请机构批准的环境 |
| AI 的工作 | 在获准材料中标记方法与结果可能不一致的位置,不直接改稿或重算结果 |
| 人工核验 | 分析负责人返回分析记录和最终表格逐项确认;作者决定是否修改文字 |
| 发表处理 | 按目标期刊当时的规则核验披露位置和内容,记录核验日期 |
| 停止条件 | 权限不清、输出无法回到原始材料、工具环境改变,或发现未经授权输入 |
这张表没有得出“本项目完全不能使用 AI”的结论。它先把原稿挡在个人账号之外,同时允许团队用模拟材料测试检查逻辑。若机构批准了合适环境,研究者仍只提供完成一致性检查需要的字段,而不是因为环境获准就上传整个项目目录。
NIH 的 AI 研究政策页面提醒研究者,研究数据发给外部 AI 提供方可能造成非预期的未经授权披露。这个风险发生在输入时;事后删除模型写出的摘要,或在论文里补一句 AI 声明,都无法反过来证明当时的输入获得了许可。
获得工具权限以后,还要缩小材料
假设团队后来确认,机构环境可以处理未公开手稿,但参与者数据仍受原数据使用约定限制。研究者把任务重新写窄:只比较方法段中的分析名称、结局定义和结果表标题;涉及小样本行的数据摘要由分析负责人在线下核对。
进入 AI 的材料不再是整篇手稿,而是经过人工摘出的三组对应文字。模型输出一张疑点清单,其中一项说“方法使用调整模型,结果表标题未说明是否调整”。这只是待核对问题。分析负责人打开实际代码和表格后,确认结果确实来自调整模型,于是作者修改表题,并记录依据。模型没有权根据常见论文结构自行补上“已调整”。
另一项疑点来自模型误读:方法段写的是敏感性分析,结果表对应主要分析。人工核对后,这条建议被拒绝。使用记录不仅保存接受的修改,也注明这条为何没有采用。否则项目结束时只剩一份看起来完美的稿件,没人能回答 AI 曾经影响过什么。
其中一条核对记录可以简化成这样。文字和表名均为教学示例:
送入机构环境的摘录
方法:主要模型调整年龄与病程;另做未调整的敏感性分析。
表 2 标题:主要结局的回归结果。
AI 标记
表 2 可能来自未调整分析,建议把方法改为“未调整模型”。
人工核验
分析脚本与输出记录显示,表 2 来自调整模型。
保留原方法,在表 2 标题补充“调整年龄与病程”;拒绝 AI 对方法的改写。
这条记录说明,AI 找到了一处值得查的含糊,却给出了错误修正。若作者只接受“让表述保持一致”这一目标,很可能反过来把正确的方法段改错。核验必须回到分析脚本和输出记录,而不是在两个句子之间挑一个读起来更顺的版本。
材料最小化在这里产生了双重作用。它减少未公开信息进入工具的范围,也迫使团队先说清检查对象。润色一句方法文字不需要患者记录,检查变量名不需要自由文本病历;代码测试往往可以先使用结构相同的模拟数据。把“可能有用”当作上传理由,会让边界无限扩大。
AI 参与了文字,也不会成为作者
一致性检查结束后,团队让 AI 对作者已经写好的中文方法说明提出英文表达建议。模型改出的句子仍要由作者逐句确认,尤其要核对分析名称、研究对象、时间和否定词。语言更顺不代表科学含义没有变化。
ICMJE 关于出版中使用 AI 的建议指出,AI 或 AI 辅助技术不应列为作者;人类需要检查 AI 辅助内容的准确性,并对引用、许可和透明使用负责。原因很直接:作者必须能够回答研究内容、处理质疑并承担责任,工具无法履行这些义务。
因此,团队没有在作者列表中增加工具名称,也没有把“由 AI 完成分析”写进贡献说明。概念形成、数据整理、正式分析、验证、初稿和修改等人类工作,可以参照 CRediT 贡献者角色如实记录;AI 的工具、用途和核验方式则留在使用登记与适当的披露位置,两者不混在一起。
如果某位成员只负责把文件交给模型并转发结果,这个动作本身也不会自动变成“正式分析”或“方法学”贡献。团队仍要依据期刊和机构的作者标准讨论署名,并记录真正作出判断和完成核验的人。
披露不能只写“本文使用了 AI”
准备投稿时,研究者回到同一份使用记录,而不是凭记忆写声明。记录显示:机构批准环境用于检查方法与表格的一致性;输入只包含人工摘出的对应文字;模型列出疑点;分析负责人用代码和最终表格核验;作者使用过英文表达建议并逐句修改。
据此形成的披露应说明使用了什么工具或环境、在哪个环节使用、输入范围、人工怎样核对,以及 AI 是否影响数据、方法、图表或最终文字。具体放在方法、致谢、声明还是投稿系统,要在提交当天查目标期刊规则。不同期刊的要求会变化,不能把别家期刊的一段模板永久复制过来。
例如这项教学任务可以留下这样的事实底稿:2026 年 8 月,作者在机构批准环境中使用生成式 AI 标记方法段与结果表之间可能不一致的位置,并对作者自写文本提出语言修改;未输入参与者级数据;所有疑点由分析负责人依据脚本和最终表格核验,作者决定是否修改。正式披露时再按目标期刊要求压缩措辞。先保存事实,能避免投稿前为了适配一个文本框而丢失真实过程。
Nature Portfolio 当前的 AI 编辑政策按风险判断 AI 用途,强调学术判断和责任仍由人承担,并要求保护手稿、评审意见和敏感数据。这个页面在本文核验日为 2026 年 8 月 7 日;真正投稿时仍要重新查看目标期刊,而不能把今天的页面当作长期不变的通行证。
披露也不能替代核验。模型若给出不存在的参考文献,作者不能因为已经声明“使用 AI”就把引用留在文中;生成内容若过度接近未标注来源,仍要处理引用、许可和文字原创性问题。透明说明使用过程,是为了让责任更清楚,不是把责任转给读者。
保密评审稿要另作判断
同一位研究者后来收到一篇同行评审邀请。即使他已经有机构批准的 AI 环境,也不能沿用自己手稿的使用记录。评审稿属于作者交给期刊的保密材料,允许范围要看编辑许可、期刊政策和工具环境是否真正保证保密。
ICMJE 的建议指出,在无法保证保密且没有作者明确许可时,编辑、审稿人或出版方不应把投稿手稿上传到 AI 系统。研究者因此没有把评审稿、摘要、图表或拟写的评语输入外部工具。已有账号、过去成功的用法和删去作者姓名,都不是这次任务的授权依据。
这与作者使用 AI 整理自己论文的语言也不是同一件事。材料的权利关系、承担的角色和对他人的保密义务已经改变,必须另建记录。把所有“PDF 阅读”归为同一种任务,会掩盖最重要的差别。
如果先上传后才发现不合规
假如研究者已经误把数据摘要传入个人账号,正确动作不是只删除本地聊天并继续工作。他要先停止继续输入,保存发生时间、账号、工具、输入范围和已经采取的操作,隔离由这些材料产生的摘要或表格,然后按机构流程联系项目负责人、数据保护、信息安全或伦理管理人员。
是否能够从服务端删除、是否需要通知合作方、怎样评估重新识别风险,以及相关输出能否继续使用,都应由有权限的人根据实际情况决定。因为害怕追责而改写或不留事件记录,会使团队既无法处理数据风险,也无法证明后续结果已经与受影响材料隔离。
隔离输出并不表示认定所有输出都已泄露或全部错误,而是在评估完成前切断它们进入下一步的路径。受影响的表格如果已经被复制进草稿,要标出位置;相关代码如果混入了受限字段名称,也先暂停共享。等负责人明确哪些产物可以保留、哪些必须从获准材料重新生成后,再恢复工作。
在本文的教学项目中,上传前记录挡住了这一步。最终稿中的方法、结果和引用都能返回人工确认的材料;署名只反映真实的人类贡献;披露与实际用途一致。安全和诚信并不是靠一句“AI 仅作辅助”获得,而是由那条从输入许可、最小材料、输出核验一直延续到投稿的记录支撑。