核心结论
AI 写论文最危险的时刻,不是它写出一句难看的话,而是它把一项有限实验讲成了更完整、更确定的故事。只按“引言—方法—结果—讨论”逐节生成,模型会主动补过渡,也可能顺手补上未执行的方法、未核验的引用和数据不支持的结论。
写作前先画一张主张—证据地图:论文准备让读者相信什么,直接证据在哪里,哪一章负责表达,同时必须带上什么边界。模型可以围绕这张地图组织和修改文字;地图里没有的事实,不能靠写得顺畅进入稿件。
“延长长期寿命”不是这项实验的结果
教学案例是一项传感器封装材料实验。团队在 85°C、85% 相对湿度下进行了短期加速老化,记录新封装与常规封装的信号漂移和质量变化。现有材料包括方案、实验日志、分析脚本、表 2 和图 3。
作者第一次要求 AI “按高水平期刊格式写一篇完整论文”。初稿很流畅,摘要却称新封装“显著延长设备长期使用寿命”,方法中多出“所有试样随机分配并盲法检测”,引言还有两篇团队从未核验过的对比文献。
这里至少有三种不同问题。湿热加速试验没有建立与真实使用寿命的换算,不能直接写长期寿命;项目记录中没有随机化和盲法,不能因为类似实验通常这样做就补上;引用是否真实、是否支持当前主张,也不能由生成时的流畅程度判断。
团队停止继续润色,把这份初稿当成问题清单。最需要修的句子不是语法,而是论文究竟准备提出什么判断。
四条主张把正文接回真实材料
作者只保留四条会推动论证的主张:
| 编号 | 准备表达的判断 | 直接证据 | 放置位置 | 必须同时出现的边界 |
|---|---|---|---|---|
| C1 | 新封装在本次湿热条件和观察期内信号漂移较小 | 图 3、结果 R07、分析 v2.4 | 结果、摘要 | 不外推真实长期寿命 |
| C2 | 信号变化与测得的质量变化在时间上同时出现 | 两条时间序列及同步测量记录 | 结果、讨论 | 一致变化不等于吸湿机制已被证明 |
| C3 | 已有封装研究报告了同类环境中的稳定性困难 | 6 篇已核验文献的证据卡 | 引言 | 不声称代表全部材料和使用场景 |
| C4 | 当前实验为特定条件下的材料选择提供比较依据 | C1、C2 与实验限制 | 讨论 | 不写成现场性能保证 |
初稿里的“延长长期寿命”找不到证据位置,直接删除。两篇新增文献也不因为题目看似相关就留下;作者回到数据库与全文核验,只有来源、版本和支持关系清楚的文献才进入 C3。
地图还发现 C2 的措辞过强。质量变化和信号漂移同时出现,可以说结果“与吸湿过程参与变化一致”,不能说“证实吸湿导致信号衰减”。项目没有直接测量水分扩散路径,也没有排除其他老化机制。这个边界被写入讨论,而不是丢在最后一句“仍需进一步研究”。
写作材料包只给当前章节真正需要的内容
作者没有把整个项目目录和旧聊天都交给模型。写结果时,材料包只有研究问题、冻结结果登记、图表来源单、术语表和 C1—C2;写引言时,换成 C3 及对应的六张文献证据卡;方法来自方案、实验记录、数据字典和实际运行版本。
每份材料标明状态。草拟决定、过期表格和未核验来源不与已放行内容放在一起;出现冲突时,模型的任务是列出差异,不是选一份看起来较新的数字。这样做也减少了无关上下文,避免旧的样本数或早期分析方案混回正文。
方法段的核验最直接。AI 草稿写了“试样随机分配”,作者在方案和日志中找不到随机序列,删去该句,并如实说明实际分配方式。它又写“检测者不知道材料类型”,但数据表在检测时已经显示组名,因此不能使用盲法措辞。报告指南可以提醒作者读者需要哪些信息,不能替项目制造缺失的步骤。
EQUATOR 的研究写作工具建议按研究类型寻找合适的报告指南,以便完整呈现研究,让读者评价或复现。清单指出“这里应报告什么”;若材料中没有答案,正确动作是查记录、标为未做或说明不足,不是请 AI 补一个常见答案。
一条结果句经过三次改写才达到证据强度
初稿写道:“The coating dramatically improves long-term device reliability.” 作者没有先做英文润色,而是把句子放回 C1:
原句:新涂层显著提高设备长期可靠性。
直接证据:短期 85°C/85%RH 试验中的信号漂移,图 3,模型 v2.4。
越界位置:“显著提高”未说明指标;“长期可靠性”没有现场寿命证据。
第二版:新封装在湿热试验中表现出更好的稳定性。
仍有问题:“更好的稳定性”没有说测量对象和观察期。
放行句:在本次湿热试验期内,新封装组的信号漂移小于常规封装组(估计与区间见图 3)。
第三句不如第一句响亮,却让对象、条件、方向和证据位置都清楚。实际稿件会填入已核验估计和区间,而不是让语言模型根据图形猜数字。
同一方法也用来处理“新封装更加稳定”中的比较范围。表 2 只有新封装和一种常规封装,不能写成优于“现有封装技术”;试验只覆盖当前温湿度和观察期,也不能推到低温、循环应力或现场污染。作者把比较对象写回组名,把试验条件放在首次出现的结果句中。读者不必等到讨论末尾,才发现标题式结论的适用范围其实很窄。
引用也按主张检查,而不是按段落数量检查。一篇综述能支持湿热环境是常见挑战,却不能支持某种材料已被证明具有相同机制;另一篇研究使用不同封装与测试时间,只用于说明已有做法,不拿来做直接性能排名。AI 若建议替换引用,作者重新核验新来源的原文和版本,不能因为引用格式正确就接受。
结果段只报告观察到的差异及不确定性,不提前解释为什么。讨论再比较已有研究、提出可能机制和替代解释。作者把“可能因为吸湿更少”标为解释,把同时变化的质量记录标为支持线索,并同时写明未直接测量扩散机制。一个“可能”并不会自动把无证据陈述变得安全。
先修证据,再修结构,最后才修语言
团队把修改分三轮。第一轮只问:每项判断有没有证据,方法是否真实,结果是否越过设计,引用是否核验。第二轮才看段落顺序:引言是否自然导向当前实验,结果顺序是否与图表一致,讨论是否先回答问题再处理比较、解释和限制。
第三轮处理中文、英文、术语和期刊格式。术语表锁定“signal drift”的译法,润色时同时锁定数字、单位、否定、比较方向与确定性。模型曾把“did not reach the prespecified threshold”简化成“showed no difference”,作者依据结果登记退回,因为没有达到阈值不等于已经证明没有差异。
这种顺序不是形式要求。如果先把过强结论润色得很像论文,作者反而更难看出它没有证据。证据层通过后,语言层只负责让真实判断更容易读,不负责提高故事的戏剧性。
修改记录保留原句、问题、证据编号、新句和仍存在的限制。作者能够看到哪些变化来自结果更新,哪些来自审稿意见,哪些只是语言调整。若一个措辞变化改变结论强度,它就回到证据层重新审批,不能归入普通润色。
跨章节对账发现摘要还留着旧故事
正文改完后,摘要仍写“验证长期寿命”,引言目的写“评估湿热稳定性”,方法只描述加速试验,讨论则提出现场部署。四段单独读都通顺,合在一起却回答了不同问题。
团队按主张编号横向检查。摘要的目标改回特定湿热条件下的信号漂移;方法中的温度、湿度、时间、样本和分析都能支持 C1;结果出现 C1—C2 的真实输出;讨论只把 C4 写到材料选择依据,不跨到产品寿命保证。
数字也逐项反查。摘要、正文、表 2 和图 3 使用同一分析版本;样本排除后,分母在所有位置同步更新;“信号漂移”“质量变化”和“可靠性”不再交替当作同一个结局。AI 可以并排抽取句子和数字找遗漏,作者负责判断它们的科学含义是否一致。
限制不再单独堆在讨论末尾。没有真实寿命换算直接限制 C1 与 C4,所以摘要不写寿命,讨论也只谈当前条件;机制测量不足限制 C2,所以作者同时保留其他解释;样本来自一次受控实验,则限制对制造批次和现场环境的外推。每项限制都改变一个具体句子的强度,而不是用“样本较小、仍需研究”完成礼貌性声明。
一位没有参与起草的合作者随后只拿主张地图和稿件,尝试为摘要四句话分别找到证据。前三句能够回到 C1、C3 和研究目的,最后一句“具有广泛商业应用前景”找不到对应证据。团队删掉该句,没有把它移到讨论继续保留。这次盲读也发现方法中的观察期与图注相差一天,回到实验日志后统一了起止规则。
ICMJE 的稿件准备建议说明各章节承担不同职责,并强调结果应按逻辑呈现,讨论要联系整体证据与限制。IMRAD 是组织形式,不是自动生成四段就完成了论证。
终稿放行的是一套材料,不是一份“final.docx”
最后版本与主张地图、结果登记、图表版本、引用台账和投稿文件清单绑定。方法负责人确认文字等于实际执行,分析负责人确认数字和表图,通讯作者确认结论、声明和全部作者已经看过提交版本。AI 不能代替任何人勾选确认。
工具使用也按目标期刊当时政策记录,包括工具、使用范围、输入材料和人工核验。披露不意味着作者可以把错误归给模型;AI 不能列为作者,人类作者仍对事实、引用、原创性和结论负责。
若终稿后有人改了图 3 的数据、摘要结论或作者信息,对应检查重新触发,而不是继续沿用旧放行记录。找不到证据位置的句子被删除、降级或返回研究材料核对。论文完成的标志不是章节齐全,而是最重要的每项主张都能说明证据在哪里,以及证据允许它说到哪里。