核心结论
用 AI 辅助统计分析,正确顺序是先写分析问题、变量角色、数据结构和模型假设,再让 AI 解释候选方法、生成代码和检查结果。不能先把数据交给 AI,让它“自动选择最显著的分析”。
统计结果是否可信,取决于研究设计、数据质量、模型适用、诊断和透明报告,不取决于代码看起来多复杂。AI 输出的 p 值、图表和解释必须用独立计算、测试数据和统计判断核验;主要分析的最终决定应由能够对方法负责的人作出。
先建立分析说明,而不是先生成代码
分析开始前应明确:主要研究问题;主要和次要结局;比较或暴露;重复测量、聚类和配对结构;预先计划的协变量;缺失和异常处理;需要报告的效应量和不确定性。
这些内容决定方法。三组独立样本与同一对象三次测量不能用同一检验;二分类结局与连续结局需要不同模型;预测准确与解释因果关系也不是同一个目标。
AI 可以根据说明列出候选方法和需要检查的假设,但它不能从变量名称猜出设计。例如列名 group 不告诉模型分组是否随机,time 不说明是重复测量还是不同横断面样本。
教学案例:三组实验的“显著差异”
**教学模拟案例:**生物学研究者彭越有三个处理组,每组 12 个独立培养样本,主要结局是归一化蛋白表达。她把表格交给 AI,要求“分析三组是否有显著差异”。AI 直接运行多个两两 t 检验,并报告其中一组
p<0.05。
问题至少有四个:没有检查三个样本组是否独立;没有说明主要比较;多次两两检验增加错误发现;没有查看分布、方差、批次和异常来源。
彭越先填写分析说明:
| 项目 | 教学示例 |
|---|---|
| 主要问题 | 三种处理条件下归一化表达的总体分布是否不同 |
| 实验单位 | 独立培养样本,不是同一样本重复技术测量 |
| 主要结局 | 预先定义的归一化表达值 |
| 主要比较 | 总体组间比较;通过后按预先指定对照作比较 |
| 批次 | 两个实验批次,需检查并在设计允许时处理 |
| 缺失 | 一项测量失败,保留原因,不按零处理 |
| 报告 | 各组原始点、描述统计、组间效应与区间、模型诊断 |
之后才比较适合的数据模型和稳健替代方案,并由统计负责人确认。
模型假设要变成可检查的问题
“数据是否正态”只是其中一项,而且小样本中单一检验很难提供充分判断。需要结合设计和模型查看:
- 观察是否独立,技术重复是否被误当成生物重复;
- 结局分布和尺度是否适合当前模型;
- 组间方差、残差结构是否合理;
- 是否存在批次、聚类、配对或重复测量;
- 极端值是否来自测量错误、录入错误或真实变异;
- 模型形式是否遗漏非线性或关键交互;
- 样本量是否足以支持计划参数和结论精度。
AI 可以生成诊断图和检查代码,但研究者要解释每项诊断对当前实验意味着什么。发现假设不满足时,不能只让 AI 轮流尝试变换,直到出现显著结果。
p值不是结论
美国统计协会关于 p 值的声明指出,p 值不表示假设为真的概率,也不衡量效应大小或研究重要性;科学结论不应只由是否跨过某个阈值决定。
在彭越的案例中,即使总体比较得到较小 p 值,仍要报告组间差异大小、区间、原始数据分布和实验背景。如果区间很宽,说明估计不精确;如果差异来自单一批次或一项有疑问的记录,需要敏感性检查;如果效应很小,也不能仅因“显著”写成生物学重要。
反过来,p>0.05 不等于三组相同。它可能来自效应确实很小、样本不足、测量噪声或模型不合适。若要证明等效或非劣,需要预先定义界值和相应设计,而不是把未显著当作等效证据。
让AI写代码,要同时给测试和期望
统计代码任务至少说明:输入数据结构、变量类型、设计、主要比较、缺失规则、输出对象和测试。彭越可以准备一张小型模拟表,已知每组数量、均值和一个缺失值,验证代码是否正确计算分母、保留组别和处理缺失。
验收不只看程序运行:
- 用另一种可靠实现复算关键统计量;
- 检查组别、参照、方向和单位;
- 检查代码是否静默删除记录;
- 检查随机过程是否固定种子并记录;
- 检查图表和正文是否来自同一分析对象;
- 检查软件、包和版本是否保存。
AI 修改代码后要重新运行全部测试。不要在控制台手工更改一部分结果,再把无法重现的数字复制进论文。
区分探索性分析和验证性分析
探索可以帮助发现模式、检查数据和形成后续假设,但看到结果后选择变量、分组、模型或终点,会改变错误率和解释。应保存预先分析计划,并把后续探索明确标记。
AI 特别擅长迅速尝试大量模型,这既是优势也是风险。每多试一次分组、转换和协变量,就增加选择最有利结果的机会。如果团队无法完整记录尝试过什么、为什么保留当前模型,就应限制自动探索。
一份透明记录可以写:主要分析按方案执行;敏感性分析检验某项假设;探索性分析用于生成下一项研究问题。三者在论文中不能用相同确定性呈现。
多重比较和模型选择
当研究有多个结局、时间点、亚组和模型时,偶然出现小 p 值的机会增加。AI 不应按“最显著”自动选择结果。团队要提前区分主要、次要和探索性比较,选择与问题和领域规范相符的控制或解释策略。
模型选择也不能只比较拟合优度。复杂模型可能在当前数据拟合更好,却泛化更差或无法解释;把全部候选变量交给自动选择,可能产生不稳定系数和过度自信的区间。预测任务需要独立验证或适当重采样,解释任务要依据因果和设计结构确定变量角色。
填写完成的统计分析与诊断清单
主要研究问题:
实验或观察单位:独立/配对/重复测量/聚类
主要结局及尺度:
主要比较或参数:
预先协变量及依据:
数据版本与纳入数量:
缺失、异常和排除规则:
候选模型及选择依据:
需要检查的模型假设:
主要效应量、区间和单位:
p值在本分析中的作用:
多重比较处理:
敏感性分析:
探索性分析及其标记:
代码、软件、包和版本:
测试数据与期望结果:
独立复算的统计量:
统计负责人和核验日期:
结果从代码进入论文前要逐项对账
统计输出完成后,建立一个结果登记表:结果编号、数据版本、代码版本、分析人群、模型、主要估计、区间、单位、图表位置和核验状态。正文和摘要只能引用登记表中的已核验结果。这样修改模型或数据以后,可以明确知道哪些数字、图和句子必须更新。
彭越的主要比较若从“处理组减对照组”变成“对照组减处理组”,效应符号会反转,而 p 值可能不变。只看显著性很难发现这种错误。对账时要同时核对组别顺序、参照、方向、单位和样本数,并从原始数据抽取少量记录手工验证。图上的点数、表中分母和模型实际使用行数也应一致。
独立核验不一定要求另一团队重写全部代码。可以用第二种函数复算一个关键效应,用人工可计算小样本验证公式,或让另一名分析者从冻结数据和说明运行主脚本。若两种实现结果不同,应先查清差异,不得选更符合预期的一种。
写作必须保留统计不确定性
AI 常把“估计值为正但区间很宽”压缩成“处理有效”,把“未达到阈值”压缩成“没有差异”。结果段应先报告对象、比较、效应量和不确定性,再说明探索或敏感性分析;讨论段才结合设计、偏倚和外部证据解释。统计显著、实践重要和因果可信是三个不同判断。
对于多个模型,不要在正文只呈现最有利的一项。主要模型按计划报告,合理敏感性分析说明结论是否稳定,探索性结果明确标记。若结果对某条无法核验的数据处理规则高度敏感,诚实结论可能是“证据不足以稳定判断”,而不是继续让 AI 寻找另一个模型。
投稿前将摘要数字、正文、表格、图注和补充材料交叉检查。常见错误包括四舍五入不一致、样本数随模型变化但未说明、置信区间和 p 值来自不同模型、图例颜色对应相反、更新正文后摘要保留旧结果。AI 可以执行字符串和结构检查,最终仍由作者确认科学含义。
分析失败也要产生可交付记录
有些数据无法支持原计划模型:样本或事件太少、模型不收敛、关键组完全分离、缺失模式破坏比较。此时不能让 AI 不断更换算法直到出现数字。应记录失败模型、诊断信息、尝试过的合理修正、为什么仍不可用,以及因此能够回答的更窄问题。
例如三组实验中某一组只有两个有效生物重复,复杂模型即使输出系数,也难以提供可信精度。团队可以透明报告数据损失和描述性结果,或者在方案允许且科学合理时补充实验;不能把技术重复扩成独立样本,也不能隐去该组。分析失败是研究结果的一部分,不是需要由模型“修好”的格式问题。
当发现主要分析与预注册或方案不一致,要区分是实现错误、数据现实导致的必要调整,还是看到结果后的探索选择。修正错误并重跑;必要调整说明理由与影响;探索选择明确降级。保存这些决定,能防止 AI 在生成方法段时把所有步骤写成预先计划。
给AI的统计解释任务也要设边界
如果让 AI 辅助解释,只向它提供已核验的结果登记表、研究设计和限制,不允许从变量名猜机制,也不允许新增来源。输出格式可要求逐条写“观察结果—允许解释—替代解释—不能声称”。这样它提供的是讨论候选,而不是替作者作统计结论。
任何涉及临床意义、政策效应、生物机制或因果推断的句子,都要由相应领域人员核查。统计模型描述的是在假设和数据条件下的估计;它不会自动赋予实际重要性,也不会替研究设计消除偏倚。
必须停止并转交统计人员的情况
- 不清楚实验单位、配对、聚类或重复测量关系;
- 主要结局和比较在看到结果后才决定;
- 样本量很小,却拟合大量参数或进行大量亚组分析;
- 缺失和排除与结局有关,但团队不知道怎样处理;
- AI 生成的结果无法由另一种方法复算;
- 模型诊断明显失败,只通过不断变换追求显著;
- 团队无法解释效应量、区间、模型系数和适用范围;
- 研究涉及复杂因果、纵向、空间、生存、组学或高维数据,而没有相应专长。
停止不是放弃数据,而是防止不透明分析进入科学记录。AI 可以减少代码劳动,不能降低统计推断所需的设计和专业判断。