核心结论
用 AI 检查研究设计,不应从“选什么高级模型”开始。先看研究问题需要哪一种证据,再检查样本、变量、比较、时间和分析是否真的能够提供这种证据。任何一处断开,模型再复杂也补不回没有收集的数据。
AI 适合提出反向关系、未测因素和实施失败情境。研究者把这些疑点放进一张设计一致性表,由领域、统计和伦理人员分别确认。最终产物不是一串方法建议,而是一份在数据收集前已经修过断点的方案。
团队先问模型,AI 先推荐了模型
下面是一项教学设计。团队准备在新教师入职、三个月和六个月时调查工作自主性与职业倦怠,研究两者怎样随时间共同变化。预计可招募约 90 人,样本来自两个地区。
最初的提问是:“应该用交叉滞后模型还是机器学习预测倦怠?”AI 很快比较了几种模型,却没有拦住更早的设计问题:不同文档把目标分别写成预测、影响和双向关系;工作自主性原计划只在基线测一次;团队没有估计三次随访的失访。
原方案
问题:工作自主性是否影响职业倦怠?
测量:倦怠测三次;自主性只在入职时测量。
样本:预计招募 90 人,未处理失访。
AI 第一次建议
比较交叉滞后模型与随机森林,以选择预测表现更好的方法。
人工核对
自主性没有重复测量,无法研究两项变量的共同变化;
90 人只是招募目标,不能当作三次分析样本。
团队暂停模型讨论,把主要问题改回可观察关系:较早时点的自主性是否与随后倦怠有关,以及两项指标的变化是否相关。这个问题仍不能自动证明因果,但至少能明确需要哪些时间和测量。
一张表让问题、数据和结论接起来
团队围绕当前问题填写设计一致性表。每一行都要求一个处理决定,不能只写“已考虑”。
| 设计位置 | 当前材料暴露的问题 | 收集前的处理决定 | 结论边界或执行证据 |
|---|---|---|---|
| 主要问题 | “预测”“影响”“双向关系”混用 | 冻结时间先后与共同变化两个判断,区分验证与探索 | 摘要不使用已证明因果的措辞 |
| 对象与样本 | 两地区渠道可能产生选择;90 人未扣失访 | 记录邀请、参加与失访原因;重新做精度和可行性评估 | 报告样本覆盖,不外推全部新教师 |
| 测量 | 自主性只计划基线测量 | 三个时点均测自主性与倦怠;核验量表版本、授权和跨时可比性 | 保存各时点问卷版本与实际发送记录 |
| 时间 | 0、3、6 个月可能与学期阶段重合 | 记录学期节点和实际测量日期 | 解释中保留时间与学期无法完全分开的限制 |
| 混杂与反向关系 | 学校支持、负荷和合同稳定性可能同时影响两项指标;倦怠也可能改变自主性感受 | 按理论和可测量性预先选择变量,不把 AI 候选全部塞入模型 | 保存选择依据与未测因素 |
| 缺失 | 离职或高倦怠者可能更易失访 | 预先记录失访原因并规划敏感性分析 | 不能把完成随访者默认为原样本代表 |
| 分析 | 模型选择早于问题和数据结构 | 由统计负责人根据最终问题、重复测量和可得样本确定 | 代码与诊断对应冻结的分析说明 |
| 停止点 | 量表不可用、随访无法实施或实际样本不足 | 在收集前改问题或设计;分析条件不足时不强行拟合 | 记录谁批准变更以及是否已看结果 |
这张表的价值首先体现在采集计划。若自主性仍只测一次,团队可以研究基线自主性与后来倦怠,却不能声称两者共同变化。收集完成后再要求 AI “构造一个纵向指标”,只会把缺失设计包装成新变量。
第一次逐项核对时,团队还发现“新教师”没有统一定义。招募说明把入职一年内的人算作新教师,问卷首页写的是三年内,分析草案则没有年限字段。如果三份材料照旧执行,纳入对象会随入口变化,之后无法判断差异来自研究现象还是样本口径。团队最终采用伦理申请中已经批准的定义,并把入职日期设为必填核验字段;不满足定义的记录不靠模型“判断是否像新教师”,而是按预先规则处理。
主要指标也经历了同样的核对。工作自主性并不是问卷中所有相关题目的平均值,职业倦怠也不能由模型从开放回答里自行归纳。团队列出正式量表版本、计分方向、分量表、允许缺失题数和分数解释,之后用几份人工构造的答案验证计分程序。一个反向题在 AI 初稿中没有倒分,使少量样本的自主性分数方向相反;程序能够运行,却回答不了预定问题。修正后,计分规则、测试样例和确认人一起保存。
这轮核对还改变了问卷发送方式。原计划允许参与者在任意日期填写“三个月问卷”,系统只看文件名区分时点。团队改为保存基线日期、目标窗口、实际完成日期和超窗原因。超窗记录不自动删除,而是在分析说明中预先约定主分析与敏感性处理。这样,所谓“三个月后的倦怠”才有可以检查的时间含义。
EQUATOR Network提供与不同研究设计对应的报告指南。团队用相关指南检查将来需要透明报告哪些参与者、变量、偏倚与分析信息,但没有把“清单填全”当作设计有效。报告完整可以让缺陷更可见,不能把观察研究升级成实验。
失败情境比一份顺利流程更能检查设计
表格初步完成后,团队让 AI 生成几种可能发生、而且会改变解释的情境:两项量表都没有变化;自主性先变、倦怠后变;变化只出现在一个地区;高倦怠教师更容易退出六个月随访。情境用于压力测试,不用于预测真实结果。
“高倦怠者更易失访”暴露出原招募表没有保存足以分析失访的信息。团队因此增加每轮联系状态、退出时间和可获得的原因,并明确这些信息如何与研究回答分开保护。AI 可以提示需要观察失访,伦理和隐私安排仍由团队批准。
“只有一个地区出现关联”又暴露出地区样本可能不足。如果研究问题预先承诺地区比较,预计样本和招募能力并不支持。团队把地区差异降为探索性描述,不在主要目标中承诺稳定分层结论。
如果量表跨时含义发生变化,简单分数差可能不再代表同一种构念。团队把测量一致性检查交给熟悉量表与统计方法的人员;无法判断时,不让 AI 根据常见教程自动选择检验,再把结果作为放行依据。
这些情境说明,有些问题可以通过补记录或收窄目标修正,有些必须改设计。没有时间顺序,分析不能创造时间顺序;没有可靠比较,协变量模型不会制造随机化;概念测错,增加样本也不会把它变对。
样本量和分析要等主要问题稳定下来
“预计 90 人”来自招募经验,不是样本量结论。重复测量设计需要考虑主要结局、预期精度或效应、相关结构、失访、模型复杂度和实际分析方式。AI 可以整理所需参数、起草计算代码和检查输入是否齐全,参数来源与最终计算由统计负责人确认。
NIH 关于严谨性与透明度的资源强调预先说明样本量、纳排、随机化或盲法等关键设计与分析信息。具体做法会随研究类型变化;在本案例中,最基本的要求是不能让模型根据“通常够用”给出一个人数,再把它包装成有依据的设计。
统计负责人先查看预计招募、各时点保留、主要参数和模型可识别性。如果现实资源无法支持原分析,团队有两个诚实选择:扩大资源或缩小问题。选择更简单模型或改成探索性分析可以合理,但要在查看主要结果之前说明。
研究中发生变更时,表中记录原计划、新决定、日期、原因、批准人和是否已经查看结果。AI 可以比较版本并列出差异,不能把新版本改写成“从一开始就这样计划”。方法部分最终报告实际实施,也区分预先与事后分析。
每项方案承诺都要找到执行证据
方案冻结后,团队继续用同一张表核对实施。写了三个时点测量,就应有三版问卷、发送日期和完成记录;写了失访原因,就应在联系记录中出现对应字段;写了量表版本,就能找到授权和正式文本;写了主要分析,就能对应到代码版本和诊断输出。
系统可以自动标出“方案承诺存在,执行材料缺失”的位置。例如方案要求记录未参加原因,招募系统却没有字段,这个缺口应在招募尚未结束时修复。AI 只能报告缺口,不能为已经错过的记录补一份看起来合理的执行证据。
一名未参加最初讨论的成员随后只看方案和一致性表,尝试回答四个问题:主要问题是什么,哪项数据回答它,最严重的偏倚是什么,什么情况会使项目无法回答。她最初无法判断“影响”是否指因果,促使团队统一了摘要、方案与统计说明中的措辞。
团队又让她从结论反推证据。她写下三个可能出现于论文摘要的句子:“自主性较高者随后倦怠较低”“自主性降低导致倦怠升高”“该规律适用于所有新教师”。只有第一句在测量、样本和分析条件满足时可能由当前设计支持;第二句越过了观察研究的因果边界,第三句越过了两个地区的样本边界。这个反推测试比单问“设计是否合理”更具体,也让后来参与写作的人知道哪些措辞不能因为结果显著就放宽。
设计检查最终改变了哪些事情
这次检查没有替团队选定某个复杂模型。它让自主性在三个时点重复测量,让失访和学期节点进入采集,让地区比较退出主要目标,并把样本量与分析交给有依据的统计评估。
最终问题、数据和结论边界能够相互对应:团队可以研究时间先后与共同变化,仍需承认观察设计、选择、混杂和测量限制。若随访无法执行或量表不适用,就在数据收集前退回问题,而不是等结果出来后让 AI 找一种能够“跑出答案”的方法。
一致性表到这里完成自己的任务。之后的统计建模另有分析说明与诊断,伦理审批也走正式流程;本文只确保它们接到一个数据能够回答的研究问题上。 如果其中一项仍接不上,方案继续修改,不以“后续分析时再处理”作为放行理由。