核心结论
AI 检查研究设计时,最适合发现“链条不对齐”:研究问题要求一种证据,实际样本、变量、设计和分析却只能提供另一种证据。检查顺序应从问题和目标开始,依次核对假设、对象、变量、比较、时间、偏倚控制和分析,而不是先让 AI 推荐一种高级模型。
AI 可以提出遗漏、反例和替代解释,不能批准伦理、确定样本量或替代领域与统计判断。设计检查的最终产物是一张一致性表,明确每个主张靠什么数据回答、哪些风险已控制、哪些问题必须在收集数据前解决。
从“想证明什么”改成“什么证据能回答”
研究计划常把目标写成“探究影响机制”“验证效果”“预测风险”,但实际设计可能只有一次问卷、便利样本或不完整的历史数据。AI 容易顺着目标语言生成复杂方法,掩盖证据类型不匹配。
第一步应把问题改写成可观察关系,再判断设计支持哪种推断:
- 描述问题需要有定义明确、覆盖目标对象的测量;
- 关联问题需要明确变量、时间和混杂;
- 因果问题需要合理的比较、时间顺序和对替代解释的控制;
- 预测问题需要区分开发与验证,检查泛化和校准;
- 机制问题需要直接测量或操控机制,而不是只观察两个变量相关。
如果现有资源只能回答关联,就应调整研究问题和论文措辞,而不是要求 AI “设计一个因果模型”来升级证据。
一致性链的八个节点
- 研究问题和主要目标;
- 可检验假设或明确的探索目标;
- 目标对象、样本来源和纳入排除;
- 暴露、干预、比较和结局的操作性定义;
- 时间顺序、随访和测量时点;
- 选择、信息、混杂和实施偏差的控制;
- 与数据结构匹配的分析和缺失处理;
- 结论允许达到的强度和适用范围。
任何相邻节点断开,后面的模型和写作都无法补救。
教学案例:纵向问卷计划中的断点
**教学模拟案例:**心理学团队计划研究新入职教师的工作自主性与职业倦怠变化,准备在入职、三个月和六个月收集问卷。研究者希望 AI 检查方案,并问“应该用结构方程还是机器学习”。
AI 最初推荐了交叉滞后模型和随机森林,但没有指出三项基础问题:团队的主要问题在不同文档里分别写成预测、影响和双向关系;工作自主性量表只计划在基线测量;预计样本 90 人,却没有估算三次随访失访。
团队先填一致性表:
| 节点 | 当前方案 | 发现的问题 | 处理决定 |
|---|---|---|---|
| 主要问题 | 自主性变化是否与倦怠变化相关 | 需要两者重复测量 | 三个时点都测两项 |
| 主要假设 | 较高自主性与随后较低倦怠相关 | 尚不能证明因果影响 | 使用时间先后语言,保留混杂限制 |
| 样本 | 两个地区的新入职教师 | 招募渠道可能造成选择 | 记录未参与原因与样本覆盖 |
| 时间 | 0、3、6个月 | 学期阶段可能与时间重合 | 记录学期节点并在解释中限制 |
| 测量 | 两项量表 | 量表版本和跨时可比性未确认 | 先核验授权、信效度和测量一致性 |
| 缺失 | 尚无规则 | 离职者可能更易失访 | 预先记录原因并设计敏感性分析 |
| 分析 | 未确定 | 模型选择早于问题和样本评估 | 由统计负责人基于最终问题与样本计划确定 |
设计检查改变的不是模型名称,而是采集计划。如果等数据收完才发现自主性只测了一次,就永远无法回答“共同变化”。
让AI做压力测试,而不是替你选答案
可以要求 AI 从四个角度攻击方案:
反向关系
职业倦怠是否会影响教师对自主性的评价?如果可能,设计怎样提供时间顺序或替代解释的证据?AI 提出的反向关系是候选,研究者再用理论和文献筛选。
未测混杂
学校支持、教学负荷、合同稳定性等因素是否同时影响自主性和倦怠?不是把所有候选变量都塞进模型,而是明确哪些是理论上关键、能可靠测量且应在方案中处理。
测量失败
量表是否在目标语言和人群中适用;重复测量会不会产生反应偏差;同一测量者和同一时间是否造成共同方法问题。AI 不能仅凭量表名称确认有效性。
实施失败
招募不足、失访、时间点偏移或某地区无法继续参与时,主要问题还能否回答?提前定义最低可行条件和停止规则。
报告指南不能替代设计
EQUATOR Network按随机试验、观察研究、定性研究、诊断研究等提供报告指南。它们可以在设计阶段帮助发现将来必须透明报告的信息,但主要功能是改善报告,不是证明研究已经设计合理。
例如 STROBE 提醒观察研究报告参与者、变量、偏倚和统计方法;使用清单仍不能把横断面研究变成因果实验。AI 可以把方案与相应指南逐项比较,输出“已说明、未说明、不适用、需专家判断”,不应自动生成一个质量总分。
样本量不能由AI随口给数字
样本量依赖主要结局、设计、预期效应或精度、变异、聚类、重复测量、失访和分析计划。AI 可以解释需要哪些参数、生成计算代码并检查输入是否齐全,但参数应来自合理的先验研究、试点或明确假设,并由统计人员复核。
NIH 关于严谨性和透明度的资源强调随机化、盲法、样本量估计、纳排标准和完整统计报告等要素。不同领域的具体做法不同,但“先定义、后执行、透明报告”是共同原则。
设计变更要区分看结果之前和之后
研究中合理调整不可避免,但看到主要结果后修改结局、纳排或模型,会产生选择性解释风险。每次重要变更应记录:原计划、变更内容、日期、是否已查看结果、原因、批准人和对分析的影响。
AI 可以比较方案版本并生成差异清单,不能自动把新版本改写成“原本就这样设计”。论文方法应区分预先计划和探索性分析。
用一份模拟结果检验设计能否回答问题
在真实数据收集前,可以构造几种可能结果,对设计做“反向演练”。例如:两项变量都没有变化;自主性先变化、倦怠后变化;二者只在一个地区共同变化;失访主要发生在高倦怠教师中。团队逐种询问现有测量和分析能够支持什么、还会有哪些替代解释。
这个练习不用于预测最终结果,而是暴露信息缺口。若“只有一个地区出现关联”时团队才发现地区样本极少,说明分层结论不能作为预设主要目标;若高倦怠者失访就无法识别,说明必须改进失访原因和基础信息记录;若两项量表跨时含义变化,简单比较分数变化可能不成立。
AI 可以快速生成边界情境和待核问题,但不得用模拟数据估计真实效应,也不能把演练后的有利路径写成主要假设。所有设计修正仍要由团队按理论、资源与伦理条件决定。
演练结果最好形成一张决定表,而不是留在讨论里。例如“若六个月失访超过预设范围,则主要结论只针对完成随访者,并执行预先定义的缺失敏感性分析”;“若量表跨时结构不稳定,则不解释原始分数变化,先由测量专家评估”。阈值和处理不能照抄示例,应根据领域、设计和统计计划确定。
这一过程还会揭示无法通过分析补救的缺陷。没有收集时间顺序,就不能靠更复杂模型创造时间顺序;没有可靠对照,就不能靠 AI 选择协变量制造随机化;测量概念错误,也不能靠增加样本纠正。遇到这类断点,应在数据收集前改变设计或缩小问题。
建立“设计决定—执行证据”对照
方案通过以后,每项关键决定都应对应一种执行证据。决定三个时点测量,就要有调查版本、发送日期和实际完成记录;决定控制批次,就要有批次字段和分析代码;决定盲法,就要记录谁在何时不知道哪些信息;决定预注册主要结局,就要能保存注册版本与时间。
AI 可以在研究进行中比较“方案承诺”和“当前材料”,标记尚无执行证据的项目。例如方案说记录不参与原因,但招募表没有相关字段,问题应在招募尚未结束时修复。它不能自动生成一条看似完整的执行记录填空。
这张对照也帮助写作。方法段描述实际完成了什么,而不是照抄计划;偏离项进入变更日志并说明影响。这样即使设计因现实条件调整,读者仍能区分计划、执行和事后解释。
设计冻结时,可邀请未参与最初讨论的领域、统计或实施成员进行一次红队检查。让其只依据方案回答:主要问题是什么,哪项数据回答它,最严重的偏倚是什么,什么情况会使研究无法回答。若答案彼此矛盾,说明方案虽然篇幅完整,一致性链仍未建立。
必须停止并寻求专业支持的情况
- 研究问题要求因果或机制结论,现有设计没有合理比较和时间顺序;
- 主要结局、纳入排除或核心变量仍没有操作性定义;
- 样本量参数来自 AI 猜测或无关研究;
- 涉及参与者权益,但伦理审批和知情同意路径不清;
- 团队无法判断统计模型、聚类、重复测量或缺失机制;
- 关键测量工具没有授权、适用性或可解释性依据;
- 数据已经收集完,AI 却建议删除不利样本或更换主要结局。
此时应退回问题定义、方案设计、统计咨询或伦理审查。不能把高风险决定包装成“AI建议”。
可直接复用的研究设计一致性表
主要研究问题:
允许的结论类型:描述/关联/因果/预测/机制/探索
主要假设或探索目标:
目标对象与样本来源:
纳入排除及其依据:
比较或对照:
主要结局及操作性定义:
暴露、干预和关键协变量:
测量时点和时间顺序:
主要偏倚来源:
对应的设计控制:
仍无法控制的限制:
主要分析与数据结构怎样匹配:
样本量或精度依据:
缺失、异常和方案偏离怎样处理:
什么结果能回答问题:
什么情况无法回答问题:
收集数据前必须解决:
需要领域/统计/伦理人员放行:
研究设计检查完成的标志,是每个主要结论都能沿链条回到相应对象、变量、比较和分析;链条断裂处要么在数据收集前修复,要么明确缩小研究问题。