核心结论
AI 能帮研究者把一个宽泛方向展开成若干可能的问题,也能指出其中缺失的对象、测量和替代解释。但它生成一句像论文标题的话,不代表这句话已经能够研究。真正可用的研究问题,应当反推出需要什么样本、收集哪些数据、采用什么设计,以及最后哪些结论仍然不能说。
把方向收窄时,最实用的产物不是十个“创新选题”,而是一张研究问题定义卡。卡片上同时放入现实限制:能接触谁、能测几次、量表是否可用、伦理上能否收集,以及什么结果会回答不了问题。AI 提供候选,研究者用真实条件作决定。
“AI 与睡眠”还不是一个研究问题
下面是一项教学场景。一位护理专业硕士生想研究“AI 与睡眠健康”。她只有一个学年,可以接触本校两个学院的全日制硕士研究生,无法取得平台后台日志,也做不了长期临床随访。
她最初请 AI 提供十个创新选题,得到的其中一句是:
生成式 AI 依赖对研究生睡眠质量的影响机制研究
这句话很像题目,却预先埋进了三个尚未解决的判断。“依赖”没有操作性定义;“影响”暗示时间顺序甚至因果;“机制”要求的证据远超一两次问卷。若研究者直接围绕它写方案,后面很可能出现一个标题讨论机制、数据却只能展示相关性的项目。
她先把目标改成一个较朴素的问题:在自己能够接触的人群和时间内,晚间使用生成式 AI 的变化,是否与睡眠质量评分的变化有关。这个版本仍需核验,但至少开始约束数据,而不只是修饰题目。
定义卡先把现实条件放进来
研究者填写了下面这张卡。右侧不是留给 AI 自动补全的空白,而是她在见导师、查量表和做可行性测试时要逐项解决的事情。
| 项目 | 当前定义 | 仍需确认 |
|---|---|---|
| 研究对象 | 本校两个学院的全日制硕士研究生 | 预计招募人数、两个学院的差异和结论适用范围 |
| 核心暴露 | 自报的晚间生成式 AI 使用频率及主要用途 | 是否有能被受试者稳定回答的题项 |
| 主要结局 | 经验证量表测得的睡眠质量 | 中文版本、授权和本研究人群中的适用性 |
| 时间 | 一个学期内测量两次 | 失访、考试周与两次测量的匹配方式 |
| 关系 | 比较同一个人暴露和睡眠评分的共同变化 | 当前设计只能支持关联,不能直接声称因果 |
| 可能混杂 | 课程压力、咖啡因、既往睡眠问题、总体屏幕时间 | 哪些因素能够可靠测量并进入分析 |
| 可行性 | 学院渠道可以协助招募,项目周期为一个学年 | 实际响应率和第二次测量保留率 |
| 伦理与数据 | 涉及行为及健康问卷 | 正式伦理审查、知情同意和数据保护安排 |
| 当前问题 | 在上述学生中,一个学期内晚间生成式 AI 使用频率的变化,是否与睡眠质量评分的变化相关? | 导师、测量与可行性核验后冻结 |
| 当前不能声称 | 生成式 AI 导致失眠;存在“AI 依赖机制”;结论适用于所有研究生 | 后续研究也不能越过实际设计 |
这张卡没有强迫所有研究问题使用同一种句式。干预研究常关心人群、干预、比较和结局,定性研究可能没有预设比较组,基础机制研究又需要操控和排除替代解释的证据。框架的作用是暴露缺项,不是把所有学科塞进一个缩写。
研究问题框架综述讨论了不同证据与问题类型所需的框架差异。对本案例而言,决定采用“对象—暴露—变化—结局—时间”这一写法,是因为她计划观察关联,而不是因为某个框架听起来更标准。
从问题倒推数据,第一次版本就遇到了障碍
定义卡填完后,研究者试着逐项列出回答问题所需的数据:两次晚间 AI 使用测量、两次睡眠评分、个体匹配标识、关键混杂信息和失访记录。很快就发现,原来准备的一道题“你是否使用过生成式 AI”无法回答频率变化,更无法区分晚间使用和白天使用。
她先请五名同学试填一组教学题项。这个数字只用于说明可行性检查,不是正式研究样本。最初的问题要求回忆过去一个月每天使用 AI 的分钟数,试填者普遍无法稳定估计;有人把上课使用算进去,有人只计算睡前使用。AI 把反馈归纳成“用户记忆存在偏差”,但这句话还不足以改量表。
研究者回到原始反馈,发现真正不一致的是时间窗口和使用情境。她把暴露定义收窄为“通常在计划睡觉前两小时内使用生成式 AI 的天数和主要用途”,并保留“不确定/无法回忆”的回答,而不是逼参与者给一个精确分钟数。改后的题项再次试填时,研究者检查大家是否按同一时间窗口理解;这一步通过,才把修改写回定义卡。
原题项
过去一个月,你每天使用生成式 AI 多少分钟?
AI 的初步归纳
受试者存在回忆偏差,建议使用更精确的分钟分档。
人工核对后的问题
回答者对“全天还是睡前”理解不一致,精确分档不会解决口径问题。
修正
限定计划睡觉前两小时;记录每周使用天数和主要用途;允许无法回忆。
这个修正也改变了研究问题中的措辞。若最终测到的是每周晚间使用天数,题目就不能继续写成“AI 依赖程度”。问题、题项和分析变量必须说的是同一件事。
研究者接着问自己:什么结果算是回答了问题?如果晚间使用天数增加的学生,睡眠评分也随之变化,这只是与当前问题一致的观察;若两者没有共同变化,同样是可报告结果。若第二次测量大量缺失,而且失访与第一次睡眠评分有关,现有数据可能无法可靠回答原问题。把第三种情况提前写进卡片,能防止项目结束时为了“有结论”而忽略数据已经失去回答能力。
替代解释也要落到可收集的变量上。课程压力、咖啡因和总体屏幕时间并不是列得越多越好;团队要确认题项、测量时间和样本规模是否允许分析。AI 提出“学习动机、人格、宿舍噪声、运动、饮食”等更长清单时,研究者没有全部加入问卷,而是请导师和统计人员判断哪些因素与当前因果解释最相关、哪些能够可靠测量。无边界地增加协变量,会让一份可做的问卷重新失控。
保留几个候选,才能看见真正的取舍
导师讨论时,研究者没有只拿一个已经润色好的问题,而是保留了三种可能:一次问卷比较晚间使用频率与睡眠评分;两次测量观察二者是否共同变化;访谈学生为何在睡前使用生成式 AI。
三个版本围绕同一方向,却会产生不同证据。一次问卷最容易实施,只能描述当前样本中的横断面关联;两次测量增加时间信息,但需要匹配个体并处理失访;访谈能够理解用途和体验,不能估计关联大小。把三者合成“全面揭示影响机制”,只会让一项硕士研究同时背上三套无法完成的承诺。
研究者原本偏向两次测量,因为它看起来比横断面研究更完整。真正的取舍来自学校能否支持第二轮联系,以及失访会不会使两次数据失去可比性。她先确认招募渠道、学期安排和匿名匹配方式,再决定保留纵向版本。AI 可以列出每个候选需要的材料和风险,却不能替学校承诺资源,也不能替伦理审查放行。
讨论中还有一个容易被题目掩盖的选择:晚间使用可能用于赶作业、聊天、查资料或情绪支持,这些情境与睡眠的关系未必相同。若问卷只记录总频率,研究者以后不能根据结果再声称某种用途是机制。因此卡片把“主要用途”列为描述性信息,并明确当前样本不足以对许多小组分别作强推断。这个限制反过来让题目保持在“使用频率变化与睡眠评分变化”上。
关于研究问题形成的实践文章把结构化问题与可行、相关、合乎伦理等检查联系起来。这里的“可行”不能由模型根据一句“有两个学院”自动判定;它要落到招募、测量次数、授权、技能和时间表上。
什么情况下要把问题退回来
如果学校最终只能支持一次匿名调查,定义卡中的“两次变化”便无从回答。研究者可以改做横断面关联,清楚降低结论强度;也可以调整数据获取方案。不能保留纵向题目,再用一次问卷结果勉强作答。
另一个停止点是测量。若睡眠量表不能合法使用,或晚间 AI 使用始终无法形成可理解的题项,就先处理测量问题。AI 再生成十个变量名,也不会让一个含义不稳定的概念变得可测。
伦理批准也不是卡片里可以事后打勾的一项。问卷涉及健康信息,招募又通过学院渠道,团队要考虑学生是否会感到必须参加、联系方式和研究回答如何分开、匿名匹配码能否被反推。若这些安排不能得到正式审查和可执行保护,问题即使结构完整也不能进入收集阶段。AI 可以帮助检查说明中是否漏项,不能作出伦理批准。
问题中预设结论时也要退回。“生成式 AI 依赖为什么损害睡眠”不允许出现没有损害、反向关联或共同原因等结果。现有证据不足以预设这些关系时,研究问题应允许多种方向,也允许观察不到关联。
创新性则是下一项工作。当前卡片只证明问题与可取得的数据比较匹配,不证明世界上没人做过。她需要另做检索和相近研究比较,才能说明项目增加什么认识;这也避免本文与创新性核验混成一篇。
冻结问题时,卡片给出了一个可以执行的版本
经过试填、导师讨论和资源确认后,研究者冻结当前问题,并记录版本、日期和批准人。她同时保存了两项限制:样本来自两个学院,不能外推全部研究生;观察性数据支持变化之间的关联,不能直接证明生成式 AI 导致睡眠变化。
定义卡还写明了三个后续触发条件:第二轮联系无法实现时退回横断面版本;量表授权或适用性不成立时更换测量并重新审查问题;正式检索发现当前关系已被充分研究时,另做创新性判断。这样,冻结不是把一句题目锁死,而是说明当前版本在什么现实条件下有效。
从这句话已经能够反推下一步:招募谁、测量哪两个时间点、怎样匹配记录、收集哪些混杂信息、使用什么结局量表。若后续招募或数据质量迫使问题改变,定义卡也要说明哪些变量、分析和已写文字受到影响。
AI 在这里没有替她“找到最佳选题”。它帮助暴露了原题中的含糊、整理试填反馈并比较候选。最终留下的是一个资源允许、数据能够回答、结论边界写得明白的研究问题。