核心结论

AI 可以帮助研究者扩展概念、发现变量和比较不同问题表述,但不能替研究者决定什么问题值得研究。把一个宽泛方向变成可执行研究问题,需要依次确定研究对象、核心现象或干预、比较关系、结局、时间与情境,并用可行性、伦理和研究价值进行筛选。

最容易犯的错误,是让 AI 先生成几十个“创新题目”,再从中挑一个看起来新颖的标题。标题可以很快生成,研究问题却必须能导向明确的证据、数据和研究设计。无法说明怎样观察、比较或检验的问题,还不是可执行的研究问题。

方向、题目和研究问题不是一回事

“AI 与睡眠健康”是研究方向;“人工智能时代大学生睡眠研究”是题目表达;“在某类学生中,某种可测量暴露与某个睡眠结局之间存在什么关系”才接近研究问题。

研究问题至少要约束六个要素:

  • **对象:**研究谁、什么材料或什么系统;
  • **现象或干预:**关注哪一种暴露、机制、方法或措施;
  • **比较:**与谁、什么状态或什么方法比较;
  • **结局:**用什么可以观察的结果回答问题;
  • **时间:**在哪个时间范围或阶段观察;
  • **情境:**结论适用于什么地区、机构、学科或条件。

不同研究设计不一定需要把六项全部写进一句话。例如探索性定性研究可能没有预先固定的比较组,基础机制研究也不适合生搬硬套临床 PICO。框架的作用是暴露缺失信息,不是迫使所有学科使用同一个句式。

AI适合做“扩展”和“质疑”

在问题形成阶段,AI 有三类有用角色。

第一,扩展概念语言。研究者提供一个初步方向和几篇可靠种子文献后,AI 可以列出同义词、上位概念、相邻机制和不同学科用语,帮助发现自己没有采用的表达。

第二,提出替代解释。研究者认为 A 影响 B 时,可以要求 AI 列出可能同时影响 A 和 B 的因素、反向关系和测量偏差。候选仍需通过领域知识和文献验证,但它能帮助研究者避免过早锁定单一解释。

第三,做可执行性压力测试。让 AI 按对象来源、样本规模、测量工具、时间、伦理和分析能力逐项提问,比让它直接“优化题目”更有价值。

教学案例:从“AI与睡眠”收敛问题

**教学模拟案例:**护理学硕士生许澄关注生成式 AI 使用与研究生睡眠,希望在一个学年内完成论文。她能接触本校两个学院的研究生,但没有条件做长期临床随访,也不能获取平台后台使用日志。

她最初向 AI 输入:“请给我十个关于 AI 使用影响睡眠的创新选题。”AI 返回了“生成式 AI 依赖对研究生睡眠质量的影响机制”等题目。问题在于,“依赖”没有操作性定义,“影响机制”暗示因果,而她能做的很可能只是一次或两次问卷观察。

许澄改用研究问题定义卡。

字段当前填写仍需确认
研究对象本校两个学院全日制硕士研究生招募数量与代表性
核心暴露自报的晚间生成式AI使用频率与用途是否有可靠测量题项
比较不同晚间使用频率组,或同一人的不同时段设计允许哪一种比较
主要结局经验证量表测得的睡眠质量量表授权与中文版适用性
时间一个学期内两次测量失访和考试周影响
情境两个学院,不外推全部研究生学科差异怎样描述
潜在混杂课程压力、咖啡因、既往睡眠问题、总体屏幕时间哪些能可靠测量

基于现有资源,她把问题改为:“在本校两个学院的全日制硕士研究生中,一个学期内晚间生成式 AI 使用频率的变化,是否与睡眠质量评分的变化相关?”

这个问题没有使用“依赖”“机制”或“导致”,因为现有设计无法支持这些强结论。它明确了对象、暴露、结局、时间和关系类型,也暴露了下一步必须解决的测量与样本问题。

用结构框架,但不要套错框架

临床干预问题常使用 PICO:人群、干预、比较和结局;加入时间后常写作 PICOT。它适合帮助定义治疗、诊断或服务效果问题,但不是普遍适用于所有研究的唯一格式。关于研究问题框架的综述也指出,不同证据和研究类型需要对 PICO 作调整或采用其他框架。

可以按研究类型选择提问方式:

  • 干预效果:对象、干预、比较、结局、时间;
  • 观察关联:对象、暴露、比较或变化、结局、情境;
  • 诊断或预测:目标人群、指数方法、参照标准、目标结局;
  • 定性探索:参与者、关注现象、情境、希望理解的经验或过程;
  • 方法比较:数据或任务、候选方法、基准、评价指标和使用条件;
  • 基础机制:系统、操控因素、对照、可观察反应和排除替代解释的证据。

让 AI 先判断问题属于哪一类,并说明为什么,比直接要求它套一个熟悉缩写更稳妥。分类不确定时,应保留多种表述交给导师或领域专家讨论。

问题还要通过FINER检查

结构完整不代表值得做。FINER 常用于检查问题是否可行、有趣、新颖、合乎伦理且相关。这里的“新颖”不是要求世界上从未有人涉及,而是当前研究能增加什么可靠认识。2024 年的研究问题指导文章把 PICO 等结构与 FINER 的实践筛选结合使用。

许澄的检查如下:

维度证据当前判断
可行可接触两个学院;可在一个学期两次测量有条件可行,需先估算招募与失访
有意义晚间使用行为可能与学习和睡眠管理有关需要避免把相关写成危害结论
新增认识现有讨论多为一般屏幕时间,生成式AI的使用目的可能不同必须通过系统检索核验,不能凭AI判断
伦理问卷风险较低,但涉及心理和健康信息仍需正式伦理审查与数据保护安排
相关对研究生支持服务可能有解释价值结论只适用于当前样本与测量

AI 可以帮助为每一格提出核查问题,却不能把“可能有价值”自动标成通过。可行性需要真实招募资源,伦理需要正式审批,创新性需要文献证据。

从问题反推“需要什么证据”

一个好问题应当能够反推研究设计和数据。如果研究者无法说出什么观察会支持、削弱或无法回答这个问题,问题仍然太模糊。

对许澄的问题,至少需要:两次时间点的 AI 使用测量、同一时间点的睡眠质量、关键混杂信息和个体匹配标识。如果她最终只能获得一次横断面问卷,就不能继续使用“变化是否相关”的问题,必须调整问题或改变数据获取方案。

同样,如果暴露只能问“是否使用过 AI”,却在题目中讨论“晚间频率和用途”,测量与问题就不一致。AI 可以做一致性检查,但实际量表、样本和伦理条件必须由研究者确认。

不要过早只留一个问题

问题形成不是一次措辞优化。更稳妥的做法是同时保留两到三个结构不同、但都能用现有资源回答的候选问题,再比较各自需要的数据和能够支持的结论。许澄可以形成三个版本:横断面比较晚间使用频率与睡眠评分;两次测量比较二者的共同变化;定性访谈理解学生为什么在睡前使用生成式 AI。三个问题都围绕同一方向,但需要不同样本、测量和分析,不能合成一句“全面研究影响机制”。

AI 在这里可以把每个候选转换成一张“问题—证据—设计”对照表,暴露真正的取舍。

候选问题必要数据可以回答不能回答主要负担
单次问卷中的频率与睡眠评分关系一次暴露、结局和混杂测量当前样本中的横断面关联时间顺序与因果招募较容易,解释受限
一学期两次测量的共同变化两次可匹配测量、失访记录个体变化是否相关未控制混杂下的因果需要追踪与处理失访
睡前使用体验的定性探索目的抽样访谈与反思记录行为情境、动机和体验关联大小和人群比例转录、编码与解释工作

选择哪个版本,应由研究价值与真实资源共同决定。不能因为 AI 把第二个写得最像“高级研究”就忽略追踪条件,也不能因为第一个最省事就夸大它能够回答的问题。

用小型可行性检查决定问题能否落地

正式冻结问题前,可以做不涉及正式假设检验的可行性检查:确认目标人群是否愿意参加;题项是否能区分晚间与全天使用;量表授权和语言版本是否可用;两次测量能否可靠匹配;团队是否具备计划中的分析能力。这里可以使用模拟数据检查表结构和分析流程,但模拟结果不能当作研究发现。

假如五名试填者都无法回忆“过去一个月每天使用分钟数”,暴露定义就需要调整;如果学校只能支持一次匿名调查,纵向问题必须退回;如果关键量表不可合法使用,应在收集数据前更换测量或问题。AI 可以归纳试填反馈和列出修改候选,不能自行宣告量表有效或样本可行。

冻结研究问题时,保存版本、日期、批准人和修改理由。之后若因招募或数据质量调整,应同时记录问题、结局和分析计划受到什么影响。这样论文才能如实区分原计划、实施中的变化和看到结果后的解释,避免把事后形成的问题伪装成预先设定。

三种应当放弃或退回的问题

结论预设在问题里

“生成式 AI 依赖为什么损害睡眠”已经假设存在依赖和损害。除非有足够前期证据,研究问题应允许不同方向或没有关联的结果。

研究尺度超过资源

“全球不同文化中 AI 使用对长期健康的因果影响”可能有价值,但不适合一个只能接触两所学院、持续一个学期的硕士项目。缩小问题不是降低水平,而是让结论与证据匹配。

关键概念无法测量

“高质量科研思维”“AI 依赖”“创新能力”等概念如果没有清楚定义和可用测量,AI 再多生成变量也无法补救。应先做概念澄清、量表核验或探索性研究。

可直接复用的研究问题定义卡

宽泛方向:

研究对象:可以实际接触或观察谁/什么?
核心现象、暴露、干预或方法:
比较关系:与什么比较,或观察什么变化?
主要结局:怎样测量,单位或评价标准是什么?
时间与情境:结论限定在哪里?

候选替代解释:
需要控制或记录的混杂因素:
什么结果会支持、削弱或无法回答问题:

可行性:样本、时间、预算、技能和数据权限是否具备?
伦理:需要什么审批、同意和保护?
新增认识:相对于现有证据增加什么,而不是只换对象?
研究价值:谁会因答案而改变理解或行动?

最终研究问题:
当前不能声称的结论:
进入研究设计前必须确认的事项:

这张卡完成后,AI 可以继续帮助检查遗漏和生成多个等价表述,但最终问题要由研究者、导师和需要时的统计或伦理人员确认。文章到这里的停止点是“问题已经可定义、可核查、可实施”;它是否真正构成研究空白,需要进入下一篇的创新性证据核验。