核心结论

AI 可以替定性研究者提出候选编码、寻找相似片段,也可以专门搜反例;它不能因为标签稳定或出现频繁,就宣布某个主题已经成立。主题是研究者结合问题、语境、差异和自身位置作出的解释,不是词频统计的升级版。

要让 AI 的参与可检查,最有用的不是一张“一致率”截图,而是一份编码备忘:每次接受、拒绝或修改 AI 建议时,都能回到完整访谈和当时的理由。下面用同一组访谈说明这份备忘怎样改变分析。

“即时支持”这个标签,合并了两种不同经验

教学案例有 20 份模拟访谈,讨论青年照护者怎样使用线上互助群。研究问题不是群里出现了哪些话题,而是参与者怎样理解“得到支持”,以及这种支持何时又变成新的照护责任。假定材料已经去标识化,并在获准环境中处理。

真实项目不能把“已经删掉姓名”当作上传许可。团队先对照知情同意、伦理批件和数据管理方案,确认这些材料是否允许由当前服务处理、服务是否保留输入、谁能访问以及怎样删除。访谈中的罕见疾病、具体机构、时间和家庭关系组合仍可能指向个人,因此去标识化检查按整段语境进行,不只运行姓名替换。

本案例只把完成检查的文本放入机构批准环境,参与者对应表留在隔离位置,工具使用随机访谈编号。研究者给模型的批次也只包含当前编码所需文本,不附联系方式、招募表或完整人口学字段。若许可不能覆盖这种处理,后面的编码方案再完善也不能让上传变得合规。

研究者先精读四份差异较大的访谈,记下信息支持、情绪承接、随时在线的压力、互惠义务和退出困难。这些只是初始代码,不是五个预定主题。之后,她让 AI 用同一版代码处理两份样本,并要求每项建议返回原句位置和不确定原因。

AI 把下面两段都标成“即时支持”:“晚上有人陪我聊两句,就没那么慌”和“管理员通常十分钟内回复服务申请”。从关键词看,两段都谈到快速回应;回到上下文,前者是被陪伴的感受,后者是服务效率。若合在一起,研究结果会把关系体验和平台功能压成同一件事。

研究者没有直接给 AI 加一个新标签,而是先检查其他访谈:这种差异是否反复出现,是否与研究问题有关,旧代码为什么容纳不了。确认后,她把原代码拆为“夜间陪伴感”和“服务响应效率”,并重看已经处理过的材料。

编码备忘保存的不是标签,而是判断过程

团队把这次变化和后续分歧写入同一份备忘:

记录原文与语境AI候选研究者决定对后续分析的影响
Q-016-01I05,夜间独自照护后的完整段落即时支持改为“夜间陪伴感”检索陪伴、在场和情绪承接的其他表达
Q-016-02I08,讨论平台办事速度即时支持改为“服务响应效率”不与关系体验合并计数
Q-016-03I07,“别人帮过我,我不回消息会觉得不应该”情绪压力同时编码“互惠义务”和“道德回应压力”不强制一段只有一个代码
Q-016-04I12,主动把群设为免打扰且无负罪感与主题不符保留为反例收窄“持续在线责任”的适用边界

每条记录保留访谈编号和段落位置,但最终用于论文的引文还要根据同意范围再次去标识化。AI 建议与研究者决定分列保存;否则批量重跑以后,团队会误以为某个标签一直来自人工阅读。

Q-016-03 暴露出模型喜欢单一、边界清楚的分类。这句话既表达压力,也说明压力来自已经接受帮助后的互惠关系。只留下“情绪压力”,就会删掉研究问题关心的关系机制。团队允许多重编码,并在后续材料中寻找支持和不支持这一解释的片段。

代码版本也随备忘保存。0.1 版来自四份人工精读;0.2 版拆开陪伴与服务效率;0.3 版明确互惠义务可以和道德回应压力并存。每次变更都列出受影响访谈,重新核对,而不是让 AI 在下一轮悄悄换一套更漂亮的词。

为了检查代码边界,团队为每个新代码保存一个正例、一个明确排除例和一个仍有争议的边界例。“互惠义务”纳入因过去受助而感到必须回应,排除一般的主动分享;“道德回应压力”纳入不回应时的内疚或规范期待,排除单纯被通知吵醒。AI 处理新批次前先在这些例子上试跑,若连排除例也反复纳入,就暂停批量编码并回到定义。

高频代码还不是主题

批量候选编码完成后,“信息支持”出现最多。如果按频次排序,它很容易成为文章的第一个主题。但研究者回看访谈时发现,真正贯穿多种经历的关系是:参与者通过互惠获得支持,也因此感到需要持续在线。

这个判断把几个代码组织成一个可讨论的主张。“信息支持”说明参与者得到什么,“互惠义务”和“道德回应压力”说明支持怎样带来责任,“退出困难”说明责任如何维持。主题暂时写成:“支持通过互惠关系获得,也把部分照护者留在持续回应的义务里。”

它仍需接受材料检验。团队要求 AI 列出每个支持片段、反例和原文位置,再由研究者阅读完整访谈。模型找到 I12 的免打扰片段,却把它标成“离群值”。研究者保留这段,因为它提示责任并非群聊的自动后果:参与者的资源、群体规范和照护阶段可能改变这种体验。

另一个反例来自一位只读不发言的参与者。文本中没有“负担”一词,AI 因而判断不相关;完整访谈却显示,他通过阅读获得信息,同时刻意避免建立需要回报的关系。这段材料既不完全支持也不简单否定候选主题,而是帮助研究者说明互惠怎样被回避。

团队随后按参与者而不是按代码再读一遍材料。按代码查看时,同类句子会自然聚在一起,很容易给人“大家都这么认为”的印象;按人查看后,才看到同一位照护者在母亲出院前积极回应,出院后因为工作恢复而逐渐沉默。时间变化进入主题说明后,“持续在线责任”不再被写成固定性格,而被理解为随照护阶段和群体关系变化的经验。

没有谈到互惠的访谈也被列出。沉默本身不能直接解释为拒绝或没有压力,研究者要看访谈提纲是否问到、访谈者有没有追问,以及参与者是否有机会形成这种关系。AI 可以指出哪些材料没有相关片段,不能给缺少文本自动补上心理含义。

原文回链拦住了一个看似合理的误读

处理 I14 时,AI 抽取一句“我当然愿意半夜回她”,并编码为积极互助。前文却在谈照护者长期睡眠不足,后文的“当然”带有无奈。仅凭一句话无法判断它是认同、讽刺还是转述。

编码备忘把这条移入人工队列,记录需要查看的前后段落和仍存在的歧义。研究团队讨论后,将其作为“义务被自然化”的边界例,但在论文中不把它写成确定的内心动机。若模型不能稳定返回原句位置,批量辅助就应停止,因为所有解释都会失去与参与者材料的连接。

同样需要人工处理的还有方言、代词指向、否定套否定和罕见事件。提高提示长度未必能解决这些问题。缩小 AI 使用范围、只让它做可核对的检索,有时比继续调整模型更符合研究伦理和分析质量。

一致率不能替团队选择方法论

团队曾想用 AI 与人工的标签一致率证明过程可靠。抽查却发现,表面代码的一致率很高,涉及互惠和语气的片段分歧最多。高一致可能只是代码定义简单,低一致也可能暴露真正值得解释的模糊处。

有些定性方法会使用多名编码者和一致性指标,另一些更强调反思、解释与讨论。是否计算以及怎样理解一致性,应服从所采用的方法论,而不是为了给 AI 一个“准确率”。AI 也不是能够承担研究关系、伦理和理论选择的客观第二编码员。

COREQ 报告指南要求访谈和焦点小组研究透明说明研究团队、关系、设计、分析和报告。它可以提醒作者交代谁参与编码、主题怎样形成,却不会替团队决定所有定性研究都必须采用同一种编码哲学。

因此,方法记录除了工具和版本,还写明研究者位置、初始假设、AI 看到了哪些材料、在哪些阶段提供候选、人工怎样处理差异。研究者注意到自己原本更关注群聊的好处,这也解释了为什么最初忽略退出困难;这项反思与 AI 的系统性遗漏一起进入分析记录。

主题成立以后,还要逐位参与者检查

候选主题形成后,团队建立“主题—代码—原文—参与者”回链。不是为了堆更多例句,而是查看主题是否只由少数表达清楚的人支撑,某类参与者是否完全没有进入解释,以及同一个人在不同照护阶段是否出现矛盾经验。

在本案例中,有人白天依赖群内信息,夜间却关闭提醒;也有人开始时积极回复,照护任务加重后退出。若把每位参与者只截取成一条符合主题的引文,这些变化会消失。团队因此在主题备忘中写明过程和条件,不把“支持”与“负担”当成两个互不相干的列表。

最终引文再次检查身份组合。罕见职业、具体机构和特殊事件即使没有姓名,也可能使人被识别;必要时改用更短片段、概括或不引用。工具能帮助查找重复实体,是否足以保护参与者由项目的伦理与数据管理要求决定。

如果同意文件不允许当前工具处理材料,模型持续误解语言语境,研究者没有精读访谈,或主题只能存在于 AI 摘要而回不到原文,流程就在这里停止。可行的处理是换到批准环境、减少材料范围或改回人工分析,而不是把保密和解释问题写进风险提示后继续上传。

这 20 份访谈最后交付的不是一组“由 AI 发现的主题”,而是一份能回到参与者语境的解释:哪些材料支持它,哪些材料限制它,研究者和工具各自怎样影响了判断。AI 提供候选视角和检索速度,主题仍由能够说明方法、语境和责任的人来形成。

写作时,每个主题旁都保留备忘编号。若一段分析只能引用模型的概括,却找不到参与者原话、反例和研究者决定,它就没有达到进入论文的条件。 主题名称再动听,也不能跨过这项检查。 这也是研究者对参与者材料承担解释责任的最后一道关口。