核心结论

文献证据矩阵不是把每篇摘要压成一行,而是让多篇研究按同一问题接受比较。对象、设计、对照、结局和测量时间没有说清之前,一张整齐表格只会把不同问题伪装成同一种证据。

矩阵最有价值的地方,往往是它明确写出“不能直接比较”。研究者由此看见,表面冲突究竟来自结果方向,还是来自样本、测量、时间与分母不同。AI 可以按已定义字段提取和标记疑点,字段口径与最终解释仍要由研究者决定。

八篇论文最初被压成了“六篇有效”

下面是一项教学案例。教育研究者收集了八项关于 AI 生成反馈与大学生论证写作的研究,里面有随机课堂试验、准实验、单组前后比较和一次性使用体验调查。

她第一次让 AI 按“作者、样本、方法、主要结论”生成摘要表。模型给出的总览是“六篇认为 AI 反馈有效,两篇效果有限”。返回原文后,研究者发现这个计数没有共同分母:满意度、修改次数、即时论证评分和延迟迁移测验都被算作“效果”;两篇报告还来自同一个课程样本。

第一次输入
八篇论文全文,请总结每篇是否证明 AI 反馈有效。

AI 输出
六篇:有效;两篇:效果有限。

人工核对
“有效”混合了接受度、即时修订、长期能力和不同研究设计;
同一课程样本的两份报告被当成两项独立证据。

处理决定
取消“有效/无效”列,先统一比较单位、结局和时间。

矩阵的第一步因此不是继续补摘要,而是问:当前综述真正要比较什么?研究者把问题限定为,AI 反馈与其他反馈方式相比,是否改变学生论证写作表现,以及这种变化是否持续到新的写作任务。

同一张矩阵,把不可比之处保留下来

研究者按这个问题重建矩阵。下面只展示决定解释的字段;每个数值和判断在实际文件中还要保存页码、表号或图号。

研究记录设计与比较实际结局与时间当前可支持不能直接支持
S01—S02随机课堂研究;AI 反馈与其他反馈比较一次修订后的即时论文评分对当前课程中即时修订表现提供较直接证据长期写作迁移、AI 替代教师
S03两个自然班的准实验,共 82 人;AI 建议后自改与教师书面反馈比较一次反馈后的论证结构评分;无延迟测验两种反馈流程在该课程的即时比较排除班级与教师差异、长期能力
S04—S06使用体验或横断面调查接受度、自报帮助和使用意愿学生怎样看待工具客观写作改进
S07 及一项同类记录单组前后或课程进度内比较修改次数或前后评分描述实施后的变化排除练习、课程进度和其他共同变化
S08含延迟迁移任务的研究新任务中的延迟表现没有观察到与即时评分同等的优势不能据此证明所有情境完全无效

同一课程样本的多份报告共享研究编号,另用报告编号区分。这样既不会重复计算样本,也不会丢掉方案、主要结果和长期随访分别提供的信息。Cochrane Handbook 的检索章节提醒综述者区分研究与报告;在普通综述中,这项区分同样会改变“有多少独立证据”的答案。

矩阵也区分“未报告”“全文未取得”“当前不适用”和“解析失败”。四种状态看起来都是空格,后续动作却不同:作者没报告的内容属于证据限制;全文没取得要继续获取;不适用不应被当成缺失;PDF 表格解析失败则转人工录入。

字段定义要与表一起保存。例如“延迟测验”究竟指离开即时修订任务后的新写作,还是隔一天重交同一篇文章,不能由每位提取者自己理解;“AI 反馈”也要记录工具输出后教师是否筛选。若字段手册没有这些界线,八行即使由同一个人填写,也可能在不同论文上偷偷改变口径。

研究者先用 S01 和 S03 试填,发现一个单元格容不下论文报告的多个时间点。她没有把即时和延迟结果用斜杠塞在一起,而是让同一研究生成两条结果记录,共用研究身份与设计字段。这样后续按时间比较时无需重新拆表,也不会把两个时间点误算成两项独立研究。

S03 的一行,是怎样从原文进入矩阵的

AI 第一次处理 S03 时,把两个自然班写成“随机分组”,又把讨论中的“学生普遍认可反馈”当成主要结局。研究者先确认样本和分配方式,再定位课程量表、结果表与模型脚注。原文只说明班级接受不同反馈,没有随机分配;主要结局是修订稿的论证结构评分,评分者是否盲法没有确认。

这几处修正不是措辞偏好。班级与反馈方式绑定,意味着教师、课程安排或原有差异可能与结果混在一起;一次修订后的评分不能说明学生把能力迁移到新任务;接受度也不能替代写作表现。矩阵中的“当前可支持”和“不能支持”因此与原文方法一起变化。

结果字段不只保存 p 值或“显著”。它要记录原文组间估计、区间、参照关系、模型和表 2 的位置。若 AI 无法可靠读出表 2,字段写“解析失败,等待人工录入”,不能从讨论中的“显著改善”倒推一个数值。

研究者另请一人核对 S03 的样本、主要结局、方向和证据位置。第二人发现 AI 使用的是招募人数,而结果模型只包含完成修订任务的学生,于是矩阵同时保留招募分母和分析分母。只改一个数字不够,所有使用“参与者比例”的后续观察都要检查。

S03 的作者在讨论中还把即时评分提高解释为学生学会了更好的论证策略。矩阵把评分变化记在结果列,把这一解释放进作者解释列。由于研究没有新的迁移任务,它不能进入“长期能力”判断。分列以后,研究者仍可在综述中讨论作者怎样解释结果,却不会把解释当成测得的结局。

Cochrane 关于纳入研究数据收集的章节说明重复数据提取有助于减少错误与单人选择。这个教学综述不必把所有操作伪装成系统综述流程,但对会改变结论的字段安排第二次核对,远比最后通读一遍顺滑摘要有效。

AI 批量处理前,先让复杂样本暴露规则问题

八篇论文不多,团队仍没有直接批量生成。它先选一篇报告清楚的研究、一篇像 S03 这样设计复杂的研究,以及一篇只报告使用体验、不应进入效果比较的论文,建立人工答案。

AI 在简单研究上提取正确,却连续把“作者称为主要发现”的内容当作预先定义主要结局。团队于是修改字段说明:主要结局需要依据方案、方法或明确的预先指定信息;无法确认时写“主要结局地位未确认”,不能由结果显著与否判断。

如果只计算所有单元格的总体准确率,大量容易抄录的年份和题名会掩盖主要结局、分母和效应方向的错误。验收因此单独检查高影响字段。关键字段仍反复错配时,就把这些字段交回人工,而不是因为表格大部分已填满就继续。

AI 还可以标记同一术语在不同研究中的含义差异。例如“反馈采纳”可能指点击接受建议,也可能指最终稿实际发生修改。模型先找出用法,研究者决定它们能否进入同一比较列。统一名称不等于统一构念。

若差异集中在一个字段,团队先修字段手册,再重新处理已经完成的行。比如三篇论文把“完成率”分别按注册者、登录者和开始任务者计算,不能简单标准化成一个百分比。矩阵保留原分子与分母,并让综合阶段决定能否比较;整理阶段不替方法问题作答案。

矩阵完成后,先看差异从哪里来

重填以后,“六篇有效”被一个更有用的观察取代:较积极的结果主要出现在即时修订任务;只报告接受度的研究不能证明写作改善;包含延迟迁移任务的研究没有显示同等优势。这个判断可以逐行返回矩阵,不需要按论文数量投票。

团队要求 AI 为这条候选观察列出对应研究编号和字段。模型把一项只有课程末评分的研究也归入“延迟迁移”,人工查看任务说明后发现学生仍在修改原作业,并非面对新题目,于是将它退回即时/课程内结果。若没有矩阵中的时间与任务类型,这种听起来合理的归类很难被看见。

研究结果冲突时,研究者先查看设计、对照、结局定义、时间和分析分母。若两篇研究分别测即时修改次数和延迟写作质量,方向不同并不一定是真正冲突。矩阵保留差异,避免 AI 用“研究结论不一致,可能源于样本差异”这种通用解释把问题带过。

风险提示与信息提取也不混成一个总分。矩阵记录论文报告了什么,再注明班级非随机、评分盲法不清或失访分母变化可能怎样影响解释。使用哪种正式偏倚评价工具,要由研究设计和综述类型决定,不能让 AI 看到几个缺失字段后自动给“中等质量”。

一格修改,要追到依赖它的文字

矩阵建立版本记录以后,团队找到了某项研究的补充材料。原表把“课程完成率”的分母记为全部注册学生,附件说明它只计算登录过平台的人。研究者修正分母,同时标记依赖这项比例的候选观察需要重算。

如果只更新单元格,不检查已经写出的“多数学生完成课程”,旧错误仍会留在综述。每行因此保存来源版本、提取状态、核验人和修改日期;关键字段变更还记录影响了哪些综合判断。

进入写作前,团队检查三个问题:所谓“多数研究”按独立研究还是论文报告计算;同一列中的对象、结局和时间是否足够接近;空白究竟代表哪一种缺失状态。通过后,矩阵才交给综述写作。

它还保留了原始提取与统一标签之间的距离。论文原文的结局名称和数值不被“即时表现”这样的综合标签覆盖;标签只用于分组,并可随综述问题变化。以后若团队改为研究学生接受度,可以重新使用 S04—S06 的原始字段,而不必从一张已经把它们判为“非效果证据”的表中恢复信息。

最终这张表没有给八项研究一个简单胜负。它保留了哪些证据针对即时修订、哪些只反映体验、哪些触及延迟迁移,以及每项判断能回到原文哪里。下一篇综述文章可以从这些差异形成主题;矩阵本身停在可比较、可追踪的证据底稿。