核心结论
文献证据矩阵不是把多篇论文的摘要排在一张表里,而是用同一组可比较字段,记录每项研究的对象、设计、测量、结果、偏倚和适用范围。只有字段含义统一、每个判断能回到原文、缺失信息不被补写,AI 才能帮助跨研究比较。
矩阵的目的不是制造“研究很多”的视觉效果,而是暴露差异:哪些研究实际上回答了不同问题,哪些结果因为测量和时间不同不能合并,哪些冲突可能来自样本、设计或分析。后续综述的主题和争议应该从这些比较中形成。
为什么摘要表不能承担证据比较
如果表格只有“作者—年份—主要结论”,AI 很容易把每篇论文压缩成一句肯定句,丢掉样本、对照、测量和不确定性。两篇都写“干预有效”,可能一篇报告短期自评变化,另一篇报告长期客观结局;它们不能只因为方向相同就合并为一致证据。
证据矩阵首先要确定“比较单位”。系统综述通常以研究为单位,而不是以论文报告为单位;一项研究可能有注册、会议摘要、主要结果和长期随访多份报告。Cochrane Handbook明确提醒要区分研究与报告。普通文献综述也应避免把同一样本的多篇论文当作多项独立证据。
从研究问题反推矩阵字段
字段不是越多越专业。应从当前问题反推哪些差异会改变解释。例如比较课堂反馈干预时,学习阶段、反馈来源、持续时间和结局测量可能关键;比较材料性能时,样品制备、环境、时间点和测试标准可能关键。
字段通常分五组:
- **身份与关联:**研究编号、报告编号、来源和是否属于同一项目;
- **问题与设计:**研究目的、设计、时间结构和比较;
- **对象与实施:**样本、情境、干预或暴露如何定义;
- **结果与证据:**结局定义、数值、区间、证据位置;
- **解释边界:**偏倚、限制、适用性和与当前问题的关系。
每个字段还要定义允许值和缺失值规则。“未报告”“不适用”“全文未获取”和“AI 无法可靠解析”是不同状态,不能都留成空白。
教学案例:八项课堂反馈研究怎样比较
**教学模拟案例:**教育学研究者唐微想了解 AI 生成反馈是否改善大学生的论证写作。她纳入八项教学模拟研究,其中有随机课堂试验、准实验和一次性使用体验调查。
AI 最初按摘要生成了一张表,六篇被写成“有效”,两篇“效果有限”。唐微检查后发现:体验满意度、修改次数、量表评分和延迟测验被当成同一种“效果”;两篇论文来自同一个课程样本。
她重新定义矩阵核心字段:
| 字段 | 定义 | 允许值或记录方式 |
|---|---|---|
| 研究编号 | 独立样本和研究方案 | S01、S02……;同一研究多报告共享编号 |
| 设计 | 分配与时间结构 | 随机/准实验/单组前后/横断面体验 |
| 对照 | 实际比较条件 | 教师反馈/同伴反馈/无反馈/基线 |
| AI反馈 | 工具、输入和教师介入 | 按原文记录,不以“AI反馈”一词概括 |
| 主要结局 | 研究预先或明确指定的核心结果 | 论证评分、延迟迁移等 |
| 测量时点 | 反馈后多久 | 即时/课程末/延迟;保留实际时间 |
| 结果 | 组间或时间比较 | 数值、区间、模型和证据位置 |
| 风险提示 | 会改变解释的问题 | 选择、失访、测量、分析、报告 |
| 当前用途 | 对唐微的问题能支持什么 | 直接/间接/仅背景 |
重填以后,“六篇有效”消失了。两项随机研究对即时论文评分提供较直接证据;三项研究只报告学生接受度;两项单组研究无法排除练习和课程进度;另一项延迟测验没有观察到优势。矩阵没有自动给出总答案,却让证据结构变得真实。
一条记录怎样从原文进入矩阵
以 S03 为例,处理过程应可重建:
- 确认该报告是否与已有研究共享样本;
- 从方法定位参与者、分配、反馈流程和主要结局;
- 从结果表定位组别、样本数、统计量和区间;
- 分开记录主要结果、次要结果和作者解释;
- 根据预先字段写风险提示,不临时发明总分;
- 保存页码、表号和人工核验状态。
填写完成的记录示例:
| 字段 | S03记录 |
|---|---|
| 设计与样本 | 两个自然班的准实验,合计82人;班级非随机分配 |
| 比较 | AI建议后学生自行修改 vs 教师书面反馈后修改 |
| 主要结局 | 课程量表的论证结构评分,评分者是否盲法未确认 |
| 时间 | 一次反馈后提交修订稿,无延迟测验 |
| 结果 | 记录原文组间估计、区间和表2位置;不只写p值 |
| 风险提示 | 班级与教师条件可能混杂;评分盲法不清 |
| 可支持 | 两种反馈流程在该课程即时修订中的比较 |
| 不可支持 | 长期写作能力、所有学科、AI替代教师 |
如果 AI 无法准确读取表2,应把结果字段标为“解析失败,等待人工录入”,不能根据讨论中的“显著改善”自行补数。
AI适合辅助的环节
AI 可以把已经定义的字段应用到候选论文,标记缺失、定位可能相关的段落,并检查同一术语是否被不同研究用成不同含义。批量使用前应先完成人工金标准样本:选择一篇容易的、一篇报告复杂的和一篇不应纳入的论文,比较 AI 输出与人工记录。
对于关键字段,不能只看总体准确。样本数、主要结局、效应方向、分母、参照组和证据位置的错误成本更高,应单独验收。若 AI 在 3 个样本中持续把次要结局当主要结局,就应修改任务或改为人工提取,而不是依赖之后“总体复核”。
不要让AI自动填补异质性
矩阵的价值之一就是保留差异。以下做法会制造虚假可比性:
- 把不同量表都转换成“高/中/低效果”,却没有转换依据;
- 把即时结果和长期结果放在同一列直接排序;
- 把作者未报告的平均数从图中粗略猜出,却不标记提取方法;
- 把“未显著”写成“没有效果”;
- 把无对照的前后变化与随机组间差异并列;
- 用期刊影响力替代研究设计和偏倚判断。
无法比较本身就是重要结果。矩阵应允许“不能直接比较”,并记录造成不可比的字段。
风险评价与信息提取分开
信息提取回答“论文报告了什么”,风险评价回答“这个结果可能怎样偏”。二者可以在同一矩阵显示,但不能由一句印象替代。不同设计应采用合适的偏倚评价工具;系统综述中的数据提取和偏倚评价还需要独立复核。Cochrane 数据收集章节指出,重复提取可以减少错误和单人选择偏倚。
普通叙述综述未必需要两名独立提取者,但高影响结论至少应对关键字段进行第二次核对,并记录是谁、何时、依据什么作出修正。
从矩阵产生的四种可用观察
矩阵完成后,先不要让 AI 直接写综述。可以只要求它列出候选观察,并为每项观察指向支持行:
- 哪些研究回答同一个问题,结果是否一致;
- 冲突是否与设计、样本、测量或时间有关;
- 哪些结论只由间接或高风险证据支持;
- 哪些关键比较没有可靠研究。
唐微的矩阵形成了一个具体观察:“较积极的即时结果主要出现在短期修订任务,而包含延迟迁移测验的研究没有显示同等优势。”这项观察可以被逐行核对,也直接产生后续综述需要讨论的时间尺度问题。
矩阵也需要版本和变更规则
证据矩阵不是一次生成后不再变化的表格。新增全文、作者勘误、补充材料或团队口径改变,都可能更新记录。每一行至少保留来源标识、提取版本、提取人或工具、人工核验状态和最后修改日期;关键字段修改要说明旧值、依据和受影响的综合结论。
教学案例中,若一项课堂反馈研究后来找到补充材料,发现“课程完成率”只针对登录过平台的学生,而矩阵原来记录为全部注册学生,就要修正分母,同时检查所有依赖这项数据的比较。不能只改一个单元格而不追踪下游段落。对于数值密集的项目,最好把原始提取、清洗后的统一字段和解释标签分开,避免标准化操作覆盖原始报告。
多人或人机协作时,可以先双独立提取少量研究,比较差异类型。分歧若集中在定义不清的字段,应修改字段手册;若集中在 PDF 表格识别,应降低自动化范围;若涉及风险评价,则由具备方法学能力的人裁决。目标不是强行得到一致,而是让一致来自共同规则与可核验证据。
从矩阵到文字之前再做三项检查
第一,检查分母。所谓“多数研究”是按论文数、独立样本数还是参与者数计算?同一队列的多篇论文不能默认为多份独立证据。第二,检查可比性。相同列名下的对象、测量和时间是否足够接近?第三,检查缺失。空白代表未报告、无法获得、提取未完成,还是不适用?这些状态不能混用。
只有通过这三项检查,矩阵中的分组、差异和冲突才适合转成综述候选观察。AI 可以发现组合模式,却不能自行决定临床、教育或理论上的等价性。任何需要把不同指标换算、合并效应或评价偏倚的动作,都应进入相应方法流程,而不是藏在表格整理中。
可直接复用的证据矩阵结构
研究编号/报告编号/是否同一项目:
完整来源与全文版本:
研究问题与设计:
对象、样本来源、数量和情境:
干预、暴露、方法或核心现象:
对照或比较:
主要结局定义:
测量时间:
主要分析:
主要结果:数值、单位、区间、参照组、证据位置
阴性或不确定结果:
作者解释:
偏倚与报告缺口:
与当前问题的直接性:直接/间接/仅背景
可以支持:
不能支持:
人工核验状态、人员和日期:
矩阵的停止点是:真正相关的研究都能用同一口径比较,无法比较之处被明确保留,关键字段和证据位置已经人工核验。之后才能进入综述的主题、争议和研究位置组织。