研究问题定下来以后,团队把“中式早餐营养结构不好研究”整句放进搜索框。几分钟后,结果页上同时出现了膳食指南、媒体文章、学生问卷、代谢实验、外卖商品页面和若干论文摘要。材料看上去不少,负责评分的人仍不知道该选哪些营养指标,负责调查的人也没有找到早餐组合应该怎样记录的依据。
这不是检索技术不熟练造成的小麻烦。即使再下载几十篇,只要研究者仍把所有“与早餐有关”的材料当成同一种证据,方案就不会变得更可靠。文献的作用不是给原观点找几句出处,而是让已有知识进入研究现场,迫使研究者修改定义、测量、变量关系或结论边界。
本文继续使用虚拟早餐案例,但只演示文献怎样改变研究决定。它不表示我们已经按照预先注册的程序,对现实中的中式早餐研究完成了系统综述,更不能由此推断现实早餐有多少不符合某项标准。一次可复查的检索练习,与系统综合一个领域的全部合格证据,并不是同一件事。
文献不是来给观点站队的
检索最容易滑向一种熟悉的写法:先把“中式早餐营养结构可能不好”当作结论,再把找到的文章分成支持和反对两边。最后写成“有研究认为早餐重要,也有研究发现蛋白质不足”,引用很多,自己的判断却没有接受任何限制。
不同来源本来就在回答不同问题。中国居民膳食指南的官方说明可以为食物多样、合理搭配和三餐安排提供规范背景,所以它能解释研究者为什么关注一份早餐的组合结构。它不能告诉我们六个城市片区里有多少外购早餐低于教学评分线。“怎样吃更合理”是一种规范判断,“现实中有多少早餐呈现某种结构”是一项经验问题;用前者替后者作证,引用再权威也答非所问。
同样,一项学生调查可能提供记录早餐的办法,却不能直接代表早餐店出售的组合;外卖商品页可以显示名称和价格,不等于经过验证的营养数据;一项原始研究可以报告自己样本中的结果,却不能因为结论醒目就自动成为整个领域的定论。判断一篇材料有没有用,首先要问它承担什么证据工作,而不是标题与自己的题目有多相似。
结果互相冲突的论文,往往比结论一致的论文更能暴露研究条件。假设一项研究观察到价格较高的早餐评分较好,另一项没有看到明显关系。不能简单数成一票支持、一票反对。第一项的价格范围可能更宽,第二项可能只研究一所学校;一项按完整早餐计价,另一项记录单品;一项处理了店铺类型,另一项没有。所谓冲突,也许来自现实场景不同,也许来自对象、测量或模型不同。把这些差异查清,才能决定自己的研究应记录什么。
例如,若前一项研究的“价格”是整份套餐的总价,后一项却把每件单品价格分别入表,两篇论文表面使用同一个变量名,实际比较的对象并不相同。早餐团队因此需要在证据记录中留下价格单位、购买组合和调查年份,而不是只抄一个相关系数。只有这些条件能够对齐,结果才有资格被放在一起解释;无法对齐时,差异本身就是研究边界的一部分。
文献综述因此不是作者观点的支持者名单。它更像一次交叉询问:每篇材料究竟看见了什么,又因为怎样的设计只能看见这些。
检索要从尚未决定的事情出发
整句搜索题目之所以低效,是因为研究者没有先说明自己希望文献解决哪一个决定。早餐案例至少有几件事仍然悬着:外购早餐组合怎样界定,营养结构应关注哪些方面;份量、配方和营养值怎样取得,误差会落在哪里;价格、食物组成、城市和店铺为什么可能一起变化;已有研究覆盖了什么对象和场景,当前问题真正空缺的是哪一小块。
这些未决事项会把检索带向不同方向。寻找定义时,需要早餐、早饭、morning meal 与膳食质量、营养结构、diet quality 等概念表达;寻找外购场景时,要加入早餐店、prepared food 等对象词;寻找现状调查时,横断面、调查、cross-sectional、survey 才开始有用。若结果太宽,可以加入场景或设计;若结果太窄,暂时拿掉地点限制,先看看其他地区用过哪些测量办法。
数据库中的 OR 让近义表达任意出现一个即可,AND 要求前后概念同时出现,括号则规定组合关系。PubMed 的官方帮助页还说明了题名、摘要等字段限定和检索历史。掌握这些操作能够减少遗漏,却不能替研究者修正概念。检索式语法完全正确,仍可能把“是否吃早餐”和“买到的早餐组合是什么”混在一起,带回一批与当前观察对象无关的研究。
找到一篇高度相关的论文后,顺着它的参考文献向早期研究追踪,再看后来哪些论文引用了它,往往能发现数据库里没有想到的表达。有时某条研究传统根本不用“早餐质量”这个词,却测量了相近内容。此时应该把新词带回原数据库重新检索,而不是把偶然找到的几篇材料冒充完整结果。
检索过程也必须留下痕迹:在哪个数据库、哪一天、用了什么完整式子、得到多少条记录、按照什么条件留下或排除。对系统综述来说,Cochrane Handbook 的检索章节要求会严格得多,包括同时使用数据库编排的主题词和作者实际使用的自由词,并识别同一研究发表的多份报告。早餐案例没有完成这种级别的综述,但“别人能够复查当时怎样找过”仍是最低责任。否则一串引用只证明作者找到了它们,不能说明相关证据为何没有被漏掉。
理论模型不是一幅装饰图
文献读到一定程度,变量之间的关系需要被画清楚。初学阶段可以把这种尚未写成统计公式的关系图叫作概念模型或理论模型。它不是为了让开题报告多一张图,而是为了逼研究者说明:每条箭头为什么存在,哪些只是推测,哪些变量会同时影响前后的关系。
早餐案例中,城市和店铺条件可能影响当地可售食物、价格和常见搭配;实际的食物组成与份量决定营养内容;调查员怎样称量、店家是否提供配方、使用哪套营养数据库,又决定真实组成怎样变成表格里的观察值;最后,蛋白质、膳食纤维、钠等指标共同进入教学营养评分。把这条关系写出来以后,店铺类型和城市就不能随意从数据表中删掉,因为它们可能同时影响价格与评分,使价格替场景承担一部分关系。这类共同影响解释因素和结果的变量,通常称为混杂因素。
测量过程也不再隐藏在一个整齐的营养数字后面。配方只能估算、份量没有实测,都会使观察值偏离真实组成。因此方案增加“份量是否实测”“配方是否估算”等质量字段,并另选 120 份早餐做称重或营养估算复核。这里的复核仍是虚拟教学安排,不是真实实验室检测。它出现的理由不是让项目显得严谨,而是概念模型已经指出:测量误差可能改变评分和低分比例。
模型还揭开了一个更隐蔽的循环。教学总分本来就由蛋白质、膳食纤维、钠等维度计算而来,若再用蛋白质克数去“发现”总分与蛋白质有关,关系中有一部分是公式预先写进去的。这种部分与整体的关系不能包装成新的科学发现。营养数值仍适合描述样本和检查评分,但正式关联分析更需要关注上游的食物标记、价格、店铺类型和城市,并坦白这些变量通过什么路径与总分相连。
一套测量工具“别人用过”也不能结束讨论。COSMIN 关于测量工具的资料提醒研究者分别考察工具是否稳定、是否测中了目标概念以及误差有多大。早餐评分即使在其他场景出现过,仍要问它是否适用于外购组合、所需信息能否可靠取得,以及换一种合理测法会不会改变结论。理论模型的价值,就在于让这些问题在收数据以前暴露,而不是等模型跑完才补一句“可能存在测量误差”。
AI 能扩大入口,不能替证据作判断
检索词卡住时,可以把已经确认的概念和几篇真正相关的论文交给 AI,让它补充作者可能使用的其他说法。这个用法有实际价值,但模型给出的每个候选词都要放回数据库试搜。若一个词带回的大多是“是否吃早餐”的研究,而项目关心的是“外购早餐组合”,它就不该进入正式检索式。
AI 也可以先把论文中的对象、设计、测量和结果填入提取表,节省机械整理时间。研究者仍要打开原文核对。模型若把“与低分相关”改成“导致低分”,把讨论部分的推测写成实测结果,或者只摘结论不保留样本范围,这条摘要就没有资格进入证据表。错误不是因为文字不够漂亮,而是它会沿着概念模型继续传下去,最终改变变量和结论。
把 AI 放在这里,它承担的是扩大入口和整理候选材料的工作;证据是什么、适用于谁、能够改变哪项决定,仍由可核对的原文回答。否则检索速度提高以后,研究只是更快地积累了一批未经判断的句子。
检索结束时,研究方案应该变了
下载 50 篇不代表已经查够,只读 12 篇也不必然太少。更可靠的暂停条件是:关键定义、测量办法、变量关系和研究空白都有能够承担相应工作的来源,新读材料已经很少改变核心决定,同时数据库、检索式和筛选理由都被保留下来,可以在写作前再次更新。
经过这一轮,虚拟早餐研究已经与检索前不同。五个评分维度被保留,却明确标成教学工具;城市和店铺类型进入数据表,用来检查价格关系是否夹杂场景差异;份量实测和配方估算必须标记,并增加 120 份复核子样本;疾病因果退出当前问题;与预期相反的结果也不再被简单归入“反对文献”,而要连同对象和方法差异一起解释。
这些变化才是文献真正进入研究的证据。若研究者读了很多材料,最后只是给原来的每句话加上括号和作者年份,研究方案却一字未动,那么检索很可能只完成了引用装饰。好的文献工作不保证研究者得到想要的答案,它首先让研究者无法再像检索以前那样轻易地解释问题。