许多人第一次接触定量研究,会把它理解成一条很直观的生产线:先有一个想法,再找一批数据,交给统计软件计算,最后把显著或不显著的结果写进论文。照这种理解,问题、数据和结论只是前后相接的几个工序。只要每道工序都做过,研究似乎就算完成了。
真正的困难恰恰藏在这种直观里。数字不会主动纠正一个含糊的问题,样本多也不会自动带来代表性,复杂模型更不会替研究者补回没有观察到的事实。一项定量研究之所以成立,不是因为它使用了数字,而是因为研究者从提出问题开始,就不断限制自己能够怎样解释这些数字。到了最后,结论只能说到证据真正到达的地方。
下面仍以“中式早餐营养结构是否普遍不好”为例。不过,这是一项贯穿十篇教学文章的虚拟研究。六个城市片区、店铺、早餐、测量值以及以后出现的分析结果都是模拟材料,不描述现实中的中式早餐,也不构成饮食建议。选择这个题目,只因为它足够日常,也足以暴露科研里一个常见的误会:人们往往以为自己缺的是数据,其实最先缺的是一个能够被数据反驳的判断。
数字不能替含糊的判断作决定
“中式早餐营养结构不好”听起来像一个研究问题,实际上更接近一种印象。有人想到白粥配油条,有人想到包子和豆浆,也有人想到粉面、馄饨或者食堂窗口的一整套餐食。只要“中式早餐”没有明确范围,每个人都能挑出支持自己印象的例子。这样的争论可以持续很久,因为双方说的可能根本不是同一类早餐。
虚拟研究因此把对象限定为六个固定城市片区里、在早餐店能够同时购买的一份外购早餐组合。一件油条不是一份完整的观察对象,一名顾客一天的饮食也不是。数据表中的一行,必须对应一份按照统一规则记录的早餐组合。这个限定看似缩小了题目,却第一次让问题有了稳定的对象:研究以后得到的答案只属于这些片区、这些店铺和这种购买场景,不能顺手扩大到家庭早餐,更不能代表全国居民的长期饮食。
对象明确了,“营养结构不好”仍然不能直接计算。它可能指能量偏高,也可能指蛋白质或膳食纤维不足、钠偏高、食物种类太少。研究者必须在看见结果以前,就决定自己到底依据什么作判断。教学案例为此设置了一套 0—10 分的评分:能量区间、蛋白质、膳食纤维、钠、食物多样性五个方面各占 0—2 分,低于 6 分记为结构失衡。
这套分数不是天然真理,更不是可以直接拿去评价现实饮食的营养标准。真实研究必须依据目标人群、正式指南和营养专业意见来设定阈值,还要检查换一个合理阈值后结论会不会大幅改变。这里使用它,是为了把一句模糊评价改成一项公开约定:什么会被计入,怎样计算,出现什么结果时原来的看法不能成立。
于是,“普遍不好”也不再是一句可以随意解释的话。虚拟研究把主要假设写成:按照预先规定的教学评分,超过半数样本低于合格线。如果最后只有三成早餐低于 6 分,研究者就应当承认主要假设没有得到支持,而不是看完数据再把“普遍”改成“超过四分之一”。假设的意义不在于表达信心,而在于给原来的判断留下失败的可能。
从这个角度看,量化并不是给观点披上一层数字外衣。它要求研究者在结果出现前公开自己的尺子,并接受同一把尺子可能给出相反答案。一个问题若无论得到什么数据都能被解释成“我原来是对的”,那么再精确的数字也没有真正参与判断。
样本的力量来自选择方式,不来自行数
有了可以计算的结果,还不能马上开始收集早餐。研究要估计六个虚拟城市片区里常见外购早餐的失衡比例,样本就必须对这个范围负得起责任。数据表有多少行,只说明观察数量;这些行从哪里来,才决定结论可以说到哪里。
设想调查员为了尽快得到 1,200 行记录,在一家连锁门店里把当天能够组合出来的早餐全部录入。表格很大,均值、柱状图和回归模型也都能顺利生成。但这批数据主要重复了同一家店的菜单、采购和制作方式。它可以非常细致地描述这家店,却没有增加对其他门店、食堂窗口或早餐摊点的了解。计算可能越来越精确,问题却在不知不觉中被缩成了“这一家店是什么样”。
虚拟研究采用的方案是六个城市片区各抽取 40 家店,再在每家店按照预先规则记录 5 份常见早餐,一共 240 家店、1,200 份早餐。店铺还要按早餐摊点、独立门店、连锁门店和食堂窗口分层。这样做并不保证样本天然代表一切,它只是让“希望描述谁”和“实际从哪里取得记录”开始对应起来。世界卫生组织关于调查抽样的资料也把目标人群、实际抽取对象的名单、样本量和现场实施放在同一套准备工作里。实际用来抽取对象的名单,在研究方法中常被称为抽样框;名单漏掉了谁,后面的统计就看不见谁。
每家店的五份早餐也不能被当成来自五个互不相关的来源。它们共享菜单、配方、采购渠道和厨师的制作习惯,往往比不同店铺的早餐更相似。因此数据中必须保留店铺编号,也就是 shop_id,分析时要把同店早餐按成组数据处理。如果丢掉这列编号,软件会把 1,200 行都当成彼此独立的信息,给出的不确定程度可能显得过于乐观。
这项研究还是一次横断面观察。所谓横断面,是在同一个调查阶段记录当时的现状,像拍下一张数据快照。它适合描述失衡比例,也可以观察哪些早餐特征经常与低分同时出现;它没有安排人改变早餐,也没有长期追踪健康变化,因此不能证明某种早餐搭配后来导致了疾病。这个边界在数据收集前就已经形成,不会因为样本达到 1,200 份而消失。
样本量当然重要,但它只在抽样来源和层级合理的前提下发挥作用。反复观察一个狭窄来源,可以让研究者更有把握地回答一个狭窄问题,却不能把窄问题自动推成宽结论。代表性不是行数的奖励,而是选择过程留下的结果。
数据表不是现实本身
即使抽样方案合理,早餐进入数据表时仍会发生损失。一份套餐里有什么食物,份量是多少,配方来自店家说明、现场称重还是数据库估算,都会影响最后的营养值。若研究者只留下“包子、豆浆”几个名称,删掉份量和估算依据,同样的文字可能被换算成很不一样的能量、蛋白质和钠含量。
虚拟研究要记录能量、碳水化合物、蛋白质、脂肪、膳食纤维、钠和食物类别数,也要记录早餐是否含明确的蛋白质食物、蔬菜、奶或豆类、油炸食品,以及主食类型、烹饪形式、价格、店铺类型和城市。与此同时,份量是否实测、配方是否只能估算、关键字段是否缺失、数据后来为什么修改,也必须留在质量记录里。后一组信息不直接构成营养评分,却决定研究者能在多大程度上相信前一组数字。
现实中,早餐店未必愿意提供完整配方,调查员也未必能称量每一份食物。虚拟方案因此另选 120 份早餐做称重或营养估算复核,用来比较日常记录与参照测量之间的偏差。这仍是教学中的校准安排,不是真实实验室检测。它的作用不是宣布“数据已经准确”,而是让误差有机会被看见:哪些估算经常偏高,哪些食物最难判断,换一种换算方法后低于 6 分的比例会不会明显变化。
数据表因而不是现实的无损复制,而是研究者按照规则留下的一组记录。某份早餐得 4 分,是一条由食物、份量、换算和评分共同产生的数据;1,200 份早餐中有多少低于 6 分,才成为针对主要问题的样本结果。即使这个比例计算无误,换一批店铺也几乎不会得到完全相同的数字,所以结果旁边还要给出估计区间,表示在当前抽样和计算条件下存在多大的不确定性。
承认这种不确定性不会削弱研究,反而说明数字承担了什么、没有承担什么。把估算值伪装成精确测量,或者只报告一个比例而隐藏样本来源,得到的文章可能更干脆,却让读者无法判断结论究竟依赖哪些条件。
模型能整理证据,不能扩大证据
完成基本描述以后,研究者还会用统计模型考察一些次要问题:含明确蛋白质食物的早餐是否较少出现结构失衡,含蔬菜或奶豆类的早餐是否得分更高,价格与评分有没有关系,城市和店铺类型是否混在这些关系里。这里的模型,可以先理解为一种在同一次计算中比较多个可观察条件的方法。由于早餐按店铺成组,模型和不确定性估计还要处理这种聚集,不能把同店的五份早餐假装成五个完全独立的来源。
模型的价值在于整理已经取得的证据,而不是替证据扩张领地。研究没有记录蔬菜,模型就不能从早餐名称中可靠地补出蔬菜;抽样没有覆盖家庭场景,模型也造不出家庭早餐的数据。价格即使与评分有关,也不等于提高或降低价格会造成营养结构变化。横断面调查发现的关联,仍然可能同时受到店铺定位、地区习惯或其他未测因素影响。
统计方法越复杂,这一点越容易被忽略。一个模型可以给出很多系数、小数位和显著性结果,看上去比一张简单的比例表更像科研。但形式上的精细不能改变研究最初观察了什么。若数据只支持“这些特征在样本中经常同时出现”,作者就不能把它改写成“某种食物改善了营养”或“某种早餐导致健康风险”。那不是语言稍微大胆了一点,而是把观察性证据换成了研究从未取得的因果证据。
NIH 关于研究严谨性与可重复性的说明把研究设计、方法、分析和解释放在一条连续链上,原因也在这里:解释不是分析结束后的自由发挥,它仍然受前面所有决定约束。统计软件负责按照设定计算,却不负责替作者判断一句话是否越过了研究设计。
研究完成,意味着结论还能退回证据
假如这项虚拟调查最终得到一个结构失衡比例和若干关联结果,允许写出的结论应当类似于:在六个虚拟城市片区、按照既定抽样和教学评分观察到的外购早餐中,失衡比例是多少,哪些可观察特征与低分同时出现,估计仍有多大不确定性。这里的每个限定词都有来处。删掉“外购”,对象变了;删掉“教学评分”,判断标准被藏了起来;删掉“观察到的关联”,读者可能把结果误解成因果效应。
相反,“中国早餐普遍不健康”“这种搭配导致疾病”或者“提高价格就会改善营养”,都不是同一结论的简写,而是新的主张。它们需要全国性的抽样、长期健康资料或能够识别因果效果的设计。当前研究没有提供这些证据,作者便没有权利因为一句话更有传播力而越过边界。
判断研究是否完成,可以尝试让结论沿原路退回去:这个比例来自哪些早餐,早餐怎样进入样本,评分依据哪些字段,哪些份量只是估算,同店数据怎样处理,模型是否遵守原先写下的假设。如果其中一段断了,最后的数字就算能够复算,也未必能够解释。
STROBE要求观察性研究透明报告设计、研究对象、变量、偏倚和统计方法,正是为了让读者看见这条证据链。但清楚报告一项错误设计,只能让错误更容易被识别,不能把它修好。美国国家科学院关于可重复性与可复制性的报告还区分了两件事:使用同一份数据、代码和条件重建计算,与另收一批独立数据检验发现是否再现。前者检查计算能否走通,后者考验发现能否离开原样本;两者都不能省略研究最初对对象和测量的说明。
所以,一项定量研究并不是在统计软件输出结果时突然完成的。它完成于研究者能够说明:什么结果会推翻原来的判断,每一行数据代表谁,数字经过什么规则形成,结论为什么只能写到这里。若这些问题还没有答案,最稳妥的做法不是赶快收满 1,200 份早餐,而是暂时放下数据表。因为从问题到结论的距离,靠的从来不是数字的数量,而是中间没有被悄悄跳过的证据。