核心结论
研究设计不是一张从“普通”排到“高级”的方法榜单。它是取得证据的安排:在什么时间观察谁,有没有主动改变条件,设置什么比较,以及这些安排最后允许研究者说到哪里。
想知道某个时段的现状,做一次有明确抽样规则的观察可能很合适;想知道一件事发生以后另一件事怎样变化,就需要真实的时间顺序;想判断一项干预的效果,还要考虑对照、分配办法和伦理。问题变了,合适的设计也会变。
早餐案例最终采用多城市横断面观察。它能估计虚拟样本中的营养结构分布,并分析哪些特征经常与评分同时出现;它不能证明某种早餐造成疾病,也不能证明价格改变会带来营养改善。
先别问哪种设计最厉害,先看你准备说哪句话
下面三个问题都在谈早餐,所需证据却不是一回事。
第一个问题是:“这六个城市片区当前常见外购早餐中,低于教学评分线的比例是多少?”研究者需要在规定时期抽取早餐组合,按同一把尺子测量,再估计分布。
第二个问题是:“价格较高的早餐,是不是常常也有较高的结构评分?”同一批数据可以记录价格和评分,分析二者是否一起变化。不过,“一起变化”还没有回答是谁造成谁。
第三个问题是:“如果早餐店把一部分主食换成蛋白质食物和蔬菜,顾客的某项健康指标会不会改善?”这里出现了真实干预、顾客和后续健康变化。只看一次菜单已经不够,研究者需要重新定义对象、最后关心的健康结果和观察时间。
把三类问题放在一起,就能看到设计选择的起点不是方法名称,而是希望得到的句子:
| 想回答的事 | 数据里必须出现什么 | 常见设计思路 | 最多允许说什么 |
|---|---|---|---|
| 当前分布 | 有抽样规则的一次观察 | 横断面调查 | 比例、均值、分布 |
| 某个条件出现以后发生什么 | 起点记录、真实经过的时间、后续结果 | 持续跟踪同一组对象 | 时间顺序和关联 |
| 主动改变条件是否带来差异 | 改变了什么、和谁比较、怎样分组、之后怎样观察 | 随机或其他干预研究 | 在分组和比较可靠时,估计这项具体改变的效果 |
研究方法里常把先出现、可能与结果有关的条件叫“暴露”,把之后关心的结果叫“结局”,把持续联系研究对象并再次测量叫“随访”。这些名称会在论文里反复出现,但先看清它们在数据中分别对应什么,比先背名字更重要。
这张表也不是说每个问题只有一种设计。现实中还有自然实验、病例对照、重复横断面等许多安排。入门时先抓住时间和干预这两件事,比背下一长串名称更有用。
横断面研究不是“随便看一次”
横断面可以理解成在一个规定调查阶段,为目标现状拍一张数据照片。照片中可能相关的条件和研究结果大多在同一时期记录,不持续等待几年后的变化。它适合估计比例,也能观察特征之间的同期关系。
我们的“照片”不是走进最近一家店随手拍菜单。计划先覆盖六个虚拟城市片区,每个片区抽 40 家店,每家记录 5 份常见组合。240 家店提供 1,200 份早餐。早餐组合是一行分析数据,店铺是这些早餐共同所属的聚类,因为同店组合共享菜单、采购和制作方式。
调查期也要固定。如果一个城市在春节前记录,另一个在盛夏记录,季节性菜单变化就可能和城市差异混在一起。横断面不一定只发生在某一天,但各地必须使用可以比较的时间窗口,并在论文中交代清楚。
另取的 120 份早餐参照测量也没有改变主体设计。团队没有随机要求店家改变配方,只是从主体调查中抽出一部分记录,使用额外测量检查蛋白质和钠估值误差。它仍是横断面调查内部的质量检查,不是营养干预实验。
世界卫生组织 STEPS 的调查资料把目标人群、实际用于抽取对象的名单、抽样方法和样本量放在同一套调查准备中。研究方法把那份实际名单叫作抽样框。即使只观察一次,也要先说明希望描述谁,再说明通过什么名单找到他们。一次观察可以很严谨;多次观察也可能一直重复同一种偏差。
“研究有偏差”太笼统,要看问题从哪里进来
设计阶段至少要盯住三条不同的路。第一条是对象怎样进入样本。如果只选愿意公开配方的连锁店,样本可能系统性地漏掉配方不透明的小摊点,最后比例会偏向哪边并不容易知道。这类问题发生在“谁被看见”,增加每家店的早餐份数也修不好。
第二条是记录怎样接近真实情况。菜单写“一碗豆浆”,不同店的一碗可能差很多;调查员把没称过的份量当成标准份,误差会进入营养值。若高价连锁店更容易提供准确配方,而摊点更多依靠估算,测量误差还可能随店铺类型而变化,不再只是让所有数字随机晃动。
第三条是为什么两个变量会同时出现。价格与评分的关系可能受店铺、城市或组合份量影响,这属于替代解释的问题。它和前两条不能用同一种办法解决:扩大样本不能纠正错误测量,回归调整也不能让没进入样本的店铺重新出现。
研究内部的计算是否可信,常被称作内部有效性;结果能否合理地放到研究之外的对象和场景,常被称作外部有效性。两个目标有时会拉扯。只选配方最清楚的门店,测量可能更整齐,代表的早餐场景却更窄;覆盖更多复杂门店,外部范围变宽,现场测量难度也会上升。设计不是把两者都写成“良好”,而是说明怎样取舍,并把剩余问题带进分析和结论。
如果问题里有“后来”,数据就必须真的经过后来
假如研究对象改成就餐者,问题也改成“长期早餐结构与一年后某项健康指标有什么关系”,就需要在起点记录早餐和健康状况,再让时间经过,随后测量结局。这类沿时间追踪一组对象的安排,通常叫队列研究。
队列能让研究者知道早餐记录发生在结局之前,解决横断面缺少时间先后的一个困难。但它仍不自动等于因果证明。早餐选择可能与收入、工作时间、其他饮食、运动和原有健康状况同时有关;随访中离开的人也可能与留下的人不同。研究者只能处理已经认真记录的替代解释,未测因素不会因为随访一年便消失。
如果问题进一步变成“主动更换早餐搭配是否改变结局”,研究者可能设计随机实验:把符合条件的对象按随机办法分到不同早餐方案,设置对照,记录是否真的按方案吃,并在规定时间测量结局。随机分配的用途,是让比较组在研究开始时尽量只系统性地差在干预上。
为什么一定要有比较?同一家店在同一个早晨不可能既更换菜单又完全不更换,研究者看不到同一对象在另一种条件下会怎样。对照组承担的是这个无法直接观察的参照。随机分配也不是为了让两组每个特征都一模一样,而是避免店家或研究者按预期结果挑选谁接受方案,让已知和未知差异在平均意义上更可比较。
实验也不是万能答案。让人长期接受不合适的饮食可能不符合伦理;参与者知道自己吃了什么,很难做到让参与者或研究人员不知道分组情况——研究里把这种隐藏分组的办法叫盲法;实验提供的免费套餐与现实购买环境也可能相差很大。更关键的是,随机实验回答的是“这个特定方案在这些对象和条件下产生什么差异”,并不适合替代一次调查来描述城市早餐店真实出售什么。
因此,队列或实验看上去更复杂,不代表它们更适合当前问题。我们的主要问题就是一个现状比例。为了追求“高级”,把它硬改成健康干预,反而会换掉原本想认识的对象。
同时看到价格和评分,不知道是谁推了谁一把
横断面数据会同时记录价格、食物组成和教学评分。假设分析时发现价格高的早餐更常低于或高于某个分数,至少有几种解释。
价格可能反映组合份量:东西更多,价格更高,能量也可能超出计分区间。价格也可能反映店铺类型:连锁店、食堂窗口和街边摊的定价与搭配不同。城市成本、商圈位置和促销也可能同时影响价格与菜单。评分又是由营养组成计算的,组成与价格的关系会顺着公式进入总分。
统计模型可以把已记录的城市、店铺类型和食物标记同时纳入比较,看看“在这些条件相近时”价格还与结果怎样关联。论文常把这种同时考虑其他已记录条件的做法称为调整。它做不到三件事:不能补出没记录的商圈和顾客需求,不能让同一时刻的数据出现时间先后,也不能把研究者没有实施的降价或换餐变成真实干预。
所以这项研究可以写“价格与结构失衡状态存在调整后的关联”,不能直接写“提高早餐价格会改善营养”。前一句描述当前数据中的条件关系,后一句假设改变价格会造成结果变化,中间缺了一套因果设计。
美国国立心肺血液研究所的观察性研究质量评估工具会追问研究问题、研究对象、暴露和结局怎样定义、是否处理混杂等事项。清单本身不能把关联变成因果,但能逼研究者交代:结论到底建立在哪些观察和假设上。
设计冻结以后,有些诱人的问题要主动放下
当前设计可以完整写成一句话:在同一调查期内,对六个虚拟城市片区按店铺类型抽取的 240 家早餐店进行横断面观察,每店记录 5 份常见外购早餐组合,以早餐为分析单位、店铺为聚类单位,估计低于教学评分线的比例,并分析组成、价格、城市和店铺特征与评分的同期关联;另对 120 份早餐做参照测量比较。
这句话同时冻结了能做和不能做的事。能做的是描述营养指标和评分分布,估计失衡比例,比较可观察特征。不能做的是代表所有中国早餐、分析某个人实际摄入、推断疾病风险,或者声称某种搭配造成了健康变化。
STROBE 观察性研究报告指南要求作者透明交代设计、场景、对象、变量、偏倚和统计方法。它不是一张选中“横断面”以后自动生成好研究的表,但可以在方案阶段反查:读者将来需要知道的关键信息,现在有没有被记录。
设计局限也不是论文快写完时补上的客套话。因为店铺是聚类单位,第 6 篇计算样本量和抽样时就要处理同店相似;因为只是一次观察,第 7 篇不必设计多年随访,却要把调查期和现场规则固定;因为不能做因果推断,第 9 篇的模型和第 10 篇的结论措辞都受限制。设计一旦冻结,后续每个环节都要认这张账,不能等结果出来后再给它换一种身份。这不是遣词问题,而是证据身份变了。