方案讨论时,团队写下了三个问题:六个城市片区当前有多少早餐低于评分线;价格较高的早餐是否也常有较高评分;如果店家更换一部分主食,顾客以后的健康指标会不会改善。三个问题都谈早餐,却不可能共用一份数据。

第一个问题要看当前分布,第二个问题要比较同一时期出现的价格和评分,第三个问题却要求店家真的改变早餐,还要把研究对象从餐食换成顾客,等待后续健康变化。若团队先选一个听起来高级的方法,再把三个问题塞进去,得到的不是更完整的研究,而是一份不知道自己在证明什么的数据。

研究设计的本质不是给方法排等级。它是在数据产生以前,为未来的结论划定权限:观察了什么时间,设置了什么比较,是否真的改变了研究条件,决定作者最后有资格写“有多少”“与什么同时出现”,还是“某种改变带来了什么结果”。

设计选择,其实是在选择结论的动词

“六个城市片区中低分早餐的比例是多少”,只要求在规定调查期内,用清楚的抽样和测量观察现状。得到的数据可以支持比例、均值和分布。“价格与评分是否有关”可以使用同一批早餐,比较两者是否一起变化,但这种同时出现还没有说明谁改变了谁。

“更换早餐搭配能否改善健康”则完全不同。句子里有一个主动改变,也有改变以后才发生的结局。研究者需要说明谁接受了哪种早餐、与谁比较、分组怎样形成、对象是否按方案执行,以及经过多长时间观察什么健康指标。缺少这些材料,“改善”只是作者给同期差异加上的方向。

所以,研究设计应当从准备写出的结论反推。想写“后来”,数据必须真的经过后来;想写“改变造成差异”,研究中就必须存在可信的改变和比较。统计软件无法在分析阶段为一次现状调查补上一段从未发生的时间,也不能把研究者没有实施的干预变成事实。

这并不意味着每个问题只有一个设计名称。自然实验、病例对照、重复横断面等安排都可能在特定条件下有用。关键不是背下一张方法目录,而是检查结论里的每个动词有没有对应的证据结构。方法名称相同,抽样、时间和比较做法不同,实际权限仍会不同。

横断面不是“随手看一眼”

虚拟早餐研究关心的是现状比例,并顺带观察若干同期关联,因此采用多城市横断面观察。横断面可以理解为在一个规定调查阶段,为目标现状拍一张数据照片。照片不等待几年后的变化,却仍需要决定拍谁、何时拍、怎样测量以及照片能代表哪一部分现实。

计划覆盖六个虚拟城市片区,每个片区抽取 40 家店,每家按照统一规则记录 5 份常见外购早餐,共 240 家店、1,200 份组合。早餐组合是一行分析数据,店铺则是共同来源,因为同店早餐共享菜单、采购和制作方式。若分析时把同店五份早餐当成五个完全独立的来源,照片里的信息量就会被夸大。

调查时间同样属于设计。一个城市若在春节前记录,另一个在盛夏记录,季节菜单就可能与城市差异混在一起。横断面不一定只发生在同一天,但各地必须采用可以比较的时间窗口,并清楚报告现场发生在什么时候。“一次观察”描述的是时间结构,不是允许研究者随时、随地、随手收集。

世界卫生组织 STEPS 的调查资料把目标人群、实际抽取对象的名单、抽样方法和样本量放在一套调查准备中,也说明严谨性不会因为只观察一次而降低。多次观察一个有系统遗漏的名单,只会重复同一种偏差;一次按照问题认真组织的调查,反而可能更适合回答当前分布。

另取 120 份早餐做称重或营养估算复核,也没有把主体研究变成实验。团队没有随机要求店家改变配方,只是在已有调查中增加一项测量质量检查。多做一种测量,不等于实施了一次干预;研究身份由对象如何进入、条件是否改变以及结果何时观察共同决定。

时间和因果不会从模型里长出来

横断面数据会在同一时期记录价格、食物组成和教学评分。即使分析发现价格较高的早餐往往得分较高,解释仍然不止一种。较贵的组合可能份量更大,店铺类型可能同时影响定价和可售搭配,城市成本、商圈位置和促销也可能共同影响价格与菜单。评分又由食物组成计算,组成与价格的关系还会沿公式进入总分。

统计模型可以把已经记录的城市、店铺类型和食物标记放进同一次比较,观察在这些条件相近时价格与评分怎样变化。它不能补出没有记录的商圈和顾客需求,也不能判断价格先变还是菜单先变。模型越精细,越可能让结果看起来像一个经过控制的实验;数据的时间结构却没有因此改变。

假如模型给出“含蔬菜早餐的低分概率较低”,横断面数据仍只说明蔬菜标记和评分在同一份早餐里共同出现。由于评分本身包含植物性食物维度,这个关系还可能部分来自计分规则;提供蔬菜的门店也可能在份量、价格和其他搭配上同时不同。把结果改写成“增加蔬菜能够改善营养”看似只换了一个动词,实际增加了一个研究中从未发生的改变。分析阶段没有哪种调整可以把这段缺失的事实补上。

如果问题改成“长期早餐结构与一年后的某项健康指标有什么关系”,研究对象就要换成就餐者。在起点记录早餐和健康状况,让时间真实经过,再测量结局,这类持续追踪同一组对象的安排通常称为队列研究。它建立了时间先后,却仍可能受到收入、工作时间、其他饮食、运动和原有健康状况影响;随访中离开的人,也可能与留下的人不同。时间顺序是因果判断的一项必要信息,不是因果结论的全部。

若问题进一步改成“主动更换早餐搭配是否改变健康指标”,研究者可能考虑随机实验。符合条件的人被随机分到不同早餐方案,设置对照,记录是否按方案执行,并在规定时间测量结局。随机分配试图让比较组在研究开始时,除了干预以外没有系统性的选择差异;对照组则提供同一对象无法同时经历的另一种条件。

实验也不是横断面的高级替代品。长期要求人接受某种饮食可能涉及伦理,参与者通常知道自己吃了什么,免费提供的套餐也可能与现实购买环境相差很大。更重要的是,实验回答“这个具体方案在这些对象和条件下产生什么差异”,并不能替代调查去描述城市早餐店真实出售什么。选择更复杂的设计,常常意味着换了问题,而不是把原问题回答得更好。

偏差从哪里进入,就要在哪里处理

研究者常用一句“本研究可能有偏差”概括所有问题,仿佛最后在局限部分承认一下就算处理。实际上,不同问题从证据链的不同位置进入,补救办法不能互换。

如果只纳入愿意公开配方的连锁门店,小摊点和配方不透明的店铺可能系统性缺席。这发生在“谁被看见”的位置。多记录每家连锁店的早餐,只会增加同一种来源,不能把缺席的门店带回来。若菜单写“一碗豆浆”,调查员却把所有店的一碗都当成相同份量,问题发生在测量。扩大样本会把同一种误差收集得更多,真正需要的是称量、估算标记和复核。

处理选择问题,要回到门店名单和纳入过程:哪些店被抽中,哪些拒绝,哪些类型没有进入名单,是否还能用现场信息比较进入者与未进入者。处理测量问题,则要回到表单、培训和参照测量。两者最后都可能表现为一个偏离真实情况的比例,但发生位置不同。若只在论文末尾统一写成“可能存在偏倚”,读者既不知道方向,也看不出研究者曾经做过什么补救。

价格与评分同时受店铺类型或城市影响,则属于替代解释,也就是常说的混杂。模型可以调整已经记录的混杂因素,却不能修复抽样时根本没有进入样本的对象,也不能校正一列没有任何误差标记的错误份量。美国国立心肺血液研究所的观察性研究质量评估工具会分别追问研究问题、研究对象、暴露、结局和混杂,正是因为“观察性研究”这个名称本身不能保证这些环节已经接好。

内部有效性与外部有效性也可能发生拉扯。只选配方最清楚的门店,测量更整齐,研究代表的早餐场景却变窄;覆盖更多复杂门店,外部范围扩大,现场误差又更难控制。设计不是在申请书里同时写下“内部和外部有效性良好”,而是做出取舍,说明剩余问题会限制哪一句结论。

冻结设计,就是放弃一些诱人的结论

当前研究最后保留的是一次多城市横断面观察:在同一调查期内,从六个虚拟城市片区抽取 240 家早餐店,每店记录 5 份常见外购早餐组合,以早餐为分析单位、店铺为聚类单位,估计低于教学评分线的比例,并考察组成、价格、城市和店铺特征与评分的同期关联;其中 120 份另做参照测量比较。

这句话并不只是供方法部分复制。调查员可以据此知道不需要招募顾客,数据管理员知道要保留店铺层级,分析人员知道主要结果是比例而不是疾病变化,写作者也知道“导致”“改善”和“风险增加”没有证据入口。设计若不能在这些岗位上产生实际约束,就仍然只是申请书里的标签。

这项设计允许作者描述营养指标和评分分布,估计结构失衡比例,也允许报告可观察特征与评分的关联。它不允许代表全国早餐,不知道某个人实际吃下了什么,没有疾病结局,更不能把价格、食物或店铺差异写成健康因果。

STROBE 观察性研究报告指南要求透明交代设计、场景、对象、变量、偏倚和统计方法。它不能替团队生成一个正确设计,却能在数据收集前反过来追问:将来读者需要判断证据身份的信息,现在是否已经准备记录。

设计边界也不会等到论文讨论部分才生效。店铺是聚类单位,下一步抽样和样本量就要考虑同店相似;调查只有一个时期,数据表不必假装拥有随访;结论不能谈因果,后面的模型措辞也不能越界。选择设计真正困难的地方,正是愿意为一个可回答的问题放下其他更响亮的句子。若这些句子始终舍不得删,研究者选择的就不是设计,只是一个希望所有答案都能出现的方法名称。