预算表上先出现了“1,200 份早餐”。这个数字看上去足够大,但如果 1,200 份都来自几家愿意配合的连锁门店,它们只能细致重复少数菜单和配方,很难说明六个城市片区的早餐店是什么情况。文件确实有 1,200 行,研究想讨论的许多门店却从来没有机会进入。

样本量回答的是在一套既定选择方式下观察多少,抽样方法回答的是谁可能被观察。前者可以估算随机波动,后者决定数据与目标对象之间有没有可解释的联系。把两件事合成一个最终数字,会让研究者误以为行数足够多,代表性也随之到来。

下面使用的预计比例、店内相似程度和不可用率,都是为了演示计算而设定的教学参数,不是现实早餐调查的已知结果。真正要证明的也不是“1,200 是一个标准答案”,而是这个整数只有连同它背后的总体、名单、层级和假设一起出现,才具有研究含义。

代表性在公式以前已经被决定

“研究中式早餐”听起来范围很大,实际却不存在一份包含全国所有早餐组合的完整名单。虚拟研究只能先把希望讨论的对象限定为六个固定城市片区在调查期内常见的外购早餐组合,再通过当地店铺名录、食堂名单和现场补充找到可接触门店。清理重复、停业和不符合条件的记录后,真正用来抽店的那份名单才是抽样框。

六个城市片区是教学方案预先指定的场景,并不是从全国城市中随机抽出。即使每个片区内部做到了概率抽样,结果仍只属于这六个虚拟场景,不能因为早餐总数达到 1,200 就写成“中国中式早餐”。这个限制发生在最上层的城市选择上,与后面多收几百份没有关系。

店铺名单也会留下边界。方案希望覆盖在固定早间时段出售完整组合的早餐摊点、独立门店、连锁门店和食堂窗口,不纳入只卖包装零食的便利点。若名录长期漏掉流动摊点,这类早餐便没有已知机会被抽中。事后给已经入样的少数摊点增加权重,也造不回从未进入名单的对象。加权可以让已知抽中机会不同的记录代表不同份额,不能替不存在的名单补人。

世界卫生组织 STEPS 的抽样说明把目标人群、抽样框、抽样设计和现场实施放在一套准备中,正是因为代表性不是分析软件生成的属性。名单怎样形成、谁一开始就被排除,已经在决定最后的比例能够描述谁。

1,200 是假设算出的结果,不是正确性的证书

虚拟方案在每个城市按四类门店分别建名单,抽取早餐摊点 10 家、独立门店 14 家、连锁门店 9 家、食堂窗口 7 家,共 40 家。六城合计 240 家。每家再从调查时段内符合定义的完整菜单中,按预先规定的随机起点和固定间隔取得 5 份常见组合,于是得到 6 × 40 × 5 = 1,200 份早餐。不能让调查员专挑看起来最“中式”或最不健康的五份。

这套结构同时有分层和聚类。按店铺类型分层,是为了避免抽样运气使某类场景几乎消失;每店收五份形成聚类,可以减少现场往返,却使同店早餐共享菜单、采购和制作条件。分析的一行是早餐组合,抽中并把多行连接起来的单位是店铺。两种单位不相同,样本量就不能只把 1,200 当成彼此独立的观察。

计算先服务主要问题,也就是估计低于 6 分的早餐比例。假如每份早餐都像简单随机抽到一样相互独立,希望 95% 估计区间从中心向任一侧延伸约 3 个百分点,可以使用比例样本量关系:n0 = z² × p × (1-p) ÷ d²。其中 z = 1.96 对应常用的 95% 水平,d = 0.03 是可接受的单侧误差。计划阶段不知道真实比例时取 p = 0.50,因为它在其他条件相同时给出较保守的样本量。代入得到 1.96² × 0.50 × 0.50 ÷ 0.03² ≈ 1,067。

1,067 仍然假设每份早餐独立。教学方案用店内相关系数 ρ = 0.02 表示同店相似,每店平均 m = 5 份。由聚类造成的精度折损称为设计效应,这里是 1 + (m-1) × ρ = 1 + 4 × 0.02 = 1.08。把 1,067 乘以 1.08,得到约 1,152。再为关键字段缺失、组合不符合定义或无法复核等约 4% 的不可用记录预留,1,152 ÷ (1-0.04) = 1,200。现场结构才由此落到 240 家店、每店 5 份。

这条算式公开了 1,200 依赖的条件,也公开了它可能失效的方式。预测试若发现店内相关不是 0.02 而是 0.08,聚类折损会增加;不可用率若明显高于 4%,实际可分析记录会减少。参数变化时应重新计算,而不是反过来挑一组刚好证明既定预算合理的数字。95% 和 ±3 个百分点也不是科研的统一标准,预算、决策后果和主要目标不同,团队可能接受不同精度。

计算结果还要服从实际抽样单位。每家固定记录五份,最终数量就应调整成完整店铺数,而不能为了贴近一个小数结果,把最后一家店只记录两份,或者把需要的店数向下抹掉。若预算最多只能支持 200 家店,正确做法是重新计算可达到的精度,并明确取舍;先把 1,000 份定死,再调低店内相关或不可用率使公式正好成立,只是用计算装饰预算。

相同的行数,可以含有不同的信息

假如团队为了少跑门店,把方案改成 120 家店、每店 10 份,文件仍有 1,200 行。沿用 ρ = 0.02,设计效应变成 1 + 9 × 0.02 = 1.18,粗略有效样本量约为 1,200 ÷ 1.18 ≈ 1,017。原计划每店五份时,粗略有效样本量为 1,200 ÷ 1.08 ≈ 1,111。

“有效样本量”只是帮助理解重复信息造成的精度损失,不表示原始文件真的少了若干行。两种方案都观察 1,200 份早餐,但 240 店×5 份覆盖更多菜单来源,同店重复更少。对主要比例来说,多去一家店通常比在已经进入的店里继续抄相似组合更有价值。这也是为什么论文只写“共纳入 1,200 份”远远不够。

当然,多跑一家店的成本通常高于在同店再记一份,这正是聚类抽样存在的现实原因。设计不是无视成本追求最大独立性,而是把成本节省换来的精度损失公开计算。团队可以决定接受更强聚类,却不能一边享受少跑门店的便利,一边仍按 1,200 个独立来源报告区间。预算决定现场能够做到什么,设计效应则让这种妥协不会在分析中消失。

总体精度也不能分给每个小组。六城合并的主要比例按照 ±3 个百分点规划,每城只有 200 份。暂时忽略聚类、仍按 50% 计算,每城简单区间的半宽约为 1.96 × √(0.5×0.5÷200) ≈ 6.9%。再分到某类店铺,样本更少,结果会更不确定。1,200 能支持一个总体主要问题,不等于顺便让六座城市和四种店铺都获得同样精确的独立结论。

如果准确比较六座城市原本就是主要目标,样本量就要围绕城市差异另行设计。六城之间还会产生许多两两比较,尝试越多,偶然出现醒目差异的机会也越大。不能等总体样本收完,再从中挑一组差异最大的城市,并借用总体精度为它担保。

WHO 2025 年的抽样与加权手册面向手机调查,研究对象与早餐店不同,但其中关于对象按已知机会进入样本、逐级抽取和计算代表份额的关系仍有通用价值。借用的是概率抽样原则,不是把手机号码规则原样搬到门店。研究者引用一种抽样方法时,也要交代它在自己场景中如何实际执行。

抽中,不等于最终进入数据

抽样程序选中一家店,它仍可能停业、拒绝参与或不符合纳入条件。调查员不能因此走进隔壁最好说话的门店。每个店铺层需要预先生成随机替补顺序,达到规定联系次数并记录原店状态后,才启用同层下一家。原抽中数、停业数、拒绝数、替补数和最终入样数都应保留。

替补能够维持计划中的场景构成,却不能让拒绝从证据中消失。假如拒绝配合的门店普遍更小、配方更不透明,最终样本仍可能偏向容易提供资料的店。研究者可以利用抽样框中已有的店铺类型和地区信息比较进入者与未进入者;没有相应资料时,只能把不确定性留在结论中,不能写“采用随机替补,因此无非应答偏差”。

门店内部也要记录合格组合总数、抽中数和不可用原因。每份早餐获得唯一 combo_id,同时保存 shop_id,才能从最后一行数据追到哪家店、哪次抽取。六城主汇总因为每城都是 200 份而采用等权,它描述的是这个教学总体,不是让人口更多的现实城市代表更大份额。

120 份参照测量子样本按六城各 20 份取得,并在城市内跨店铺类型随机选择。若让调查员挑“最标准、最好称”的早餐,测量误差只会代表容易处理的记录,无法说明那些配方模糊、份量难估的组合。STROBE要求观察性研究透明报告对象选择、纳入标准和分析样本,正好提醒现场团队保存从抽样框到最终文件的全部流转,而不是只交一张洗干净的表。

一份抽样方案是否真正完成,可以交给现场人员试走:他能否从明确的名单找到第一家店,拒绝后知道启用哪家替补,在门店内按规则选五份,并为每一步留下编号。若他拿到的只有“六城共 1,200 份”,前面的公式仍没有成为研究。

最终的 n 当然要报告,但它不是代表性的缩写。只有当读者同时知道城市怎样确定、门店如何获得机会、早餐为何成组、哪些对象拒绝或未能进入,这 1,200 行才说明自己从哪里来。样本量可以让一项合格抽样的估计更稳定,却不能替一项来源含糊的研究购买它从未拥有的代表性。