第一次讨论选题时,“中式早餐是不是不健康”很容易得到点头。话题有现实感,也有传播性,几乎每个人都能马上举出几个例子。可当负责调查的人准备画数据表时,讨论往往会停下来:一行究竟是一件食品、一份早餐组合,还是一个吃早餐的人?“不健康”是看这顿饭的营养组成,还是看几年以后有没有患病?样本来自早餐店、食堂还是家庭厨房?

如果这些问题只能靠作者在旁边不断补充,白板上的那句话就还不是研究问题。它表达了研究兴趣,却没有决定数据从哪里来,也没有排除这项研究不能回答的内容。

本系列的早餐研究仍然是虚拟教学案例。六个城市片区、240 家店、1,200 份早餐和后续出现的评分规则都不是现实调查结果,也不构成营养建议。我们借它讨论的,是一个比措辞更根本的问题:研究问题为什么要主动缩小作者想说的话,研究假设又为什么必须给作者留下判断失败的可能。

好问题首先要舍得删

一个选题通常从宽泛的兴趣开始,这没有问题。问题在于,很多人舍不得把兴趣里最吸引人的部分删掉。“中式早餐是否影响健康”可以涉及家庭习惯、个人摄入、地区文化、收入差异和多年后的疾病,但一项研究不可能因为标题里写了这些词,就同时拥有相应的证据。

虚拟研究最终把对象限定为六个固定城市片区中的常见外购早餐组合。数据表中的一行是一份可以同时购买的早餐搭配,不是一名就餐者,也不是某个人一天的全部饮食。调查在一个时期内观察早餐本身,不招募食客,不记录他们几年的健康变化。这样一来,“长期吃某种早餐是否增加慢性病风险”就必须从当前问题中拿掉。

删掉它,不是因为疾病不值得研究,而是因为现有对象根本没有疾病资料。若坚持回答这个问题,研究对象就要换成人,数据里要出现年龄、既往健康状况、长期饮食和后续结局,还会涉及新的伦理与随访安排。那会成为另一项研究,而不是给现有早餐表多加一列就能完成的扩展。

问题经过这样的删减,才有了可以执行的写法:在六个虚拟城市片区抽取的常见外购中式早餐组合中,按照预先规定的教学营养评分,低于 6 分的比例是多少?对象、范围和主要结果都在句子里,读者不需要猜作者想去哪里找数据。美国国立心肺血液研究所的观察性研究质量评估说明把问题是否清楚、研究人群来自何处以及在什么时期取得放在前面的判断位置,原因就在于此:如果谁会成为一行数据仍不清楚,后面的统计精度没有落脚点。

研究问题因此不是把大题目写得更专业,而是公开承认这项研究准备放弃什么。它越清楚,允许作者自由发挥的空间反而越小。

主要问题必须管得住后面的选择

对象确定以后,团队仍然会冒出许多有趣的问题:低分早餐多不多,哪类主食得分较低,价格是否有关,不同城市是否一样,连锁门店和摊点是否不同,油炸食品会不会伴随较低评分。若把它们全部并列为研究中心,样本量不知道为哪个结果计算,数据表会越画越长,写论文时也很容易挑出最漂亮的发现临时充当主角。

这项虚拟研究把“低于 6 分的比例是多少”定为主要问题。能量、蛋白质、膳食纤维、钠和食物类别数的分布,可以帮助读者看懂这个比例由什么构成;食物组成、价格、城市和店铺类型与评分的关系,可以帮助解释样本为什么出现差异。它们都有价值,但不与主要比例争夺整项研究的中心。

研究目标、研究问题和研究假设在这里承担不同责任。目标是研究者准备做什么,本例要估计结构失衡比例并考察若干可观察特征与评分的关系;问题是数据最后必须回答什么;假设则是结果出现以前写下的预期,而且必须允许数据不支持它。把三者写成同一句话的三个版本,只会让“准备做什么”“想知道什么”和“预期看见什么”重新混在一起。

并非每个问题都需要一个方向假设。“样本早餐的钠含量怎样分布”只要求如实描述中位数、范围和分布形状。没有可靠依据却硬写“钠一定很高”,只是把印象换成了科研措辞。真正需要检验的预期才写成假设,研究者不确定方向的部分应当诚实地保留为描述或探索。

这项安排还有一个实际作用:后面的每一次取舍都有了裁判。某个字段是否值得收集,某种模型是否必要,某个结果是否应该进入摘要,都可以问一句——它在回答主要问题,还是在解释主要结果?若两者都不是,就不能仅凭“也许有意思”无限扩张研究。

它还防止论文在结果出来以后悄悄更换主角。假如主要比例平淡,六个城市之间恰好出现一个醒目的差异,作者可以把这个差异如实写成次要或探索结果,却不能删掉原来的主要问题,再把论文包装成一项从开始就以城市比较为目标的研究。若城市差异确实值得成为新的中心,应当据此设计下一项研究,重新考虑每城样本、比较方法和可能的替代解释。承认一个发现来得意外,比伪造一条从未存在的预测更有研究价值。

假设的作用,是让作者也可能错

日常语言里的“普遍”尤其容易逃避检验。假如样本中有 58% 的早餐低于合格线,研究者可以事后说“超过 55% 就算普遍”;若结果是 48%,又可以改口说“接近一半也很普遍”。只要标准跟着数据移动,任何结果都能被包装成原判断正确。

虚拟研究因此在查看结果以前,把主要假设固定为:按照教学评分,超过半数样本低于 6 分。低于 6 分是主要结果的操作定义,超过 50% 是“普遍”在本案例中的失败边界。若估计结果没有清楚支持超过半数,能写的只是主要假设未获支持,不能转而宣称已经证明低分早餐少于一半。估计可能靠近 50%,也可能不确定性太大;这两种情况都与“证明相反结论”不同。

6 分本身并不是公认的现实营养诊断线。真实研究需要根据目标人群、正式指南、营养专业意见和测量验证来确定标准。为了知道结论是否过度依赖这一条教学界线,方案还会预先计算低于 5 分和低于 7 分时的结果。这两个替代阈值只能用来观察主结论是否敏感,不能在 6 分结果不理想时接替它成为主要答案。

关联问题同样要把预期说在前面。本案例保留三条:含明确蛋白质食物的早餐,结构失衡概率较低;含蔬菜或奶豆类的早餐,结构评分较高;价格与评分有关,但价格不能完全解释食物组成的差异。数据中后来发现的其他关系仍然可以报告,却应当标作探索发现,而不能假装作者早已预测。美国国立神经疾病与卒中研究所关于严谨研究设计的说明强调预先说明研究问题和分析,并区分验证性与探索性内容,正是为了让读者知道哪些判断真正冒过失败风险。

假设不是作者立场的庄严版本。它更像作者写给未来结果的一份约束:如果数据走向另一边,我愿意改掉哪一句话。

没有数据入口的问题,仍然只是愿望

一个问题写得再严谨,如果不能导出需要记录的内容,仍然停留在纸面上。主要比例要求每份早餐都有总分和低分标记;蛋白质、蔬菜、奶豆类与评分的关联,需要相应的食物标记;价格预期需要价格、食物组成、评分、城市和店铺类型。若问题写了蔬菜,记录表却只保存餐名,后面的模型不会凭空知道一份包子里有没有蔬菜。

反过来,每个准备收集的字段也应当说清自己服务哪个问题。包装颜色若既不进入主要结果,也没有可信理由解释评分,就不该因为表格还有空位而收进正式数据。无关字段看似没有坏处,实际会增加现场负担、缺失和事后挑选偶然关系的机会。

每家店记录五份早餐还带来一种容易被误写的内容:同店早餐共享菜单、采购和制作方式,可能比不同店铺的早餐更相似。因此必须保留 shop_id,在估计不确定性时按店铺成组处理。这不是等待数据支持的营养学假设,而是抽样结构产生的分析条件。若把它与“蛋白质食物和低分有关”放在同一类假设里,研究者会把计算前提误当成研究发现。

问题与字段的关系应当是双向的。问题向数据表索取必要字段,数据表则迫使问题暴露自己是否可测。六城、240 家店和 1,200 份早餐此时仍只是计划样本;它们没有产生任何调查结论,却已经能够检验问题有没有落到实际观察上。

冻结起点,不等于禁止修改

研究问题并非写下以后永远不能动。文献检索可能发现某个概念没有可靠测法,预测试也可能发现门店根本无法提供关键配方。面对这些证据,修改问题和评分规则是正常的。真正有问题的是删掉修改痕迹,让看过数据以后形成的新标准伪装成最初计划。

合理的修改要留下时间、理由和受影响的部分,并在正式分析以前冻结新版本。NIH 关于严谨性与可重复性的说明把设计、方法、分析、解释和报告看成连续过程,也意味着起点变化时,后面的变量、样本量和结论边界必须一起重查。冻结不是停止思考,而是不允许结果悄悄回头改写问题。

判断一个题目是否已经可以开工,不妨把它单独交给一名没有参加讨论的人,不再补任何口头说明。让他写下准备去哪里找数据、一行记录什么、主要报告哪个结果、什么情况会使假设不获支持。若他画出的数据表与原团队完全不同,先改问题,而不是责怪读者没有理解作者。

到了这一步,“中式早餐是不是不健康”已经不再只是一个容易引起共鸣的话题。它失去了几种更响亮但无法承担的答案,换来了明确的对象、结果和失败条件。研究问题真正提供的,正是这种克制;没有这种克制,数据越多,作者反而越容易从中挑出一个自己喜欢的故事。

能把问题缩到证据够得着的地方,并不显得宏大,却是这项研究第一次真正对结果负责。