核心结论

论文写作不是给已经算好的结果套一个格式。它真正要完成的,是让读者沿着研究问题、方法、数据和解释逐项检查:这个数字怎样来的,它回答了什么,还有哪些话不能由它推出。

结果部分负责写“观察到了什么”,讨论部分负责写“这些观察可能意味着什么、还有什么别的解释”,结论只留下证据最稳的一两层回答。三处如果都写成“本研究证明了……”,前面再严谨的设计也会在最后几句话里被放大。

本文把前九篇的虚拟早餐研究整理成论文主张。它仍是方法教学,不是现实调查。任何标题、摘要和结论都必须保留这项限定,不能只在方法末尾藏一句“数据为模拟”。

先给每项证据划一条不能越过的线

写正文以前,可以先做一张主张表。左边放证据,中间写它直接支持的句子,右边写最容易发生的升级。

为了让本篇可以单独阅读,先回顾表里的几个结果名称。“按店铺聚类调整”是把同一家店的五份早餐作为一组计算区间;调整后的优势比(OR)是在同时考虑城市、店铺类型等已记录条件后比较两组,OR 等于 1 表示两组没有差别;AUC 看模型能否把低分早餐排在更前面,Brier 分数看预测概率离实际 0/1 结果有多远。它们分别回答不同问题,不能拿一个数代替整项研究。

证据可以写不能升级成
669/1,200 低于 6 分,聚类调整区间 52.6%—58.9%在六座城市所占比重相同的模拟样本和教学评分下,低分比例超过一半中国多数中式早餐不健康
食物标记、油炸和价格的调整后 OR同时考虑模型中其他已记录条件后,这些特征仍与低分状态有关增加蔬菜必然改善健康;涨价造成低分
AUC 0.829、Brier 0.167当前模拟模型有一定排序与概率表现模型已经能评价现实早餐或指导个人选择
低于 5/6/7 分为 38.8%/55.8%/70.7%总体判断对教学阈值敏感任选 70.7% 作为“真实失衡率”
120 份参照测量中蛋白质、钠误差为 6.7%、9.2%两项估值误差有了教学量级已经证明整套评分准确测中了“营养结构”这个概念

这张表的用处不是让措辞变保守,而是让每句话与实际证据处在同一层。样本证据不能越过抽样范围,关联证据不能越过时间和干预条件,模型性能不能越过验证场景,教学测量也不能假装已经在现实中证明“确实测中了目标概念”——研究方法把后一项判断称为效度。

如果一个句子无法放进中间一列,要么回到数据补证据,要么缩小句子。最危险的做法是把它留在讨论中,认为“讨论本来就可以大胆推测”。讨论允许提出解释,却必须让读者看得出哪部分是数据、哪部分是推测。

引言、方法、结果和讨论,不是在重复同一件事

引言的任务是把问题带到研究入口。先用可靠文献说明为什么关心早餐组合,再说明已有证据在对象、场景或测量上留下什么缺口,最后给出本研究的问题、主要假设和三条关联预期。同店早餐需要成组处理,则写进抽样和分析方法,不再冒充第五条研究假设。引言不能一边提问,一边用“中式早餐普遍营养不良”提前宣布答案。

方法要让另一名研究者知道研究实际做了什么。本案例至少要写六个固定城市场景、四类门店、240 店×5 份的抽样结构;早餐组合的纳入定义;0—10 分及低于 6 分规则;份量与配方质量标记;120 份参照子样本;怎样按店铺成组计算区间、怎样探索早餐分组、怎样同时比较多项条件,以及更换阈值和轮流拿掉一座城市后怎样复算。模拟数据是按什么规则生成的、用哪个固定起始编号保证可以重新生成、文件是什么版本,也应公开;那个固定起始编号常叫随机种子。

方法里不应偷偷出现“最终有 55.8% 低分”,那是结果。反过来,结果也不应第一次告诉读者总分怎样算。每部分只承担自己的工作,读者才能发现方法和结果是否对应。

结果按研究问题顺序写。先交代样本流转与数据质量,再报告营养分布和主要比例,随后才是探索出的早餐模式、三条关联预期的模型结果和稳定性检查。支持预期的食物标记要写,反直觉的价格关系也要写;一个结果有没有跨过约定的统计门槛,常被简称为“是否显著”,但它不能决定结果是否进入论文。

每个主要数字最好有一个固定的家。完整系数放表格,正文只解释与问题直接相关的几项;分布形状放图,正文指出读者该看哪里。不要在摘要、正文、表格和图注里用四种不同的四舍五入,也不要让同一结果在五处逐字重复。数字出现多次时,应从同一份结果文件自动生成或逐项对照。

讨论开头先用一段话直接回答问题,不要从“随着社会经济快速发展”重新写背景。接着解释为什么可能出现几类早餐模式、价格结果有哪些替代解释,再与真正可比的既有研究对照。对照时要比较对象、测量和设计,不能只写“与某某一致”便结束。

STROBE可以帮助检查观察性研究是否报告了设计、场景、对象、变量、偏倚和分析。EQUATOR 对报告指南的说明也提醒,报告指南是一套保证基本信息完整的工具。清单能让一项有缺陷的研究更透明,却不会替作者修复实际用于抽取店铺的名单、评分是否测中目标概念,或缺少因果设计的问题。

论文之外还要准备能够对应正文的材料:冻结数据版本、数据字典、评分函数、分析代码和变更记录。美国国家科学院关于可重复性的资料区分了使用相同材料重建计算与用新数据检验发现。当前教学项目先做到前者;现实复现仍需要真正独立的数据。

局限要说明“它让哪句话变得不确定”

“本研究样本量有限,仍需进一步研究”几乎可以贴到任何论文后面,读者看不出局限对结论有什么影响。本案例的局限可以写得更具体。

六座城市是固定的虚拟场景,不是全国概率样本。因此 55.8% 不能外推为全国比例;它限制的是外部范围,不是把数字本身自动改成错误。

0—10 分是教学操作定义,而且总体比例从 38.8% 到 70.7% 随阈值明显改变。因此“失衡是否普遍”高度依赖评分规则。0—10 分、五个维度和替代阈值必须与“低于/不低于”这项两类结果一起报告。

横断面同时记录组成、价格和评分,没有真实的先后变化。即使调整后 OR 的整个估计区间都位于 1 的同一侧,也只能支持关联。未记录的商圈、菜单份量和顾客需求仍可能解释价格结果;模型还假定每增加 5 元都按同一种方式与结果变化,可能把真实的弯曲关系硬压成一个方向。

90 份未实测份量、148 份估算配方会带来测量误差。较高质量子集方向一致,让结果更稳一些,却不能证明误差完全没有影响。120 份参照子样本只检查了蛋白质与钠的一部分误差,没有验证这套评分是否完整测中了“营养结构”这个概念。

最后,六城全部由同一个模拟机制生成。留一城市 AUC 看似稳定,只说明模型能在这六组同源虚拟数据间迁移,不能当作现实外部验证。这一条局限必须在摘要和结论里出现,因为它决定整篇文章只能作为方法示例。

好的局限不是向审稿人道歉,而是给主张安装边界。它还会自然导向下一项真正不同的研究:若要认识现实比例,需要建立一份能够覆盖目标早餐店、可用于实际抽取店铺的名单,并在现实中验证评分;若要研究健康效果,需要换成人作为对象,加入时间或干预设计。

一份能够沿数字走回方法的摘要

下面是一份结构化摘要示例。它故意不塞入所有城市和聚类数字,只保留主要问题、核心方法、关键结果、验证与最重要的边界。

题目: 以模拟外购中式早餐数据演示横断面营养结构研究:一项科研方法教学

目的: 演示如何从操作定义、分组并分阶段抽样和描述估计,走到关联模型与稳定性检查;估计虚拟六城样本中低于教学营养评分线的早餐比例。

方法: 生成六个固定虚拟城市片区、240 家店和 1,200 份早餐组合的教学数据,在同一调查阶段记录现状,也就是采用横断面设计。五个营养维度形成 0—10 分,主要结果为总分低于 6。比例区间把同店早餐作为一组计算;处理两类结果的 logistic 模型纳入食物标记、每 5 元价格、城市和店铺类型,并更换阈值、排除质量较低的记录,轮流拿掉一座城市后复算。

结果: 669 份早餐低于 6 分,比例为 55.8%(聚类调整 95% 区间 52.6%—58.9%)。有明确蛋白质食物、蔬菜及奶豆的调整 OR 分别为 0.267、0.168 和 0.199;油炸食品与每 5 元价格的 OR 分别为 3.834 和 2.369。模型 AUC 为 0.829,Brier 为 0.167;留一城市 AUC 为 0.793—0.849。低于 5 分和低于 7 分的比例分别为 38.8% 和 70.7%。

结论: 在这套等权六城模拟数据和教学评分下,低分早餐超过半数,食物组成、油炸与价格和低分状态存在调整后关联;总体比例明显依赖阈值。结果只用于方法演示,不能解释为现实中式早餐现状、健康影响或价格干预效果。

摘要中的每个数字都能回到方法:55.8% 对应主要阈值,区间对应店铺聚类,OR 对应预设模型,AUC/Brier 对应模型验证。题目也把“模拟”和“教学”放在读者第一眼能看到的位置,不用一个像现实调查的标题换点击,再指望读者在全文末尾发现限定。

AI 可以帮忙改句子,不能替作者改变证据

AI 很适合做几类写作辅助:对照问题卡检查是否漏报主要结果,找出表格和正文数字不一致,压缩重复背景,把过长句子改得更顺,或者标出“导致、证明、全国”等可能越界的词。

它不能替作者决定删掉价格结果,不能虚构一篇“支持本研究”的文献,也不能把 52.6%—58.9% 改成“约六成”后丢掉不确定性。把未公开数据或在审稿件交给外部工具以前,还要检查隐私、保密和期刊规则。

ICMJE 关于作者使用 AI 的建议要求说明如何使用相关工具,并由人类作者检查准确性、完整性和引用。具体投稿时应再看目标期刊的最新政策。工具可以参与表达,最终主张、原创性和责任仍然落在人身上。

投稿前最后做一次主张审计:主要问题有没有直接答案;所有数字能否从冻结数据和代码复算;不符合预期的结果是否仍在;结果与讨论有没有混写;抽样、测量和设计边界是否跟着结论出现;标题和摘要有没有暴露模拟性质。

十篇文章到这里走完了一项常见观察性定量研究的完整路线。读者现在再进入后面的 AI 科研实务文章,面对提示词、检索、分析或写作工具时,就不必把“AI 能生成什么”误当成“研究证据允许说什么”。工具开始发挥作用以前,研究本身先要站得住。