核心结论
论文图表首先是一件证据工具,才是一件视觉作品。动手画图前先写清读者要判断什么,再让每个点、线、区间、标签和分母回到同一份分析结果。这样才能分辨“版式更漂亮”和“科学含义被改变”。
本文只跟踪一张回归结果图。它从一幅看似醒目的彩色柱状图,改成可以核对估计与不确定性的森林图;贯穿修改的是一张图表来源单,而不是一套通用美化提示词。
数字没有变,第一版图仍然误导了读者
教学案例分析四项行为因素与 30 天再入院的关联。统计负责人已经冻结主要模型,结果表包含调整后优势比、95% 置信区间、实际样本数和参照定义。作者让 AI “做一张适合论文、突出显著变量的图”。
模型生成四根颜色鲜艳的柱子,把最小 p 值的因素排在第一,横轴从 0.8 开始,没有置信区间,参照线画在 0。图中使用的点估计没有被篡改,视觉含义却错了:优势比的无效值是 1,截断坐标放大差异,没有区间则隐藏估计精度,按显著性排序又把探索结果包装成重要性排名。
团队没有继续调颜色,而是把任务改写成一句读者问题:“四项因素的调整后关联方向和大小是什么,估计有多不确定,各自相对于哪个参照?”这句话决定要显示点估计、95% 区间、OR=1 的无效线和清楚的参照标签。柱状图不再合适,改用森林图。
第一版指令:做一张漂亮的图,突出显著结果
读者实际需要:比较四项调整后优势比及其不确定性
必须保留:点估计、95% 区间、OR=1、参照组、实际样本数
不能编码:按 p 值排序、用颜色暗示重要性、隐藏未显著结果
图形选择不是审美偏好,而是由判断任务和数据结构决定。若案例换成同一人的前后变化,就要保留配对;若要看连续值分布,就不能只画均值柱;若是筛选流程,每一步人数必须对账。
来源单让图中的每个元素都有出处
团队为图 2 建立来源单。它只接受冻结结果表,不从论文草稿或截图抄数字:
| 图形元素 | 数据与含义 | 核验要求 |
|---|---|---|
| 四个点 | 主模型四项调整后优势比 | 与结果编号、方向和单位逐行一致 |
| 横线 | 对应 95% 置信区间 | 下限、上限与点来自同一模型 |
| 竖线 | OR=1 | 不使用 0 作为比值尺度参照 |
| 纵轴标签 | 因素名称和比较参照 | 与变量字典、方法和表 2 一致 |
| 排序 | 预先确定的临床逻辑 | 不按显著性或效应大小重排 |
| 页脚 | 实际分析 n、数据与模型版本 | 与统计登记表一致 |
绘图脚本读取结构化结果,先验证四个结果编号是否齐全、区间是否包围点估计、参照字符串是否缺失、模型版本是否相同。任何一项不满足就停止,不能在图形软件里手工补一条线或输入一个数字。
第一次重画时,脚本发现其中一行的区间来自敏感性模型,而点估计来自主模型。两者数值接近,肉眼很难发现。来源单要求点与区间共享结果编号,这项混用在导出前被拦住。团队回到统计输出重新生成,而不是选视觉更整齐的那组区间。
横轴采用适合优势比的尺度,并明确标出 1。范围要覆盖所有区间,不能裁掉宽区间只为了让图居中。极宽区间若压缩了其他结果,可使用清楚标注的轴处理或补充呈现,但不能让读者误以为被裁掉的端点不存在。
团队也认真比较过表格。四项结果数量不多,如果读者主要需要查找精确数字,表 2 已经足够;森林图保留下来,是因为论文还需要让读者快速比较方向和区间是否跨过无效线。它不重复表中的全部模型参数,只呈现这项视觉判断所需信息。若只有一项估计,另画一幅图反而可能浪费版面。
点旁没有再加显著性星号。星号会再次把注意力拉回阈值,而区间已经呈现不确定性。p 值仍可按期刊和分析方案在结果表中报告,不能因为图上没有星号就从研究记录消失,也不能因为有星号就省略效应和区间。
三位读者让图暴露了三个不同问题
第二版图交给三位未参与制作的人,每人完成三个任务:指出主要比较,读出任一因素的估计与区间,说明图中不能直接得出什么结论。
第一位把一个缩写当成行为因素本身,没有理解它其实表示“是”相对于“否”。团队把参照写进标签,而不是只放在长图注末尾。第二位能读出点估计,却不知道横轴是比值尺度;团队调整刻度并在图注明确 OR。第三位认为离 1 最远的点“导致”再入院,说明图注和正文没有充分标明这是观察性关联。
这三项都不是换字体能解决的问题。修改后再次测试,读者能够说出方向、区间和参照,也知道图不能证明因果或比较不同因素的机制重要性。图表好不好,不只看作者能否解释,更看脱离口头说明后是否仍能被正确阅读。
无障碍检查也放在同一轮。颜色不是区分结果的唯一方式,点形和直接标签提供冗余;图在灰度打印和常见手机宽度下仍可识别;字体与线宽按最终版面检查。高饱和颜色不等于辨识度,低对比的细区间也会让不确定性在缩放后消失。
图、图注、正文和方法必须同时对账
森林图通过阅读测试后,团队同时打开统计结果、图、图注和正文。点的方向与区间来自同一行,实际样本数与模型一致,图注解释 OR、95% 区间、无效线、参照和调整信息,正文只强调预先关注的比较,没有把图中最有利的一项单独升级成主要发现。
这次对账发现正文写着“全部 642 名参与者”,主模型实际只纳入 617 人,因为两项协变量缺失。图页脚已经显示 617,图注却没有解释差异。团队没有把图改回 642,而是在方法和图注交代实际分析样本,并让流程数量与缺失记录对应。
又发现摘要使用旧版模型的一位小数结果,而图已经更新为两位小数。作者从图的结果编号返回登记表,统一精度和版本。自动字符串检查能找出类似数字,科学方向、参照和措辞仍要作者确认。
图注经过修改后能够独立回答这些问题:研究对象和结局是什么;点与横线各表示什么;参照组如何定义;模型调整信息在哪里;617 是怎样得到的;观察性设计不能支持哪类因果说法。它没有把结果段完整复制一遍,也不在图注里宣布“最重要因素”。
导出环节另做一次复核。编辑器里的矢量图正确,不代表嵌入稿件后仍正确:字体替换可能使负号消失,裁切可能截断区间端点,PDF 转换也可能改变透明度和细线。团队在投稿尺寸查看最终 PDF,核对四个点、八个区间端点、无效线、标签和页脚,再从其中一个点反查结构化结果。
ICMJE 的稿件准备建议强调按逻辑呈现结果,避免正文、表格与图无必要地重复。对本案例,正文说明最重要判断,森林图承载四项估计与区间,完整模型细节留在表格;三者分工,而不是复制同一组数字。
审稿人要求“突出一个亚组”时,修改回到代码
审稿意见提出把某个亚组改成醒目颜色,并按效应大小排序。作者先判断这是否改变读者对预设分析的理解。该亚组原本是探索性的,若以最强颜色和第一位置展示,会给它超出设计的地位。团队在回复中说明分层性质,并用分面和文字标签区分,而不按结果大小重排。
任何改变数据选择、分组、时间窗口或计算的要求都回到冻结数据与绘图代码。纯版式调整也保留参数和上一版图。一次变量标签更新触发代码重跑,来源单随后检查表 2、图注和正文是否使用同一定义。没有人直接在导出的 PDF 上移动点或擦掉系列。
图像文件本身携带的名称不作为唯一版本证据,因为 final-final2.pdf 无法说明它来自哪次分析。来源单记录输入文件校验、结果编号、绘图脚本提交和导出设置;稿件只引用已放行的图号。工作目录里即使还有候选图,也不会被排版人员误选为正式结果。
如果模型或数据更新,旧图标为过期,脚本生成新版本并重新执行阅读测试与四方对账。这样做看似比手工改图慢,却避免“图换了、正文没换”或“区间来自另一模型”的隐蔽错误。
实验图像不能交给生成工具补得更好看
来源单同样适用于显微图、凝胶和医学影像,但这些图像有更严格的完整性要求。生成式工具不能补齐缺失区域、去掉不理想信号、制造更清楚的细胞边界,或把示意性内容混成真实实验结果。
Nature Portfolio 的图像完整性政策要求最终图像正确代表原始数据,并说明相关处理。具体允许的裁剪、亮度、拼接与标注还要核对目标期刊和领域规则。提高分辨率时,应从原始绘图对象或获准的原始影像重新导出,不用生成式增强猜出像素。
纯说明性插图与数据图也要明确分开。若期刊允许 AI 生成示意图,作者仍需核对披露和版权要求;示意图不能被放在结果面板中,让读者误以为它来自实验观察。
同一原则也约束常规“美化”。删除散点中的极端观察、把误差线缩短到更整齐、复制一块背景遮住实验瑕疵,都会改变或遮蔽证据。若确有获准的整体亮度调整或裁剪,原始文件、操作参数和未处理版本应保留,图注或方法按期刊要求说明。局部修改不能因使用的是传统修图软件就变得合理。
图 2 最后显得比第一版安静:没有冠军色,没有星号雨,也没有夸张坐标。它却让读者看到四项估计、区间和参照,并能从任意一个点返回冻结结果。只要分母、模型或标签发生变化,这张图就重新生成和复核;无法回到来源的“漂亮版本”不进入论文。
交付给期刊的是图、图注和来源单共同确认过的版本。作者不需要向读者展示整张内部来源单,却必须能够回答图中任一数字来自哪一行、哪一模型和哪一次运行;回答不出来,就说明制图还没有结束。