核心结论

把科研任务交给 AI,关键不是把提示词写得很长,而是让它知道这次究竟要交付什么。研究目标、允许使用的材料、不能越过的边界、输出怎样进入下一步,以及研究者准备如何验收,这些内容没有写清楚,模型只能自己猜。

因此,真正值得保存的不是某段“神级提示词”,而是一份任务说明。提示词只是把说明发送给模型的那段文字。工具换了,措辞可以换;目标、材料和验收口径不能跟着消失。

先把“深入分析论文”改成一件具体的事

下面用一个教学场景说明。某位博士生手里有 12 篇可降解涂层论文,原本想让 AI “深入分析这些文章,并找出研究空白”。这句话听起来目标明确,实际混在一起的至少有三件事:逐篇提取实验信息、比较不同论文的结果、判断还有什么值得研究。

他眼下真正缺的并不是研究空白,而是一张能帮助自己设计实验的比较表。具体来说,他想知道各篇论文用什么指标测量耐腐蚀性能,实验介质和观察时间是否相同,哪些结果可以放在一起比较。把这个需求说清楚以后,任务自然缩小了:先比较测量方法,不评价哪种涂层最好,也不直接宣布创新点。

这一步很容易被忽略。研究者说“分析”,心里可能想的是比较;模型理解的“分析”,却可能是每篇写一段摘要。最后生成了十二段流畅文字,双方都完成了各自理解中的工作,结果仍然不能用于实验设计。

这份任务说明写给人看,也写给 AI 看

博士生把任务记为 TASK-LIT-03 v1.0。下面是实际送入工具前的版本。它没有角色扮演,也没有要求模型“全面、专业、深入”。

项目本次任务的写法
目标比较 12 篇论文怎样测量可降解涂层的耐腐蚀性能,整理测量指标、实验条件和观察时间,供后续实验设计使用
材料P01—P12 全文、论文编号表、项目术语表 1.2 版;只依据这些文件
不做什么不判断哪种涂层整体最好;不直接提出研究空白;不按期刊或作者推断质量;不补写原文没有的数值和参考文献
怎样处理先确认样品和对照,再定位实验介质、指标、单位和时间点;结果数值与作者解释分开记录
交付内容每篇论文对应若干条记录,包含论文编号、材料与对照、实验介质、测量指标、单位、时间点、结果、证据位置和可比性说明
无法确认时文件缺页、扫描不清或正文没有报告的内容写“原文未确认”,不得根据摘要或常识补齐
怎样验收12 篇都要有处理记录;数值带单位和页码、表号或图号;先完整核对 P02、P06、P09、P12,再决定是否使用其余结果
什么时候停关键数值与原文错配、不同指标被当成同一指标,或证据位置无法复核时,停止批量处理并回查

这张表最重要的作用,是让“完成”变成一件双方都能判断的事。十二篇各有记录,不等于十二篇都必须有结果;如果 P08 没有报告实验介质,合格输出应当保留 P08 并写“原文未确认”,而不是静默漏掉它,也不是补一个常见介质进去。

材料一栏也不是简单写一句“见附件”。论文编号表用来防止文件名和论文身份错配,术语表则固定项目内已经采用的中英文名称。若某篇 PDF 只有摘要,模型应在材料检查时把它报出来,研究者决定补全文还是暂不处理,不能等比较表完成以后才发现若干结论其实来自摘要。

边界和交付内容要配着看。“不把作者解释写成实验结果”只有落实到不同字段才有用。原文报告的数值进入“主要结果”,作者对机理的讨论另行记录,两者都带证据位置。这样,后续写综述的人能看出哪句话是观察结果,哪句话仍是论文作者的解释,不会因为它们出现在同一段正文里就混成一个事实。

输出怎样使用,也在这里提前确定。论文若报告三个时间点,就生成三条记录,而不是把三个数值塞进一个单元格。这样整理好的内容可以直接进入后续证据矩阵,不必等十二篇全部完成后,再由人工拆列和猜测一对多关系。

NIST AI 风险管理框架把使用情境、预期用途、测试和处置放在相互关联的位置,也明确指出这些动作不是一张固定顺序的检查清单。对这项文献任务来说,具体做法就是先写用途,再用少量已知材料测试;发现系统性错配时,返回任务说明修正,而不是继续处理剩余论文。

第一次试跑,让一个含糊的字段露了出来

任务说明写完后,博士生没有马上处理 12 篇,而是先选了自己熟悉的 P02 和 P06。第一次输出读起来没有明显问题,证据位置也能找到,但表格把两项结果都归在“耐腐蚀性能”下面,并给出了“可比较”的判断。

把相关记录简化后,问题很清楚:

原文信息
P02:腐蚀电流密度;浸泡 7 天后测量
P06:阻抗值;测试开始时测量

AI 第一次整理
P02|耐腐蚀性能|浸泡 7 天腐蚀电流密度|可比较
P06|耐腐蚀性能|测试开始时阻抗值|可比较

人工核对
指标不同,时间点不同,不能放进同一结果列横向比较。
两条记录均保留,但可比性改为“不可直接比较”。

这里没有编造数值,模型也确实找到了原文位置。如果验收只检查“是否完整”和“是否有出处”,这两条都会通过。错误来自任务说明本身:它要求提取指标和时间,却没有明确规定,每一条结果必须同时绑定指标、单位、时间点和实验条件;“同属耐腐蚀性能”也不能成为横向排序的理由。

博士生据此把原来的同一份说明改为 v1.1。交付内容中增加一条约束:一条记录只能对应一个指标和一个时间点;可比性判断必须写出共同条件,不同指标、不同介质或不同时间点默认不直接比较。停止条件也随之变得更具体:一旦再次出现跨指标或跨时间点排序,就暂停剩余论文。

验收人随后回到表中的四篇抽查对象。核对时不是从头重读一遍 AI 的总结,而是从每条记录标出的页码、表号或图号返回原文:论文编号是否对应,指标和单位有没有抄错,时间点是否跟着数值一起移动,“不可比较”的理由是否真的来自实验条件。发现一条证据位置指向讨论段、找不到对应数据,这条记录就不算通过,即使结论碰巧与原文一致。

修改以后不能继续用 P02 和 P06 证明任务已经可靠。模型已经见过这两条及其修正,再跑一次只能说明它会不会顺着刚给出的答案。博士生换了一篇自己提前核对过、同时报告多个时间点的论文复测。模型把各时间点拆成独立记录,并分别保留证据位置,这才开始处理余下材料。

提示词只负责把说明送进去

任务说明准备好以后,真正输入模型的文字可以很短:说明本次执行 TASK-LIT-03 v1.1,附上待处理论文,并要求它先处理一篇,输出后等待核对。没有必要再叠加“你是世界顶级材料学教授”“请进行深度思考”之类的身份和语气要求。

第一次运行也不要一句话要求它处理到底。先让模型复述它收到的论文编号、缺失文件和准备交付的字段,研究者确认无误后,再处理一篇。这样做不是增加聊天仪式,而是尽早发现附件漏传、版本拿错或字段理解不同。材料清单已经不对时,后面生成得越多,返工越大。

这些话最大的问题不是一定有害,而是占据了研究者的注意力。模型被称作什么角色,不会自动知道“未报告”和“数值为零”的区别,也不会知道论文报告三个时间点时该生成三行。能影响结果的,是材料里有没有这项信息、任务说明采用什么口径,以及错误出现时是否有人真的停下来。

同样,输出格式不能只写“请用表格呈现”。表格可以很漂亮,里面的内容仍可能无法核对。任务说明要求每个结果带证据位置,是为了让博士生能返回原文;要求无法确认时保留缺失,是为了防止完整表格掩盖材料不足。这些约束都服务于下一步工作,而不是为了让提示词显得专业。

NIH 关于科研严谨性与可重复性的说明把严谨性落实到研究设计、方法、分析、解释和结果报告的严格运用。放到这项任务里,AI 输出的表格只是中间材料:它是否可用,要看提取口径能否被说明、原文位置能否被别人找到、相同材料能否按同一规则重新处理,而不是看文字是否像专家写的。

什么时候该新建任务,而不是继续补充原说明

处理完测量方法以后,博士生可能想让 AI 根据比较表判断研究空白。此时不应在 TASK-LIT-03 后面追加一句“再给出创新建议”。提取报告内容和判断研究空白,需要的证据、判断口径与人工责任不同,后者已经是另一项任务。

任务说明可以在原目标不变时修订,例如补上跨时间点不得直接比较的规则,或者把缺失值写法统一为“原文未确认”。如果主要产物从比较表变成创新性结论,或输入从十二篇全文扩展到新的数据库检索结果,就另建编号。旧说明和旧输出留着,才能知道哪批记录按什么口径生成,也能判断哪些内容需要重跑。

这个区分不需要复杂的版本系统。任务编号、版本、使用的文件版本和一次简短的修改原因已经够用。关键是不要让一项已经通过验收的提取任务,在聊天过程中悄悄变成没有定义过的评价任务。

如果只是把输出从 Markdown 表格改成 CSV,目标和判断口径没有变化,可以在原任务中记录格式调整。若增加了新的比较指标,则要看已有十二篇是否都需要重新提取;需要重跑,就在版本说明里写明影响范围。版本号的价值不在形式整齐,而在于团队以后能够回答:眼前这张表是按哪套规则产生的。

这次交付最终停在什么地方

完成试跑和修正后,TASK-LIT-03 v1.1 只交付一张测量方法比较表。每条结果绑定论文、指标、单位、时间点、实验条件和证据位置;条件不足的记录明确写出为什么不能直接比较。博士生核对约定样本后,才接受其余记录进入证据矩阵。

它没有替博士生判断哪种涂层最好,也没有直接生成研究空白。这不是任务少做了,而是任务已经在预定的位置完成。接下来若要评价证据或寻找创新点,应当带着这张经过核验的比较表,另写一份新的任务说明。