核心结论

把科研任务交给 AI,最有用的不是背诵一段“万能提示词”,而是写出一份可验收的任务说明。任务说明至少要包含目标、材料、边界、处理方法、输出格式和验收标准。它把研究者脑中隐含的判断变成 AI 能执行、研究者能检查的约定。

提示词只是这份说明进入工具时的表达形式。没有清楚任务,即使提示词很长,AI 也只能猜测研究对象、证据范围和“完成”的含义;任务清楚以后,很多普通表达也能得到稳定结果。

为什么“帮我分析这些论文”无法执行

一句“帮我分析这些论文”,至少留下了六个未定义问题:分析是摘要、比较还是质量评价;围绕哪个研究问题;允许使用哪些材料;没有全文时怎样处理;需要提取哪些字段;什么结果算合格。AI 往往会用最常见的写法补齐这些空白,输出看似完整,却未必服务于当前研究。

科研任务特别容易受这种隐性补全影响。比如“效果更好”可能指统计显著、效应更大、成本更低或患者体验更佳;“研究质量”可能指报告完整、偏倚风险低,也可能只是在高影响力期刊发表。研究者不定义,模型就会自行选择一种含义。

因此,任务说明的首要作用不是“让 AI 更听话”,而是迫使研究者先说清自己准备作出什么判断。

六部分任务说明

一份够用的科研任务说明可以写成六部分。

1. 目标:完成什么判断

目标用动作和对象表达。例如“比较 12 篇研究对远程康复依从性的定义与测量方式”,比“总结远程康复文献”更容易验收。一个任务只保留一个主要目标;如果同时要求检索、评价、写综述和设计研究,应先拆开。

2. 材料:只能依据什么

列出 AI 可以使用的材料及其版本,例如 12 篇全文、研究问题说明、字段表和术语表。还要说明材料不完整时怎样处理:没有全文就标记“无法判断”,不能根据标题或常识补写。

3. 边界:明确不能做什么

边界不是泛泛地说“不要出错”,而是限制推断范围。例如:不把相关性改写为因果;不根据期刊名称推断研究质量;不生成材料中不存在的样本量和结论;不新增参考文献。

4. 处理:按什么顺序工作

需要判断的任务应写出处理顺序。先识别研究对象,再定位测量定义,随后摘录原文证据,最后比较差异。顺序使研究者能够检查错误发生在哪一步,也避免 AI 跳过证据直接给结论。

5. 输出:以什么结构交付

输出结构应与后续工作直接衔接。需要建立证据矩阵,就定义字段、允许值和缺失值;需要代码,就定义输入文件、函数接口和测试结果;需要文字,就规定每项结论必须带出处位置。

6. 验收:怎样判断能不能用

验收标准必须能够检查。例如“12 篇全部有记录;每个判断带页码或章节;无法判断处不补写;随机抽查 4 篇与原文一致”。“准确、专业、深入”不是可操作的验收标准。

把模糊请求改造成可执行任务

**教学模拟案例:**材料学博士生周屿已经选出 12 篇关于可降解涂层的论文,想比较不同研究怎样评价耐腐蚀性能。他原本准备把 PDF 上传后输入“请深入分析这些文章,并给出研究空白”。

这个请求把单篇提取、跨文献比较和创新性判断混在一起。改写后的任务说明如下。

填写完成的任务说明

目标
依据提供的 12 篇论文,比较耐腐蚀性能的测量指标、实验条件和观察时间,形成一张用于后续研究设计的比较表。本任务不判断整体“哪种涂层最好”,也不直接提出创新性结论。

材料
P01—P12 论文全文、论文编号表、项目术语表 1.2 版。只依据这些文件;文件缺页、扫描不清或正文未报告的信息写“原文未确认”。

边界

  • 不使用论文外知识补齐数值;
  • 不把电化学指标与失重指标直接等同;
  • 不根据摘要中的形容词判断效果;
  • 不生成新的参考文献;
  • 不把作者的解释写成实验结果。

处理顺序

  1. 确认材料对应的样品、对照和实验介质;
  2. 定位每项耐腐蚀指标的定义、单位和测量时间;
  3. 摘录支持信息并记录页码、表号或图号;
  4. 分开记录“结果数值”和“作者解释”;
  5. 只有条件足够可比时才描述差异,否则说明不可直接比较的原因。

输出字段

字段允许内容
论文编号P01—P12
材料与对照原文名称
实验介质名称、浓度、温度
测量指标指标全称与缩写
单位与时间点原文报告值
主要结果数值和不确定性信息
证据位置页码、表号或图号
可比性判断可直接比较/需谨慎/不可比较
未确认项缺失或歧义说明

验收标准

  • 12 篇各有一条或多条记录,不能静默漏掉论文;
  • 所有数值带单位和证据位置;
  • “不可比较”必须说明缺少哪个共同条件;
  • 人工核对 P02、P06、P09、P12 的全部字段;
  • 抽查发现关键数值错配时,停止批量使用并回查全部记录。

这份说明没有追求华丽措辞,但研究者可以判断任务是否完成,也能把输出直接交给下一步的证据矩阵。

提供一个正确样本和一个错误样本

仅靠字段定义,AI 仍可能误解研究者的口径。最有效的补充通常不是增加十条抽象规则,而是提供一条已经人工确认的正确记录,以及一条必须拒绝的错误记录。

正确样本应展示:原文怎样写、字段怎样填、为什么判定“需谨慎比较”。错误样本可以展示:两篇都报告百分比,但基线、介质或时间点不同,不能因为单位相同就排序。样本的用途是确定判断口径,不是诱导 AI 照抄相同结论。

当任务包含类别或评分时,还要说明临界情况。例如“证据位置只能定位到摘要,全文不可访问”应属于“未确认”,而不是低分或零分。缺失、否定和真正的零值必须分开。

分轮执行,不等于反复闲聊

复杂科研任务适合分轮,但每一轮都应产生可检查的中间产物:

  1. 第一轮只检查材料清单和缺失文件;
  2. 第二轮处理两篇样本,校准字段和边界;
  3. 第三轮批量处理剩余材料;
  4. 第四轮只做一致性和遗漏检查;
  5. 人工完成抽查、修正和放行。

这不是让 AI “一步一步想”的表演,而是把错误限制在小范围内。前两篇样本没有通过,就不应继续处理其余十篇。

NIST AI 风险管理框架强调先理解使用情境、再选择测量和处置方法。对应到科研任务,就是在运行前写明用途与风险,在运行中用样本测试,在输出后按验收标准决定继续、返工还是停止。

常见失败及其修正

把角色设定当成任务定义

“你是一位顶级教授”没有提供研究材料、判断口径或验收标准。角色可以帮助控制表达视角,但不能替代任务说明。应把篇幅优先留给真实输入、字段和边界。

同时要求过多成果

“阅读论文、评价质量、找空白、设计实验、写出引言”会让错误跨步骤传播。应按产物拆开:先建立可信论文记录,再比较证据,之后才讨论研究位置。

只规定格式,不规定证据

要求输出一张漂亮表格,并不能防止表格中的内容被编造。每个关键字段需要证据位置;无法定位时允许留空或写“未确认”。

没有停止条件

当 PDF 无法读取、术语含义冲突或抽查出现系统性错误时,继续生成只会扩大返工。停止条件应在运行前写进任务说明。

任务说明也要经过一次“干跑”

任务说明写完后,不要立即处理全部材料。先拿一个人工熟悉的样本做干跑,并逐项问:模型是否找到了正确材料,是否按规定顺序处理,输出能否直接进入目标表格,验收人能否根据证据位置复核。如果失败,先判断问题来自说明不清、材料不足,还是模型能力不足。

仍以涂层论文为例,第一次干跑时,输出把“浸泡 7 天后的腐蚀电流密度”和“测试开始时的阻抗值”放进同一比较列。问题并不是行文质量,而是任务说明没有规定“每条结果必须绑定指标、时间点和实验条件”。团队补充这个约束,并加入一条跨时间点不得横向排序的反例,再用另一篇论文复测。只有新样本也通过,才开始处理剩余材料。

干跑还应验证交付接口。假如后续要把结果导入证据矩阵,字段名、缺失值和一对多关系必须提前确定。论文报告三个时间点时,是生成三行,还是在一个单元格中保存数组?如果不先规定,批量完成后再整理格式会引入第二轮错误。好的任务说明不仅让 AI 能回答,也让输出能被下一步稳定接收。

任务改变时,不能偷偷沿用旧说明

同一项目中,任务常从“提取报告内容”变成“评价偏倚风险”,或从“比较测量方法”变成“提出实验设计”。这时必须新建任务说明。前一个任务允许的材料、判断口径和放行人,不会自动适用于后一个任务。尤其是质量评价和创新判断,需要相应方法规范与领域判断,不能因为已经读过论文就顺带完成。

建议给每份说明写上任务编号和版本,并在输出中保留该编号。例如 TASK-LIT-03 v1.2 对应比较测量指标;若研究者修改了主要问题、字段或验收抽样,就升级版本并说明哪些结果需要重跑。这样团队能回答“这一批表格是按哪个口径生成的”,也能避免新旧规则混用。

一份任务可以关闭的条件也应明确:目标产物已经通过验收,未确认项已单独登记,人工放行人签认,输出与输入版本都已保存。只要其中一项缺失,AI 显示“任务完成”也不代表科研任务真正完成。

可直接复用的科研任务说明模板

任务名称:

目标:本次只完成什么判断或产物?

材料:允许使用哪些文件、数据和版本?材料缺失时怎样处理?

边界:哪些推断、数据、来源和外部动作明确禁止?

处理顺序:需要依次识别、提取、比较或检查什么?

输出:字段、格式、允许值、证据位置和缺失值怎样表示?

正确样本:一条人工确认的输入与合格输出。

反例:一条容易误判、应拒绝或转人工的输入。

验收:检查多少样本、检查哪些字段、达到什么条件可以使用?

停止:出现哪些错误、缺失或风险时立即停止?

责任:谁复核,依据什么,在什么动作之前放行?

如果这份模板只能填出“高质量、专业、全面”之类形容词,说明任务还没有被定义。先回到研究目的和材料,把“好”改成可观察、可复核的条件,再开始与 AI 对话。