
1. 为什么需要一个“严肃的审稿人”提示词做研究和写论文的人大概都有过这种体验稿子改到第三四轮自己已经看不出问题了眼睛会自动跳过那些逻辑断层和表述含糊的地方。找同行帮忙看人家时间宝贵往往只给几句笼统的意见找导师看导师可能一周后才回复而且关注点未必和你当前需要的修改方向一致。这时候一个能随时调用、态度严谨、反馈具体的“AI审稿人”就成了刚需。但直接对ChatGPT或Gemini说“帮我审一下这篇论文”得到的结果通常很糟糕。模型会给出“本文结构清晰、论证充分”之类的客套话或者提一些不痛不痒的建议比如“建议增加更多文献”。这不是模型能力不行而是提示词没有把它约束到审稿人这个角色该有的行为模式上。一个真正的审稿人不会夸你他会直接指出你的样本量为什么是137而不是一个更整的数字你的对照组在第三段提到的处理方式和表格2里不一致哪个是对的你的结论部分说“显著改善”但统计检验只报了p值没报效应量这个“显著”到底有多大实际意义“严肃的审稿人”这个提示词要解决的核心问题就是把AI从“礼貌的助手”切换成“挑剔的评审专家”。它不负责鼓励你不负责帮你润色语言它只做一件事——用学术审稿的标准逐条指出你的稿件在逻辑、方法、数据呈现和论证链条上的漏洞。适合用这个提示词的人包括正在投稿前需要预审的研究生、需要快速获得结构化反馈的科研人员、以及任何希望用AI辅助提升写作严谨性的写作者。我最初做这个提示词是因为要投一个比较顶的期刊导师说“你先自己找人看看别让我看到低级错误”。找同门看了一遍反馈很浅。后来我花了一个下午反复调试提示词让模型扮演一个“有二十年审稿经验、以严格著称、且对方法论特别挑剔”的审稿人。第一次跑出来的结果就让我后背发凉——它指出了我方法部分一个变量定义和操作化之间的断裂这个问题我自己改了五遍都没发现。从那以后这个提示词就成了我投稿前的固定流程。2. 提示词的核心结构拆解2.1 角色设定不是“助手”是“审稿人”提示词的第一段必须完成角色锚定。很多人写提示词喜欢用“你是一个有帮助的助手”这在审稿场景下是灾难性的。助手倾向于配合你、肯定你而审稿人的职责是找问题。所以角色描述要具体到让人感到压力你是一位在[具体领域]有二十年审稿经验的资深评审人以严谨和挑剔著称。你审稿时从不客套直接指出问题。你的判断标准是如果这篇稿件投到顶刊它是否经得起方法学上的推敲。这里的关键是“从不客套”和“经得起推敲”这两个约束。前者压制了模型的讨好倾向后者给了它一个明确的判断标尺。我试过把“从不客套”去掉结果模型还是会先夸两句再提意见虽然意见本身质量不差但那种“先肯定再但是”的结构会稀释问题的严重性让你不自觉地觉得“问题不大”。2.2 审稿维度把“审稿”拆成可执行的检查项只说“请审稿”是不够的模型不知道从哪些维度切入。必须把审稿拆成具体的检查清单。我的提示词里固定包含以下维度每个维度都要求模型逐条回应不能跳过研究问题与假设研究问题是否明确假设是否可检验变量之间的关系是否交代清楚方法部分样本选择依据、实验设计、测量工具的信效度、统计方法的适用性。数据呈现表格和图形是否自明有没有选择性报告缺失值怎么处理的论证链条从数据到结论的推理有没有跳跃有没有替代解释没有被排除文献对话引用是否覆盖了关键文献有没有曲解被引文献的原意写作与结构段落之间的逻辑衔接、术语一致性、摘要与结论的对应关系。每个维度下还要给模型一个“必须回答”的子问题。比如方法部分必须回答“如果换一种统计方法结论是否稳健”数据呈现必须回答“表格中的数字加起来是否等于声称的总数”这些子问题把审稿从主观判断变成了可操作的检查动作。2.3 输出格式结构化反馈拒绝散文式评论如果让模型自由发挥它会写出一大段散文式的评论读起来很累而且容易漏掉关键点。所以提示词里要强制规定输出格式。我用的格式是【总体判断】接收/小修/大修/拒稿必须选一个并给出一句话理由 【主要问题】按严重程度排序每条包含问题描述、所在位置、为什么这是问题、修改建议 【次要问题】格式、语言、引用规范等 【必须补充的分析或实验】如果有这个格式的好处是强迫模型做优先级排序。“主要问题”必须按严重程度排这就逼着它区分“致命缺陷”和“可以改进的地方”。很多AI审稿结果之所以没用就是因为把所有问题平铺直叙你不知道先改哪个。有了优先级你就能把精力集中在最要命的地方。2.4 约束条件防止模型“放水”或“跑偏”提示词里必须加入几条硬约束否则模型很容易回到“有帮助的助手”模式。我常用的约束包括禁止使用“建议考虑”“或许可以”等模糊表述必须用“必须修改”“存在以下问题”等明确判断。如果稿件存在方法学上的致命缺陷直接给出“拒稿”判断不要用“大修”来缓和。不要重复稿件中已经写得很清楚的内容只指出问题和改进方向。如果某个维度没有发现问题写“未发现明显问题”不要为了凑字数而编造问题。最后一条特别重要。早期版本里模型为了显得“认真”会在每个维度都硬找问题导致一些本来没问题的部分被强行挑刺反而干扰判断。加上“未发现明显问题”这个选项后反馈的准确性明显提升。3. 完整提示词模板与使用步骤3.1 可直接复用的提示词全文以下是我目前稳定使用的版本你可以直接复制到ChatGPT或Gemini里使用。注意把方括号里的内容替换成你的具体领域和稿件信息。你是一位在[你的研究领域]有二十年审稿经验的资深评审人以严谨和挑剔著称。你审稿时从不客套直接指出问题。你的判断标准是如果这篇稿件投到[目标期刊或会议名称]它是否经得起方法学上的推敲。 请对以下稿件进行审稿。稿件内容如下 [粘贴你的稿件全文或核心部分] 请严格按照以下格式输出不要添加任何额外说明 【总体判断】 接收 / 小修 / 大修 / 拒稿必须选一个 一句话理由 【主要问题】 按严重程度从高到低排列每条包含 - 问题描述 - 所在位置章节或段落 - 为什么这是问题 - 修改建议 【次要问题】 格式、语言、引用规范等。 【必须补充的分析或实验】 如果有列出具体内容如果没有写“无”。 约束条件 1. 禁止使用“建议考虑”“或许可以”等模糊表述必须用明确判断。 2. 如果存在方法学致命缺陷直接给出“拒稿”不要用“大修”缓和。 3. 不要重复稿件中已写清楚的内容。 4. 如果某个维度没有发现问题写“未发现明显问题”不要编造问题。 5. 所有判断必须基于稿件内容不要引入外部文献或假设。3.2 使用步骤从粘贴到获得反馈实际操作流程比想象中简单但有几个细节决定了反馈质量。第一步准备稿件。不要直接把整篇PDF丢给模型PDF里的格式信息会干扰理解。把稿件转成纯文本保留章节标题和段落结构。如果稿件很长优先保留方法、结果和讨论部分引言可以适当精简。我通常会把摘要、方法、结果、讨论、结论这五个部分完整保留引言只留最后一段研究问题和假设。第二步替换领域信息。把提示词里的[你的研究领域]换成具体方向比如“教育心理学”“计算机视觉”“临床流行病学”。越具体越好因为不同领域的审稿标准差异很大。投计算机会议和投医学期刊对方法部分的要求完全不同。目标期刊也要写清楚模型会根据期刊层级调整严格程度。第三步粘贴稿件并发送。如果模型输出被截断不要让它“继续”而是重新发送并附上“请只输出主要问题部分次要问题省略”。截断通常发生在主要问题很多的情况下分段获取比一次性获取更可靠。第四步处理反馈。拿到反馈后先看“总体判断”。如果是“拒稿”不要急着沮丧仔细看主要问题里有没有你确实无法反驳的硬伤。如果有那就是真实存在的问题改就是了。如果是“大修”把主要问题逐条抄到文档里每条下面留出修改空间改完一条划掉一条。3.3 参数调整让审稿人更严或更宽同一个提示词通过调整几个参数可以改变严格程度。如果你只是想要一个快速检查可以把“二十年审稿经验”改成“五年审稿经验”把“以严谨和挑剔著称”改成“以细致著称”。如果你在冲刺顶刊反过来把“二十年”改成“三十年”加上“你曾经拒过很多现在被广泛引用的论文”。我试过在冲刺一个顶会时用加强版模型直接指出了我实验设计中一个混淆变量的问题那个问题在后来真实审稿意见里也被提到了。另一个可调参数是“目标期刊”。写“投到Nature”和写“投到省级期刊”模型的判断标准会明显不同。前者会要求你证明每一个假设后者可能更关注格式规范。根据你的实际投稿目标来写不要虚高也不要虚低。4. 实测中发现的典型问题与应对4.1 模型“编造”问题如何识别和过滤即使加了“不要编造问题”的约束模型偶尔还是会挑出一些不存在的问题。常见的情况有三种一是把稿件中已经解释过的内容当作“未解释”来批评二是对统计方法的适用性做出错误判断比如批评你用了t检验但数据明明符合正态分布三是把不同段落的内容混淆指出一个“矛盾”但实际上并不存在。识别编造问题的方法是每一条主要问题都回到稿件原文去核对。如果模型说“第三段没有报告样本量”你就去第三段找看是不是真的没报告。如果模型说“表2和正文数据不一致”你就把表2和正文对应位置都打开逐字比对。我自己的经验是编造问题的比例大概在10%到15%之间主要集中在统计方法判断和跨段落一致性检查上。过滤的方法是在提示词里加一句“每条问题必须引用稿件中的具体原文作为依据引用格式为‘原文……’”。这样模型在指出问题时必须附上它认为有问题的原文片段你一眼就能看出它是不是在编。如果它引用的原文根本不存在或者引用的是无关内容这条问题就可以直接忽略。4.2 反馈过于笼统怎么逼模型说具体有时候模型会给“方法部分需要更详细”这种笼统反馈。这不是它不想说具体而是提示词没有逼它说具体。解决办法是在输出格式里强制要求“修改建议”必须包含可操作的动作。比如不能写“建议补充样本量计算”而要写“在方法部分第一段末尾补充样本量计算依据包括效应量、显著性水平和统计功效并引用用于计算的软件或公式”。我还会在提示词里加一个约束“每条修改建议必须具体到‘在哪个章节的哪个位置、补充或修改什么内容、达到什么标准’。”加上这个约束后反馈的可操作性明显提升。比如它会说“在讨论部分第三段补充与Smith等2020结果的对比说明你的发现与他们的不一致可能源于样本文化差异并引用至少两篇支持该解释的文献”。这种反馈你拿到就能直接动手改。4.3 不同模型的审稿风格差异ChatGPT和Gemini在审稿任务上的表现有明显差异。ChatGPT更倾向于从论证逻辑和写作结构切入对方法部分的统计细节相对宽松Gemini对方法学和数据呈现更敏感但有时会过度关注格式问题而忽略论证链条。我的做法是先用ChatGPT跑一遍拿到逻辑和结构层面的反馈再用Gemini跑一遍拿到方法和数据层面的反馈。两份反馈合并后覆盖的维度比单用任何一个都全面。另外同一个模型在不同时间段的输出质量也会有波动。我遇到过同一篇稿件、同一个提示词上午跑和下午跑主要问题的数量和排序都不一样。所以如果第一次跑出来的结果感觉不对不要急着改稿件先重新跑一次。如果两次结果差异很大说明稿件本身在某些维度上处于“边界状态”这时候需要你自己判断哪些问题是真问题。5. 把审稿反馈转化为修改动作5.1 优先级排序先改什么后改什么拿到反馈后不要从第一条开始逐条改。先做一次分类把所有问题分成“致命问题”“重要问题”“改进建议”三类。致命问题是那些如果不改就会被拒稿的比如研究设计有根本缺陷、统计方法用错、结论没有数据支持。重要问题是影响稿件质量的比如文献综述不全面、讨论部分没有回应关键假设。改进建议是格式、语言、引用规范等。分类之后先改致命问题。如果致命问题超过三个考虑是否要重新分析数据或补充实验而不是硬改文字。我自己的经验是如果模型给出了“拒稿”判断且主要问题里有两条以上涉及研究设计那这篇稿件大概率需要重做部分实验而不是修改写作。这时候最理性的做法是暂停投稿先把设计问题解决掉。5.2 逐条回应建立修改追踪表对于“大修”或“小修”的稿件我习惯建一个修改追踪表。表格有三列审稿意见、修改动作、修改位置。每改完一条在“修改动作”里写清楚具体做了什么在“修改位置”里写清楚在修改稿的哪一页哪一段。这个表有两个用途一是防止漏改二是投稿时如果期刊要求提交“逐条回应”可以直接把这个表整理成回应信。审稿意见修改动作修改位置样本量计算依据不足补充G*Power计算过程报告效应量0.3、显著性水平0.05、统计功效0.8方法部分第2段表2与正文数据不一致核对原始数据修正正文中误写的均值结果部分第3段讨论未回应假设2增加一段解释假设2未得到支持的可能原因讨论部分第4段这个表看起来简单但实际用起来能省很多时间。尤其是改到第三四轮的时候你根本记不住哪条改了哪条没改有这个表一目了然。5.3 判断哪些反馈可以忽略不是所有反馈都要照单全收。有几种情况可以合理忽略一是模型对领域常识判断错误比如它批评你用了某个方法但那个方法在你的领域就是标准做法二是模型要求的补充分析超出了稿件范围比如它要求你增加一个实验条件但那个条件在你的理论框架里没有依据三是模型对文献的引用要求不合理比如它要求你引用某篇文献但那篇文献和你的研究问题无关。忽略反馈的前提是你能给出明确理由。如果你只是觉得“改起来太麻烦”而忽略那大概率会在真实审稿中被同样的问题卡住。我的判断标准是如果我能用一句话向导师解释为什么这条反馈不适用那就可以忽略如果解释起来支支吾吾那还是改吧。6. 进阶用法让审稿人更懂你的研究6.1 提供领域背景减少常识性误判模型不是领域专家它对你的研究领域的了解来自训练数据。如果你的研究问题比较新或者比较窄模型可能会用相邻领域的标准来评判导致误判。解决办法是在提示词里加一段“领域背景”说明。比如领域背景本研究属于教育干预效果评估采用准实验设计因学校层面随机分组不可行。该领域对因果推断的要求是尽可能控制混淆变量而非必须使用随机对照试验。加上这段背景后模型就不会因为“没有随机分组”而直接给拒稿而是会检查你是否充分控制了混淆变量。这个技巧在跨学科研究上尤其有用因为不同学科对同一方法的接受度差异很大。6.2 指定审稿重点让反馈更聚焦如果你已经知道稿件哪里比较弱可以在提示词里指定审稿重点。比如“请特别关注讨论部分对替代解释的排除是否充分。”或者“请重点检查统计方法部分特别是多重比较校正是否恰当。”指定重点后模型会在该维度上给出更细致的反馈而不是平均用力。但要注意指定重点不等于让模型忽略其他维度。我通常会在指定重点的同时加一句“其他维度也请正常审稿但重点放在上述方面”。这样既保证了聚焦又不会漏掉其他问题。6.3 多轮审稿改完再跑一遍第一轮审稿改完后不要直接投稿。把修改稿再跑一遍提示词看模型是否还会指出同样的问题。如果同样的问题再次出现说明你改得不够彻底或者模型认为你的修改没有真正解决问题。如果新出现了一些问题说明修改引入了新的不一致。如果主要问题都消失了只剩次要问题那就可以准备投稿了。我自己的流程是至少跑两轮。第一轮改完后再跑第二轮第二轮的主要问题通常比第一轮少一半以上。第三轮基本只剩格式和语言问题。这个流程走下来投稿后的真实审稿意见里方法学层面的问题会明显减少。7. 一些实操中的零碎经验提示词里的“目标期刊”不要写得太泛。写“投到SCI期刊”和写“投到《XX学报》”模型的严格程度完全不同。越具体越好如果不知道具体投哪个写一个你领域内公认的顶刊名字让模型按那个标准来审。如果稿件里有公式或特殊符号粘贴时尽量用纯文本表示比如用“beta”代替β用“p .05”代替p0.05。模型对特殊符号的处理不稳定有时候会把符号识别成乱码导致审稿意见里出现莫名其妙的错误。模型对表格的审稿能力有限。如果你的核心数据在表格里最好在粘贴稿件时把表格转成文字描述比如“表2显示实验组均值3.45标准差0.89对照组均值2.98标准差0.92t2.34p0.02”。这样模型才能准确判断数据呈现是否有问题。如果模型给出的“总体判断”是“接收”不要高兴太早。检查一下它是不是漏掉了某些维度。我遇到过模型给“接收”但主要问题里列了三条的情况这明显是矛盾的。遇到这种情况重新跑一遍或者在提示词里加一句“总体判断必须与主要问题的严重程度一致”。最后这个提示词不能替代真实审稿人的意见但它能帮你把稿件里那些“自己看不出来”的问题提前暴露出来。我用了大半年最大的感受是它不会让你的论文变得更好但它会让你的论文变得更难被拒。因为那些最容易被审稿人抓住的硬伤在投稿前就已经被你自己改掉了。