ARTICLE DETAIL

建站实战干货

来自一线的建站与推广经验沉淀,每一条都经过真实交付验证。

用AI打造严肃审稿人:学术论文同行评审提示词全攻略

2026/9/20 12:13:52 拓冰建站 浏览量
用AI打造严肃审稿人:学术论文同行评审提示词全攻略 1. 为什么需要一个“严肃的审稿人”提示词做研究和写论文的人都有一个共同的痛点自己写的东西自己看不出问题。这不是能力问题而是心理机制决定的。你花了两周时间打磨一篇文章每一个论证步骤在你脑子里都是自洽的因为你已经沿着同一条逻辑路径走了几十遍。这时候你需要的是一个“外部视角”一个不关心你感受、只关心逻辑是否成立的审稿人。传统的解决方案是找同行帮忙看但同行有同行的问题他们太忙不好意思往死里批他们有自己的研究方向未必熟悉你论文的方法论细节最关键的是你不好意思反复麻烦同一个人帮你看第五稿。AI 大模型的出现改变了这个局面——它永远不会累不会碍于情面而且可以针对不同章节反复审阅。但直接用 ChatGPT 或 Gemini 来审稿效果往往不理想。你丢一篇论文进去说“帮我审一下”它大概率会给你一堆“本文选题具有重要价值”“建议进一步完善”之类的废话。这不是模型能力不行而是你没有给它一个明确的角色设定和审稿框架。“严肃的审稿人”这个提示词的核心思路就是把 AI 从“好好先生”模式切换到“严格同行评审”模式。这个提示词适合谁用我梳理了一下大致是这几类人正在准备投稿的研究生和青年学者、需要写开题报告或中期检查材料的博士生、给期刊做审稿但想先让 AI 过一遍的审稿人、以及任何需要对自己的长文进行批判性审视的写作者。不管你用的是 ChatGPT、Gemini 还是其他大模型这套提示词的底层逻辑都是通用的。注意提示词不是越长越好。很多人写提示词喜欢堆砌大量形容词比如“请你非常非常严格地审阅”“用最苛刻的标准”——这些对模型的实际行为影响很小。真正有效的是结构化的审稿维度、明确的输出格式、以及可操作的评判标准。2. 提示词的整体架构设计思路2.1 角色设定为什么是“严肃的审稿人”而不是“严格的导师”角色设定决定了模型的输出基调。我试过很多种角色描述最终发现“严肃的审稿人”这个定位最有效。原因在于“严格的导师”这个角色会让模型倾向于给出指导性意见语气上更像是在教你做事输出内容会偏向“你应该怎么改”。而“严肃的审稿人”这个角色模型会模仿学术期刊审稿人的行为模式——先判断论文是否达到发表标准再逐条列出具体问题最后给出审稿结论接受/小修/大修/拒稿。后者的输出结构更清晰批判性更强也更接近真实的审稿场景。另一个关键点是“严肃”这个词。它传递的是一种态度不是“苛刻”也不是“严厉”而是认真对待、不敷衍。实测下来加了“严肃”之后模型给出“建议进一步完善”这类空话的概率明显降低。2.2 审稿维度的拆解五个核心维度一个好的审稿提示词必须告诉模型“从哪些角度审”。如果只说“帮我审稿”模型会随机挑选几个角度覆盖面不可控。我根据自己给期刊审稿的经验把审稿拆成了五个核心维度研究问题与创新性论文要解决的问题是否明确创新点是否真实存在还是包装出来的方法论严谨性实验设计是否合理数据收集和分析方法是否经得起推敲样本量是否充分论证逻辑与结构从问题到结论的逻辑链条是否完整有没有跳跃论证或循环论证文献综述与理论框架文献覆盖是否全面理论框架是否支撑研究问题写作规范与表达术语使用是否准确图表是否清晰引用格式是否规范这五个维度基本覆盖了学术论文审稿的主要方面。每个维度下面还需要给出具体的检查点否则模型还是可能泛泛而谈。2.3 输出格式的约束为什么必须结构化很多人忽略了一点提示词的输出格式约束直接决定了输出内容的可用性。如果你不规定格式模型会给你一大段连续的文字读起来很累而且容易遗漏关键信息。我在提示词中强制要求模型按以下结构输出论文概述一句话总结论文做了什么总体评价接受/小修/大修/拒稿各维度详细审稿意见按五个维度逐一展开关键问题清单按严重程度排序修改建议具体可操作的建议这个结构的好处是你拿到审稿意见后可以直接对照修改不需要再花时间整理。2.4 温度参数与模型选择如果你是通过 API 调用模型温度参数建议设置在 0.3-0.5 之间。温度太高比如 0.8 以上模型会变得“有创造力”审稿意见可能偏离论文实际内容温度太低比如 0.1模型会变得过于保守不敢指出问题。0.3-0.5 这个区间实测下来比较平衡。模型选择方面ChatGPT 和 Gemini 都可以用。ChatGPT 在逻辑推理和结构化输出方面表现稳定Gemini 在处理长文本比如整篇论文时上下文窗口更大。如果你要审的论文超过一万字建议用 Gemini 或者 ChatGPT 的长上下文版本。3. 完整提示词模板与逐段解析3.1 提示词全文以下是我反复调试后定稿的提示词模板。你可以直接复制使用也可以根据自己的学科特点调整审稿维度。你是一位[学科领域]领域的资深审稿人拥有超过15年的同行评审经验。你以严谨、客观、不留情面著称但你的所有批评都基于学术标准而非个人偏好。 现在你需要对以下论文进行审稿。请严格按照我给出的审稿框架逐项进行不要跳过任何一项。 【审稿框架】 一、论文概述 用2-3句话概括论文的研究问题、方法和主要结论。不要评价只做客观概括。 二、总体评价 给出以下四个等级之一的判定接受、小修、大修、拒稿。并用一段话说明给出该判定的核心理由。 三、分维度详细审稿 1. 研究问题与创新性 - 研究问题是否明确、具体、有价值 - 创新点是什么是理论创新、方法创新还是应用创新 - 创新点是否足够支撑一篇论文的发表与现有文献相比增量贡献在哪里 2. 方法论严谨性 - 研究设计是否合理是否能够回答研究问题 - 数据收集方法是否科学样本是否具有代表性 - 分析方法是否恰当是否存在统计方法误用 - 是否讨论了研究的局限性 3. 论证逻辑与结构 - 从问题到结论的逻辑链条是否完整 - 是否存在跳跃论证、循环论证或因果倒置 - 各章节之间的衔接是否自然 4. 文献综述与理论框架 - 文献覆盖是否全面是否遗漏了关键文献 - 理论框架是否清晰是否有效支撑了研究假设 - 是否对现有文献进行了批判性分析而非简单罗列 5. 写作规范与表达 - 术语使用是否准确一致 - 图表是否清晰、自明 - 引用格式是否规范 - 语言表达是否存在歧义或冗余 四、关键问题清单 将所有问题按严重程度分为三级 - 致命问题必须解决否则无法发表 - 重要问题需要认真修改 - 次要问题建议改进 五、具体修改建议 针对每个致命问题和重要问题给出具体可操作的修改建议。不要只说“需要改进”要说“怎么改”。 【论文内容】 [在此粘贴论文全文或指定章节]3.2 关键段落的设计意图角色描述中的“不留情面”这个词看起来有点极端但实测效果很好。如果不加这个词模型倾向于在批评之前先夸一段比如“本文选题具有重要价值但……”。加了“不留情面”之后模型会直接进入批评模式省去客套话。当然提示词里也补了一句“所有批评都基于学术标准”防止模型为了批评而批评。“不要评价只做客观概括”这是为了防止模型在概述阶段就混入主观判断。如果概述阶段就开始批评后面的分维度审稿就容易重复。先客观概括再集中批评输出结构更清晰。四个等级的判定接受/小修/大修/拒稿是学术期刊的标准审稿结论。让模型先给一个总体判定再展开细节符合真实审稿流程。而且这个判定本身就是一个强约束——模型不能含糊其辞必须选一个。“不要只说需要改进要说怎么改”这是区分“有用的审稿意见”和“废话”的关键。很多 AI 生成的审稿意见停留在“建议加强理论框架”这种层面对作者没有实际帮助。强制要求具体建议后模型会给出类似“在第二章第二节补充关于XX理论的讨论建议引用Smith(2020)和Zhang(2021)的研究”这样的可操作建议。3.3 针对不同学科的调整建议上面这个模板是通用版本。如果你要审的是特定学科的论文建议在审稿维度上做调整。举几个例子实验科学化学、生物、物理在方法论维度增加“实验可重复性”“对照组设置”“试剂/设备型号是否标注”等检查点。社会科学经济学、社会学、管理学增加“内生性问题处理”“稳健性检验”“样本选择偏差”等检查点。人文学科历史、哲学、文学增加“史料可靠性”“论证的诠释学循环”“原始文献掌握程度”等检查点。工程与计算机科学增加“基线对比是否公平”“代码/数据是否开源”“实验环境是否可复现”等检查点。调整的方法很简单在对应维度下面增删检查点即可。不需要重写整个提示词。4. 实操流程从论文到审稿意见的完整过程4.1 准备工作论文格式与分段策略在把论文丢给 AI 之前有几个准备工作要做。第一把论文转成纯文本。PDF 直接丢给模型有时候会丢失格式信息尤其是公式和表格。建议先把 PDF 转成 Markdown 或纯文本公式用 LaTeX 表示表格用 Markdown 表格表示。这样模型能更准确地理解论文内容。第二如果论文超过一万字考虑分段审稿。虽然现在的大模型上下文窗口很大但一次性丢进去太长的文本模型对后半部分的注意力会下降。我的做法是先让模型通读全文给出总体评价然后分章节让模型给出详细审稿意见。具体操作是第一轮 prompt 只包含“论文概述”和“总体评价”两个部分第二轮再针对具体章节展开。第三标注关键信息。如果论文有补充材料、数据集链接、代码仓库等在论文末尾附上。这些信息会影响模型对方法论严谨性的判断。4.2 第一轮审稿获取总体评价第一轮审稿的目标是快速判断论文的整体质量。把提示词中的审稿框架精简一下只保留“论文概述”和“总体评价”两个部分然后附上论文全文。这一轮通常几分钟就能出结果。拿到总体评价后你可以判断这篇论文是否值得继续花时间修改。如果模型给出“拒稿”且理由充分你可能需要重新考虑论文的定位如果给出“大修”说明论文有救继续下一轮。实操心得第一轮审稿时建议把温度参数设低一点0.2-0.3让模型的判断更保守、更稳定。如果温度太高模型可能会给出过于乐观或过于悲观的评价。4.3 第二轮审稿分维度深入第二轮审稿是核心环节。把完整的审稿框架和论文全文一起发给模型要求它按五个维度逐一给出详细意见。这一轮输出会比较长通常有 2000-4000 字。拿到输出后不要急着全部接受。先快速浏览一遍标记出你觉得有道理的批评和无理的批评。AI 审稿不是百分百准确有时候它会误解论文内容或者提出一些不适用于你研究领域的意见。我的做法是把 AI 的审稿意见复制到一个单独的文档里逐条阅读在每条意见后面标注“同意”“部分同意”“不同意”并简要写明理由。这个过程本身就是一次深度自我审视。4.4 第三轮审稿针对修改稿的复审修改完论文后把修改稿和之前的审稿意见一起发给模型要求它检查修改是否解决了之前提出的问题。这一轮的提示词需要调整增加一个“修改回应检查”的环节以下是论文的修改稿以及上一轮审稿中提出的关键问题清单。 请逐条检查每个问题是否在修改稿中得到了解决。 对于每个问题给出以下判定之一 - 已解决修改稿中明确回应了该问题 - 部分解决有回应但不充分 - 未解决修改稿中没有相关修改 - 不适用该问题基于对原文的误解修改稿无需回应 对于“部分解决”和“未解决”的问题请说明还需要补充什么。这个复审环节非常有用。它相当于一个“修改检查清单”确保你没有遗漏任何重要问题。4.5 人工复核哪些审稿意见必须打折扣AI 审稿意见不是圣旨。根据我的使用经验以下几类意见需要特别警惕关于文献遗漏的批评模型的知识截止日期之后发表的新文献它不知道。如果它说“缺少某某文献”先确认这篇文献是否真的存在且相关。关于统计方法的批评模型对统计方法的理解有时会出错尤其是涉及具体检验方法的选择时。这类意见建议找真人统计师确认。关于学科惯例的批评每个学科都有自己的写作惯例模型可能用其他学科的标准来评判你的论文。比如用自然科学的标准来要求人文学科论文的论证方式。过于笼统的批评如果模型给出“理论框架不够扎实”但没有具体说明哪里不扎实这条意见基本没用可以直接忽略。5. 常见问题与排查技巧实录5.1 模型输出太客气怎么办这是最常见的问题。你明明用了“严肃的审稿人”提示词模型还是给你一堆“本文具有重要价值”之类的客套话。原因通常有两个一是提示词中的角色描述不够强硬二是论文本身确实写得不错模型找不到太多可批评的地方。针对第一种情况可以在提示词中增加一句“请直接指出问题不要用‘本文具有重要价值’‘选题新颖’等客套话作为开头。你的审稿意见应该从第一个具体问题开始。”针对第二种情况可以要求模型“即使论文整体质量较高也要找出至少5个可以改进的具体问题”。5.2 模型只挑格式问题不挑内容问题有时候模型会花大量篇幅批评引用格式、标点符号、图表编号等表面问题而对研究设计、论证逻辑等核心问题一笔带过。这通常是因为提示词中的审稿维度权重不明确。解决方法是在提示词中明确优先级“请优先关注研究问题、方法论和论证逻辑方面的问题。格式和语言问题放在最后且只列出最严重的3-5个例子不需要逐一列举。”5.3 模型对论文内容理解有偏差模型有时候会误解论文中的某些表述导致审稿意见基于错误的理解。这种情况在论文涉及专业术语或复杂公式时尤其常见。应对方法是在提示词中增加一句“如果你对论文中的某个表述不确定请先引用原文然后说明你的理解再给出审稿意见”。这样你可以快速判断模型是否理解正确。如果理解错误可以在下一轮对话中纠正它。5.4 不同模型的审稿风格差异我用同一个提示词分别测试了 ChatGPT 和 Gemini发现了一些有趣的差异对比维度ChatGPTGemini批评直接程度较高敢于直接说“这个问题很严重”中等倾向于用“建议考虑”等委婉表达结构化程度非常严格遵循提示词格式偶尔会合并或调整章节顺序长文本处理超过一万字后注意力下降长文本处理更稳定学科知识深度计算机、经济、管理领域较强自然科学、工程领域较强修改建议具体性建议较具体常给出示例建议较宏观偏方向性这个对比不是绝对的不同版本、不同时间点的模型表现会有波动。但大致趋势是如果你需要犀利的批评ChatGPT 更合适如果你需要处理超长论文Gemini 更合适。5.5 常见问题速查表问题现象可能原因解决方法输出全是客套话角色描述不够强硬增加“不要客套话”指令只挑格式问题审稿维度权重不明确明确优先级格式问题限数量理解偏差专业术语或公式导致要求模型先引用原文再评论输出太短提示词约束不足要求每个维度至少300字输出太长没有字数上限设置总字数上限或分轮审稿修改建议不具体缺少具体性约束要求“给出可操作的修改步骤”漏掉关键问题模型注意力有限分章节审稿不要一次性丢全文6. 进阶技巧让审稿意见更有针对性6.1 针对特定期刊的审稿标准定制不同期刊的审稿标准差异很大。顶刊要求理论贡献显著领域期刊更看重方法严谨性应用型期刊关注实际价值。你可以把目标期刊的审稿标准嵌入提示词中。具体做法是找到目标期刊的“作者指南”或“审稿人指南”把其中的关键要求摘录出来作为审稿框架的补充。比如某期刊要求“论文必须包含至少一个理论贡献”你就在审稿维度中增加一条“理论贡献是否明确且显著”。6.2 让模型扮演“魔鬼代言人”有时候你需要的不只是审稿意见而是对论文核心论点的极限施压。这时候可以切换提示词策略让模型扮演“魔鬼代言人”请扮演一位对这篇论文核心论点持怀疑态度的学者。 你的任务是找出论文论证中最薄弱的环节并构建一个有力的反驳论证。 不要客气你的目标是让作者无法轻易回应你的质疑。这个模式适合在论文投稿前做“压力测试”。如果模型构建的反驳论证你能轻松回应说明论文的防御力不错如果模型提出的质疑让你一时语塞那说明论文确实存在漏洞。6.3 多轮对话中的上下文管理审稿通常不是一轮就结束的。你可能需要跟模型来回讨论好几轮。这时候上下文管理就很重要了。我的建议是每一轮对话开始时先简要总结上一轮的结论再提出新的要求。比如“上一轮审稿中你指出了三个致命问题我已经针对第一个和第二个做了修改现在请检查修改是否到位并继续讨论第三个问题。”这样模型不会丢失上下文你也能保持清晰的修改脉络。6.4 结合具体修改场景的提示词变体除了通用审稿你还可以针对具体修改场景设计提示词变体。举几个我常用的针对摘要的审稿请以审稿人的视角审阅以下论文摘要。 检查研究问题是否清晰方法是否明确结论是否具体 摘要中是否存在过度声称overclaiming 修改后的摘要应该控制在250字以内。针对回复信的审稿以下是我对审稿意见的回复信。 请以审稿人的视角检查每个审稿意见是否都得到了回应 回复语气是否恰当是否存在回避问题的情况 是否有回复过于冗长或过于简略的问题针对图表的审稿请审阅以下论文中的图表。 检查图表是否自明不看正文也能理解 坐标轴标签、单位、图例是否完整 是否存在图表与正文重复表达的问题7. 我个人的使用体会这套提示词我用了大半年审过自己的论文也帮朋友看过稿子。最大的体会是AI 审稿的价值不在于它给出的意见有多准确而在于它强迫你从“作者视角”切换到“读者视角”。很多时候模型指出的问题我自己其实隐约知道只是一直在回避。当这些问题被一个“外部审稿人”明确指出来时你就很难再假装看不见了。另一个体会是提示词需要持续迭代。我现在的版本已经跟最初写的完全不一样了中间改了十几稿。每次发现模型输出不理想就回去改提示词然后再测试。这个过程本身就是在梳理“什么是一篇好论文”的标准。最后分享一个小技巧如果你觉得模型给出的审稿意见太泛可以追加一句“请举一个论文中的具体例子来说明这个问题”。模型通常会从论文中摘取一段原文然后指出具体哪里有问题。这种“原文问题”的格式比抽象的描述有用得多。