
26年7月来自北大、军事科学院和中南大学的论文“AI for Science: A Systematic Survey of Architectures, Autonomy, and Open Challenges”。这篇综述最有价值的地方是把 AI for ScienceAI4S组织成一个贯穿科研全过程的系统并尝试评价 AI 在其中的自主程度。但其自主性评分尚不成熟部分案例和文献引用存在实质性问题因此更适合作为领域框架与研究线索不能直接当作可靠的系统排名或成熟评价标准。文章首先提出AI4S 的研究对象应扩展到整个科研流程。作者认为现有研究往往分别关注蛋白质结构预测、材料筛选、数值模拟或实验自动化但科学发现需要多个环节协同提出问题、组织知识、获取数据、建立模型、开展计算、验证结果。因此文章区分了两个层面的 AI4S广义 AI4S使用 AI 支持科学研究包括单一预测工具、模拟加速器等。较强意义的 AI4S能够连接多个科研环节形成“假设—验证—修正—知识更新”的持续循环。作者据此把 AI4S 描述为继实验科学、理论科学、计算科学和数据密集型科学之后的“第五科学范式”。这里需要区分“第五范式”是文章采用的解释框架不能视为文中已经实证证明的结论。文章也提出了适用边界AI 比较适合搜索空间庞大、关系复杂、实验昂贵同时具备数据或模拟器反馈的问题对于缺乏可靠数据、可检验假设和明确验证标准的问题AI 难以独立承担研究任务。全文的第一个组织框架是“六层科研架构”。第 2—4 页图 1所示图 1 用蛋白质发现说明这些层次如何配合确定目标整理结构与功能知识从 PDB、UniProt 等资源获取数据用模型预测结构再开展分子动力学模拟和自动化实验筛选。这一框架的核心含义是模型性能只是系统的一部分数据质量、设备接口、实验反馈和任务定义都可能成为科研效率的瓶颈。作者承认问题提出和研究目标设定仍主要依赖人类因此后续重点放在其余五个技术层面。第二个框架是用五个等级和五项指标描述科研自主性。第 5—10 页五个等级大致表示 AI 承担责任的逐步增加为避免只凭名称分级作者又设计了五项指标其中人类决策权重分别设为问题定义 1、过程中决策 2、事后验证 0.5。跨领域评价要求至少三个测试领域并达到目标领域专用基线性能的 90%。最终等级采用“最低维度等级加条件补偿”的规则先取五个维度中最低的等级若至少两个维度高于最低等级则整体加一级。文章选取四个系统说明这一方法CLAIRify把自然语言实验描述转为机器人可执行程序作者列为 L1。Coscientist连接文献检索、实验规划、仪器调用与结果分析作者列为 L2。A-Lab连接无机材料合成、X 射线衍射表征和主动学习案例标题列为 L3。LUMI-Lab连接分子模型、脂质候选选择、自动化实验和反馈更新案例标题列为 L4。这些等级属于作者提出的评价结果。其中后两个案例更换了计算口径具体问题见后文。如图3 所示 DPA-1模型从原子输入到预测结果的端到端流程。该流程图展示DPA-1模型的处理管线以原子类型和相对坐标为输入经由类型嵌入、广义坐标变换、局部嵌入、门控自注意力机制及矩阵乘法处理最终通过拟合网络输出预测结果。如图4 所示BIOMA多智能体系统。该系统由PredAgent预测智能体、ProAgent规划智能体、OperAgent操作智能体和ComAgent通信智能体四类智能体协同运作能够完成理论预测、实验规划、自动化无人实验及数据分析迭代的全流程工作。这实现了“构思-设计-执行-分析-优化”的自主研究闭环显著提升了生命科学研究的效率。如图5 所示FALCO基础模型架构。该图展示了FALCO的端到端工作流程与核心模块为适应天文光变曲线的连续通量特性该模型采用MLP编码替代离散Token嵌入以处理连续时间序列数据。如图6 所示具备科学思维的全能型AI化学家AI-Chemist。该图全面展示了AI-Chemist系统平台的顶层架构、核心模块构成及完整闭环工作机制直观呈现了“化学大脑机器人实验智能优化”三位一体的方法论。图7. 基于 Med-PaLM 2 的集成精修Ensemble Refinement, ER。Med-PaLM 模型提出了集成精修ER方法旨在增强大型医学模型的推理能力。该方法利用模型自身生成的多个潜在推理路径作为条件对最终答案进行精修与优化。如图7 所示基于 Med-PaLM 2 的集成精修Ensemble Refinement, ER。Med-PaLM 模型提出了集成精修ER方法旨在增强大型医学模型的推理能力。该方法利用模型自身生成的多个潜在推理路径作为条件对最终答案进行精修与优化。普林斯顿大学开发的AI控制器整合了托卡马克tokamak装置的实时传感器数据利用深度强化学习技术提前300毫秒预测等离子体撕裂不稳定性并动态调整束流功率与等离子体形态从而将核聚变实验的控制模式从“事后补救式应对”转变为“事前风险预防”有效解决了核聚变反应堆在极端工况下的控制难题。如图8 所示完整展示了 DIII-D 托卡马克装置中撕裂模不稳定性规避系统的整体架构及全链路工作机制。如图 9 所示 Pallatom-Ligand Transformer架构。该架构采用三重注意力模块流水线协同更新粗粒度Token表征与细粒度原子表征从而在条件约束下实现蛋白质-配体复合物全原子三维坐标的端到端去噪生成。文章篇幅最大的部分是五类瓶颈及其解决路径。第 10—25 页1.科研工具碎片化让模型、软件和实验设备能够协同工作。作者指出科研人员经常需要在不同软件、仪器和计算环境之间手动切换单个工具的智能化并不能自动连接整条工作流程。文中归纳了三条路径建设统一自动化实验平台通过预训练和微调提高模型复用能力由科研智能体协调工具调用和设备调度。A-Lab、ChemCrow、BIOMA 和 SciMaster 等被作为相关例子。这一部分关心的实质是一个研究计划如何被拆成可执行任务各工具如何传递输入输出以及执行失败后如何恢复。2.数据孤岛使分散的数据可以被共同理解、追溯和使用。数据不仅分散在不同机构还存在格式、单位、语义、质量和访问条件上的差异。作者讨论了多模态统一表示、跨源数据平台、元数据管理、FAIR 原则、数据溯源和联邦学习等路径。FAIR 强调数据可发现、可访问、可互操作和可复用溯源记录则帮助研究者了解数据从何而来、经过哪些处理。其重点是数据规模之外还必须关注数据之间能否对应、处理过程是否可查、结论是否可复现。3.跨学科知识壁垒把不同学科的知识转化为共同的研究行动。不同学科在术语、表示形式、方法和判断标准上存在差异。文章主张结合通用模型与专业模型并通过多模态表示、专业工具和多智能体协作处理复杂任务。作者还强调交互式需求澄清、可执行实验协议以及保存问题描述、假设、证据、代码和实验记录等结构化成果。其目的是让跨学科合作中的假设与约束可以被检查和延续。这一部分也涉及形式化验证用于检查关键工作流程是否符合事先设定的规则。4.信息可信度与知识更新让科研输出具有可核查的依据。作者讨论了四类方法建立验证与纠错闭环提高模型可解释性用科学理论、实验事实或形式逻辑约束输出通过持续学习吸收新知识。文中的代表性路径包括检索增强生成、证据汇总与评分、符号验证、多智能体审查以及主动学习驱动的模型更新。这部分提出了一个有用的要求科研系统不仅要给出结果还应保留支撑结果的证据、验证过程和更新记录。复杂与极端场景在数据有限、试验昂贵的条件下进行预测与控制。文章覆盖等离子体控制、天气预测、分子设计等问题归纳了三条技术路线建立模拟与控制闭环利用合成数据补充训练融合不同尺度的表示和模型。相关例子包括物理信息神经网络、傅里叶神经算子、强化学习控制、天气降尺度模型和全原子扩散模型。其研究目标包括降低计算成本、提高实验选择效率以及把预测结果及时用于实际控制。最后作者提出七个未来方向。第 25—26 页这七个方向分别是科研全流程协作系统、跨学科知识建模与知识图谱、开放共享的数据基础设施、可信科学基础模型、科学机制发现、AI 与高性能计算融合以及自驱动实验室。其中“机制发现”是比预测精度提升更进一步的目标系统需要把观察到的规律转化为可解释、可检验、能够指导下一轮干预的科学知识。不过文章对这一目标的具体实现与评价讨论较少主要停留在展望层面。如果提炼这篇综述最值得保留的要点我会归纳为五条。以科研全过程为单位理解 AI4S。 评价对象应包括模型与数据、工具、算力和实验之间的协作。实验反馈决定闭环是否成立。 生成方案之后系统还需要执行、分析失败并修正后续研究。自主性应分维度描述。 覆盖环节、人工介入和持续迭代能力比“AI 科学家”这一名称更有信息量。可信性需要贯穿全过程。 数据来源、工具执行、证据引用和实验验证共同决定结论是否可信。预测与优化之后还有机制解释和知识积累。 科研系统的长期价值在于形成经得起验证、能够重复使用的知识。对综述本身存在以下问题。前几项直接影响其核心评价结论。1.“系统性综述”的检索与筛选过程没有交代清楚。全文未给出可复现的检索数据库、检索式、时间范围、纳入排除标准、筛选流程或研究质量评价。103 条参考文献混合了期刊论文、预印本、平台介绍和技术文档但没有明确区分证据层级。因此读者难以判断代表性系统是否选全失败结果是否被遗漏不同机构的平台是否得到一致评价。从实际方法看这篇文章更接近按主题组织的叙述性综述。 这不否定其整理价值但不足以支持“全面覆盖”和“系统比较”的强结论。2.自主性指标混合了不同性质的能力评分依据也缺少验证。生命周期覆盖、人工介入程度与自主性直接相关新颖性衡量科研产出的原创程度跨领域迁移衡量通用性。三者有关联却不能互相替代。例如一个专用实验室可以高度自主地完成重复验证但不会因此产生新知识一个通用模型也可能需要人类不断指导。把这些维度合并成单一“自主性等级”容易压低专用系统的自主能力评价。此外0.7 的阶段评分、决策权重和各等级阈值没有给出校准实验或敏感性分析。虽然作者要求专家评价新颖性却未报告案例评分的评审记录或一致性。跨领域评分尤其缺乏依据CLAIRify 被说明只在化学领域验证却得到 15% 的迁移成功率A-Lab 被描述为专用系统却得到 5%。文中没有给出这些百分比对应的测试领域、成功次数和分母。3.评分表与案例计算存在明确的不一致。第 5—10 页表 1 和表 2 对新颖性 NP 的等级阈值不同。例如表 1 把 L5 的 NP 写为 50%—100%表 2 则要求 90%—100%表 1 的 L3 和 L4 甚至共享 30%—70% 的区间。表 2 对部分迁移分数只给出“L1—L2”等范围也没有说明如何确定唯一等级。更关键的是案例之间使用了不同维度LUMI-Lab 的五维等级为 [L4, L5, L4, L4, L1]最低等级为 L1加一级只能得到 L2。分别报告“领域内能力”和“跨领域能力”本身可以成立但需要从一开始定义两套指标并一致应用于所有案例。目前这种口径切换使 L1—L4 的案例比较失去统一基础。A-Lab 的关键案例沿用了已被更正的新颖性说法。第 9 页文章以 A-Lab“实现了 41 种此前从未实际合成的新化合物”为依据将新颖性赋值为 55%。但原论文已于 2026 年 1 月 19 日发布更正早于本综述发布成功结果更新为从 57 个目标中合成 36 个化合物更正还说明原先的新颖性表述意指相对预测平台而言并不必然意味着科学界首次发现。这会直接影响综述给出的新颖性评分。 A-Lab 的自动化贡献仍然成立但其知识原创程度必须重新评价。5.若干模型介绍、表格和所引文献不匹配。抽查中可以确认或明确指出的问题包括这些是局部核查结果并不意味着所有引用都有问题但已足以说明具体技术描述需要回到原始论文确认。6.六层架构主要提供分类视角还没有形成可操作的系统设计。作者没有充分说明各层之间的数据接口、状态传递、失败恢复、版本管理和责任边界。章节主体又转为按“五类挑战”组织六层架构与后续技术综述之间缺乏明确映射。生命周期评分也存在结构问题它列入“知识传播”却没有把“实验执行”单列为阶段而实验执行又是全文自主闭环的重要组成部分。此外文章强调 AI 应参与问题提出但对如何评价问题的重要性、可检验性和研究价值讨论明显不足。7.解决方案的有效性常被写得过满缺少失败条件和代价比较。文中多次使用“解决”“确保”“保证”等措辞但不少方法只能提高成功概率。例如把物理方程残差加入损失函数不能仅凭这一设置就推出模型在所有情况下都严格符合物理规律模型自我反思与多轮修正也不能自动构成对科学结论的独立验证。更有说服力的综述应比较何时有效、何时失败、需要多少人工维护、实验和计算成本如何、相对传统方法获得多少收益。本文对失败案例、负结果、独立复现和长期运行成本的讨论不足。因而这篇文章需要优先补足三类工作统一并验证评价规则逐条核实关键案例与引用再用性能、成本和失败条件比较不同技术路线。