大模型能否真正辅助污泥膨胀管理?构建可解释评估框架并提出能力提升路径
🌞欢迎来到人工智能的世界
🌈博客主页:卿云阁💌欢迎关注🎉点赞👍收藏⭐️留言📝
📆首发时间:🌹2026年7月30日🌹
✉️希望可以和大家一起完成进阶之路!
🙏作者水平很有限,如果发现错误,请留言轰炸哦!万分感谢!
目录
论文信息
材料和方法
评估数据集
模型参数与推理超参数设置
人工专家评价
大模型打分器(LLM-rater)
大语言模型认知能力提升策略
视觉模块串联大语言模型流程构建
面向文本任务的检索增强生成(RAG)优化
统计分析方法
结果与分析
大模型打分器可实现稳定可靠的大模型评测
理解、分析与实操三类任务结果对比
图像识别任务
理解能力、分析能力和实践能力
大语言模型之间的比较
Token 效率
定性误差分析与大语言模型认知能力优化
视觉模块提升了视觉理解能力
RAG 提升了文本类任务表现
大语言模型案例研究,以及污水厂工程师对使用大语言模型的看法
论文信息
活性污泥膨胀是全球污水处理厂中普遍存在的一类运行故障。它需要及时、准确的人工干预,但专
业污水处理知识和经验的稀缺构成了很大挑战。大语言模型有可能通过提供类似人类的认知能力来
支持污泥膨胀管理。然而,目前还缺乏一种可解释的评估框架,用来量化大语言模型认知能力的优
势和边界;更关键的是,也缺乏一种框架来指导如何提升这些能力,从而服务于更高级的污泥膨胀
管理。
在本研究中,我们建立了一个可解释评估框架。具体来说,作者构建了一个开放获取的评估套件,
其中包含280个任务,包括真实世界案例;同时设计了一个 LLM-rater,也就是“大语言模型评分
器”。这个评分器在提示词中包含标准答案,以保证评估的可靠性。通过这个框架,作者诊断了大
语言模型在三个方面的认知能力:理解能力、分析能力和实践能力。
在该框架下,研究发现:模型表现主要受任务类型影响,而不是由具体模型身份决定。也就是说,
相比 DeepSeek-R1、GPT-4o 和 Gemini-2.0 哪个模型更强,任务本身属于哪一类反而更重要。
具体来看,大语言模型在基于显微镜图像的识别任务中理解能力有限,准确率低于54%;在微生物
识别任务中的归一化得分为28%-42%。此外,它们在分析工艺过程与微生物相互作用方面也较
弱,归一化得分为36%-52%。实践类任务同样具有挑战性,模型在所有认知能力上都存在不足,
而且这类任务在所有任务类型中对 token 的需求最高。在这个可解释评估框架的指导下,作者将视
觉模块与大语言模型结合,用来提升模型对关键丝状菌的视觉理解能力,包括 Beggiatoa、真菌和
Nocardia。加入视觉模块后,识别准确率从51%提高到78%。
与此同时,作者进一步采用检索增强生成,也就是 RAG,来有选择地提升模型的实践能力。其
中,作为“思考型模型”的 DeepSeek-R1 在实践能力上的提升最大,提升幅度达到69%。经过 RAG
增强的 DeepSeek-R1,也就是 FilamentGPT,取得了最佳的整体表现。除微生物识别外,它在所
有任务中的归一化得分都超过80%。基于20名污水厂工程师的评价,FilamentGPT 也表现出作为
污水厂决策支持工具的实际可行性。作者认为,这种优势来自于 FilamentGPT 更强的能力:它能
够把检索到的专业知识整合进合理的、针对具体污水厂情况的工作流程中。
总体而言,本研究为污泥膨胀管理场景中的大语言模型建立了一套可解释评估框架,为大语言模型
评估提供了科学基础。同时,在该可解释框架的指导下,作者也提出了若干训练或后训练路径,例
如 RAG 和视觉模块,用于有选择地增强大语言模型的认知能力。这有可能让污水处理厂更容易获
得接近细分领域专家水平的专业知识支持。
材料和方法
评估数据集
为了评估大语言模型,作者构建了一个特定领域的知识语料库。该语料库包括案例书和内部数据
集,规模约为100万个 token,涵盖了丝状菌污泥膨胀管理的基础知识。整理得到的数据集包含
280个高质量任务。
该评估套件包含六种任务类型。其中包括82个视觉理解任务,这些任务为多项选择题,即任务
⑴;此外,还包括五类基于文本的任务,共198个任务:微生物识别,即 MICRO,任务①,35个
任务;工艺基础,即 PROC,任务②,47个任务;工艺-微生物相互作用,即 P-M,任务③,17个
任务;运行风险评估,即 RISK,任务④,73个任务;以及工艺控制/优化,即 CTRL,任务⑤,26
个任务。
| 任务编号 | 类型 | 数量 | 主要考察 |
|---|---|---|---|
| Task 1 | Visual understanding 图像理解 | 82 | 看显微镜图像,识别丝状菌 |
| Task 2 | MICRO 微生物识别 | 35 | 描述或识别某类丝状菌/微生物 |
| Task 3 | PROC 工艺基础 | 47 | 理解活性污泥和污泥膨胀基础知识 |
| Task 4 | P-M 工艺-微生物关系 | 17 | 分析工艺条件如何影响微生物 |
| Task 5 | RISK 运行风险评估 | 73 | 判断是否存在污泥膨胀或运行风险 |
| Task 6 | CTRL 工艺控制与优化 | 26 | 给出具体控制建议 |
图 1 (a) 大语言模型应用于污泥膨胀管控现存痛点:模型产生无法识别的幻觉内容,会给污水处理
厂运行带来安全风险。 (b) 面向污泥膨胀管控的大模型可解释评价框架总览:分为评测任务构建、
模型认知能力诊断、针对性能力增强三大模块。评测任务包含视觉理解任务与五项文本类任务,共
同构成框架的诊断层;将大模型输出结果拆解为三类可解读的核心能力:理解能力、分析能力、工
程实操能力。本研究基于 GPT-4.1 开发污泥膨胀专用大模型打分器,其评分结果与行业专家判断
高度吻合。依托该可解释评价框架,为定向提升模型认知能力,本研究引入视觉模块优化图像识别
能力,并采用检索增强生成(RAG)技术强化模型工程实操能力。 (c) 本研究污泥膨胀评测体系完
整开发流程汇总。 (d) 用于评估大模型综合能力的全部污泥膨胀评测任务总览。
模型参数与推理超参数设置
针对文本类任务(任务①~⑤),本研究评测了三款大语言模型:DeepSeek-R1(模型版本
deepseek-r1-2025-01-20)、GPT-4o(模型版本 gpt-4o-2024-11-20)以及 Gemini-2.0-flash(模
型版本 gemini-2.0-flash-001)。所有模型推理流程均基于 Python 搭建统一评测流水线完成,脚
本通过 OpenRouter 平台对接各模型接口,并在严格一致、完全受控的解码参数条件下完成三款大
模型的对比测试(详细参数见表 S3)。
每条提问均搭载统一固定提示词:“你是水处理与污水治理领域专家,请尽可能简洁地给出回答。”
全模型统一采用确定性推理参数:温度系数 temperature=0、核采样阈值 top-p=0.1、最大输出词
元 max tokens=2000。本研究将所有模型的温度参数统一设为 0,目的是最大程度消除生成结果的
随机性,实现确定性文本输出。该参数设置可保证多次重复实验得到高度可复现的输出结果,确保
本文报道的模型性能具备稳定可靠的参考价值(Huang 等人,2024;Sandmann 等人,
2024)。
评测流水线会向全部模型输入同一测试问题,记录各模型生成的回答内容;同时统计每
条问答对应的词元消耗量,将词元用量、任务编号与模型名称同步存档,为后续分析词元消耗与模
型性能之间的权衡关系提供数据支撑。
针对视觉理解任务(任务⑴),研究额外引入多模态模型参与评测。该任务需要解析显微图像,而
DeepSeek-R1、Gemini-2.0-flash 仅为纯文本大模型,不具备图像分析能力。因此,在保留 GPT-
4o 作为基准的基础上,新增 DeepSeek-VL2 与 Gemini-3-Pro-preview 两款多模态模型参与测
试。既可以横向对比不同多模态模型的图像理解能力,又能和前文文本任务使用的核心模型体系保
持实验连续性。
基于大模型打分器与行业专家人工的评价方法
对于视觉理解类选择题任务,活性污泥显微图像中的丝状菌鉴定仅由专业人工专家完成评
测;大语言模型的性能以全部丝状菌形态类型的平均正确率(%)作为评价指标。
针对文本类任务中大模型的性能评测,本研究融合人工专家打分与大模型打分器(LLM-
rater)两套评价体系。以人工评价结果作为基准真值,再使用经过校准的大模型打分器对全部文
本任务批量打分。为验证大模型打分器的可信度,本研究引入评分者间一致性指标(详见 2.5 节)
(Zhai 等,2026)。
人工专家评价
理解能力:评判回答是否准确掌握丝状菌污泥膨胀相关核心概念与定义(对应任务⑴、①、②、
③、④、⑤);
分析能力:衡量模型依托客观证据推导故障诱因、反应机理、潜在风险的逻辑推理水平(对应任务
③、④、⑤);
实操调控能力:评判给出的工艺调控策略是否具备现场可落地性(对应任务⑤)。
正式打分阶段,每份模型回答至少由 3 名专家独立评分。若多位专家打分结果存在显著分歧,则重
新复核讨论达成统一结论;分歧无法调和时,由额外资深专家仲裁判定。
大模型打分器(LLM-rater)
人工评价是大模型性能评估的黄金标准,但存在天然主观性强、人力成本高、耗时久的缺陷(Xu
等,2025b)。近年来兴起的大模型打分方案提供了替代思路:利用一个大语言模型,自动化评判
其他模型的输出文本(Xu 等,2025b;Zhang 等,2025b)。
本研究搭建基于 GPT-4.1 的打分模型作为评价框架的评分层,依托标准化评分细则,实现规模
化、自动化量化打分。
流程如下:
北京师范大学专家先将整套评测题库的标准答案拆解为理解、分析、实操三大维度的标准得分要
点,为每一项任务生成固定评分关键点清单;
将三类信息输入打分模型 GPT-4.1(版本 gpt-4.1-2025-04-14):
①原始问题;②专家制定的标准得分要点清单;③待评测模型生成的回答文本;
指令打分模型匹配回答覆盖的标准要点,分别输出理解、分析、实操三项能力分项得分与总分;各
单项能力满分区间 0~5 分(详见附图 S1)。
打分模型专用提示词与评分规则在小规模校准数据集上调试完成,正式全量评测前固定不再修改。
为验证打分模型可靠性,本研究随机抽取约 30% 任务,对比人工打分与有无标准答案辅助的大模
型打分器的评分结果。
由于不同文本任务分项满分设置不同(理解满分 5 分、分析满分 10 分、实操满分 15 分),为实
现跨任务横向对比,原始得分统一归一化为 0~5 分标准分;
若需要统一对比视觉任务与文本任务结果,将归一化分数换算为百分比标准化得分,计算公式:
(归一化得分 / 5) × 100%。
大语言模型认知能力提升策略
视觉模块串联大语言模型流程构建
基于可解释评价框架,结合 GPT-4o、DeepSeek-VL2、Gemini-3-Pro-preview 的图像识别能力评
测结果(见 3.2、3.3 节),本研究选取贝氏硫细菌、诺卡氏菌、真菌这三类识别效果较差的丝状
菌作为概念验证优化对象。在视觉任务⑴中,Gemini-3-Pro-preview 对这三类菌种的识别准确率
均不足 50%,存在极大的性能优化空间,适合用于验证视觉模块能否提升大模型识别效果(Gao
等,2026)。因此本研究以 Gemini-3-Pro-preview 为基础模型,搭建视觉模块 + 大语言模型串联
式概念验证流程。
视觉模块开发流程
将贝氏硫细菌、诺卡氏菌、真菌以及其他菌种(阴性对照)显微图像按类别划分训练集与验证集,
划分比例 8:2(Gao 等,2026;Zhang 等,2025a)。视觉模块基于 ResNeXt50_32×4d 骨干网络
搭建,为引入注意力机制增强特征提取能力,采用双分支网络结构。模型预训练骨干网络参数大部
分冻结,仅对高层网络与任务专属输出头进行迁移学习微调,并采用复合损失函数训练;最大训练
轮次 30 轮,搭配早停策略防止过拟合。网络结构、训练参数、图像预处理完整细节见补充文本
S1.1–S1.3。
模型内部验证
在预留的独立验证集上设置两组推理工况开展内部验证:仅使用原生 Gemini-3-Pro-preview、视觉
模块串联大模型方案(详见补充文本 S1.4),采用准确率、F1 分数作为评价指标。进一步在任务
⑴中包含贝氏硫细菌、真菌、诺卡氏菌的 37 项视觉识别子任务上测试视觉模块串联方案:流程中
视觉模块先输出结构化特征证据(含图像相似度检索信息),一并送入大语言模型,最终由大模型
输出识别结论。采用精细准确率、粗分类准确率、分层误差指标综合评估模型性能,完整评测流程
见补充文本 S1.5–S1.7。
面向文本任务的检索增强生成(RAG)优化
结合可解释评价框架与模型认知能力分析结果,实操应用能力是三大评价维度中得分最低、波动最
大的指标(见 3.2 节)。因此,为提升文本任务整体效果,重点强化模型实操调控能力,本研究搭
建检索增强生成(RAG)流程:构建结构化污泥膨胀专业知识库(包含污水厂污泥膨胀调控相关
专业书籍文献),融合稠密向量检索 + 词法检索的混合检索架构。
对原始 PDF 文献进行解析、清洗,按 600、1000、1200 词元三种长度分段,分段重叠率统一设
置 20%。 文本块采用两套检索方式建立索引:
稠密检索:BGE-m3 向量模型 + FAISS 向量库;
词法检索:BM25 算法。
推理阶段,输入问题同时调用混合检索器,返回相关性最高的前 10 段文本;检索结果去重、重排
序后,作为事实依据拼接至模型输入提示词中。 所有 RAG 增强模型与无 RAG 原生模型评测时,
统一使用完全相同的提示词与推理解码参数,保证对照实验变量唯一,RAG 完整配置见补充文本
S2。
为验证 RAG 增强大模型在污水厂现场的实际可用性,邀请 20 名具备 1~8 年一线运维经验的污水
处理工程师开展实操测试:
(1)工程师独立完成代表性工艺实操任务,记录耗时;
(2)对基于 1200 词元分段的 DeepSeek-R1(FilamentGPT)生成的 198 条任务回答进行审阅;
通过定制交互界面完成六项李克特量表满意度调研,调研详情见补充文本 S3。
统计分析方法
本研究采用适用于有序分级评分的评分者一致性指标评估大模型打分器的可靠性,包括二次加权卡
帕系数、斯皮尔曼等级相关系数与皮尔逊相关系数。研究按任务类型、三大认知能力维度(理解能
力、分析能力、实操应用能力)对比各模型性能;采用单侧曼 - 惠特尼 U 检验判定不同大模型间
性能差异是否显著,并通过成对散点图可视化对比结果。通过任务得分与词元消耗量的关联分析模
型推理效率;将引入检索增强生成(RAG)后相对无 RAG 基准模型的性能提升幅度进行量化。完
整统计分析结果见补充文本 S4。
结果与分析
大模型打分器可实现稳定可靠的大模型评测
已有研究证实,利用大模型打分器评判其他大模型的输出具备良好应用潜力(Xu 等人,2025b;
Zhang 等人,2025b)。本研究依托人工专家总结的打分要点(即基准标准答案),搭建基于
GPT-4.1 的大模型打分器,实现全部文本类任务的规模化自动化评分。
相较于无标准答案支撑的打分模型,搭载基准真值的 GPT-4.1 打分器评分规律与人工专家高度贴
合(图 2a),和人工评分一致性极佳:二次加权卡帕系数 κ=0.975、斯皮尔曼等级相关系数
ρ=0.975、皮尔逊相关系数 r=0.982。该结果说明,基准标准答案是构建适配污泥膨胀管控场景、
评分逻辑贴合人工判断的可靠打分工具的核心。
在理解、分析、实操三类任务中,人工打分与大模型打分器得到的分数分布几乎无差别(图
2b)。分任务组验证一致性后,卡帕系数、斯皮尔曼相关系数、皮尔逊相关系数普遍高于 0.90,
进一步佐证打分稳定性(图 2c)。
为验证基于 GPT-4.1 的打分模型评判 GPT-4o 结果时是否存在同系列偏袒偏差,本研究选取
Gemini 系列模型作为独立打分器,对随机抽取的样本子集开展测试。独立打分模型敏感性分析结
果表明,两款不同体系的大模型打分器,评分规律均与行业专家保持一致(详见附图 S2)。
综上,由于打分结果与人工专家高度吻合,本研究将这套依托标准化评分细则、基于 GPT-4.1 的
打分器作为全量文本任务规模化评测替代工具,同时以人工专家评价作为判定基准。
理解、分析与实操三类任务结果对比
图像识别任务
本研究采用多模态大语言模型完成视觉理解任务,任务包含 11 种工程上明确划分的丝状微生物种
类识别。本节仅以 GPT-4o 作为典型模型展示结果;GPT-4o、Gemini-3-Pro-preview、
DeepSeek-VL2 三款模型的完整横向对比,以及视觉模块串联大模型方案带来的性能提升将在
3.3.1 节展开分析。
整体来看,GPT-4o 对丝状微生物的识别总准确率仅为 54%(图 2d)。细分菌种识别效果差异显
著:0914 型丝状菌识别准确率为 0;浮游球衣细菌(Sphaerotilus natans,25.0%)、0041 型丝
状菌(28.6%)识别效果较差;0092 型、1851 型丝状菌、诺卡氏菌、发硫菌、微丝菌识别效果中
等;而浮游胶枝藻识别准确率 71.4%,贝氏硫细菌与真菌识别准确率均达到 100%,表现相对优
异。综上,仅依靠原生 GPT-4o 无法稳定、可靠地基于显微图像完成丝状菌鉴定工作。
理解能力、分析能力和实践能力
| 任务类型 | 中文含义 | 主要能力 | 表现 |
|---|---|---|---|
| PROC | 工艺基础 | 理解能力 | 较好 |
| MICRO | 微生物识别 | 理解能力 | 最弱 |
| P-M | 工艺-微生物关系 | 理解 + 分析 | 较弱且波动大 |
| RISK | 运行风险评估 | 理解 + 分析 | 较好 |
| CTRL | 控制与优化 | 理解 + 分析 + 实践 | 中等但不稳定 |
大语言模型之间的比较
为了比较不同大语言模型之间的表现和认知能力,作者使用了配对散点图,也就是 bubble plots,
以及单侧 Mann-Whitney U 检验。对于 PROC 工艺基础任务,也就是理解任务,GPT-4o 的理解
能力显著高于 Gemini-2.0-flash 和 DeepSeek-R1。其中,GPT-4o 与 Gemini-2.0-flash 的比较结果
为 p = 0.001;GPT-4o 与 DeepSeek-R1 的比较结果为 p = 0.03。在 MICRO 微生物识别任务中,
这种差异更加明显。GPT-4o 在理解能力上优于 Gemini-2.0-flash,p = 0.002;也优于 DeepSeek-
R1,p < 0.001。对于分析任务,也就是 P-M 工艺-微生物关系任务和 RISK 风险评估任务,作者
同时评估了理解能力和分析能力。在 P-M 任务中,GPT-4o 在理解能力上优于 Gemini-2.0-flash,
p = 0.04;在分析能力上也优于 Gemini-2.0-flash,p = 0.01。在 RISK 任务中,GPT-4o 在理解能
力上优于 Gemini-2.0-flash 和 DeepSeek-R1,对应 p 值分别为 0.005 和 0.05。在分析能力上,
GPT-4o 也优于 Gemini-2.0-flash 和 DeepSeek-R1,两个比较的 p 值均小于 0.0001。对于 CTRL
控制任务,三个模型在理解能力上没有显著差异。然而,GPT-4o 在分析能力上优于 Gemini-2.0-
flash 和 DeepSeek-R1,p 值分别为 0.02 和 0.002;在实践能力上也优于 Gemini-2.0-flash 和
DeepSeek-R1,p 值分别为 0.03 和 0.002。
Token 效率
除了关注大语言模型的准确性之外,作者还关注了 token 消耗,因为 token 消耗反映了计算成本。
具体来说,token-得分散点图显示,Gemini-2.0-flash 平均生成的回答最短,平均为244 tokens;
其次是 GPT-4o,平均为277 tokens;DeepSeek-R1 平均为298 tokens。
当用归一化得分除以 token 数量时,GPT-4o 和 Gemini 表现出更高的 token 效率,平均约为22
grade / 1000 tokens;而 DeepSeek-R1 平均为18 grade / 1000 tokens,差异具有统计学意义,
p < 0.05。
这说明,作为“思考型模型”的 DeepSeek-R1,需要更多 token 才能转化为相近的性能收益。
不同任务类别的 token-得分模式也不同。PROC 工艺基础任务是最具长度效率的任务,因为回答
相对较短,平均约174 tokens,并且能达到约20 grade / 1000 tokens。
相反,MICRO 微生物识别任务使用了更多 token,平均约229 tokens,但效率最低,约7 grade
/ 1000 tokens。这说明更长的输出并不能可靠地克服微生物解释本身的内在困难。
P-M 工艺-微生物关系任务的 token 消耗范围更广、整体更高,平均约307 tokens,但仍然受到
token 效率限制,约17 grade / 1000 tokens。这是因为它需要较高的认知能力,要把微生物、机
制和工艺条件联系起来。
RISK 风险评估任务则在中等 token 预算下获得了较高性能,平均约245 tokens,并取得最高
token 效率,约30 grade / 1000 tokens。
CTRL 控制任务需要最多 token,平均约568 tokens,因此效率只达到中等水平,约16 grade /
1000 tokens。这说明大模型的控制建议常常比较冗长,而且不够精准。
总体而言,作者提出了一个同时评估任务准确性和 token 效率的框架,用来比较不同大模型和任务
类型。研究发现,低 token 效率主要来自有限的认知能力。例如 MICRO 的 token 效率一直很低,
约7 grade / 1000 tokens,原因是大模型在这类任务上的理解能力较弱。
因此,作者建议:要降低计算成本、提升 token 效率,不能只让模型“少说话”,更应该提升它的认
知能力,尤其是在实践任务中。
定性误差分析与大语言模型认知能力优化
视觉模块提升了视觉理解能力
与单独使用大语言模型相比,视觉模块 + 大语言模型流程同时提高了粗略准确率和精细准确率。
这说明它不仅提升了在大类层面识别丝状微生物形态的能力,也提升了判断具体微生物类型的能
力。同时,粗类漏判率降低,说明严重识别失败变少了;同粗类但细分类错误率降低,说明模型虽
然能识别出大致类别、但选错具体类别的情况也减少了。 性能提升来自视觉模块提供的结构化视
觉证据,以及大语言模型对这些视觉证据的整合能力
RAG 提升了文本类任务表现
加入 RAG 后,DeepSeek-R1 在五类任务中的平均归一化得分分别为:
| 任务 | 得分 |
|---|---|
| PROC 工艺基础 | 3.9 / 5 |
| MICRO 微生物识别 | 2.2 / 5 |
| P-M 工艺-微生物关系 | 4.0 / 5 |
| RISK 风险评估 | 4.3 / 5 |
| CTRL 控制优化 | 4.2 / 5 |
与没有检索增强的基线相比,DeepSeek-R1 的提升幅度为:
| 任务 | 提升幅度 |
|---|---|
| PROC | 17% |
| MICRO | 56% |
| P-M | 70% |
| RISK | 31% |
| CTRL | 60% |
大语言模型案例研究,以及污水厂工程师对使用大语言模型的看法
加入 RAG 后的 DeepSeek-R1,也就是 FilamentGPT,在具体污泥膨胀案例中比原始模型更能给
出精确、可执行、有安全边界的工程建议,并且获得了污水厂工程师较高的认可,说明它具备作为
决策支持工具的实际潜力。
| 案例类型 | 比较内容 | 说明的问题 |
|---|---|---|
| 理解任务 | Type 1863 描述 | FilamentGPT 更能给出精确微生物特征 |
| 分析任务 | EPS、高碳水化合物、染色异常 | FilamentGPT 更能联系现象、机制和原因 |
| 实践任务 | RAS 氯化控制污泥膨胀 | FilamentGPT 更能给出具体操作方案 |
结论
第4章:讨论。本章首先比较不同类型大模型在污泥膨胀管理中的适用性:GPT-4o凭借原生多模
态能力和较稳定的文本任务表现,可作为当前实用基线;但从长期看,DeepSeek-R1等推理型模
型更适合作为系统底座,因为它们能够更有效地将RAG检索到的知识整合为具有步骤、参数和安
全边界的厂级操作方案。作者进一步指出,不同能力需要针对性增强:采用专用视觉模块改善丝状
菌识别,采用领域监督微调(SFT)强化专业概念理解,采用强化学习(RL)提升机理分析与推
理效率,并采用GraphRAG增强操作建议的完整性和工况适配性。单独使用RAG无法同时解决理
解、分析和实践能力的全部缺陷。
第5章:意义与不足。本章认为,该研究的主要意义是建立了包含280项专家设计任务的可解释评
估框架,使研究者能够判断大模型在污泥膨胀管理中“哪里可靠、哪里薄弱以及应该怎样改进”,并
通过LLM-rater实现规模化评价。不过,现有结果仍不足以证明大模型能够直接用于污水厂自主控
制:评分器仍可能存在位置偏差、冗长度偏差和评价标准覆盖不足;视觉模块仅验证了少量丝状菌
类别;实践案例和参与评价的污水厂工程师数量有限;FilamentGPT也没有在真实膨胀事件中接受
闭环运行验证。作者因此建议后续在实验室诱导膨胀和全尺度污水厂中,使用SVI、丝状菌丰度、
出水水质、预警提前量、误报率及操作员接受度等指标开展验证。
第6章:结论。作者最终认为,大模型具有辅助污泥膨胀管理的潜力,但当前商业模型仍不够可
靠,其主要瓶颈是显微图像与微生物识别能力不足、工艺—微生物关系分析较弱,以及控制任务中
的实践能力不稳定。专用视觉模块可将三个重点丝状菌类别的识别准确率由51%提高至78%;
RAG增强的DeepSeek-R1(FilamentGPT)取得了三种模型中的最佳综合表现,并能够比人工更
快生成较为具体的建议。然而,任何单一增强方法都不能改善全部能力,未来应综合采用视觉模
块、SFT、RL和GraphRAG,并加入工程师审核及安全约束,将系统定位为污水厂的“运行决策副
驾驶”,而不是自主控制器。