欢迎来到人工智能的世界博客主页卿云阁欢迎关注点赞收藏⭐️留言首发时间2026年7月30日✉️希望可以和大家一起完成进阶之路作者水平很有限如果发现错误请留言轰炸哦万分感谢目录论文信息材料和方法评估数据集模型参数与推理超参数设置人工专家评价大模型打分器LLM-rater大语言模型认知能力提升策略视觉模块串联大语言模型流程构建面向文本任务的检索增强生成RAG优化统计分析方法结果与分析大模型打分器可实现稳定可靠的大模型评测理解、分析与实操三类任务结果对比图像识别任务理解能力、分析能力和实践能力大语言模型之间的比较Token 效率定性误差分析与大语言模型认知能力优化视觉模块提升了视觉理解能力RAG 提升了文本类任务表现大语言模型案例研究以及污水厂工程师对使用大语言模型的看法论文信息活性污泥膨胀是全球污水处理厂中普遍存在的一类运行故障。它需要及时、准确的人工干预但专业污水处理知识和经验的稀缺构成了很大挑战。大语言模型有可能通过提供类似人类的认知能力来支持污泥膨胀管理。然而目前还缺乏一种可解释的评估框架用来量化大语言模型认知能力的优势和边界更关键的是也缺乏一种框架来指导如何提升这些能力从而服务于更高级的污泥膨胀管理。在本研究中我们建立了一个可解释评估框架。具体来说作者构建了一个开放获取的评估套件其中包含280个任务包括真实世界案例同时设计了一个 LLM-rater也就是“大语言模型评分器”。这个评分器在提示词中包含标准答案以保证评估的可靠性。通过这个框架作者诊断了大语言模型在三个方面的认知能力理解能力、分析能力和实践能力。在该框架下研究发现模型表现主要受任务类型影响而不是由具体模型身份决定。也就是说相比 DeepSeek-R1、GPT-4o 和 Gemini-2.0 哪个模型更强任务本身属于哪一类反而更重要。具体来看大语言模型在基于显微镜图像的识别任务中理解能力有限准确率低于54%在微生物识别任务中的归一化得分为28%-42%。此外它们在分析工艺过程与微生物相互作用方面也较弱归一化得分为36%-52%。实践类任务同样具有挑战性模型在所有认知能力上都存在不足而且这类任务在所有任务类型中对 token 的需求最高。在这个可解释评估框架的指导下作者将视觉模块与大语言模型结合用来提升模型对关键丝状菌的视觉理解能力包括 Beggiatoa、真菌和Nocardia。加入视觉模块后识别准确率从51%提高到78%。与此同时作者进一步采用检索增强生成也就是 RAG来有选择地提升模型的实践能力。其中作为“思考型模型”的 DeepSeek-R1 在实践能力上的提升最大提升幅度达到69%。经过 RAG增强的 DeepSeek-R1也就是 FilamentGPT取得了最佳的整体表现。除微生物识别外它在所有任务中的归一化得分都超过80%。基于20名污水厂工程师的评价FilamentGPT 也表现出作为污水厂决策支持工具的实际可行性。作者认为这种优势来自于 FilamentGPT 更强的能力它能够把检索到的专业知识整合进合理的、针对具体污水厂情况的工作流程中。总体而言本研究为污泥膨胀管理场景中的大语言模型建立了一套可解释评估框架为大语言模型评估提供了科学基础。同时在该可解释框架的指导下作者也提出了若干训练或后训练路径例如 RAG 和视觉模块用于有选择地增强大语言模型的认知能力。这有可能让污水处理厂更容易获得接近细分领域专家水平的专业知识支持。材料和方法评估数据集为了评估大语言模型作者构建了一个特定领域的知识语料库。该语料库包括案例书和内部数据集规模约为100万个 token涵盖了丝状菌污泥膨胀管理的基础知识。整理得到的数据集包含280个高质量任务。该评估套件包含六种任务类型。其中包括82个视觉理解任务这些任务为多项选择题即任务⑴此外还包括五类基于文本的任务共198个任务微生物识别即 MICRO任务①35个任务工艺基础即 PROC任务②47个任务工艺-微生物相互作用即 P-M任务③17个任务运行风险评估即 RISK任务④73个任务以及工艺控制/优化即 CTRL任务⑤26个任务。任务编号类型数量主要考察Task 1Visual understanding 图像理解82看显微镜图像识别丝状菌Task 2MICRO 微生物识别35描述或识别某类丝状菌/微生物Task 3PROC 工艺基础47理解活性污泥和污泥膨胀基础知识Task 4P-M 工艺-微生物关系17分析工艺条件如何影响微生物Task 5RISK 运行风险评估73判断是否存在污泥膨胀或运行风险Task 6CTRL 工艺控制与优化26给出具体控制建议图 1 (a) 大语言模型应用于污泥膨胀管控现存痛点模型产生无法识别的幻觉内容会给污水处理厂运行带来安全风险。 (b) 面向污泥膨胀管控的大模型可解释评价框架总览分为评测任务构建、模型认知能力诊断、针对性能力增强三大模块。评测任务包含视觉理解任务与五项文本类任务共同构成框架的诊断层将大模型输出结果拆解为三类可解读的核心能力理解能力、分析能力、工程实操能力。本研究基于 GPT-4.1 开发污泥膨胀专用大模型打分器其评分结果与行业专家判断高度吻合。依托该可解释评价框架为定向提升模型认知能力本研究引入视觉模块优化图像识别能力并采用检索增强生成RAG技术强化模型工程实操能力。 (c) 本研究污泥膨胀评测体系完整开发流程汇总。 (d) 用于评估大模型综合能力的全部污泥膨胀评测任务总览。模型参数与推理超参数设置针对文本类任务任务①~⑤本研究评测了三款大语言模型DeepSeek-R1模型版本deepseek-r1-2025-01-20、GPT-4o模型版本 gpt-4o-2024-11-20以及 Gemini-2.0-flash模型版本 gemini-2.0-flash-001。所有模型推理流程均基于 Python 搭建统一评测流水线完成脚本通过 OpenRouter 平台对接各模型接口并在严格一致、完全受控的解码参数条件下完成三款大模型的对比测试详细参数见表 S3。每条提问均搭载统一固定提示词“你是水处理与污水治理领域专家请尽可能简洁地给出回答。”全模型统一采用确定性推理参数温度系数 temperature0、核采样阈值 top-p0.1、最大输出词元 max tokens2000。本研究将所有模型的温度参数统一设为 0目的是最大程度消除生成结果的随机性实现确定性文本输出。该参数设置可保证多次重复实验得到高度可复现的输出结果确保本文报道的模型性能具备稳定可靠的参考价值Huang 等人2024Sandmann 等人2024。评测流水线会向全部模型输入同一测试问题记录各模型生成的回答内容同时统计每条问答对应的词元消耗量将词元用量、任务编号与模型名称同步存档为后续分析词元消耗与模型性能之间的权衡关系提供数据支撑。针对视觉理解任务任务⑴研究额外引入多模态模型参与评测。该任务需要解析显微图像而DeepSeek-R1、Gemini-2.0-flash 仅为纯文本大模型不具备图像分析能力。因此在保留 GPT-4o 作为基准的基础上新增 DeepSeek-VL2 与 Gemini-3-Pro-preview 两款多模态模型参与测试。既可以横向对比不同多模态模型的图像理解能力又能和前文文本任务使用的核心模型体系保持实验连续性。基于大模型打分器与行业专家人工的评价方法对于视觉理解类选择题任务活性污泥显微图像中的丝状菌鉴定仅由专业人工专家完成评测大语言模型的性能以全部丝状菌形态类型的平均正确率%作为评价指标。针对文本类任务中大模型的性能评测本研究融合人工专家打分与大模型打分器LLM-rater两套评价体系。以人工评价结果作为基准真值再使用经过校准的大模型打分器对全部文本任务批量打分。为验证大模型打分器的可信度本研究引入评分者间一致性指标详见 2.5 节Zhai 等2026。人工专家评价理解能力评判回答是否准确掌握丝状菌污泥膨胀相关核心概念与定义对应任务⑴、①、②、③、④、⑤分析能力衡量模型依托客观证据推导故障诱因、反应机理、潜在风险的逻辑推理水平对应任务③、④、⑤实操调控能力评判给出的工艺调控策略是否具备现场可落地性对应任务⑤。正式打分阶段每份模型回答至少由 3 名专家独立评分。若多位专家打分结果存在显著分歧则重新复核讨论达成统一结论分歧无法调和时由额外资深专家仲裁判定。大模型打分器LLM-rater人工评价是大模型性能评估的黄金标准但存在天然主观性强、人力成本高、耗时久的缺陷Xu等2025b。近年来兴起的大模型打分方案提供了替代思路利用一个大语言模型自动化评判其他模型的输出文本Xu 等2025bZhang 等2025b。本研究搭建基于 GPT-4.1 的打分模型作为评价框架的评分层依托标准化评分细则实现规模化、自动化量化打分。流程如下北京师范大学专家先将整套评测题库的标准答案拆解为理解、分析、实操三大维度的标准得分要点为每一项任务生成固定评分关键点清单将三类信息输入打分模型 GPT-4.1版本 gpt-4.1-2025-04-14①原始问题②专家制定的标准得分要点清单③待评测模型生成的回答文本指令打分模型匹配回答覆盖的标准要点分别输出理解、分析、实操三项能力分项得分与总分各单项能力满分区间 0~5 分详见附图 S1。打分模型专用提示词与评分规则在小规模校准数据集上调试完成正式全量评测前固定不再修改。为验证打分模型可靠性本研究随机抽取约 30% 任务对比人工打分与有无标准答案辅助的大模型打分器的评分结果。由于不同文本任务分项满分设置不同理解满分 5 分、分析满分 10 分、实操满分 15 分为实现跨任务横向对比原始得分统一归一化为 0~5 分标准分若需要统一对比视觉任务与文本任务结果将归一化分数换算为百分比标准化得分计算公式(归一化得分 / 5) × 100%。大语言模型认知能力提升策略视觉模块串联大语言模型流程构建基于可解释评价框架结合 GPT-4o、DeepSeek-VL2、Gemini-3-Pro-preview 的图像识别能力评测结果见 3.2、3.3 节本研究选取贝氏硫细菌、诺卡氏菌、真菌这三类识别效果较差的丝状菌作为概念验证优化对象。在视觉任务⑴中Gemini-3-Pro-preview 对这三类菌种的识别准确率均不足 50%存在极大的性能优化空间适合用于验证视觉模块能否提升大模型识别效果Gao等2026。因此本研究以 Gemini-3-Pro-preview 为基础模型搭建视觉模块 大语言模型串联式概念验证流程。视觉模块开发流程将贝氏硫细菌、诺卡氏菌、真菌以及其他菌种阴性对照显微图像按类别划分训练集与验证集划分比例 8:2Gao 等2026Zhang 等2025a。视觉模块基于 ResNeXt50_32×4d 骨干网络搭建为引入注意力机制增强特征提取能力采用双分支网络结构。模型预训练骨干网络参数大部分冻结仅对高层网络与任务专属输出头进行迁移学习微调并采用复合损失函数训练最大训练轮次 30 轮搭配早停策略防止过拟合。网络结构、训练参数、图像预处理完整细节见补充文本S1.1–S1.3。模型内部验证在预留的独立验证集上设置两组推理工况开展内部验证仅使用原生 Gemini-3-Pro-preview、视觉模块串联大模型方案详见补充文本 S1.4采用准确率、F1 分数作为评价指标。进一步在任务⑴中包含贝氏硫细菌、真菌、诺卡氏菌的 37 项视觉识别子任务上测试视觉模块串联方案流程中视觉模块先输出结构化特征证据含图像相似度检索信息一并送入大语言模型最终由大模型输出识别结论。采用精细准确率、粗分类准确率、分层误差指标综合评估模型性能完整评测流程见补充文本 S1.5–S1.7。面向文本任务的检索增强生成RAG优化结合可解释评价框架与模型认知能力分析结果实操应用能力是三大评价维度中得分最低、波动最大的指标见 3.2 节。因此为提升文本任务整体效果重点强化模型实操调控能力本研究搭建检索增强生成RAG流程构建结构化污泥膨胀专业知识库包含污水厂污泥膨胀调控相关专业书籍文献融合稠密向量检索 词法检索的混合检索架构。对原始 PDF 文献进行解析、清洗按 600、1000、1200 词元三种长度分段分段重叠率统一设置 20%。 文本块采用两套检索方式建立索引稠密检索BGE-m3 向量模型 FAISS 向量库词法检索BM25 算法。推理阶段输入问题同时调用混合检索器返回相关性最高的前 10 段文本检索结果去重、重排序后作为事实依据拼接至模型输入提示词中。 所有 RAG 增强模型与无 RAG 原生模型评测时统一使用完全相同的提示词与推理解码参数保证对照实验变量唯一RAG 完整配置见补充文本S2。为验证 RAG 增强大模型在污水厂现场的实际可用性邀请 20 名具备 1~8 年一线运维经验的污水处理工程师开展实操测试1工程师独立完成代表性工艺实操任务记录耗时2对基于 1200 词元分段的 DeepSeek-R1FilamentGPT生成的 198 条任务回答进行审阅通过定制交互界面完成六项李克特量表满意度调研调研详情见补充文本 S3。统计分析方法本研究采用适用于有序分级评分的评分者一致性指标评估大模型打分器的可靠性包括二次加权卡帕系数、斯皮尔曼等级相关系数与皮尔逊相关系数。研究按任务类型、三大认知能力维度理解能力、分析能力、实操应用能力对比各模型性能采用单侧曼 - 惠特尼 U 检验判定不同大模型间性能差异是否显著并通过成对散点图可视化对比结果。通过任务得分与词元消耗量的关联分析模型推理效率将引入检索增强生成RAG后相对无 RAG 基准模型的性能提升幅度进行量化。完整统计分析结果见补充文本 S4。结果与分析大模型打分器可实现稳定可靠的大模型评测已有研究证实利用大模型打分器评判其他大模型的输出具备良好应用潜力Xu 等人2025bZhang 等人2025b。本研究依托人工专家总结的打分要点即基准标准答案搭建基于GPT-4.1 的大模型打分器实现全部文本类任务的规模化自动化评分。相较于无标准答案支撑的打分模型搭载基准真值的 GPT-4.1 打分器评分规律与人工专家高度贴合图 2a和人工评分一致性极佳二次加权卡帕系数 κ0.975、斯皮尔曼等级相关系数ρ0.975、皮尔逊相关系数 r0.982。该结果说明基准标准答案是构建适配污泥膨胀管控场景、评分逻辑贴合人工判断的可靠打分工具的核心。在理解、分析、实操三类任务中人工打分与大模型打分器得到的分数分布几乎无差别图2b。分任务组验证一致性后卡帕系数、斯皮尔曼相关系数、皮尔逊相关系数普遍高于 0.90进一步佐证打分稳定性图 2c。为验证基于 GPT-4.1 的打分模型评判 GPT-4o 结果时是否存在同系列偏袒偏差本研究选取Gemini 系列模型作为独立打分器对随机抽取的样本子集开展测试。独立打分模型敏感性分析结果表明两款不同体系的大模型打分器评分规律均与行业专家保持一致详见附图 S2。综上由于打分结果与人工专家高度吻合本研究将这套依托标准化评分细则、基于 GPT-4.1 的打分器作为全量文本任务规模化评测替代工具同时以人工专家评价作为判定基准。理解、分析与实操三类任务结果对比图像识别任务本研究采用多模态大语言模型完成视觉理解任务任务包含 11 种工程上明确划分的丝状微生物种类识别。本节仅以 GPT-4o 作为典型模型展示结果GPT-4o、Gemini-3-Pro-preview、DeepSeek-VL2 三款模型的完整横向对比以及视觉模块串联大模型方案带来的性能提升将在3.3.1 节展开分析。整体来看GPT-4o 对丝状微生物的识别总准确率仅为 54%图 2d。细分菌种识别效果差异显著0914 型丝状菌识别准确率为 0浮游球衣细菌Sphaerotilus natans25.0%、0041 型丝状菌28.6%识别效果较差0092 型、1851 型丝状菌、诺卡氏菌、发硫菌、微丝菌识别效果中等而浮游胶枝藻识别准确率 71.4%贝氏硫细菌与真菌识别准确率均达到 100%表现相对优异。综上仅依靠原生 GPT-4o 无法稳定、可靠地基于显微图像完成丝状菌鉴定工作。理解能力、分析能力和实践能力任务类型中文含义主要能力表现PROC工艺基础理解能力较好MICRO微生物识别理解能力最弱P-M工艺-微生物关系理解 分析较弱且波动大RISK运行风险评估理解 分析较好CTRL控制与优化理解 分析 实践中等但不稳定大语言模型之间的比较为了比较不同大语言模型之间的表现和认知能力作者使用了配对散点图也就是 bubble plots以及单侧 Mann-Whitney U 检验。对于 PROC 工艺基础任务也就是理解任务GPT-4o 的理解能力显著高于 Gemini-2.0-flash 和 DeepSeek-R1。其中GPT-4o 与 Gemini-2.0-flash 的比较结果为 p 0.001GPT-4o 与 DeepSeek-R1 的比较结果为 p 0.03。在 MICRO 微生物识别任务中这种差异更加明显。GPT-4o 在理解能力上优于 Gemini-2.0-flashp 0.002也优于 DeepSeek-R1p 0.001。对于分析任务也就是 P-M 工艺-微生物关系任务和 RISK 风险评估任务作者同时评估了理解能力和分析能力。在 P-M 任务中GPT-4o 在理解能力上优于 Gemini-2.0-flashp 0.04在分析能力上也优于 Gemini-2.0-flashp 0.01。在 RISK 任务中GPT-4o 在理解能力上优于 Gemini-2.0-flash 和 DeepSeek-R1对应 p 值分别为 0.005 和 0.05。在分析能力上GPT-4o 也优于 Gemini-2.0-flash 和 DeepSeek-R1两个比较的 p 值均小于 0.0001。对于 CTRL控制任务三个模型在理解能力上没有显著差异。然而GPT-4o 在分析能力上优于 Gemini-2.0-flash 和 DeepSeek-R1p 值分别为 0.02 和 0.002在实践能力上也优于 Gemini-2.0-flash 和DeepSeek-R1p 值分别为 0.03 和 0.002。Token 效率除了关注大语言模型的准确性之外作者还关注了 token 消耗因为 token 消耗反映了计算成本。具体来说token-得分散点图显示Gemini-2.0-flash 平均生成的回答最短平均为244 tokens其次是 GPT-4o平均为277 tokensDeepSeek-R1 平均为298 tokens。当用归一化得分除以 token 数量时GPT-4o 和 Gemini 表现出更高的 token 效率平均约为22grade / 1000 tokens而 DeepSeek-R1 平均为18 grade / 1000 tokens差异具有统计学意义p 0.05。这说明作为“思考型模型”的 DeepSeek-R1需要更多 token 才能转化为相近的性能收益。不同任务类别的 token-得分模式也不同。PROC 工艺基础任务是最具长度效率的任务因为回答相对较短平均约174 tokens并且能达到约20 grade / 1000 tokens。相反MICRO 微生物识别任务使用了更多 token平均约229 tokens但效率最低约7 grade/ 1000 tokens。这说明更长的输出并不能可靠地克服微生物解释本身的内在困难。P-M 工艺-微生物关系任务的 token 消耗范围更广、整体更高平均约307 tokens但仍然受到token 效率限制约17 grade / 1000 tokens。这是因为它需要较高的认知能力要把微生物、机制和工艺条件联系起来。RISK 风险评估任务则在中等 token 预算下获得了较高性能平均约245 tokens并取得最高token 效率约30 grade / 1000 tokens。CTRL 控制任务需要最多 token平均约568 tokens因此效率只达到中等水平约16 grade /1000 tokens。这说明大模型的控制建议常常比较冗长而且不够精准。总体而言作者提出了一个同时评估任务准确性和 token 效率的框架用来比较不同大模型和任务类型。研究发现低 token 效率主要来自有限的认知能力。例如 MICRO 的 token 效率一直很低约7 grade / 1000 tokens原因是大模型在这类任务上的理解能力较弱。因此作者建议要降低计算成本、提升 token 效率不能只让模型“少说话”更应该提升它的认知能力尤其是在实践任务中。定性误差分析与大语言模型认知能力优化视觉模块提升了视觉理解能力与单独使用大语言模型相比视觉模块 大语言模型流程同时提高了粗略准确率和精细准确率。这说明它不仅提升了在大类层面识别丝状微生物形态的能力也提升了判断具体微生物类型的能力。同时粗类漏判率降低说明严重识别失败变少了同粗类但细分类错误率降低说明模型虽然能识别出大致类别、但选错具体类别的情况也减少了。 性能提升来自视觉模块提供的结构化视觉证据以及大语言模型对这些视觉证据的整合能力RAG 提升了文本类任务表现加入 RAG 后DeepSeek-R1 在五类任务中的平均归一化得分分别为任务得分PROC 工艺基础3.9 / 5MICRO 微生物识别2.2 / 5P-M 工艺-微生物关系4.0 / 5RISK 风险评估4.3 / 5CTRL 控制优化4.2 / 5与没有检索增强的基线相比DeepSeek-R1 的提升幅度为任务提升幅度PROC17%MICRO56%P-M70%RISK31%CTRL60%大语言模型案例研究以及污水厂工程师对使用大语言模型的看法加入 RAG 后的 DeepSeek-R1也就是 FilamentGPT在具体污泥膨胀案例中比原始模型更能给出精确、可执行、有安全边界的工程建议并且获得了污水厂工程师较高的认可说明它具备作为决策支持工具的实际潜力。案例类型比较内容说明的问题理解任务Type 1863 描述FilamentGPT 更能给出精确微生物特征分析任务EPS、高碳水化合物、染色异常FilamentGPT 更能联系现象、机制和原因实践任务RAS 氯化控制污泥膨胀FilamentGPT 更能给出具体操作方案结论第4章讨论。本章首先比较不同类型大模型在污泥膨胀管理中的适用性GPT-4o凭借原生多模态能力和较稳定的文本任务表现可作为当前实用基线但从长期看DeepSeek-R1等推理型模型更适合作为系统底座因为它们能够更有效地将RAG检索到的知识整合为具有步骤、参数和安全边界的厂级操作方案。作者进一步指出不同能力需要针对性增强采用专用视觉模块改善丝状菌识别采用领域监督微调SFT强化专业概念理解采用强化学习RL提升机理分析与推理效率并采用GraphRAG增强操作建议的完整性和工况适配性。单独使用RAG无法同时解决理解、分析和实践能力的全部缺陷。第5章意义与不足。本章认为该研究的主要意义是建立了包含280项专家设计任务的可解释评估框架使研究者能够判断大模型在污泥膨胀管理中“哪里可靠、哪里薄弱以及应该怎样改进”并通过LLM-rater实现规模化评价。不过现有结果仍不足以证明大模型能够直接用于污水厂自主控制评分器仍可能存在位置偏差、冗长度偏差和评价标准覆盖不足视觉模块仅验证了少量丝状菌类别实践案例和参与评价的污水厂工程师数量有限FilamentGPT也没有在真实膨胀事件中接受闭环运行验证。作者因此建议后续在实验室诱导膨胀和全尺度污水厂中使用SVI、丝状菌丰度、出水水质、预警提前量、误报率及操作员接受度等指标开展验证。第6章结论。作者最终认为大模型具有辅助污泥膨胀管理的潜力但当前商业模型仍不够可靠其主要瓶颈是显微图像与微生物识别能力不足、工艺—微生物关系分析较弱以及控制任务中的实践能力不稳定。专用视觉模块可将三个重点丝状菌类别的识别准确率由51%提高至78%RAG增强的DeepSeek-R1FilamentGPT取得了三种模型中的最佳综合表现并能够比人工更快生成较为具体的建议。然而任何单一增强方法都不能改善全部能力未来应综合采用视觉模块、SFT、RL和GraphRAG并加入工程师审核及安全约束将系统定位为污水厂的“运行决策副驾驶”而不是自主控制器。