工业 AI 落地真实案例:用 Agent 代替人工巡检,泵房故障提前发现

<p style="text-align: left;"/><p style="text-align: left;"><img src="https://upload-images.jianshu.io/upload_images/1662298-ca5d8c22e1621e64.png" data-status="complete" width="auto" style="min-height:200px;min-width:200px;" class="uploaded-img" height="auto"/></p><p style="text-align: left;">你家楼里的水是怎么上来的?</p><p style="text-align: left;">不是直接从市政管网来的。大多数城市小区,地下有一套二次供水泵房——负责把水加压再送到每一层。</p><p style="text-align: left;">这套设备,很少有人注意,但一旦出问题,影响的是整栋楼的用水。</p><p style="text-align: left;">过去这套设备是靠人巡检的。有没有报警,传感器有没有超值,出了问题再去排查。</p><p style="text-align: left;">我们设计了另一套方案:让 AI 持续盯着这台设备,像医生一样持续体检,提前发现隐患、解释原因、给出处置建议。</p>


<h3 style="text-align: left;">1. 先说清楚:这个系统要解决什么问题</h3><p style="text-align: left;">泵房里的传感器其实一直在采集数据:压力、流量、电压、电流、液位、报警信号……</p><p style="text-align: left;">数据不少,但光有数据没用。</p><p style="text-align: left;">传统的报警逻辑是"超过阈值就报警"——这更像一个门铃,只负责响,不负责说清楚出了什么问题。</p><p style="text-align: left;">运维人员真正需要的是三件事:</p><p style="text-align: left;">① 这台设备现在健不健康?② 如果有问题,根因是什么?③ 我应该先去检查哪里?</p><p style="text-align: left;">这套 AI 智能体系统,就是为这三个问题设计的。</p>
<p style="text-align: left;"><img src="https://upload-images.jianshu.io/upload_images/1662298-d22ebfbc8f6f72f3.png" data-status="complete" width="auto" style="min-height:200px;min-width:200px;" class="uploaded-img" height="auto"/></p><h3 style="text-align: left;">2. 数据两层:原始指标 + 计算指标</h3><p style="text-align: left;">系统把数据分成两层处理。</p><p style="text-align: left;">第一层:原始指标直接来自传感器和 PLC:出水压力、流量、电压电流、液位、设备运行状态、告警信号。这层数据告诉你"现场发生了什么"。</p><p style="text-align: left;">第二层:计算指标由云端脚本引擎对原始数据加工得出:泵组效率、水电比(每吨水耗电量)、压力稳定性(方差)、单位能耗偏离度、泵组切换频率……</p><p style="text-align: left;">这层数据才是真正有分析价值的。</p><p style="text-align: left;">就像体检报告:抽血结果只是原始数据,真正重要的是医生根据多项指标综合判断你的健康状态。</p><p style="text-align: left;">另外——泵房还有摄像头和麦克风。设备位移、漏水痕迹、电机异响,这些都是多模态数据。它们体量大,不能全传云端,所以我们在边缘侧先做轻量 AI 预处理,只把"特征和事件"上报云端,节省带宽和计算成本。</p>
<h3 style="text-align: left;">3. 快慢双轨:AI 用在最值的地方</h3><p style="text-align: left;">这套系统最务实的设计,是对异常做分流。</p><p style="text-align: left;">快系统:确定性硬故障,不走 AI,直接处理</p><p style="text-align: left;">PLC 明确报出缺水停机、超压停机、传感器物理掉线——因果清晰,无需大模型推理。规则引擎直接扣分、报警、推送工单,秒级响应。</p><p style="text-align: left;">慢系统:复杂隐患,才交给 AI 深度分析</p><p style="text-align: left;">泵组效率持续下滑、压力方差升高、单位能耗偏离历史均值——这类问题有多种可能的根因,才值得拉 AI 来"开专家会"。</p><p style="text-align: left;">这个分流设计非常关键。</p><p style="text-align: left;">AI 大模型调用有成本,工业场景里更讲究精准——只有真正复杂、真正需要推理的问题,才值得动用 AI。</p><p style="text-align: left;"><img src="https://upload-images.jianshu.io/upload_images/1662298-3db8c54df1e5c864.png" data-status="complete" width="auto" style="min-height:200px;min-width:200px;" class="uploaded-img" height="auto"/></p>
<h3 style="text-align: left;">4. GraphRAG:让 AI 看懂设备之间的物理关系</h3><p style="text-align: left;">普通的 AI 问答更像"查文档"——你问一个问题,它从知识库里找最相关的段落回答你。</p><p style="text-align: left;">但泵房故障有很强的物理联动:一个出口压力异常,可能和变频器、水泵、阀门、管网末端、传感器都有关系。如果 AI 只看单点数据,很容易给出片面结论。</p><p style="text-align: left;">我们引入了GraphRAG——基于知识图谱的检索增强。</p><p style="text-align: left;">它把这些东西连成一张图:</p><ul><li><p style="text-align: left;">设备之间的拓扑关系(谁在谁上游)</p></li><li><p style="text-align: left;">每个指标的业务定义和异常机理</p></li><li><p style="text-align: left;">历史上类似故障的处置经验(专家录入)</p></li><li><p style="text-align: left;">当前运行工况和环境上下文</p></li></ul><p style="text-align: left;">当 AI 在分析"出口压力波动大"时,它不会只说"压力异常",而是进一步关联:</p><blockquote><p style="text-align: left;">是变频器 PID 控制参数不稳?是管网末端阀门异常节流?是泵组切换策略有问题?还是压力传感器本身数据质量不可靠?</p></blockquote><p style="text-align: left;">这才接近一名有经验的现场工程师在做分析,而不是在查 FAQ。</p>
<h3 style="text-align: left;">5. 多 Agent 交叉验证:避免大模型"一本正经地说错"</h3><p style="text-align: left;">供水系统是高安全场景,不能让一个大模型独自拍板。</p><p style="text-align: left;">为什么一个 AI 不够?</p><p style="text-align: left;">大模型有一个天然的问题:它很善于"看起来言之有理"。你给它一段异常数据,它会输出一个听起来很专业的分析——但在高安全场景里,"听起来对"和"真的对"是两件事。</p><p style="text-align: left;">工业现场的故障往往可以从多个专业视角解读,不同的工程师看同一个现象,结论可能完全不同。这不是谁的问题,而是真实世界里工业系统的复杂性使然。</p><p style="text-align: left;">我们的做法:让三个不同倾向的 Agent 同时分析,互相验证。</p><p style="text-align: left;">• Agent A(电气视角,倾向激进):优先考虑电气故障、变频器问题、电机老化,倾向判断更高风险等级&nbsp;</p><p style="text-align: left;">• Agent B(安全视角,倾向保守):优先考虑安全保护逻辑、停机风险,倾向谨慎维稳、避免误操作&nbsp;</p><p style="text-align: left;">• Agent C(水力视角,中立):从管网水力机械角度分析,关注泵组运行工况、管网压差、流量平衡</p><p style="text-align: left;">同一个异常,比如"出口压力持续低于设定值":</p><ul><li><p style="text-align: left;">Agent A 可能判断:变频器输出异常,HIGH 风险</p></li><li><p style="text-align: left;">Agent B 可能判断:供水不足风险,建议立即触发备用泵,CRITICAL</p></li><li><p style="text-align: left;">Agent C 可能判断:末端用水量峰值导致短暂压降,属正常工况,LOW 风险</p></li></ul><p style="text-align: left;">裁决 Agent 对比三份报告,评估置信度:</p><p style="text-align: left;">三者结论接近 → 直接输出风险等级和可执行建议</p><p style="text-align: left;">三者分歧严重 → 触发 Human-in-the-Loop(人类在环),推给高级工程师人工审核。AI 不降分、不自行决策,等人来判断。</p><p style="text-align: left;">这个机制的核心价值:AI 知道自己什么时候不该拍板。</p><p style="text-align: left;">工业 AI 真正的边界感,不是无所不知,而是在不确定的时候及时交给人。</p>
<h3 style="text-align: left;">6. 健康度评分:规则 × AI,稳定且可解释</h3><p style="text-align: left;">最终,系统会给每个泵房输出一个健康度分数(支持按小时、日、月周期)。</p><p style="text-align: left;">但这个分不是大模型随口打的,而是两层合并计算:</p><p style="text-align: left;">第一层:客观规则扣分(稳定可复现)</p><p style="text-align: left;">第二层:AI 判断风险系数(上下文敏感)</p><p style="text-align: left;">同样是压力波动——工况正常波动是 LOW(×0.5),设备劣化前兆是 HIGH(×1.5),数据故障可能是 CRITICAL(×2.0)。</p><p style="text-align: left;">最终扣分 = 客观基础扣分 × AI 风险系数</p><p style="text-align: left;">规则保证分数稳定可追溯,AI 负责理解复杂上下文,互相补位。</p>
<h3 style="text-align: left;">7. 真正的价值:不是分数,是可执行的建议</h3><p style="text-align: left;">健康分 78 分——这个数字本身意义不大。</p><p style="text-align: left;">系统真正交付给运维管理者的,是这样的内容:</p><blockquote><p style="text-align: left;">数据质量维度:HIGH 风险
控制效率维度:MEDIUM 风险
设备健康维度:LOW 风险</p></blockquote><p style="text-align: left;">每条建议有来源依据、关联指标、优先级——不是模糊的"需要关注",而是可以直接派工单的操作指令。</p><p style="text-align: left;">专家处置完成后,处置结果可以写回知识图谱——下次遇到同类问题,AI 可以直接复用这段经验,系统越用越准。</p><p style="text-align: left;"><img src="https://upload-images.jianshu.io/upload_images/1662298-75aa42e8c0147ac4.png" data-status="complete" width="auto" style="min-height:200px;min-width:200px;" class="uploaded-img" height="auto"/></p>
<h3 style="text-align: left;">8. 复盘:这套设计最值得借鉴的 4 点</h3><p style="text-align: left;">① AI 没有替代规则,而是和规则分层协作</p><p style="text-align: left;">客观扣分靠规则,风险判断靠 AI,两者各司其职。不迷信 AI 全自动,也不用死板规则限制住所有判断。</p><p style="text-align: left;">② 大模型不是用来处理所有告警的,而是通过快慢双轨精准调用</p><p style="text-align: left;">只有真正复杂的隐患才进慢系统,硬故障秒级处理不走 AI。算力花在刀刃上。</p><p style="text-align: left;">③ GraphRAG 把设备物理拓扑和专家经验都连进来</p><p style="text-align: left;">不只是语义搜索文档,而是在设备关系图上做有物理意义的推理,分析结论更接近现场工程师的判断。</p><p style="text-align: left;">④ 保留人工审核机制,不在高安全场景里盲目自动化</p><p style="text-align: left;">多 Agent 分歧大时强制触发人类在环,AI 主动认识自己的边界,不硬猜不乱扣分。</p>
<h3 style="text-align: left;">结尾</h3><p style="text-align: left;">城市地下有很多这样的泵房,安静地工作,很少被人注意。</p><p style="text-align: left;">传统运维方式里,它们靠定期巡检和报警维持,出了问题才知道。</p><p style="text-align: left;">这套方案想做的,是让泵房有一套持续运转的"AI 体检医生":</p><p style="text-align: left;">数据自己上报,系统持续分析,AI 辅助判断,专家经验不断沉淀。</p><p style="text-align: left;">从"坏了再修",变成"变坏之前就知道,还能说清楚为什么、该怎么处置"。</p><p style="text-align: left;">这,可能才是 AI Agent 在工业基础设施里最现实、最有价值的落地方式。</p><p style="text-align: left;">如果你也在做工业 AI 或智慧城市相关的项目,欢迎交流。</p><ol><li><p style="text-align: left;"/></li></ol><p style="text-align: left;"/>

©著作权归作者所有,转载或内容合作请联系作者
【社区内容提示】社区部分内容疑似由AI辅助生成,浏览时请结合常识与多方信息审慎甄别。
平台声明:文章内容(如有图片或视频亦包括在内)由作者上传并发布,文章内容仅代表作者本人观点,简书系信息发布平台,仅提供信息存储服务。

相关阅读更多精彩内容

友情链接更多精彩内容