
你家楼里的水是怎么上来的?
不是直接从市政管网来的。大多数城市小区,地下有一套二次供水泵房——负责把水加压再送到每一层。
这套设备,很少有人注意,但一旦出问题,影响的是整栋楼的用水。
过去这套设备是靠人巡检的。有没有报警,传感器有没有超值,出了问题再去排查。
我们设计了另一套方案:让 AI 持续盯着这台设备,像医生一样持续体检,提前发现隐患、解释原因、给出处置建议。
1. 先说清楚:这个系统要解决什么问题
泵房里的传感器其实一直在采集数据:压力、流量、电压、电流、液位、报警信号……
数据不少,但光有数据没用。
传统的报警逻辑是"超过阈值就报警"——这更像一个门铃,只负责响,不负责说清楚出了什么问题。
运维人员真正需要的是三件事:
① 这台设备现在健不健康?② 如果有问题,根因是什么?③ 我应该先去检查哪里?
这套 AI 智能体系统,就是为这三个问题设计的。

2. 数据两层:原始指标 + 计算指标
系统把数据分成两层处理。
第一层:原始指标直接来自传感器和 PLC:出水压力、流量、电压电流、液位、设备运行状态、告警信号。这层数据告诉你"现场发生了什么"。
第二层:计算指标由云端脚本引擎对原始数据加工得出:泵组效率、水电比(每吨水耗电量)、压力稳定性(方差)、单位能耗偏离度、泵组切换频率……
这层数据才是真正有分析价值的。
就像体检报告:抽血结果只是原始数据,真正重要的是医生根据多项指标综合判断你的健康状态。
另外——泵房还有摄像头和麦克风。设备位移、漏水痕迹、电机异响,这些都是多模态数据。它们体量大,不能全传云端,所以我们在边缘侧先做轻量 AI 预处理,只把"特征和事件"上报云端,节省带宽和计算成本。
3. 快慢双轨:AI 用在最值的地方
这套系统最务实的设计,是对异常做分流。
快系统:确定性硬故障,不走 AI,直接处理
PLC 明确报出缺水停机、超压停机、传感器物理掉线——因果清晰,无需大模型推理。规则引擎直接扣分、报警、推送工单,秒级响应。
慢系统:复杂隐患,才交给 AI 深度分析
泵组效率持续下滑、压力方差升高、单位能耗偏离历史均值——这类问题有多种可能的根因,才值得拉 AI 来"开专家会"。
这个分流设计非常关键。
AI 大模型调用有成本,工业场景里更讲究精准——只有真正复杂、真正需要推理的问题,才值得动用 AI。

4. GraphRAG:让 AI 看懂设备之间的物理关系
普通的 AI 问答更像"查文档"——你问一个问题,它从知识库里找最相关的段落回答你。
但泵房故障有很强的物理联动:一个出口压力异常,可能和变频器、水泵、阀门、管网末端、传感器都有关系。如果 AI 只看单点数据,很容易给出片面结论。
我们引入了GraphRAG——基于知识图谱的检索增强。
它把这些东西连成一张图:
-
设备之间的拓扑关系(谁在谁上游)
-
每个指标的业务定义和异常机理
-
历史上类似故障的处置经验(专家录入)
-
当前运行工况和环境上下文
当 AI 在分析"出口压力波动大"时,它不会只说"压力异常",而是进一步关联:
是变频器 PID 控制参数不稳?是管网末端阀门异常节流?是泵组切换策略有问题?还是压力传感器本身数据质量不可靠?
这才接近一名有经验的现场工程师在做分析,而不是在查 FAQ。
5. 多 Agent 交叉验证:避免大模型"一本正经地说错"
供水系统是高安全场景,不能让一个大模型独自拍板。
为什么一个 AI 不够?
大模型有一个天然的问题:它很善于"看起来言之有理"。你给它一段异常数据,它会输出一个听起来很专业的分析——但在高安全场景里,"听起来对"和"真的对"是两件事。
工业现场的故障往往可以从多个专业视角解读,不同的工程师看同一个现象,结论可能完全不同。这不是谁的问题,而是真实世界里工业系统的复杂性使然。
我们的做法:让三个不同倾向的 Agent 同时分析,互相验证。
• Agent A(电气视角,倾向激进):优先考虑电气故障、变频器问题、电机老化,倾向判断更高风险等级
• Agent B(安全视角,倾向保守):优先考虑安全保护逻辑、停机风险,倾向谨慎维稳、避免误操作
• Agent C(水力视角,中立):从管网水力机械角度分析,关注泵组运行工况、管网压差、流量平衡
同一个异常,比如"出口压力持续低于设定值":
-
Agent A 可能判断:变频器输出异常,HIGH 风险
-
Agent B 可能判断:供水不足风险,建议立即触发备用泵,CRITICAL
-
Agent C 可能判断:末端用水量峰值导致短暂压降,属正常工况,LOW 风险
裁决 Agent 对比三份报告,评估置信度:
三者结论接近 → 直接输出风险等级和可执行建议
三者分歧严重 → 触发 Human-in-the-Loop(人类在环),推给高级工程师人工审核。AI 不降分、不自行决策,等人来判断。
这个机制的核心价值:AI 知道自己什么时候不该拍板。
工业 AI 真正的边界感,不是无所不知,而是在不确定的时候及时交给人。
6. 健康度评分:规则 × AI,稳定且可解释
最终,系统会给每个泵房输出一个健康度分数(支持按小时、日、月周期)。
但这个分不是大模型随口打的,而是两层合并计算:
第一层:客观规则扣分(稳定可复现)
第二层:AI 判断风险系数(上下文敏感)
同样是压力波动——工况正常波动是 LOW(×0.5),设备劣化前兆是 HIGH(×1.5),数据故障可能是 CRITICAL(×2.0)。
最终扣分 = 客观基础扣分 × AI 风险系数
规则保证分数稳定可追溯,AI 负责理解复杂上下文,互相补位。
7. 真正的价值:不是分数,是可执行的建议
健康分 78 分——这个数字本身意义不大。
系统真正交付给运维管理者的,是这样的内容:
数据质量维度:HIGH 风险
控制效率维度:MEDIUM 风险
设备健康维度:LOW 风险
每条建议有来源依据、关联指标、优先级——不是模糊的"需要关注",而是可以直接派工单的操作指令。
专家处置完成后,处置结果可以写回知识图谱——下次遇到同类问题,AI 可以直接复用这段经验,系统越用越准。

8. 复盘:这套设计最值得借鉴的 4 点
① AI 没有替代规则,而是和规则分层协作
客观扣分靠规则,风险判断靠 AI,两者各司其职。不迷信 AI 全自动,也不用死板规则限制住所有判断。
② 大模型不是用来处理所有告警的,而是通过快慢双轨精准调用
只有真正复杂的隐患才进慢系统,硬故障秒级处理不走 AI。算力花在刀刃上。
③ GraphRAG 把设备物理拓扑和专家经验都连进来
不只是语义搜索文档,而是在设备关系图上做有物理意义的推理,分析结论更接近现场工程师的判断。
④ 保留人工审核机制,不在高安全场景里盲目自动化
多 Agent 分歧大时强制触发人类在环,AI 主动认识自己的边界,不硬猜不乱扣分。
结尾
城市地下有很多这样的泵房,安静地工作,很少被人注意。
传统运维方式里,它们靠定期巡检和报警维持,出了问题才知道。
这套方案想做的,是让泵房有一套持续运转的"AI 体检医生":
数据自己上报,系统持续分析,AI 辅助判断,专家经验不断沉淀。
从"坏了再修",变成"变坏之前就知道,还能说清楚为什么、该怎么处置"。
这,可能才是 AI Agent 在工业基础设施里最现实、最有价值的落地方式。
如果你也在做工业 AI 或智慧城市相关的项目,欢迎交流。






