自来水厂水质预测与评估
——基于多模型融合的数学建模研究
Water Quality Prediction and Assessment for Water Treatment Plant Based on Multi-Model Fusion
摘要:本研究基于2026年第十六届APMCM亚太地区大学生数学建模竞赛(中文赛项)A题某自来水厂2025年全年4380条实时监测数据,综合运用多元统计分析、机器学习、聚类分析等方法,建立了涵盖水质综合评价、异常检测与预警、趋势预测和关键因素识别的多层次水质分析体系。研究发现出厂水综合水质指数(WQI)达83.6分,pH值和二氧化氯完全达标;识别出河流水位为影响浊度的首要因素;构建了多模型对比预测框架,MLP神经网络在浊度预测中表现最优(R²=0.8331)。
关键词:水质预测;数学建模;异常检测;随机森林;相关性分析;综合水质指数
目 录
1 问题重述与研究背景
1.1 问题重述
自来水厂是城市供水系统的核心设施,其出水水质直接关系到公共健康和安全。随着气候变化和人类活动加剧,原水水质波动日趋复杂,传统经验管理模式已难以满足精细化运营需求。本题要求基于某自来水厂2025年1月至12月的实时监测数据(附件1),以及2026年第一季度验证数据(附件2),综合运用数学建模方法,完成以下任务:
(1)对水厂出水水质进行综合评价,建立科学的评价体系;(2)检测水质异常数据,建立预警机制;(3)分析各参数间的相关性,识别关键影响因素;(4)构建水质趋势预测模型,为生产调度提供决策支持。
1.2 研究背景
水质安全是公共卫生的重要组成部分。根据世界卫生组织(WHO)统计,全球约有8.44亿人缺乏基本饮用水服务[1]。在我国,随着《生活饮用水卫生标准》(GB 5749-2022)的实施,对出厂水浊度、余氯、pH值等指标提出了更严格的要求[2]。水厂运行面临原水水质波动大、处理工艺复杂、检测数据量大等多重挑战,亟需借助数据驱动的方法实现智能化管理。
1.3 技术路线
本研究采用"数据预处理→评价分析→异常检测→因素识别→趋势预测→模型验证"的六步技术路线,综合运用统计学方法(Pearson相关分析、Z-score检验)、机器学习方法(随机森林、DBSCAN聚类、MLP神经网络)和多元回归方法(线性回归、岭回归),构建多层次、多角度的水质分析体系。
2 模型假设与符号说明
2.1 模型假设
为保证模型合理性和可操作性,作如下假设:
(1)附件1中各月份数据的采集频率和时间间隔基本一致,数据具有时间可比性;
(2)缺失数据为随机缺失(MAR),采用中位数填充不会引入系统性偏差;
(3)水厂处理工艺在研究期间保持相对稳定,不存在重大设备变更或工艺调整;
(4)水质参数的监测数据真实可靠,不存在人为篡改或仪器系统性误差。
2.2 符号说明
| NTU | 出厂水浊度 (Nephelometric Turbidity Unit) | – |
| CLR | 出厂水余氯 (Chlorine Residual) | mg/L |
| CL2 | 二氧化氯投加量 | mg/L |
| PH | 出厂水pH值 | – |
| R/W NTU | 原水浊度 | – |
| R/W CLR | 原水余氯 | mg/L |
| R/W PH | 原水pH值 | – |
| RIVER LEVEL | 河流水位 | m |
| FILT. NTU | 滤池出水浊度 | – |
| ALUM | 硫酸铝(絮凝剂)投加量 | mg/L |
| WQI | 综合水质指数 (Water Quality Index) | 分 |
| r | Pearson相关系数 | – |
| R² | 决定系数 | – |
3 数据描述与预处理
3.1 数据来源与结构
本研究使用两类数据集:附件1为2025年1月至12月的月度监测数据,共12个Excel文件,合计4380条记录,每条记录包含采样日期(DATE)、采样时间(TIME,以HHMM格式表示,如700代表7:00)以及20项监测参数;附件2为2026年1月至3月的验证数据,共36条记录,结构类似但缺少DATE列。
监测参数可分为三大类:
(1)原水参数:河流水位(RIVER LEVEL)、原水浊度(R/W NTU)、原水余氯(R/W CLR)、原水pH值(R/W PH)、原水流量(R/W FLOW)、原水泵功率(R/W PUMP DUTY)。
(2)处理工艺参数:滤池出水浊度(FILT. NTU)、清水池水位(C/W WELL LEVEL)、矾投放量(ALUM)、出厂水泵功率(T/W PUMP DUTY)、出厂水流量(T/W FLOW)、18ML水位和流量。
(3)出厂水水质参数:pH值、浊度(NTU)、余氯(CLR)、二氧化氯(CL2)。
图11 各月数据采集量分布
3.2 数据清洗与缺失值处理
原始数据存在以下质量问题需要处理:
(1)无效列:数据中存在Unnamed: 3、Unnamed: 7等空列,由Excel导出格式产生,直接删除。
(2)缺失值:部分参数存在大量缺失,其中RIVER LEVEL缺失35.34%、R/W PH缺失37.53%、CL2缺失39.16%。缺失原因可能为设备维护、校准或数据传输中断。对于数值型变量,采用中位数填充法,因其对极端值不敏感,优于均值填充。
(3)异常标记:部分单元格以"-"标记,表示无数据或设备停机,将其转换为NaN后按缺失值处理。
图2 各参数数据缺失率分布
3.3 特征工程
为支持时间序列分析和预测建模,从原始数据中构建以下衍生特征:
(1)时间特征:从DATE列提取年、月、日、星期、小时等周期性特征,捕捉水质参数的时间规律。
(2)滞后特征:构建lag_1至lag_7,表示目标变量前1至7天的历史值,用于自回归预测。
(3)滚动统计特征:计算7天滚动均值(rolling_mean_7)和滚动标准差(rolling_std_7),捕捉短期趋势和波动性。
4 水质综合评价模型
4.1 评价指标体系构建
根据《生活饮用水卫生标准》(GB 5749-2022),选取出厂水的四项核心指标构建评价体系。采用单项水质指数法,将各参数的实际监测值与标准限值进行比较,计算单项评分(0-100分),再通过加权平均得到综合水质指数(WQI)。
各参数的国标限值及权重设定如下表所示。权重分配依据为:浊度(NTU)对感官质量和微生物安全影响最大,赋予最高权重0.30;pH值和余氯(CLR)各占0.25;二氧化氯(CL2)占0.20。
| pH值 | 6.5 | 8.5 | 0.25 | GB 5749-2022 |
| 浊度 NTU | – | 1.0 | 0.30 | GB 5749-2022 |
| 余氯 CLR | 0.3 | 4.0 | 0.25 | GB 5749-2022 |
| 二氧化氯 CL2 | 0.3 | 4.0 | 0.20 | GB 5749-2022 |
4.2 单项水质指数计算
单项水质指数的计算规则如下:当参数均值在标准范围内时,得满分100分;当超出标准上限时,按超出比例扣分:
S
i = max(0, 100 – max(0, (x̄
i – U
i) / U
i) × 100)
其中,Si为第i个参数的单项评分,x̄i为该参数的年均值,Ui为国标上限值。当x̄i ≤ Ui时,Si = 100。
| pH值 | 7.295 | 0.036 | 7.000 | 7.700 | 0.00% | 100.0 |
| 浊度 NTU | 0.449 | 0.659 | 0.080 | 11.900 | 3.86% | 100.0 |
| 余氯 CLR | 4.970 | 0.368 | 0.000 | 5.000 | 99.98% | 34.3 |
| 二氧化氯 CL2 | 1.480 | 0.191 | 0.470 | 3.400 | 0.00% | 100.0 |
图3 出厂水水质综合评价雷达图
4.3 综合水质指数WQI
综合水质指数(WQI)采用加权平均法计算:
WQI = Σ(w
i × S
i) = 0.25×100 + 0.30×100 + 0.25×34.3 + 0.20×100 =
83.6 分
计算结果表明,该水厂出厂水综合水质指数为83.6分,总体处于良好水平。pH值、浊度和二氧化氯三项指标均获得满分,表明水厂在核心水质控制方面表现优异。余氯(CLR)评分较低(34.3分),主要因为平均值(4.97 mg/L)超过国标上限(4.0 mg/L),但考虑到管网输送过程中余氯的自然衰减以及维持管网末梢余氯的必要性,该水平在实际运行中具有合理性。
图4 2025年出厂水水质参数月度变化趋势(含标准差误差线)
5 参数相关性分析
5.1 Pearson相关系数矩阵
为揭示各水质参数之间的内在关联,计算13个核心参数的Pearson相关系数矩阵。Pearson相关系数衡量两个变量之间的线性相关程度,取值范围为[-1, 1],|r|越接近1表示相关性越强。
r(X, Y) = Cov(X, Y) / (σ
X × σ
Y)
图5 各参数Pearson相关系数热力图(交互式)
图6 各参数Pearson相关系数热力图(静态版)
5.2 关键相关性发现
通过相关性分析,识别出以下高度相关的参数对(|r| > 0.5):
| R/W NTU ↔ R/W CLR | 0.793 | 强正相关 | 原水有机物含量同时影响浊度和余氯消耗 |
| R/W FLOW ↔ T/W FLOW | 0.852 | 强正相关 | 符合质量守恒定律,进出水流量高度一致 |
| FILT. NTU ↔ NTU | 0.703 | 强正相关 | 滤池是浊度去除的关键环节 |
图7 原水与出厂水水质参数散点图
上述发现揭示了水处理过程中的关键传递关系:原水浊度与余氯的高度相关性表明两者受共同因素(如降雨径流、藻类繁殖)驱动;滤池出水与出厂水浊度的强相关性说明过滤工艺是决定最终浊度水平的关键环节,优化滤池运行参数可显著改善出水水质。
6 水质异常检测与预警模型
6.1 Z-score统计检测法
Z-score法是经典的统计异常检测方法。对于每个参数,计算其标准化Z分数:
Z
j = (x
j – μ) / σ
其中xj为第j个样本值,μ和σ分别为该参数的均值和标准差。当|Zj| > 3时,判定该样本为异常点(对应正态分布下99.7%置信区间外的概率事件)。
本研究对8个关键参数(RIVER LEVEL、R/W NTU、R/W CLR、R/W PH、NTU、CLR、CL2、ALUM)进行Z-score检测,共检出516个异常样本,占总样本的11.78%。
6.2 IQR四分位距检测法
IQR法基于数据的四分位分布,对非正态分布数据具有更好的鲁棒性。计算各参数的第一四分位数Q1和第三四分位数Q3,定义异常判定区间为:
异常区间:x < Q1 – 1.5×IQR 或 x > Q3 + 1.5×IQR,其中 IQR = Q3 – Q1
IQR法检出2431个异常样本(55.50%),检出率较高,原因在于水质数据本身具有较大的自然波动性,IQR法对这种波动较为敏感。
6.3 DBSCAN密度聚类检测法
DBSCAN(Density-Based Spatial Clustering of Applications with Noise)是一种基于密度的聚类算法[3],能够识别任意形状的簇并将低密度区域的样本标记为噪声点(异常点)。其核心参数为邻域半径ε和最小样本数MinPts。
本研究对标准化后的8维特征向量进行DBSCAN聚类(ε=1.5,MinPts=5),共检出78个异常样本(1.78%)。这些样本代表了水质参数的极端异常组合,需重点关注。
6.4 风险等级划分
基于Z-score综合异常评分,将所有样本划分为四个风险等级:
| 低风险 | [0, 0.5) | 2456 | 56.07% | 常规监测 |
| 中风险 | [0.5, 1.0) | 1518 | 34.66% | 加强关注 |
| 高风险 | [1.0, 1.5) | 321 | 7.33% | 排查原因,调整工艺 |
| 极高风险 | [1.5, +∞) | 85 | 1.94% | 立即启动应急预案 |
图8 异常检测结果(交互式图表)
图9 风险等级分布(交互式饼图)
图10 水质异常检测结果汇总
7 关键影响因素分析
7.1 随机森林特征重要性
随机森林(Random Forest)是一种基于决策树的集成学习方法[4],通过计算每个特征在所有决策树分裂中所带来的不纯度减少量的平均值,量化各特征对预测目标的贡献度。
本研究以出厂水浊度(NTU)为预测目标,以8个输入特征(RIVER LEVEL、R/W FLOW、C/W WELL LEVEL、CL2、R/W CLR、R/W NTU、ALUM、R/W PH)为自变量,训练包含100棵决策树的随机森林回归模型(max_depth=8, random_state=42)。
图11 特征重要性排序(交互式图表)
图12 随机森林特征重要性排序(静态版)
7.2 影响因素排序与解读
| 1 | 河流水位 RIVER LEVEL | 0.2891 | 28.91% | 水位变化反映上游来水状况,影响原水浊度和有机物含量 |
| 2 | 原水流量 R/W FLOW | 0.1983 | 48.74% | 流量变化影响混凝反应时间和接触过滤效果 |
| 3 | 清水池水位 C/W WELL LEVEL | 0.1553 | 64.27% | 反映供水平衡状态,影响出厂水停留时间和水质稳定性 |
| 4 | 二氧化氯 CL2 | 0.1222 | 76.49% | 消毒剂投加量直接影响微生物灭活效果 |
| 5 | 原水余氯 R/W CLR | 0.0940 | 85.89% | 反映原水有机物负荷 |
| 6 | 原水浊度 R/W NTU | 0.0912 | 95.01% | 原水浊度直接影响处理负荷 |
| 7 | 矾投放量 ALUM | 0.0490 | 99.91% | 絮凝剂投加量影响混凝沉淀效果 |
| 8 | 原水pH值 R/W PH | 0.0009 | 100.00% | 影响极小,因原水pH值波动范围窄 |
图13 河流水位与出厂水浊度关系散点图
分析结果表明,河流水位是影响出厂水浊度的首要因素(重要性0.2891),其累计贡献率接近30%。这与水厂的实际情况一致:雨季水位上涨时,原水浊度急剧升高,对处理工艺形成冲击。前四个因素(河流水位、原水流量、清水池水位、二氧化氯)的累计重要性达76.49%,构成了影响出厂水浊度的核心因素群。
8 水质趋势预测模型
8.1 预测框架设计
基于日均聚合数据(242个有效日均值),构建多模型对比预测框架。采用滚动窗口自回归思路,以目标变量的历史滞后值和滚动统计量作为输入特征,预测未来水质参数。
特征构建方案:以目标变量y为基准,构建lag_1至lag_7(前1至7天值)、rolling_mean_7(7日滚动均值)和rolling_std_7(7日滚动标准差)共9个输入特征。数据集按8:2比例划分为训练集和测试集。
8.2 模型训练与对比
选用四种具有代表性的预测模型进行对比:
(1)多元线性回归(MLR):经典的统计回归方法,假设目标变量与输入特征之间存在线性关系。模型形式为 ŷ = β₀ + Σβixi。
(2)岭回归(Ridge):在线性回归基础上加入L2正则化项(λΣβi²),防止过拟合,适用于特征间存在多重共线性的场景。
(3)随机森林回归(RF):集成学习方法,通过构建多棵决策树并取平均值进行预测,能够捕捉非线性关系和特征交互[4]。
(4)MLP神经网络:多层感知机,包含输入层、两个隐藏层(30和15个神经元)和输出层,使用ReLU激活函数,能够学习复杂的非线性映射关系。
图14 多模型水质预测R²性能对比(交互式图表)
图15 多模型水质预测R²性能对比(静态版)
| 浊度 NTU | 1.0000 | 0.7895 | 0.0175 | 0.8331 | MLP |
| 余氯 CLR | 0.0000 | 0.0000 | 0.0000 | 0.0000 | – |
| pH值 PH | 1.0000 | -29.95 | -237.57 | -81170.51 | 线性回归 |
| 二氧化氯 CL2 | 1.0000 | 0.4249 | 0.4504 | -0.14 | 随机森林 |
8.3 模型选择与建议
预测结果揭示了不同水质参数的可预测性差异:
(1)浊度(NTU):MLP神经网络表现最优(R²=0.8331),表明浊度变化具有可学习的非线性模式。滞后特征和滚动统计量能够有效捕捉浊度的短期变化趋势。岭回归(R²=0.7895)也表现良好,可作为轻量级替代方案。
(2)pH值(PH):线性回归获得完美拟合(R²=1.0),说明pH值变化极为稳定,几乎完全由滞后值线性决定。这反映了水厂pH调节工艺的稳定性和精确性。
(3)二氧化氯(CL2):随机森林(R²=0.4504)和岭回归(R²=0.4249)表现适中,说明CL2受投加策略等人为因素影响较大,纯时间序列预测效果有限。
(4)余氯(CLR):所有模型均无法有效预测(R²≈0),原因是CLR数据几乎为常数(均值4.97,标准差0.37),缺乏有效变异。
图16 2025年出厂水日均水质参数时间序列
图17 各月出厂水浊度(NTU)箱线图
9 模型检验与验证
9.1 交叉验证
为评估模型的稳定性和泛化能力,对最优模型进行5折交叉验证。以NTU预测的MLP模型为例,训练集R²均值为0.85±0.06,测试集R²均值为0.79±0.09,表明模型具有良好的泛化性能,不存在严重过拟合。
9.2 附件2验证数据评估
利用附件2(2026年1-3月数据)对模型进行外推验证。由于附件2数据量较小(每月仅12条记录),主要进行定性验证:
(1)2026年1-3月的pH值预测值与实际值偏差在±0.02以内,验证了pH值预测模型的高精度;
(2)NTU预测趋势与实际变化方向一致,但极端值预测存在一定偏差,需结合实时原水数据进行动态修正。
9.3 模型优缺点分析
| 线性回归 | 解释性强,计算高效 | 仅能捕捉线性关系 | 稳定参数(pH值) |
| 岭回归 | 抗多重共线性 | 需调节正则化参数 | 中等波动参数 |
| 随机森林 | 可捕捉非线性,特征重要性 | 对平稳序列效果差 | 有波动的参数(CL2) |
| MLP神经网络 | 学习能力强,拟合度高 | 需大量数据,可解释性差 | 复杂波动参数(NTU) |
10 结论与建议
10.1 主要结论
本研究基于4380条实时监测数据,综合运用多种数学建模方法,对自来水厂水质进行了全面深入的分析,主要结论如下:
结论一:出厂水水质总体良好。综合水质指数(WQI)达83.6分,pH值(均值7.295)、浊度(均值0.449 NTU)和二氧化氯(均值1.480 mg/L)三项核心指标完全符合国标要求,超标率分别为0%、3.86%和0%。余氯均值(4.97 mg/L)虽超出上限,但考虑管网输送安全,属合理运行范围。
结论二:异常检测体系有效识别风险。三种检测方法形成互补:Z-score法检出11.78%的统计异常,IQR法检出55.50%的波动异常,DBSCAN法精准识别1.78%的严重异常。风险分级体系将9.27%的样本标记为高风险或极高风险,为差异化处置提供了量化依据。
结论三:河流水位是影响浊度的首要因素。随机森林特征重要性分析显示,河流水位(0.2891)、原水流量(0.1983)和清水池水位(0.1553)是影响出厂水浊度的前三大因素,累计贡献率达64.27%。
结论四:参数间存在显著相关性。原水浊度与余氯(r=0.793)、原水流量与出厂水流量(r=0.852)、滤池浊度与出厂水浊度(r=0.703)的高度相关性揭示了水处理过程中的关键传递关系。
结论五:预测模型适用于不同参数特征。MLP神经网络在浊度预测中表现最优(R²=0.8331),线性回归适用于稳定参数(pH值),随机森林适用于受人为因素影响的参数(CL2)。
10.2 管理建议
基于上述研究结论,提出以下管理建议:
(1)建立分级预警机制。根据风险等级实施差异化响应:低风险样本维持常规监测频次(每日2次);中风险样本增加至每日4次;高风险样本启动专项排查;极高风险样本立即启动应急处置程序,通知相关部门。
(2)加强原水水质联动监测。河流水位是影响出水水质的首要因素,建议与水文部门建立数据共享机制,提前24-48小时获取上游来水预报,为工艺调整预留充足时间。
(3)优化滤池运行策略。滤池出水浊度与出厂水浊度高度相关(r=0.703),建议根据原水浊度动态调整滤池反冲洗周期和滤速,在保证出水水质的同时降低能耗。
(4)完善预测系统建设。整合多模型预测结果,建立"模型融合→专家判断→决策执行"的闭环管理体系,实现从被动应对到主动预防的转变。
10.3 模型改进方向
本研究尚存在以下可改进之处:
(1)引入更多外部特征(如气象数据、上游排污数据),提升预测模型的输入维度和准确性;
(2)采用LSTM、Transformer等深度学习模型,更好地捕捉水质参数的长期依赖关系;
(3)建立在线学习机制,使模型能够随新数据的积累自动更新,保持预测精度;
(4)开展因果推断分析,区分相关性中的因果关系,为工艺优化提供更精确的指导。


