在现代能源体系中,风力发电机的可靠性与运行效率至关重要。实施基于数据的预测性维护,提前识别并诊断早期故障,是降低运维成本、提升发电效率的核心技术。本报告旨在通过对风力发电机SCADA(Supervisory Control and Data Acquisition)系统的运行数据进行深度分析,构建一个能够自动识别机组运行异常并辅助进行根本原因分析的智能诊断框架。
本次分析使用的数据集包含三台风力发电机在一段时间内的运行传感器读数。根据项目文档,其构成如下:
- 健康基准: 1号与2号风力发电机在此期间运行状态正常,其数据构成了"健康行为"的黄金标准。
- 故障机组: 3号风力发电机在此期间存在已知但未被标记的故障。
本项目面临的核心挑战是故障标签的缺失。我们仅知道3号机组存在故障,但故障发生的具体时刻、持续时间及其演化过程是未知的。
若将此问题草率地定性为传统监督分类,即把3号机组全部数据标记为"故障",将产生两个致命缺陷:
- 标签噪声: 大量正常的运行数据被错误地赋予"故障"标签,严重污染训练集。
- 模型偏差: 模型学习到的将是"3号机组与1、2号机组的固有运行差异",而非"故障模式与正常模式的差异",这使得模型不具备泛化能力和真正的故障诊断意义。
鉴于上述挑战,我们采用无监督异常检测 (Unsupervised Anomaly Detection) 作为本报告的核心方法论。此方法不依赖任何故障标签,其逻辑是:
- 学习范式: 仅使用1号和2号健康机组的数据,训练一个或多个模型,让其深度学习正常运行状态下多维传感器数据间的复杂、非线性关系,从而建立一个"健康行为范式"。
- 识别偏离: 将训练好的模型应用于所有三台机组的数据。当某个数据点(尤其是来自3号机组的)无法被"健康行为范式"很好地解释或重建时,模型会赋予其一个高异常分数。
该方法论使我们能够:①客观地识别出异常机组;②定位异常行为发生的时间窗口;③为进一步的根本原因分析提供数据支撑。
本章旨在通过可视化手段,从数据中寻找支持我们方法论的初步证据,并识别出异常行为的关键特征。
我们首先对各机组的关键性能指标(KPIs)进行时序和统计分布的可视化。如图2.1所示,3号机组的驱动端轴承温度(temp_drv)在采集周期的后半段,呈现出与健康机组显著分离的异常爬升趋势。图2.2的统计分布对比则进一步证实,3号机组的该项指标不仅均值更高,其数据分布也更为离散,表明其热力学稳定性变差。
| 图2.1: 驱动侧轴承温度时序对比 | 图2.2: 驱动侧轴承温度分布对比 |
|---|---|
![]() |
![]() |
任何工业设备都遵循其设计时所依据的物理规律。我们通过检验"风速-功率"这一核心性能曲线,来评估机组的能量转换效率。如图2.3所示,1号和2号健康机组的数据点紧密地聚集在一条清晰的性能带上。然而,3号机组的大量数据点(绿色)显著地散落在性能带下方,这构成了其发电效率出现实质性衰退的直接证据。
本章利用无监督模型对异常进行量化,提供可复现的、不可辩驳的诊断证据。
我们部署了基于PyTorch的自编码器 (Autoencoder) 模型。在仅由健康数据训练后,模型对所有数据进行重建,并将"重建误差"作为异常分数。如图3.1所示,该分数在时序上的演化提供了决定性证据:1号和2号机组的分数始终在低位基线上平稳波动,而3号机组的分数在采集周期后半段开始急剧、持续地攀升,再也未能回归正常水平。这不仅锁定了故障机组,更精确定位了故障恶化的时间窗口。
为从统计学上确认诊断,我们对各机组的异常分数分布进行比较。如图3.2所示,3号机组的异常分数分布在统计上与健康机组存在显著差异,其箱体和中位数远高于正常水平,从概率分布层面判决了3号机组的异常状态。
本章旨在回答"为什么异常",完成从"故障检测"到"故障诊断"的闭环。
为了探究故障的根源,我们构建了一个解释性模型,用以分析导致高异常分数的关键驱动特征。如图4.1所示,power_W(有功功率)和temp_drv(驱动侧轴承温度)是区分正常与强异常状态的最重要因素。这表明,故障的核心表现形式与机组的发电性能及传动链热力学状态直接相关。
最后,我们将模型的抽象判断与物理世界的具体读数相结合,以完成诊断的最终印证。在图4.2中,我们将最重要的物理特征power_W的原始时序图,与模型标记出的高异常分时刻(红色散点)进行了叠加。图中清晰地揭示:模型发出警报的时刻,与功率输出发生剧烈、不合逻辑的波动或持续低迷的时刻高度吻合。 这构成了完整的证据闭环,将抽象的算法诊断与真实的物理性能衰退现象联系起来。
本报告成功地应用无监督异常检测方法,对风力发电机数据集进行了深度故障诊断。通过结构化的分析流程,我们:
- 识别并确认了3号机组为故障机组。
- 定位了故障状态开始恶化的时间窗口。
- 诊断出故障的核心物理表现为发电性能的严重衰退,且与传动链的异常热力学状态高度相关。
本报告所建立的分析框架,相较于传统的监督学习方法,不仅结论更稳健、信息更丰富,而且更贴近工业界的实际应用场景(即故障标签稀缺)。该框架可作为实现高级预测性维护系统的基础,为未来的视情维修、备件管理和优化决策提供坚实的数据支持。
- 安装依赖:
pip install -r requirements.txt
- 运行脚本:
python src/main.py






