本期给大家推荐一种基于Transformer的新型局部增强通道自注意力机制在工业剩余使用寿命预测中的应用。在预测性维护领域,剩余使用寿命预测是保障复杂工业机械可靠性与安全性的核心技术。然而,现有基于循环神经网络、卷积神经网络或自注意力机制的方法,往往难以同时兼顾全局长期依赖、局部上下文信息与多传感器空间相关性。为突破这一瓶颈,本文提出一种基于Transformer的新型局部增强通道自注意力模型——LECformer。该方法不仅通过Transformer架构高效捕获长期依赖,更设计了独特的局部增强通道自注意力机制,能够自适应提取局部与全局特征,并动态加权不同通道的重要性。在多个涡扇发动机和轴承数据集上的实验表明,LECformer显著超越了当前最先进的RUL预测方法。
论文题目:A novel local enhanced channel self-attention based on Transformer for industrial remaining useful life prediction
论文期刊:Engineering Applications of Artificial Intelligence
Doi:https://doi.org/10.1016/j.engappai.2024.109815
(b) MetaReal (Beijing) Technologies Co., Ltd, Beijing, 100043, China
剩余使用寿命(Remaining Useful Life, RUL)预测是预测性维护(Predictive Maintenance, PdM)的基础技术,对保障复杂工业机械的可靠性与安全性至关重要。近年来,循环神经网络(Recurrent Neural Network, RNN)、卷积神经网络(Convolutional Neural Network, CNN)与自注意力(Self-Attention, SA)等先进深度学习架构已广泛应用于RUL预测,但现有方法仍难以同时处理序列单元的全局长期依赖、局部上下文信息以及工业多传感器的空间相关性。本文提出一种基于Transformer的局部增强通道自注意力模型(Local Enhanced Channel Self-Attention based on Transformer, LECformer),一种新型深度学习 RUL 预测方法以解决上述问题。相较于基于RNN/CNN的方法,LECformer通过Transformer架构能更高效地捕获长期依赖。此外,LECformer 提出一种新型局部增强通道自注意力(Local Enhanced Channel Self-Attention, LECSA)机制,替代原生Transformer的传统自注意力,可自适应提取长期依赖与局部上下文信息,同时动态加权不同通道的重要性以提升预测性能。本文采用两个广泛使用的涡扇发动机数据集与一个轴承数据集验证所提方法的有效性。实验结果表明,LECformer显著优于当前最优的RUL预测方法。
1 引言
2 相关工作
3 方法
3.1 所提LECformer架构概述
3.2 LECformer的输入层
3.3 LECformer的编码层
3.4 LECformer的输出层
3.5 相较传统Transformer自注意力的优势
4 案例研究1:基于C-MAPSS与N-CMAPSS数据集的实验
4.1 数据集描述
4.2 实验设置
4.3 实验分析
5 案例研究2:基于FEMTO轴承数据集的实验
5.1 数据集描述
5.2 实验设置
5.3 LECformer预测结果分析
5.4 与当前最优方法对比
6 讨论
7 结论
预测性维护(Predictive Maintenance, PdM)在现代工业系统中至关重要,相较于传统预防性维护策略,其不仅能提升设备可靠性,还可降低维护成本(Zhang等,2024)。通过分析与挖掘状态监测(Condition Monitoring, CM)数据,PdM可持续评估设备健康状态,支持主动决策。PdM的核心技术是剩余使用寿命(Remaining Useful Life, RUL)预测,可帮助维护人员预判设备状态,为生产与维护规划做出合理决策(Elsheikh,2023)。然而,工业机械数据的高复杂性与高维度性,使得精准RUL预测仍具挑战。因此,开发有效的RUL预测模型对PdM至关重要,尤其在处理大型工业机械CM数据中的复杂模式方面。
近年来,深度学习技术在RUL预测中展现出巨大潜力,其可从原始多传感器数据中自动提取高维特征,减少对人工特征工程的依赖。常见的深度学习架构,如循环神经网络(Recurrent Neural Network, RNNs)(Huang等,2019)、卷积神经网络(Convolutional Neural Network, CNNs)(Kobayashi与Alam,2024),擅长处理时序数据,已广泛应用于RUL预测。RNN变体包括长短期记忆网络(Long Short-Term Memory, LSTM)(Yang等,2023)与门控循环单元(Gated Recurrent Unit, GRU)(Liu等,2020b),以捕获时序依赖著称;而CNNs则通过卷积操作擅长提取局部特征。近期,Transformer模型(Vaswani等,2017)凭借其自注意力(Self-Attention, SA)机制被引入RUL预测领域。该机制使Transformer能基于特定时间步相关性分配权重,更高效地捕获长期依赖,相较传统RNN与CNN方法实现性能提升。
深度学习RUL预测方法的目标是从采集的多传感器数据中提取设备退化特征。受现代大型设备复杂性影响,采集的CM数据中不仅存在复杂的全局与局部时序关系,还存在不同传感器序列间的空间相关性。尽管取得上述进展,面向复杂工业应用的有效RUL预测仍需同时考虑以下方面:
(1)长期依赖建模:如何提取不同序列单元的长期时序关系。从序列数据中提取长期依赖与时序关系对精准RUL预测至关重要。
(2)局部上下文特征提取:如何在捕获长期依赖信息的同时充分利用局部上下文信息。不同局部区域的退化特征对最终RUL预测同样重要。
(3)多传感器空间相关性学习:有效学习多传感器时序数据的空间相关特征,可显著提升模型的特征学习能力。融合多通道相关信息对精准RUL预测至关重要。
然而,现有深度学习RUL预测方法难以同时解决上述问题:
基于RNN/CNN方法的局限性:基于RNN与CNN的方法及其变体(Huang 等,2019;Kong等,2019;Ding等,2022)难以从序列数据中提取长期时序关系。RNN采用串行处理数据,易出现信息丢失与梯度消失/爆炸问题。CNN受限于局部感受野,需增加网络深度才能捕获长距离依赖,效率低下且无法有效建模全局时序相关性。
传统Transformer的局限性:尽管原生Transformer(Vaswani等,2017)的自注意力机制在建模长期依赖方面表现优异,但在学习细粒度局部特征方面能力较弱。在RUL预测中,局部区域的波动对预测精度影响显著。传统自注意力机制(Ren等,2022;Ma等,2021;Liu等,2022)执行逐点点积计算,可能忽略重要局部信息。
忽略多传感器空间相关性:RUL预测中的多传感器时序数据间存在复杂的非线性空间关系。但多数现有基于自注意力的方法(Zhang等,2022,2023)聚焦于建模时序依赖,未考虑不同传感器间的空间相关性,限制了方法有效性。值得注意的是,Peng等(2023)的研究采用滞后量化解决切换系统的输入到状态镇定问题,凸显了有效传感器与执行器管理的重要性。类似地,Song 等(2024)的研究探索了持续驻留时间切换下的状态估计,强调了复杂系统动态中鲁棒测量策略的重要性。这些方法体现了当代RUL预测中融合时序与空间维度的研究方向。本文围绕上述三个关键点开展相关研究。
为解决上述问题,本文提出一种基于Transformer的新型局部增强通道自注意力模型(Local Enhanced Channel Self-Attention based on Transformer, LECformer)用于RUL预测。本研究的主要贡献如下:
提出局部增强通道自注意力(Local Enhanced Channel Self-Attention, LECSA)机制:LECformer采用LECSA替代传统自注意力机制,结合线性投影与卷积操作的优势,使模型能有效捕获长期依赖与局部上下文信息。LECSA 在保留全局时序关系建模能力的同时,增强了模型提取局部退化特征的能力。
融合通道自注意力(Channel Self-Attention, CSA):LECSA融入CSA以动态捕获不同传感器通道间的空间相关性,使模型能自适应加权不同通道的重要性,提升多传感器数据的特征融合效果。
全面评估与消融实验:本文在广泛使用的涡扇发动机数据集与轴承数据集上开展大量实验,验证LECformer的有效性。结果表明,LECformer显著优于现有当前最优RUL预测方法。学习到的注意力权重可视化进一步证实了所提方法的特征提取能力提升。
综上,LECformer通过同时建模长期依赖、提取局部上下文特征、捕获多传感器空间相关性,有效解决了现有方法的局限性,提升了复杂工业应用中的RUL预测性能。
本文组织结构如下:第2节简要介绍当前相关工作与存在问题;第3节阐述所提LECformer方法与计算流程;第4节介绍涡扇发动机实验;第5节展示轴承数据集实验;第6节讨论所提LECformer;第7节总结全文。
得益于高效的序列建模能力,RNNs、CNNs及其变体近期成为深度学习RUL预测领域的主流架构。Hu等(2021)提出一种基于双向RNN的方法,旨在提取RUL预测的退化特征。类似地,为解决RNN模型崩溃问题,Huang等(2019)提出双向LSTM模型,提升传统RNN变体的稳定性与精度。Li等(2018)提出一种基于深度CNN的新型方法用于涡扇发动机RUL预测,通过堆叠多层CNN层提取深度特征信息。Kong等(2019)开发了一种融合LSTM与CNN架构的混合RUL预测方法,利用空间与时序特征提升预测精度。
但上述现有方法存在固有局限性。基于RNN/CNN的方法难以捕获序列数据中的长期依赖(Vaswani等,2017;Zhang等,2022;Liu等,2020a)。具体而言,RNN在长序列中易遗忘关键信息,且存在梯度消失或爆炸问题。CNN受限于局部感受野,需增加网络深度才能有效建模全局信息,计算量大且效率低。
完全依赖自注意力机制处理整个序列的Transformer架构(Vaswani等,2017)的提出,为序列建模提供了更高效的方法。多项研究尝试将RNNs或CNNs与Transformer结合用于RUL预测。Wang等(2024)提出一种基于注意力机制的改进深度残差网络用于变速箱故障诊断,增强特定区域的特征提取以提升模型性能。Liu等(2022)提出一种融合CNNs与Transformer的方法,更好地结合全局与局部退化特征用于RUL预测。Wang等(2021)提出一种融合时序CNN(Temporal CNN, TCNN)与Transformer编码器的RUL预测方法,提升全局特征提取能力。此外,Liang等(2023)提出一种结合图神经网络与注意力机制的预测方法,提升时空特征提取能力。
此外,多项研究提出纯基于Transformer的方法用于RUL预测。Ma等(2021)提出一种基于Transformer的预测方法,规避RNN/CNN模块的局限性,有效捕获长期依赖。Zhang等(2022)开发了一种基于Transformer的双视角自注意力机制用于RUL预测,采用两个独立编码器进行特征提取。Ren等(2022)提出一种时序张量辅助多尺度 Transformer方法,无需任何RNN/CNN模块即可捕获时序模式。此外,新型 Transformer 结构被提出用于提取时序预测与计算机视觉任务的相关特征。Liu等(2023)提出逆 Transformer(iTransformer),在反转维度上应用注意力与前馈网络以捕获时序预测中的相关性。Xu等(2022)提出一种用于弱监督语义分割的多类别标记Transformer,采用多个类别标记学习不同标记间的交互。
尽管上述预测方法取得进展,仍存在以下挑战:
RNN/CNN模块的固有局限性:堆叠RNNs或CNNs与自注意力模块的方法难以克服RNN/CNN架构的固有缺陷,捕获长期依赖与建模全局信息的局限性在混合模型中依然存在。
传统自注意力在局部特征提取中的低效性:Transformer中传统的线性点积自注意力机制可能无法有效提取局部区域的退化信息,而这对RUL预测至关重要。标准自注意力的逐点操作可能忽略重要局部特征。
现有基于Transformer的预测方法在特征提取中通常未同时考虑全局长期依赖、局部上下文信息与多通道空间相关性。忽略这些方面会降低特征表示质量,进而降低RUL模型的预测性能。
为弥补上述差距,本文针对上述方向展开研究,提出新型LECformer使模型更适配工业RUL预测任务。通过解决上述挑战,LECformer旨在提升RUL预测任务中的特征表示与预测性能。本文通过大量实验评估所提方法的有效性,实验结果证实其在工业应用中的有效性。下文将详细介绍LECformer的具体细节。
本节详细介绍所提用于RUL预测的LECformer架构设计。首先概述LECformer架构,随后深入阐述其核心组件,包括创新的LECSA机制与CSA机制。本文旨在阐明LECformer如何通过捕获全局长期依赖、局部上下文信息与多通道空间相关性高效处理多传感器时序数据,进而提升时序预测与状态监测等应用的预测精度。
3.1 所提LECformer架构概述
LECformer架构如图1所示。LECformer采用基于Transformer的框架,包含三个主要组件:输入层、编码层与输出层。与传统基于RNN/CNN的方法不同,LECformer利用Transformer的能力建模序列元素间无论距离远近的长期依赖。此外,通过引入LECSA机制,LECformer改进传统自注意力机制,有效融合长期依赖与局部上下文特征及多通道重要性,解决现有方法的局限性。LECformer工作流程如下:
(1)输入嵌入与位置编码:输入层对多传感器数据进行嵌入并添加位置信息以保留序列顺序。
(2)LECSA特征提取:编码层应用LECSA机制提取综合特征,捕获全局与局部依赖及空间相关性。
(3)RUL预测:输出层处理提取的特征以预测RUL。下文将详细阐述上述各子结构的具体细节。
图1 所提LECformer的架构
3.2 LECformer的输入层
如图1所示,采集的多传感器时序数据为
其中
其中
3.3 LECformer的编码层
LECformer的编码层经过精心设计,增强模型捕获与处理全局长期依赖、局部上下文信息与多通道空间相关性的能力,这些均对精准RUL预测至关重要。如图1所示,编码层包含两个主要子层:LECSA机制与前馈网络(Feed Forward Networks, FFN)。每个子层后均连接残差连接与层归一化,统称为Add & Norm。这些机制有助于缓解深度神经网络训练中的梯度消失等问题,加速模型收敛。编码层可堆叠
LECSA机制是LECformer编码层的核心,相较标准Transformer使用的传统SA机制实现重大改进。LECSA将卷积操作与线性投影融合,并融入CSA机制以有效建模多传感器通道间的空间相关性。该融合使LECformer能同时捕获全局依赖、增强局部特征提取、建模通道间关系,进而解决基于RNN/CNN方法与传统Transformer的固有局限性。
其中
图2 传统SA与所提LECSA的对比
图3 所提通道自注意力机制
本文设计中,通过卷积操作生成的
其中
其中
其中
其中
其中
其中
其中
3.4 LECformer的输出层
LECformer中,编码层可统一堆叠
其中
(1)增强局部特征提取:Transformer中的传统自注意力机制主要通过计算序列中所有位置对的注意力分数捕获全局依赖,但可能忽略对精准建模RUL预测中细粒度退化模式至关重要的局部上下文信息。通过融入卷积操作,LECSA显式捕获局部模式与变化,增强模型学习细节局部特征的能力。
(2)建模多通道空间相关性:RUL预测通常涉及来自多个传感器的数据,每个传感器捕获系统状态的不同方面。传统Transformer独立处理每个特征维度,可能忽略不同传感器通道间复杂的空间相关性。LECSA中的CSA机制通过计算跨通道注意力权重有效建模这些空间关系,使模型能动态强调更具信息性的通道,提升特征融合效果。
(3)高效捕获长期依赖:尽管Transformer通过自注意力机制天生具备建模长期依赖的能力,结合卷积操作可确保高效捕获全局与局部依赖。该双重能力使LECformer优于传统Transformer,尤其在RUL预测这类需理解整体趋势与局部异常的任务中。
4.1 数据集描述
商用模块化航空推进系统仿真(Commercial Modular Aero-Propulsion System Simulation, C-MAPSS)(Saxena等,2008)数据集是RUL预测方法性能验证中最常用的数据集之一,根据不同运行条件与故障模式分为FD001–FD004四个子数据集。C-MAPSS数据集的相关细节见Saxena等(2008)。相较于FD001与FD003数据集,FD002与FD004数据集的运行环境更复杂,使RUL预测更具挑战性。每个子数据集均包含训练集与测试集,目标是在训练集上训练模型,预测测试集中每个发动机的RUL。在监测的21个传感器中,7个传感器(编号 1、5、6、10、16、18、19)数值恒定,对预测结果无影响,因此从序列分析中剔除这些传感器的数据。RUL定义为发动机发生故障前的剩余运行周期数。值得注意的是,发动机在出现故障前通常经历稳定运行阶段。为与其他方法标准化对比(Song等,2020;Li等,2018),本研究将最大RUL值设为 125,超过该值则认为发动机进入退化阶段。
N-CMAPSS(Arias Chao等,2021)数据集更详细精准地描述运行条件,贴近涡扇发动机的实际退化过程。因此,N-CMAPSS对RUL预测任务提出更大挑战,是评估RUL预测方法泛化性与鲁棒性的理想基准。本文选取N-CMAPSS数据集中的DS02子数据集评估所提LECformer的性能。DS02子数据集包含来自不同涡扇发动机的数百万条退化轨迹,每个发动机具有独特初始条件,详情见表1。实验中,按照Ren等(2023)的建议,以0.001Hz的速率对DS02进行下采样。DS02数据集中采集的多传感器数据包括14个实测传感器信号、2个虚拟传感器信号与4个场景描述符,具体细节见Arias Chao等(2021)。
表1 N-CMAPSS中DS02数据集的描述
重要的是,C-MAPSS与N-CMAPSS数据集包含各类噪声与异常值,模拟实际运行条件。这些干扰可能来自传感器误差、环境因素与意外运行异常,在实际场景中频繁发生。此类噪声与异常值的存在是对所提模型的关键测试,考验RUL预测的鲁棒性与可靠性。通过在该数据集上训练与评估模型,可有效评估模型过滤无关数据、在干扰因素下保持精准预测的能力。这使C-MAPSS与N-CMAPSS数据集在展示模型处理非理想实际数据的适应性与鲁棒性方面极具价值。
输入数据为多传感器时序数据,每个数据具有不同单位与尺度,可能增加模型训练难度。为解决该问题,本文采用最小-最大归一化(min–max normalization)(Ding等,2022)预处理采集的数据
其中
其中
图4 滑动时间窗的操作过程
4.2.2 评估指标
本研究采用三个关键评估指标确定所提方法的有效性。第一个是广泛使用的均方根误差(Root Mean Square Error, RMSE)函数,另外两个是评分(Score)与修正评分(Score
其中
训练阶段采用 Adam 优化器,总训练轮次(epoch)设为 150。为降低过拟合风险,采用早停策略,耐心值设为 20 个轮次。训练数据集按20%验证集、80%实际训练集划分。批大小设为256,损失函数采用均方误差(Mean Square Error, MSE)函数。FD001与FD003数据集的学习率设为0.001;FD002、FD004与DS02数据集的学习率设为0.0005。全连接层采用dropout技术,丢弃率为0.3。通过网格搜索确定LECformer结构的最优配置,如表2所示。为更好验证LECformer的泛化性能,本文在C-MAPSS数据集上确定LECformer的模型参数,并将相同结构参数应用于N-CMAPSS实验。为降低随机性影响,所有实验重复十次,计算平均性能作为最终实验结果。
表2 LECformer的实验参数设置
4.3 实验分析
本节全面分析LECformer的各方面性能,包括滑动时间窗大小的影响、核心组件分析、与其他方法的对比分析。此外,提供学习到的注意力权重可视化,深入理解模型的决策过程,突出预测RUL中 特定特征的重要性。通过详细分析,本文旨在凸显LECformer框架的优势与潜在改进方向,为预测性维护技术的未来发展奠定基础。
选择合适的滑动时间窗大小对实验至关重要。时间窗过大可能包含无关信息,降低预测速度;时间窗过小可能导致模型缺乏多传感器时序数据的有用信息,降低预测性能。为验证该参数的影响,本文在四个数据集上采用不同窗大小开展实验,结果如图5所示。可观察到,FD001与FD003数据集在w=40时RMSE与Score值最小,FD002与FD004数据集在w=70时数值最小。该观察结果与C-MAPSS数据集的分析一致,即FD002与FD004发动机的RUL预测比FD001与FD003更困难。因此,更大的窗大小更有利,可包含更多退化信息。据此,DS02数据集的窗大小设为70,与FD002与FD004设置一致。后续实验将采用该选定窗大小。
图5 不同滑动时间窗大小下LECformer的性能
为更全面分析所提LECformer的预测能力,从 FD001–FD004 数据集的测试集中随机选取一台发动机,预测其全生命周期运行至故障过程的 RUL。同时,为验证所提深度架构的有效性,将LECformer与三种代表性深度网络架构对比,包括基于深度 LSTM 的架构(双向LSTM(BiLSTM)(Wang等,2018))、基于深度CNN(DeepCNN,DCNN)的架构(Li等,2018)与基于深度Transformer的架构(双视角自注意力 Transformer(DAST)(Zhang等,2022))。如图6所示,实验结果表明,与其他方法相比,LECformer更贴近发动机实际RUL轨迹。此外,尽管复杂故障模式与运行条件使FD002与FD004发动机预测更具挑战性,LECformer仍保持良好的预测精度。此外,DS02测试集上发动机单元11、14、15的预测结果如图7所示。可看出,尽管模型结构基于C-MAPSS数据集选定,LECformer在DS02数据集上仍展现出优异的预测结果,验证了其出色的泛化性能。实际应用中,维护人员可根据实时预测RUL制定更合理的维护计划。
图6 FD001-FD004上的预测结果
图7 DS02上的发动机单元11、14和15的预测结果
为全面评估所提LECformer的性能,本文在相同案例研究中将其与多种当前最优 RUL 预测方法基准测试。对比方法包括纯基于RNN/CNN的方法(DCNN(Li等,2018)、BiLSTM(Wang等,2018)与混合CNN-W(Wen等,2023));此外,还考虑融合RNN/CNN与注意力机制的方法,包括分布式注意力时序卷积网络(DA-TCN)(Song等,2020)、注意力门控CNN(AGCNN)(Liu等,2020a)与双注意力 Transformer(DA-Transformer)(Liu等,2022);对比分析还包括纯基于 Transformer 自注意力机制的方法,即多尺度集成深度自注意力网络(MSIDSN)(Zhao等,2023)、距离自注意力网络(DSAN)(Xia等,2022)、DAST(Zhang 等人,2022)、动态长度 Transformer(DLformer)(Ren 等人,2023)、集成多头双稀疏自注意力网络(DSSN)(Zhang等,2023)与遗传算法优化Transformer(GA-Transformer)(Mo与Iacca,2023)。不同模型的选择可全面评估LECformer的相对性能,为其在 RUL 预测中的有效性提供有价值参考。表3与表4展示C-MAPSS数据集与DS02数据集的性能对比实验结果。显然,与其他方法相比,LECformer展现出最佳预测性能,尤其在具有挑战性的FD002与FD004数据集上。这表明LECformer能更好应对复杂环境下的预测任务。值得注意的是,LECformer在Score指标上提升更显著,体现其在实际应用中的优势。与基于RNN/CNN框架的预测方法相比,LECformer采用Transformer架构提升捕获序列单元间长期依赖信息的能力。与传统基于自注意力的方法相比,LECformer提出新型LECSA机制替代自注意力,可自适应融合局部上下文信息与全局依赖及多传感器空间相关特征,提升模型预测性能。综上,上述结果与讨论表明,所提LECformer具备出色的多传感器时序数据建模能力。
表3 C-MAPSS数据集上与先进方法的对比结果
表4 DS02数据集上的对比结果
本节开展多项实验,将所提LECformer与三种时序领域代表性Transformer变体(Wu等,2020;Kitaev等,2020;Zhou等,2021)的性能对比。由于这些Transformer 变体最初为时序预测设计,而非直接应用于RUL预测,本文将其核心组件用于特征提取任务。提取的特征随后通过LECformer的统一输出层处理,得到最终RUL预测。该方式可在RUL预测特定场景下重点对比 Transformer变体的特征提取效率,凸显LECformer在提升预测精度方面的独特 贡献。深度Transformer(Deep Transformer)(Wu等,2020)采用传统自注意力架构;Reformer(Kitaev 等,2020)采用局部敏感哈希自注意力替代传统自注意力;Informer(Zhou等,2021)采用概率稀疏自注意力与蒸馏操作。实验设置与LECformer保持一致。C-MAPSS与N-CMAPSS数据集的实验结果如表5所示,表明LECformer具有更优的预测性能。不同基于Transformer 变体在DS02数据集上的预测结果如图7所示。从结果可观察到,LECformer的预测误差显著小于其他几种基于Transformer的方法。与其他自注意力变体相比,LECSA在同时从多传感器数据中提取长期依赖、局部上下文信息与空间相关特征方面表现更出色。因此,LECformer在RUL预测任务中表现更优。
表5 和Transformer变体的对比结果
为验证所提LECformer核心组件的有效性,本文开展消融实验,包括LECformer、无局部增强的LECformer(LECformer w/o Local)、无CSA的LECformer(LECformer w/o CSA)、采用自注意力机制的传统Transformer。无局部增强或CSA的LECformer分别表示LECformer中不使用局部增强或CSA。传统Transformer与LECformer的区别在于采用传统自注意力机制。消融实验结果如表6所示。显然,在对比模型架构中,LECformer的RMSE与Score值最低,表明预测性能最优。可看出,移除局部增强或CSA后,预测性能显著下降,说明发动机的局部上下文特征与不同传感器间的空间相关特征对RUL预测同样具有重要价值。此外,LECformer的预测性能显著优于传统Transformer,表明所提LECSA机制相较于传统自注意力机制在RUL预测中更有效。传统Transformer架构采用点积注意力逐点计算每个时间步的相关性,更易受噪声与异常值影响。同时,LECformer中的LECSA机制可直接替代传统Transformer中的自注意力机制,展现出良好的实用性。
表6 消融实验结果
此外,本文还对比不同深度预测模型的预测时间。实验在相同实验条件下执行,以C-MAPSS的FD001数据集为例。预测时间结果如表7所示。从结果可看出,LECformer在GPU上对全部100台发动机的预测时间为0.057秒,即单台发动机预测时间为0.57毫秒。尽管LECformer单台发动机的预测时间相较传统Transformer有所增加,但可满足 RUL 预测的实时需求。
表7 模型复杂度和预测效率的对比
所提LECformer不仅能有效提取序列单元间的长期依赖,还能增强模型学习局部细粒度特征的能力。此外,其内部CSA机制可动态建模不同通道间的空间相关关系。为更好分析该特性,以FD001数据集的发动机单元34为例,可视化最后一个运行周期中LECSA与CSA组件学习到的注意力权重。学习到的注意力权重分布如图8所示,颜色越深表示权重值越高、相关性越强。LECSA中学习到的全局与局部注意力权重分布如图 8(a)所示,第i行第j列表示第i个时间步与第j个局部区域的相关程度。显著的是,可观察到LECSA机制使输入位置可与任意局部区域相关,无需考虑它们之间的距离。此外,某些颜色更深、有时位于远离当前位置的局部区域表明,LECformer具备有效识别长距离依赖信息的能力。图 8(b)中,不同颜色表示不同通道间的空间相关性。高维特征的每个通道映射可视为不同传感器间空间关联的表示。可看出,LECformer能动态提取空间相关特征,自适应关注通道信息,显著提升特征表示与模型预测性能。
图8 学习到的注意力权重可视化
为验证所提LECformer在实际设备中的有效性,采用FEMTO轴承数据集开展实验验证,该数据集源自加速退化PRONOSTIA平台(Nectoux等,2012),如图9所示。PRONOSTIA平台旨在真实反映轴承全生命周期的渐进退化过程。该数据集包含三种不同运行条件下17个轴承的运行至故障振动信号数据,详情见表 8。振动信号采样频率为25.6kHz,每10秒采集2560个数据点。本研究采用所有运行条件的训练数据训练LECformer,预测测试集中所有轴承的RUL。特别地,仅采用水平振动信号进行分析。这是因为水平振动信号比垂直振动信号包含更多与RUL预测相关的信息(Ren 等,2022)。
图9 用于轴承加速退化的PRONOSTIA平台
表8 轴承数据集描述
本节仅对原始振动信号采用快速傅里叶变换(Fast Fourier Transform, FFT)获取频谱特征信息,不采用复杂信号处理方法。随后,按频率范围求和能量得到一组频域特征。频率范围设为64,得到20个频域特征。经FFT变换后的振动信号数据采用与案例1相同的数据归一化与滑动时间窗处理。RUL标签归一化至0到1区间,作为轴承健康状态指标。该归一化方案中,0表示故障状态,1表示完全健康、无退化状态。该归一化过程更直观地反映轴承随时间的状态,便于直接应用预测模型评估健康退化与预测即将发生的故障。确定频谱特征与对应RUL标签后,可构建基于LECformer的深度 RUL 预测模型。
采用三个广泛使用的指标评估性能。其中两个是知名的RMSE与平均绝对误差(Mean Absolute Error, MAE),另一个是修正评分
其中
训练阶段采用 MSE 损失函数与Adam优化器促进网络学习。最大轮次设为100,学习率配置为0.0005。数据按8:2划分为训练集与验证集,采用dropout率0.3降低过拟合风险。通过大量不同窗大小实验,确定滑动时间窗大小为10最优。LECformer的参数配置与C-MAPSS数据集实验一致,如表2所示。
本节评估所提LECformer用于轴承退化RUL预测的性能。本文开展多项轴承预测实验以展示其有效性。选取三种运行条件下的所有测试轴承,预测其从健康到故障的RUL。采用三种代表性方法对比,包括基于RNN的架构(BiLSTM(Wang等,2018))、基于CNN的架构(DCNN(Li等,2018))与基于Transformer的架构(DAST(Zhang等,2022))。测试数据的RUL预测结果如图10所示。预测结果表明,所提 LECformer 能很好地预测轴承退化趋势。值得注意的是,尽管LECformer的预测值与实际RUL值非常接近,但在真实RUL值附近存在一定波动。这些结果凸显模型有效捕获与预测轴承随时间退化的能力,尽管精度因案例不同略有差异。与其他三种代表性深度预测方法相比,本文LECformer在不同运行条件下均具备良好预测性能,证明其有效捕获不同退化模式的能力。此外,LECformer提供的RUL预测值大多接近或小于真实RUL值。该特性具有优势,因为高估RUL可能比低估带来更严重的后果。实验结果表明,LECformer可很好地应用于从轴承振动信号中提取退化特征信息,执行实时 RUL 预测,在工程领域具有良好应用前景。
图10 不同方法在测试轴承上的预测结果比较
本研究展示的实验结果全面证实了所提LECformer模型在多个基准数据集(包括C-MAPSS、N-CMAPSS与FEMTO数据集)的RUL预测中具有优越性能。这些结果与本文初始研究目标高度契合,即开发一种新型基于Transformer的架构,能有效捕获全局依赖与局部上下文信息,同时建模多传感器通道间的空间相关性。
LECformer在所有评估数据集上始终优于现有当前最优方法。具体而言,在 C-MAPSS 数据集(FD001–FD004)中,与DCNN、BiLSTM 及各类基于Transformer的基线模型相比,LECformer实现最低的RMSE与Score指标。该提升凸显LECformer通过有效融合长期依赖与局部特征提取,精准预测RUL的能力增强。类似地,在N-CMAPSS(DS02)数据集上,LECformer的RMSE与Score指标大幅降低,凸显其在更复杂运行环境中的鲁棒性与泛化能力。消融实验进一步验证LECformer核心组件的有效性。移除LECSA或CSA机制均导致预测性能显著下降,表现为RMSE与Score值升高。此外,学习到的注意力权重可视化表明LECformer能动态优先关注相关时序与空间特征,进而提升预测精度。尽管LECformer因融入卷积操作与CSA机制引入额外计算复杂度,模型仍足够高效以满足实时应用需求。单台发动机约0.57毫秒的预测时间完全符合实时RUL预测的要求。最后,LECformer成功应用于FEMTO轴承数据集(涵盖不同运行条件下的实际轴承退化),证明模型的泛化能力。LECformer在不同轴承与运行设置下保持高预测精度,展现其在多样工业环境中的适应性与有效性。
尽管具备优势,LECformer存在一定局限性。因融入卷积操作与注意力机制导致计算复杂度增加,可能对资源受限环境或需实时处理的应用部署带来挑战。此外,模型性能高度依赖大量高质量多传感器数据的可用性,而实际场景中并非总能获取。LECformer在完全新型设备类型或训练数据中未出现的未知故障模式上的泛化能力也存在潜在局限性。未来工作将聚焦于优化模型计算效率,探索数据增强与迁移学习技术提升适应性,改进模型鲁棒性与可解释性,以促进在多样工业环境中的更广泛应用。
深度学习方法因擅长处理多传感器工业时序数据,被广泛应用于RUL预测。但现有模型通常难以同时提取全局与局部特征,无法有效建模多传感器间的空间相关性。为解决上述问题,本文提出LECformer,一种专为工业RUL预测设计的新型基于Transformer的架构。与传统基于RNN/CNN的方法不同,LECformer利用Transformer捕获序列数据中长期依赖的能力。相较于原生Transformer,LECformer采用LECSA机制替代线性逐点点积自注意力,融合线性投影与卷积操作,更好地捕获长期依赖与更精细的局部特征。此外,LECformer中的CSA机制动态优先考虑不同通道的重要性,优化特征融合。本文通过一系列消融实验严格验证LECformer的有效性。在C-MAPSS、N-CMAPSS与FEMTO数据集上的大量实验表明,LECformer始终优于现有当前最优方法,在RUL预测中实现更优精度与可靠性。未来工作将探索将LECformer与迁移学习和数据增强技术融合,进一步提升其在多样RUL预测场景中的适应性与性能。
编辑:陈宇航
校核:李正平、陈凯歌、曹希铭、赵学功、白亮、任超、海洋、赵栓栓、Kira、Tina、王金、赵诚、肖鑫鑫、张优
该文资料搜集自网络,仅用作学术分享,不做商业用途,若侵权,后台联系小编进行删除