首页/文章/ 详情

中科院一区Top论文学习|一种用于轴承退化建模与剩余使用寿命预测的维纳物理信息神经网络

2月前浏览816

本期给大家推荐一区TOP期刊RESS的论文。文章提出了一种新型维纳物理信息神经网络(Wiener Physics-Informed Neural Network, WPINN)框架,用于轴承退化建模与 RUL 预测。该框架融合了维纳过程的退化动力学建模能力与神经网络的特征提取能力使用 XJTU-SY 和 PHM2012 轴承数据集对所提出 WPINN 进行了全面验证。研究表明,物理信息神经网络在设备 PHM 系统的退化建模与 RUL 预测中具有良好应用潜力,并推动了物理信息预测技术的发展。

论文链接:通过点击最左下角的阅读原文进行在线阅读及下载

论文基本信息

论文题目:A Wiener physics-informed neural network for bearing degradation modeling and remaining useful life prediction
 

论文期刊:Reliability Engineering and System Safety

DOIhttps://doi.org/10.1016/j.ress.2026.112985

作者:Zhaohui Qiao a, Aijun Yin a,*, Wenlan Xu b, Yaohui Qiao c b
论文时间: 2026年
机构: 

a College of Mechanical and Vehicle Engineering, Chongqing University, Chongqing , China

b College of Materials Science and Engineering, Chongqing University, Chongqing  China

c School of Chemical Engineering and Technology, Tianjin University, Tianjin , China


作者简介:尹爱军,男,博士,重庆大学机械与运载工程学院教授、硕/博士生导师。 承担国防基础加强重点项目(课题)、国家自然科学基金、国家863计划项目、国家重点研发计划项目等40多项课题的研究。在智能测试仪器研发、故障诊断与预测、高端装备研发等方面获得多项创新性成果。研发成果在中科院、航天2院、中石油、苹果公司等企业和科研院所得到推广应用。获国家科技进步奖二等奖1项,教育部高校发明奖1等奖1项,教育部提名国家科技进步奖1等奖1项,重庆市科技进步奖1等奖1项,教育部提名国家科技进步奖2等奖1项,重庆市优秀博士论文。国家发明专利20余项。在科学出版社、机械工业出版社、高等教学出版社等出版多本中英文学术专著;在国内外发表学术论文100余篇。
通讯作者邮箱: aijun.yin@cqu.edu.cn

摘要

准确预测轴承剩余使用寿命(Remaining Useful Life, RUL)对于保障机械系统的可靠性与安全性至关重要。本文提出了一种新型维纳物理信息神经网络(Wiener Physics-Informed Neural Network, WPINN)框架,用于轴承退化建模与 RUL 预测。该框架融合了维纳过程的退化动力学建模能力与神经网络的特征提取能力。具体而言,首先引入双向长短期记忆网络(Bidirectional Long Short-Term Memory, BiLSTM),从振动信号中提取时间退化特征;随后,引入一个近似维纳过程的物理引导网络,用于建模轴承退化动力学;然后,设计物理信息联合损失函数,通过施加物理约束提高 WPINN 的预测精度和物理一致性;同时采用动态加权策略,引导训练过程从数据驱动学习逐步过渡到物理约束学习。最后,在 XJTU-SY 和 PHM2012 数据集上开展的大量实验表明,所提出的 WPINN 在预测精度和可信度方面优于其他先进模型。消融实验和小样本实验进一步验证了 WPINN 的鲁棒性和泛化能力。该工作凸显了将物理模型与神经网络相结合在复杂工业系统故障预测与健康管理(PHM)中的应用潜力。

关键词PINN;维纳过程;轴承退化;剩余使用寿命(RUL);故障预测与健康管理(PHM)    

目录

1 引言

2 相关工作

2.1 物理信息神经网络

2.2基于维纳过程的轴承退化建模

3 方法

3.1 任务描述

3.2 维纳物理信息神经网络(WPINN)框架

3.3 物理信息联合损失优化

3.4 WPINN 的训练过程

4 实验验证

4.1 实验设置

4.2 案例 I:XJTU-SY 数据集

4.3 案例 II:PHM2012 轴承数据集

结论

       


1  引言

     

机械设备在航空航天、风电和轨道交通等多种工业应用中发挥着至关重要的作用 [1]。突发故障可能导致高昂的停机成本、严重的生产损失,甚至造成灾难性事故 [2]。作为关键旋转部件,轴承在运行过程中会逐渐退化并最终失效 [3,4]。在航空发动机中,轴承退化会直接威胁飞行安全;在风力发电机组中,轴承故障是齿轮箱故障的主要原因之一;在轨道交通中,轴承过度磨损会显著影响运行稳定性 [5,6]。因此,准确预测轴承剩余使用寿命(RUL)对于保障机械系统的可靠性与安全性至关重要 [7,8]。

随着人工智能的发展,基于传感器的状态监测(Condition Monitoring, CM)已成为机械系统故障预测与健康管理(PHM)中广泛采用的策略 [9,10]。CM 数据能够提供关于设备退化状态的丰富信息,为 RUL 预测奠定了重要基础 [11,12]。RUL 预测方法通常可分为模型驱动方法和数据驱动方法 [13]。模型驱动方法利用物理模型描述退化过程并预测 RUL。Mao 等 [14] 提出了一种维纳过程辅助的深度增量迁移学习方法,用于轴承 RUL 在线预测。Wang 等 [15] 建立了一种两阶段自适应漂移维纳过程模型,用于预测轴承 RUL。Fan 等 [16] 开发了带动态变化点的高斯过程回归模型用于轴承 RUL 预测。Pei 等 [17] 提出了一种由阈值对齐指标驱动的两阶段非线性退化模型(TPNDM),用于滚动轴承 RUL 预测。这些方法具有较强的可解释性,并且对数据量需求较低。然而,它们对复杂系统退化过程的刻画能力有限。

数据驱动方法从 CM 数据中提取退化特征,并构建映射关系以预测轴承 RUL。Afshar 等 [18] 提出了一种嵌入残差块和通道注意力模块的框架,利用三相电流信号评估冷却电机轴承的 RUL。Zhang 等 [19] 提出了一种加权时间嵌入 Transformer 框架,用于滚动轴承 RUL 预测。Cui 等 [20] 设计了一种由数字孪生驱动的图域自适应方法,用于有限数据条件下的轴承 RUL 预测。Liu 等 [21] 提出了一种基于对抗策略的两阶段方法,用于变工况下轴承 RUL 预测。He 等 [22] 开发了一种双相关自适应门控图卷积网络用于轴承 RUL 预测。这些研究证实了数据驱动方法和数字孪生方法在智能预测中的潜力。尽管这些方法具有较强的非线性映射能力,但它们高度依赖大量标注数据,并存在泛化能力差、缺乏物理可解释性等问题。

针对上述局限,物理信息神经网络(Physics-Informed Neural Networks, PINNs)已成为工程可靠性预测领域中连接数据驱动学习与物理建模的一种有前景的方法。近期研究表明,PINNs 在生理信号建模 [23]、电池退化建模 [24] 和离散电力电子器件剩余寿命估计 [25] 等领域具有显著优势。这些进展表明,引入物理约束能够显著提升模型精度和可信度。在轴承 RUL 预测领域,利用物理约束引导神经网络可能成为一种有前景的方法。

受上述研究启发,本文提出了一种新型维纳物理信息神经网络(WPINN),用于轴承退化建模与 RUL 预测。所提出的 WPINN 利用维纳过程建模轴承退化动力学,并结合神经网络捕获复杂非线性退化特征,从而准确预测 RUL。本文创新点如下:

1. 提出了一种用于轴承退化建模与 RUL 预测的新型维纳物理信息神经网络(WPINN)框架。WPINN 将维纳过程的退化动力学建模能力与神经网络的时间特征学习能力相结合。      
2. 引入 BiLSTM 从 CM 数据中提取时间退化特征,并学习复杂退化轨迹;同时嵌入一个近似维纳过程的物理引导子网络,以引入随机退化约束,从而将时间特征与潜在退化动力学耦合起来。      
3. 设计物理信息联合损失函数,将物理一致性约束和单调性约束纳入其中,使模型能够同时从 CM 数据和物理退化规律中学习。此外,采用动态加权策略,引导训练过程由数据驱动学习转向物理约束学习,从而提高 WPINN 的预测精度和可信度。      
4. 基于 XJTU-SY 和 PHM2012 数据集开展实验,以验证所提出 WPINN 的性能。结果表明,与其他方法相比,WPINN 具有更高的预测精度和可信度。本研究强调了将物理模型与神经网络相融合在复杂工业系统 PHM 中的应用潜力。      

本文其余部分安排如下:第 2 节介绍 PINNs 以及基于维纳过程的轴承退化建模相关工作;第 3 节详细介绍所提出的 WPINN 框架;第 4 节给出实验验证与结果分析;第 5 节总结全文并讨论未来工作。

2 相关工作

     

2.1 物理信息神经网络

物理信息神经网络(PINNs)是一类将物理知识融入数据驱动学习的混合框架。在文献 [26] 中,PINNs 被定义为通过优化目标设计而受到物理知识约束的神经网络。这些约束通常由偏微分方程(Partial Differential Equations, PDEs)或随机微分方程(Stochastic Differential Equations, SDEs)表示 [27]。常用方法是在优化目标中加入物理惩罚项,迫使网络不仅拟合数据,还要遵循已知物理规律。PINNs 有效融合了神经网络的泛化能力与物理模型的可解释性,近年来在多个工程领域受到广泛关注。

PINN 的损失函数可表示为:

     
     

其中,         为数据监督损失,用于度量预测值与真实标签之间的差异;         为物理约束损失,用于度量模型输出是否符合物理方程;         为其他损失项。

近期研究表明,PINNs 在多种工程领域具有良好应用潜力。Sel 等 [23] 开发了一种 PINN 模型,该模型利用有限时间序列数据提取特征信息,并通过构建泰勒近似约束实现无袖带血压估计。Wang 等 [24] 提出了一种用于电池退化建模与健康状态(SOH)估计的 PINN 方法,将经验退化模型与状态空间方程相结合,实现控制方程与神经网络的融合。Lu 等 [25] 将 PINN 的基本思想用于增强 RNN,并通过在神经网络损失函数中施加物理约束来估计离散电力电子器件的 RUL。已有研究证实,PINNs 在融合物理知识与数据驱动预测方面具有巨大潜力。

本文将 PINNs 用于轴承退化建模,其中维纳过程作为退化动力学先验。通过结合物理信息学习与时间特征提取,本文旨在构建一个鲁棒且具备泛化能力的 RUL 预测模型,即使在 CM 数据有限的情况下也能够有效工作。

2.2 基于维纳过程的轴承退化建模

轴承在运行过程中会因摩擦、疲劳和磨损而逐渐退化。随着退化程度增加,RUL 逐渐降低并最终导致失效。准确建模退化动力学对于预测 RUL 和实施主动维护策略至关重要。

轴承健康状态在运行过程中以离散方式被监测,其退化过程可建模为随机过程         。在时刻         ,获得相应的退化状态         

     
     

当退化状态          超过阈值          时,认为轴承已经失效。此时,轴承失效时间(Time to Failure, TTF)         定义为

     
     

轴承在时刻          的 RUL          定义为退化状态首次达到阈值          之前的剩余时间 [28]:

     
     

为降低不同寿命和工况所导致的个体差异,将 RUL 归一化为相对 RUL:

     
     

其中,         为轴承全寿命周期,         为运行时间。

然而,轴承退化过程通常具有非线性、不确定性和随机性,因此其退化趋势并非固定不变。维纳过程擅长建模随机退化过程 [29,30]。在本文中,轴承退化过程          描述如下:

     
     

其中,         表示轴承在时刻          的退化状态,反映磨损的累积效应;         为初始状态;         为漂移项,表示退化速率;         为扩散系数,表示随机波动;         为标准布朗运动,用于表征退化的随机动力学。虽然          不能被直接测量,但可以由 CM 数据间接推断。         在由维纳过程建模的潜在物理退化动力学与可观测 CM 数据之间起桥接作用。

在本文中,物理信息特性来自于将轴承退化显式建模为维纳随机过程,该过程作为描述退化动力学的物理先验。

3 方法

     

3.1 任务描述

本研究旨在开发一个利用 CM 数据准确估计轴承 RUL 的框架。我们的任务是构建预测模型         ,使其能够捕获时间退化模式,并与已知物理退化动力学保持一致。

假设训练数据集由          个轴承退化时间序列样本组成,每个样本表示某一特定时间段内的轴承运行状态。数据集可表示为:

     
     

其中,         为第          个时间段的时间序列数据,         为该时间段对应的 RUL。通过使用训练集          优化模型          的参数来学习 RUL 预测:

     
     

对于测试样本         ,训练后的模型          预测其 RUL:

     
     

在后续小节中,将介绍所提出 WPINN 的框架,并阐述数据驱动特征提取与物理退化建模的融合方式。

3.2 维纳物理信息神经网络(WPINN)框架

为提高轴承 RUL 预测的精度和可信度,本文提出一种新型维纳物理信息神经网络(WPINN)框架。该框架将数据驱动网络与基于维纳过程的物理退化建模相结合。如图 1 所示,整体框架由特征到 RUL 预测子网络          和维纳退化建模子网络          构成。

     

图 1. 维纳物理信息神经网络(WPINN)的整体框架。

3.2.1 特征到 RUL 预测子网络           

定义预测网络         ,用于从 CM 数据中提取时间退化特征,并建立特征与 RUL 之间的非线性映射:

     
     

其中,         为轴承时间序列数据,         为提取的退化特征。

考虑到轴承退化信号的非平稳性和时间依赖性,本文采用双向长短期记忆网络(BiLSTM)[31] 提取退化特征并建模时间依赖关系。对于第          个时间步的退化状态,基于          和          预测 RUL         

     
     

其中,         为 BiLSTM 网络,输出          为预测 RUL。

3.2.2 维纳退化建模子网络           

维纳过程能够有效刻画所提取退化特征          与时间          之间的非线性关系

     
     

然而,式(12)的显式形式通常未知且难以获得。为将维纳先验嵌入神经网络训练中,受文献 [32,33] 启发,本文构建维纳退化建模子网络          来近似维纳过程:

     
     

其中,         为网络          的参数,         为函数逼近器。         的输入为轴承振动信号          以及由网络          提取的退化特征         。对于第          个时间步的轴承退化动力学,相应 RUL          可表示为

     
     

网络          利用提取的退化特征          建模轴承退化动力学,并输出退化值          及相关偏导数。这些导数对于根据维纳过程计算物理约束至关重要。

由于轴承退化过程是连续的,可以合理假设退化相对于时间的梯度在相邻时间步之间不会发生突变。利用这种连续性,本文使用第          个时间步的子网络          预测第          个时间步的 RUL:

     
     

式(11)得到的预测 RUL 与式(14)得到的估计 RUL 在第          个时间步理论上应一致:

     
     
     

为实现该约束,引入残差         

     
     

残差          可用于评估神经网络          的预测 RUL 与维纳过程子网络          的估计 RUL 之间的差异。

此外,为描述轴承退化动力学,         估计的退化速率作为物理约束,用于引导预测子网络          预测物理上合理的 RUL。退化速率可表示为:

     
     

本文计算预测子网络          的时间导数与维纳过程子网络          的漂移项          之间的残差         ,使退化速率符合维纳过程的动力学约束:

     
     

其中,         表示由子网络          预测的 RUL;         通过自动微分获得,反映网络推断出的退化速率;         为基于维纳过程估计的退化速率。

残差          和          增强了 WPINN 捕获退化轨迹连续性的能力,并通过残差优化提高 RUL 预测的准确性和物理一致性。

3.3 物理信息联合损失优化

为提高所提出 WPINN 在轴承退化预测中的预测精度和物理可信度,本文设计了物理信息联合损失函数

3.3.1 数据监督损失           

数据监督损失          用于衡量预测 RUL 与真实标签之间的差异,其定义为:

     
     

其中,         为训练样本数量,         为第          个样本的预测 RUL,         为对应真实标签。通过最小化         ,该损失项可增强模型在标注数据上的回归精度。

3.3.2 物理一致性损失           

为保证预测结果符合轴承退化的物理机制,本文设计物理一致性损失         。对所有时间步上的轴承退化序列计算残差          和         ,并将残差平方和作为物理一致性损失:

     
     

其中,         为退化序列数量,         表示每条序列索引。         对偏离维纳建模退化动力学的情况进行惩罚。通过最小化         ,可确保神经网络预测与维纳过程估计之间的物理一致性。该损失从退化动力学层面对所提出 WPINN 进行约束,引导学习到的退化过程符合物理模式。

3.3.3 单调性损失           

RUL 会随时间逐渐下降,呈现单调递减趋势。为确保预测 RUL 符合该物理属性,设计单调性惩罚项如下:

     
     

其中,                 为时刻          的预测 RUL。只有当预测 RUL 违反预期单调递减趋势时,该惩罚项才会被激活。该损失项通过惩罚对单调退化假设的偏离,有效增强模型预测结果的物理合理性,确保预测 RUL 始终反映轴承磨损不可逆的本质。

3.3.4 物理信息联合损失函数定义

总损失函数          定义如下:

     
     

其中,         和          为权重系数,用于控制训练中物理一致性约束和单调性约束的相对重要性

考虑到模型在训练初期尚未学习到稳定的预测结构,因此优先进行数据拟合十分关键。随着训练推进,应更加重视物理一致性和趋势一致性。因此,本文引入动态权重调整机制:

     
     

其中,         和          为初始权重系数,         为控制调整速率的缩放因子,         为当前训练轮次。

该策略能够实现从数据驱动学习阶段到逐步受物理约束与趋势一致性引导阶段的平滑过渡,从而增强模型的物理合理性和预测稳定性。通过反向传播优化该联合损失,所提出 WPINN 的预测结果不仅能够拟合观测到的 CM 数据,还受到底层维纳退化模型的显式引导,从而保证物理一致性。

3.4 WPINN 的训练过程

所提出 WPINN 的训练过程如算法 1 所示。

算法 1. 所提出 WPINN 的训练过程

     

3 实验验证

     

为验证所提出 WPINN 的有效性和泛化能力,本文在 XJTU-SY 和 PHM2012 轴承数据集上开展了系统实验。

4.1 实验设置

所有实验均在工作站上完成。具体配置见表 I。为尽量减小随机性的影响,每组实验重复 5 次,并报告平均结果。

表 I. 实验平台配置

     

4.1.1 评价指标

为评估所提出 WPINN 的性能,本文采用平均绝对误差(Mean Absolute Error, MAE)和均方根误差(Root Mean Square Error, RMSE)[34] 作为评价指标:

     
     
     

其中,         和          分别为第          个样本的真实 RUL 与预测 RUL,         为样本数量。MAE 衡量平均预测偏差并反映整体预测精度;RMSE 强调误差并表征预测稳定性。

4.1.2 模型设置

为证明所提出 WPINN 的优越性,本文与其他先进方法进行了对比实验,包括 GDAU [35]、TCN-RSA [36]、CLSTM [37] 和 LPINN。LPINN 被设计为 WPINN 的简化版本,其中 BiLSTM 特征提取器被 LSTM 替代,而维纳退化建模子网络          保持相同。该设计使我们能够专门评估 WPINN 中双向时间建模的优势。

为保证公平性,所有对比模型均采用与 WPINN 相同的数据集和实验设置进行训练,并保持关键超参数一致,如训练轮数、批量大小、学习率和优化器。这确保性能差异来源于模型结构,而非超参数偏差。此外,维纳退化网络          被实现为全连接前馈神经网络,其结构见表 II。

表 II. 维纳退化建模子网络          的结构

     

4.1.3 超参数设置

所提出 WPINN 的主要超参数通过网格搜索策略选取,以平衡预测性能和训练成本。为保证公平比较,所有对比模型也使用相同的网格搜索策略进行调参。这确保 WPINN 的性能提升源于其结构创新,而非超参数设置。

此外,本文对 WPINN 的损失权重进行动态调整,以逐渐强化物理一致性约束和单调性约束的作用。本文将初始物理一致性权重          和单调性权重          均设为 0.5,缩放因子          设为 0.02。WPINN 与其他对比模型的主要超参数见表 III。

表 III. WPINN 与其他模型的超参数设置

     

4.2 案例 I:XJTU-SY 数据集

4.2.1 数据集描述

XJTU-SY 数据集采集自 XJTU-SY 轴承试验台,该试验台能够模拟真实环境中不同运行工况下的轴承退化。如图 2 所示,主轴转速由调速器调节,液压加载系统向试验轴承施加径向载荷。通过安装在试验轴承上的两个加速度传感器采集振动信号。采样频率设为 25.6 kHz,采样间隔为 60 s,单次采样时长为 1.28 s。当信号最大幅值超过          时,认为轴承已失效,其中          表示健康运行状态下的最大幅值。此时实验立即终止。

XJTU-SY 数据集包含不同运行工况下的轴承全寿命周期数据。案例 I 中用于轴承 RUL 预测任务的 XJTU-SY 数据集设置见表 IV。图 3 绘制了轴承 B1_1 全寿命周期的时域波形。

     

图 2. XJTU-SY 轴承试验台。

     


图 3. 轴承 B1_1 全寿命周期时域波形。

表 IV. XJTU-SY 数据集设置

     

4.2.2 预测结果与分析

图 4 给出了所提出 WPINN 在不同任务中的 RUL 预测结果。可以观察到,WPINN 能够较好地拟合实际退化趋势,预测 RUL 曲线呈现清晰的单调性和一致性。虽然在某些时间点存在轻微波动,但整体趋势与真实轴承磨损的物理特征高度一致。所提出 WPINN 能够有效捕获轴承退化过程,并揭示潜在退化轨迹。

如表 V 所示,所提出 WPINN 在所有任务中均取得最低且最稳定的预测误差,平均 MAE 和 RMSE 分别为 0.04789 和 0.06317。所提出 WPINN 能有效捕获轴承退化模式,并在不同运行工况下建模退化动力学。通过将轴承退化动力学的维纳过程与神经网络结合,模型受到物理属性约束,从而提高了预测结果的准确性和可信度。

总之,WPINN 利用维纳过程的物理可解释性与神经网络的表征能力,实现了更准确且更符合物理退化趋势的 RUL 预测。

     


图 4. 所提出 WPINN 在案例 I 中的 RUL 预测结果。


表 V. 案例 I 中不同模型的 MAE 和 RMSE

     

4.2.3 对比结果与分析

为进一步验证所提出 WPINN 的优越性,本文与四种先进模型进行了对比实验。如表 V 所示,所提出 WPINN 在所有任务中均取得最低的 MAE 和 RMSE,显著优于其他模型。这些结果表明,WPINN 在捕获退化特征和潜在物理动力学方面具有更强能力。

BiLSTM 能够有效捕获轴承的时间依赖关系和退化模式,形成鲁棒的特征表示,从而提高 RUL 预测精度。维纳过程建模的引入能够引导学习过程趋向物理一致且单调的退化趋势,从而提高预测精度和可信度。

所提出 WPINN 有效融合了数据驱动学习与物理信息引导,兼具维纳过程的物理可解释性和神经网络的表征能力。WPINN 提升了 RUL 预测精度,并体现出优越性和可解释性。

4.2.4 消融实验与分析

为量化所提出 WPINN 中物理约束项的贡献,本文在 Task B 中设计了消融实验。消融模型设置如下

  • Model A:所提出 WPINN。
  • Model B:仅去除 WPINN 中的物理一致性约束。
  • Model C:仅去除 WPINN 中的单调性约束。
  • Model D:同时去除 WPINN 中的物理信息约束和单调性约束。

如图 5 所示,所提出 WPINN(Model A)取得最佳预测性能,验证了综合物理约束的有效性。去除物理信息约束(Model B)后,MAE 和 RMSE 均显著增大,说明物理一致性约束在引导模型学习更真实的退化动力学方面非常重要。去除单调性约束(Model C)也会降低性能,但影响小于去除物理约束。这表明单调性虽能提高轨迹平滑性和趋势一致性,但物理信息约束对整体预测精度具有更主导的影响。Model D 同时去除两类约束后表现最差,类似纯数据驱动网络,说明缺乏物理引导会导致模型泛化失败。

这些消融研究清楚地揭示了将数据驱动学习与物理退化建模相结合的协同优势。与传统数据驱动方法不同,WPINN 引入物理一致性和单调性约束。该设计既能保证预测结果与退化物理一致,又能提高预测精度,而这在现有方法中通常未被充分考虑。

     


图 5. 消融实验中各模型的结果。

4.2.5 参数敏感性分析

1)BiLSTM 层数敏感性分析。 为研究网络结构对所提出 WPINN 预测性能的影响,本文通过改变 RUL 预测子网络中 BiLSTM 的层数进行参数敏感性分析。

在保持其他超参数不变的情况下,使用不同层数的 BiLSTM 训练 WPINN。实验在 Task A 上进行。

如图 6 所示,随着 LSTM 层数增加,预测性能最初逐渐改善。当层数为三层时,WPINN 取得最低的 MAE 和 RMSE。然而,继续增加层数并不会带来显著改进,反而导致性能略有下降。层数过少会使子网络无法充分提取信号的上下文时间退化特征;层数过多会引入更高的计算开销,并可能阻碍时间退化特征的学习。

在所有配置中,三层 BiLSTM 取得最佳性能。它在避免不必要复杂性的同时,提供了足够的表达能力来提取时间退化特征。因此,最终 WPINN 配置采用三层 BiLSTM。

     


图 6. 不同 LSTM 层深度下 WPINN 的 MAE 和 RMSE。

2)权重参数敏感性分析。 为研究式(25)中的动态加权参数影响,本文在 Task B 中对初始权重                  和缩放因子          进行了敏感性分析。具体而言,首先固定         ,将                  在          范围内变化,并报告相应 RUL 预测误差(RMSE 和 MAE)。随后固定初始权重                 ,将          在          范围内变化以调节过渡速率,并绘制收敛曲线评估训练稳定性。图 7 和图 8 分别展示了不同设置下的 RUL 预测误差和训练曲线。

图 7 展示了当          时不同初始权重                  下的 RUL 预测误差。结果表明,WPINN 在较宽参数范围内保持稳定预测性能,不同设置下误差仅有轻微波动。较大的初始权重会由于早期数据拟合不足而略微降低预测性能;而过小权重则缺乏物理信息约束,同样会导致预测性能下降。

图 8 展示了当          时不同          值下的训练收敛曲线。可以观察到,较小          值(        )会减缓向物理遵循阶段的过渡并延长收敛过程;过快过渡(        )虽然能加速转换,但可能引起训练振荡。         在收敛速度与稳定性之间取得最佳折中。

实验结果确认 WPINN 对动态权重参数变化具有鲁棒性。因此,本文选择                 ,以平衡预测性能与训练稳定性。

     

图 7. 当          时,不同初始权重                  下的预测误差。

     

图 8. 当          时,不同          值下 WPINN 的收敛曲线。

4.2.6 计算效率分析

为进一步评估所提出 WPINN 在工业 PHM 系统中的实用性,本文进行了计算效率对比实验。所有实验均在相同硬件平台上完成,以保证公平性。对每个模型,记录其平均每轮训练时间、每个测试样本的平均推理时间以及峰值 GPU 显存占用。实验结果见表 VI。

如表 VI 所示,与其他模型相比,WPINN 的训练时间略高。额外成本主要来自维纳退化建模子网络          和物理信息联合损失的引入。峰值 GPU 显存占用也略有增加,反映出混合结构带来的额外计算需求。尽管如此,WPINN 的单样本推理时间仍具有竞争力,并满足工业应用需求。

总体而言,结果表明 WPINN 在可接受计算成本下实现了更优预测性能。此外,考虑到第 4.2.2 节和第 4.2.3 节中获得的显著性能提升,物理信息约束带来的额外计算成本是合理的。

表 VI. 不同模型的计算效率

     

4.2.7 小样本实验与分析

为评估不同组件的贡献并验证所提出 WPINN 在有限数据条件下的鲁棒性,本文开展了小样本实验。在 Task B 中,从 Bearings 2_1 和 2_2 中随机选取 50 个样本作为训练集训练模型,并使用 Bearing 2_3 的全部数据进行测试。所有模型均在相同配置下训练和评估,以保证公平比较。图 9 给出了有限数据条件下不同方法的预测结果。

如图 9 所示,虽然 LPINN 引入了物理约束并在一定程度上提高了预测稳定性,但将 BiLSTM 替换为标准 LSTM 会导致性能下降。这证实了双向时间特征提取的重要性。此外,当去除来自维纳过程的物理信息约束、仅使用纯 BiLSTM 时,模型性能显著下降,突出了物理信息维纳建模的关键作用。最后,TCN-RSA 作为基于卷积的时间建模基准方法,由于训练数据不足且缺乏物理约束,在轴承 RUL 预测任务中表现较差。

相比之下,即便在小样本条件下,WPINN 生成的 RUL 预测仍能紧密跟踪真实标签,波动极小且呈现清晰下降趋势。预测结果与实际退化曲线高度一致,具有极低波动性并保持较高准确性。这说明 BiLSTM 时间特征提取与维纳物理信息约束具有联合优势。

结果表明,即使在训练数据有限的情况下,WPINN 仍表现出优异的鲁棒性和稳定性。通过引入 BiLSTM,WPINN 能够有效建模退化过程中的双向时间依赖关系。此外,模型融合了基于维纳过程的物理信息约束,使其能够更准确地建模轴承退化过程。有限数据条件下的鲁棒性是 WPINN 区别于传统 RUL 预测方法的一项独特优势。

     


图 9. Bearing B2_3 上的小样本实验结果。

4.3 案例 II:PHM2012 轴承数据集

为进一步验证所提出 WPINN 的泛化能力,本文使用 PHM2012 轴承数据集开展了额外实验。

4.3.1 数据集描述

如图 10 所示,PHM2012 数据集来自 PRONOSTIA 试验台,该试验台通过控制转速和径向载荷加速轴承退化。振动信号由安装在试验轴承上的加速度传感器采集。数据采样频率为 25.6 kHz,采样间隔为 10 s,单次采样时长为 0.1 s。当加速度幅值超过 20 g 时,认为轴承已经失效,并立即终止实验。

PHM2012 数据集包含三种不同运行工况下的轴承全寿命周期退化数据。每种工况包含两个训练轴承和一个测试轴承。图 11 展示了轴承 B1_2 全寿命周期的时域波形。详细设置见表 VII。

     


图 10. PRONOSTIA 轴承试验台。

     


图 11. 轴承 B1_2 全寿命周期时域波形。

表 VII. PHM2012 轴承数据集设置

     

4.3.2 预测结果与分析

图 12 绘制了 WPINN 在任务 D、E 和 F 的测试轴承上的 RUL 预测结果。可以观察到,所提出 WPINN 仍能准确拟合轴承的真实 RUL 趋势。在 Task D 中,预测曲线紧密跟随真实退化轨迹,呈现清晰下降趋势且无明显波动。在 Task E 和 F 中,预测后半段存在轻微偏差和波动,但整体趋势仍与实际轴承退化曲线一致。WPINN 在不同任务下表现出稳定且一致的预测性能,显示出较强泛化能力以及建模物理一致退化行为的能力。

如表 VIII 所示,与其他方法相比,WPINN 在所有任务中均取得最低的 MAE 和 RMSE。WPINN 显著提高了预测精度,并能够产生趋势一致、无异常波动的预测结果,体现出较强鲁棒性。由物理约束引导的优化使模型能够保持高预测性能,优于其他数据驱动方法。

总之,两个案例研究证明了所提出 WPINN 的优异鲁棒性和泛化能力。WPINN 的成功源于其混合结构:BiLSTM 支持深层时间建模,而维纳过程将学习限制在物理合理的轨迹范围内。动态损失加权策略对于实现从数据拟合到物理约束预测的平滑过渡至关重要。结果表明,PINNs 在轴承退化建模和 RUL 预测任务中具有良好应用前景。

     

图 12. 所提出 WPINN 在案例 II 中的 RUL 预测结果。

表 VIII. 案例 II 中不同模型的 MAE 和 RMSE

     

5 结论

     

准确预测轴承 RUL 对复杂工业系统的可靠性和安全性至关重要。本文提出了一种用于轴承 RUL 预测的新型维纳物理信息神经网络(WPINN)框架。WPINN 在统一框架内结合了神经网络的特征提取能力和维纳过程的退化动力学建模能力。通过将物理退化机制融入数据驱动模型,WPINN 提高了预测精度和可信度。所提出 WPINN 利用 BiLSTM 从 CM 数据中提取时间退化特征,并引入一个近似维纳过程的物理引导退化建模子网络,以嵌入物理约束。本文设计了物理信息联合损失函数,将数据监督、物理一致性和单调性约束结合起来,以提高 WPINN 的预测精度和可信度。此外,采用动态加权策略,引导训练过程从数据驱动学习逐步过渡到物理约束学习。

最后,本文使用 XJTU-SY 和 PHM2012 轴承数据集对所提出 WPINN 进行了全面验证。结果表明,WPINN 的预测精度优于其他先进模型。WPINN 能够准确捕获退化轨迹并保持较高稳定性。物理退化约束的引入显著提高了模型可信度。小样本实验表明,受益于嵌入的物理约束,WPINN 在有限训练数据下仍能保持鲁棒预测。消融实验验证了物理一致性约束和单调性约束在提高预测可靠性方面的关键作用。WPINN 不仅实现了较高预测精度,还能够保证物理一致的退化轨迹。BiLSTM 时间学习、维纳过程信息动力学以及物理信息损失约束的结合,为 RUL 预测提供了一种新颖且有效的范式。该混合设计同时有助于提升预测性能和可解释性,相比传统方法具有进一步优势。本研究表明,物理信息神经网络在设备 PHM 系统的退化建模与 RUL 预测中具有良好应用潜力,并推动了物理信息预测技术的发展。未来工作中,将把所提出 WPINN 扩展到涡轮、泵和电池等其他工业设备,以进一步提高其泛化能力和实际适用性。此外,还将探索将 WPINN 集成到数字孪生系统中,为复杂工业设备的监测、预测和决策支持提供支撑

 

编辑:Tina

校核:李正平、陈凯歌曹希铭、Leo、白亮、任超、海洋、赵栓栓、Kira、陈宇航、王金、赵诚、肖鑫鑫、张优

该文资料搜集自网络,仅用作学术分享,不做商业用途,若侵权,后台联系小编进行删除

来源:故障诊断与python学习
MechanicalSystem振动疲劳非线性旋转机械航空航天轨道交通电力电子理论电机数字孪生控制人工智能
著作权归作者所有,欢迎分享,未经许可,不得转载
首次发布时间:2026-06-23
最近编辑:2月前
故障诊断与python学习
硕士 签名征集中
获赞 87粉丝 152文章 327课程 0
点赞
收藏
作者推荐

一种基于Transformer的新型局部增强通道自注意力机制在工业剩余使用寿命预测中的应用

本期给大家推荐一种基于Transformer的新型局部增强通道自注意力机制在工业剩余使用寿命预测中的应用。在预测性维护领域,剩余使用寿命预测是保障复杂工业机械可靠性与安全性的核心技术。然而,现有基于循环神经网络、卷积神经网络或自注意力机制的方法,往往难以同时兼顾全局长期依赖、局部上下文信息与多传感器空间相关性。为突破这一瓶颈,本文提出一种基于Transformer的新型局部增强通道自注意力模型——LECformer。该方法不仅通过Transformer架构高效捕获长期依赖,更设计了独特的局部增强通道自注意力机制,能够自适应提取局部与全局特征,并动态加权不同通道的重要性。在多个涡扇发动机和轴承数据集上的实验表明,LECformer显著超越了当前最先进的RUL预测方法。论文基本信息论文题目:A novel local enhanced channel self-attention based on Transformer for industrial remaining useful life prediction 论文期刊:Engineering Applications of Artificial IntelligenceDoi:https://doi.org/10.1016/j.engappai.2024.109815作者:Zhizheng Zhang (a), Wen Song (a*), Qiong Wu (b), Wenxu Sun (a*), Qiqiang Li (a), Lei Jia (a) 论文时间:2025年 机构:(a) Institute of Marine Science and Technology, Shandong University, Qingdao, 266237, China (b) MetaReal (Beijing) Technologies Co., Ltd, Beijing, 100043, China作者简介:宋文,海洋研究院副教授,入选山东大学青年学者未来计划,IEEE Senior Member。本硕毕业于山东大学控制科学与工程学院,博士毕业于新加坡南洋理工大学计算机科学与工程学院。长期从事深度学习、强化学习、组合优化、时间序列预测等方面的研究,主要研究方向为数据与智能驱动的优化决策技术。主持国家自然科学基金青年/面上、山东省自然科学基金、中国商飞技术研发等项目,以第一/通讯作者发表高水平SCI/EI论文30余篇,包括TNNLS、TII、TKDE等中科院1区/CCF-A类期刊论文,ICML、NeurIPS、ICLR、AAAI等CCF-A类/顶级人工智能会议论文,谷歌学术引用4400余次,H-index 32。ESI高被引论文3篇,热点论文1篇。获中科院1区Top期刊IEEE Transactions on Industrial Informatics杰出论文奖(2024年度唯一获奖论文)。任NeurIPS、ICLR、AAAI、IJCAI、KDD等顶级会议的Area Chair/SPC/PC,以及TPAMI、TNNLS、TCYB等十余个高水平SCI期刊的审稿人。(摘自山东大学教师主页) 通讯作者邮箱:wensong@email.sdu.edu.cn; sunwenxu@sdu.edu.cn 摘要剩余使用寿命(Remaining Useful Life, RUL)预测是预测性维护(Predictive Maintenance, PdM)的基础技术,对保障复杂工业机械的可靠性与安全性至关重要。近年来,循环神经网络(Recurrent Neural Network, RNN)、卷积神经网络(Convolutional Neural Network, CNN)与自注意力(Self-Attention, SA)等先进深度学习架构已广泛应用于RUL预测,但现有方法仍难以同时处理序列单元的全局长期依赖、局部上下文信息以及工业多传感器的空间相关性。本文提出一种基于Transformer的局部增强通道自注意力模型(Local Enhanced Channel Self-Attention based on Transformer, LECformer),一种新型深度学习 RUL 预测方法以解决上述问题。相较于基于RNN/CNN的方法,LECformer通过Transformer架构能更高效地捕获长期依赖。此外,LECformer 提出一种新型局部增强通道自注意力(Local Enhanced Channel Self-Attention, LECSA)机制,替代原生Transformer的传统自注意力,可自适应提取长期依赖与局部上下文信息,同时动态加权不同通道的重要性以提升预测性能。本文采用两个广泛使用的涡扇发动机数据集与一个轴承数据集验证所提方法的有效性。实验结果表明,LECformer显著优于当前最优的RUL预测方法。关键词:剩余寿命预测;预测性维护;人工智能;深度学习;Transformer;自注意力 目录1 引言2 相关工作3 方法3.1 所提LECformer架构概述3.2 LECformer的输入层3.3 LECformer的编码层3.4 LECformer的输出层3.5 相较传统Transformer自注意力的优势4 案例研究1:基于C-MAPSS与N-CMAPSS数据集的实验4.1 数据集描述4.2 实验设置4.3 实验分析5 案例研究2:基于FEMTO轴承数据集的实验5.1 数据集描述5.2 实验设置5.3 LECformer预测结果分析5.4 与当前最优方法对比6 讨论7 结论1 引言预测性维护(Predictive Maintenance, PdM)在现代工业系统中至关重要,相较于传统预防性维护策略,其不仅能提升设备可靠性,还可降低维护成本(Zhang等,2024)。通过分析与挖掘状态监测(Condition Monitoring, CM)数据,PdM可持续评估设备健康状态,支持主动决策。PdM的核心技术是剩余使用寿命(Remaining Useful Life, RUL)预测,可帮助维护人员预判设备状态,为生产与维护规划做出合理决策(Elsheikh,2023)。然而,工业机械数据的高复杂性与高维度性,使得精准RUL预测仍具挑战。因此,开发有效的RUL预测模型对PdM至关重要,尤其在处理大型工业机械CM数据中的复杂模式方面。近年来,深度学习技术在RUL预测中展现出巨大潜力,其可从原始多传感器数据中自动提取高维特征,减少对人工特征工程的依赖。常见的深度学习架构,如循环神经网络(Recurrent Neural Network, RNNs)(Huang等,2019)、卷积神经网络(Convolutional Neural Network, CNNs)(Kobayashi与Alam,2024),擅长处理时序数据,已广泛应用于RUL预测。RNN变体包括长短期记忆网络(Long Short-Term Memory, LSTM)(Yang等,2023)与门控循环单元(Gated Recurrent Unit, GRU)(Liu等,2020b),以捕获时序依赖著称;而CNNs则通过卷积操作擅长提取局部特征。近期,Transformer模型(Vaswani等,2017)凭借其自注意力(Self-Attention, SA)机制被引入RUL预测领域。该机制使Transformer能基于特定时间步相关性分配权重,更高效地捕获长期依赖,相较传统RNN与CNN方法实现性能提升。深度学习RUL预测方法的目标是从采集的多传感器数据中提取设备退化特征。受现代大型设备复杂性影响,采集的CM数据中不仅存在复杂的全局与局部时序关系,还存在不同传感器序列间的空间相关性。尽管取得上述进展,面向复杂工业应用的有效RUL预测仍需同时考虑以下方面:(1)长期依赖建模:如何提取不同序列单元的长期时序关系。从序列数据中提取长期依赖与时序关系对精准RUL预测至关重要。(2)局部上下文特征提取:如何在捕获长期依赖信息的同时充分利用局部上下文信息。不同局部区域的退化特征对最终RUL预测同样重要。(3)多传感器空间相关性学习:有效学习多传感器时序数据的空间相关特征,可显著提升模型的特征学习能力。融合多通道相关信息对精准RUL预测至关重要。然而,现有深度学习RUL预测方法难以同时解决上述问题:基于RNN/CNN方法的局限性:基于RNN与CNN的方法及其变体(Huang 等,2019;Kong等,2019;Ding等,2022)难以从序列数据中提取长期时序关系。RNN采用串行处理数据,易出现信息丢失与梯度消失/爆炸问题。CNN受限于局部感受野,需增加网络深度才能捕获长距离依赖,效率低下且无法有效建模全局时序相关性。传统Transformer的局限性:尽管原生Transformer(Vaswani等,2017)的自注意力机制在建模长期依赖方面表现优异,但在学习细粒度局部特征方面能力较弱。在RUL预测中,局部区域的波动对预测精度影响显著。传统自注意力机制(Ren等,2022;Ma等,2021;Liu等,2022)执行逐点点积计算,可能忽略重要局部信息。忽略多传感器空间相关性:RUL预测中的多传感器时序数据间存在复杂的非线性空间关系。但多数现有基于自注意力的方法(Zhang等,2022,2023)聚焦于建模时序依赖,未考虑不同传感器间的空间相关性,限制了方法有效性。值得注意的是,Peng等(2023)的研究采用滞后量化解决切换系统的输入到状态镇定问题,凸显了有效传感器与执行器管理的重要性。类似地,Song 等(2024)的研究探索了持续驻留时间切换下的状态估计,强调了复杂系统动态中鲁棒测量策略的重要性。这些方法体现了当代RUL预测中融合时序与空间维度的研究方向。本文围绕上述三个关键点开展相关研究。为解决上述问题,本文提出一种基于Transformer的新型局部增强通道自注意力模型(Local Enhanced Channel Self-Attention based on Transformer, LECformer)用于RUL预测。本研究的主要贡献如下:提出局部增强通道自注意力(Local Enhanced Channel Self-Attention, LECSA)机制:LECformer采用LECSA替代传统自注意力机制,结合线性投影与卷积操作的优势,使模型能有效捕获长期依赖与局部上下文信息。LECSA 在保留全局时序关系建模能力的同时,增强了模型提取局部退化特征的能力。融合通道自注意力(Channel Self-Attention, CSA):LECSA融入CSA以动态捕获不同传感器通道间的空间相关性,使模型能自适应加权不同通道的重要性,提升多传感器数据的特征融合效果。全面评估与消融实验:本文在广泛使用的涡扇发动机数据集与轴承数据集上开展大量实验,验证LECformer的有效性。结果表明,LECformer显著优于现有当前最优RUL预测方法。学习到的注意力权重可视化进一步证实了所提方法的特征提取能力提升。综上,LECformer通过同时建模长期依赖、提取局部上下文特征、捕获多传感器空间相关性,有效解决了现有方法的局限性,提升了复杂工业应用中的RUL预测性能。本文组织结构如下:第2节简要介绍当前相关工作与存在问题;第3节阐述所提LECformer方法与计算流程;第4节介绍涡扇发动机实验;第5节展示轴承数据集实验;第6节讨论所提LECformer;第7节总结全文。2 相关工作得益于高效的序列建模能力,RNNs、CNNs及其变体近期成为深度学习RUL预测领域的主流架构。Hu等(2021)提出一种基于双向RNN的方法,旨在提取RUL预测的退化特征。类似地,为解决RNN模型崩溃问题,Huang等(2019)提出双向LSTM模型,提升传统RNN变体的稳定性与精度。Li等(2018)提出一种基于深度CNN的新型方法用于涡扇发动机RUL预测,通过堆叠多层CNN层提取深度特征信息。Kong等(2019)开发了一种融合LSTM与CNN架构的混合RUL预测方法,利用空间与时序特征提升预测精度。但上述现有方法存在固有局限性。基于RNN/CNN的方法难以捕获序列数据中的长期依赖(Vaswani等,2017;Zhang等,2022;Liu等,2020a)。具体而言,RNN在长序列中易遗忘关键信息,且存在梯度消失或爆炸问题。CNN受限于局部感受野,需增加网络深度才能有效建模全局信息,计算量大且效率低。完全依赖自注意力机制处理整个序列的Transformer架构(Vaswani等,2017)的提出,为序列建模提供了更高效的方法。多项研究尝试将RNNs或CNNs与Transformer结合用于RUL预测。Wang等(2024)提出一种基于注意力机制的改进深度残差网络用于变速箱故障诊断,增强特定区域的特征提取以提升模型性能。Liu等(2022)提出一种融合CNNs与Transformer的方法,更好地结合全局与局部退化特征用于RUL预测。Wang等(2021)提出一种融合时序CNN(Temporal CNN, TCNN)与Transformer编码器的RUL预测方法,提升全局特征提取能力。此外,Liang等(2023)提出一种结合图神经网络与注意力机制的预测方法,提升时空特征提取能力。此外,多项研究提出纯基于Transformer的方法用于RUL预测。Ma等(2021)提出一种基于Transformer的预测方法,规避RNN/CNN模块的局限性,有效捕获长期依赖。Zhang等(2022)开发了一种基于Transformer的双视角自注意力机制用于RUL预测,采用两个独立编码器进行特征提取。Ren等(2022)提出一种时序张量辅助多尺度 Transformer方法,无需任何RNN/CNN模块即可捕获时序模式。此外,新型 Transformer 结构被提出用于提取时序预测与计算机视觉任务的相关特征。Liu等(2023)提出逆 Transformer(iTransformer),在反转维度上应用注意力与前馈网络以捕获时序预测中的相关性。Xu等(2022)提出一种用于弱监督语义分割的多类别标记Transformer,采用多个类别标记学习不同标记间的交互。尽管上述预测方法取得进展,仍存在以下挑战:RNN/CNN模块的固有局限性:堆叠RNNs或CNNs与自注意力模块的方法难以克服RNN/CNN架构的固有缺陷,捕获长期依赖与建模全局信息的局限性在混合模型中依然存在。传统自注意力在局部特征提取中的低效性:Transformer中传统的线性点积自注意力机制可能无法有效提取局部区域的退化信息,而这对RUL预测至关重要。标准自注意力的逐点操作可能忽略重要局部特征。现有基于Transformer的预测方法在特征提取中通常未同时考虑全局长期依赖、局部上下文信息与多通道空间相关性。忽略这些方面会降低特征表示质量,进而降低RUL模型的预测性能。为弥补上述差距,本文针对上述方向展开研究,提出新型LECformer使模型更适配工业RUL预测任务。通过解决上述挑战,LECformer旨在提升RUL预测任务中的特征表示与预测性能。本文通过大量实验评估所提方法的有效性,实验结果证实其在工业应用中的有效性。下文将详细介绍LECformer的具体细节。3 方法本节详细介绍所提用于RUL预测的LECformer架构设计。首先概述LECformer架构,随后深入阐述其核心组件,包括创新的LECSA机制与CSA机制。本文旨在阐明LECformer如何通过捕获全局长期依赖、局部上下文信息与多通道空间相关性高效处理多传感器时序数据,进而提升时序预测与状态监测等应用的预测精度。3.1 所提LECformer架构概述LECformer架构如图1所示。LECformer采用基于Transformer的框架,包含三个主要组件:输入层、编码层与输出层。与传统基于RNN/CNN的方法不同,LECformer利用Transformer的能力建模序列元素间无论距离远近的长期依赖。此外,通过引入LECSA机制,LECformer改进传统自注意力机制,有效融合长期依赖与局部上下文特征及多通道重要性,解决现有方法的局限性。LECformer工作流程如下:(1)输入嵌入与位置编码:输入层对多传感器数据进行嵌入并添加位置信息以保留序列顺序。(2)LECSA特征提取:编码层应用LECSA机制提取综合特征,捕获全局与局部依赖及空间相关性。(3)RUL预测:输出层处理提取的特征以预测RUL。下文将详细阐述上述各子结构的具体细节。 图1 所提LECformer的架构3.2 LECformer的输入层如图1所示,采集的多传感器时序数据为 ,其中 表示时间步, 表示传感器数量。输入层主要执行两个功能: (1)嵌入:将输入数据投影至高维空间以捕获更复杂的特征表示。 (2)位置编码:融入位置信息使模型能识别序列元素的顺序。 嵌入过程通过线性投影将输入数据 从原始维度 映射至高维 ,公式如下: 其中 是可学习的嵌入权重矩阵, 是投影后的输入。由于Transformer架构不像RNN那样具备固有序列处理能力,本文融入位置编码为模型提供每个时间步在序列中的位置信息。存在多种位置编码方法,本文采用Vaswani等(2017)的位置编码方式,公式如下: 其中 是时间步的位置索引(取值0至 ), 是维度索引(取值0至 )。位置编码矩阵 通过上述公式生成。序列中每个位置 都有唯一编码,为模型提供元素相对与绝对位置信息。编码层的最终输入通过将位置编码与投影输入相加得到: 其中 将作为编码层的输入。该相加操作使模型在处理输入数据时保留位置信息。通过将位置编码直接融入输入嵌入,LECformer能以位置感知的方式关注序列元素,这对时序顺序至关重要的RUL预测等任务至关重要。3.3 LECformer的编码层LECformer的编码层经过精心设计,增强模型捕获与处理全局长期依赖、局部上下文信息与多通道空间相关性的能力,这些均对精准RUL预测至关重要。如图1所示,编码层包含两个主要子层:LECSA机制与前馈网络(Feed Forward Networks, FFN)。每个子层后均连接残差连接与层归一化,统称为Add & Norm。这些机制有助于缓解深度神经网络训练中的梯度消失等问题,加速模型收敛。编码层可堆叠 层以提取深度退化特征。下文将详细阐述编码层的工作流程。LECSA机制是LECformer编码层的核心,相较标准Transformer使用的传统SA机制实现重大改进。LECSA将卷积操作与线性投影融合,并融入CSA机制以有效建模多传感器通道间的空间相关性。该融合使LECformer能同时捕获全局依赖、增强局部特征提取、建模通道间关系,进而解决基于RNN/CNN方法与传统Transformer的固有局限性。 是LECSA的输入,其基于缩放点积自注意力。传统自注意力中,通过线性映射生成查询(query, )、键(key, )与值(value, )矩阵, 通过点积计算与每个 对的相关性。与SA相比,LECSA通过融合线性投影与卷积操作改进此过程(如图2所示),有效捕获长期依赖的同时增强局部细粒度特征学习能力。首先,通过结合线性投影与卷积从 生成 、 与 ,公式如下: 其中 表示线性投影的可学习参数。 、 与 、 分别表示第 个卷积核的权重矩阵与偏置,其中0<f<c, 表示卷积核数量, 表示卷积核大小。通过该方式, 处理序列中每个点的信息。 与 包含发动机运行过程中的局部变化特征信息。为保证输入输出维度一致,本文对Conv2d操作执行零填充。从图3可观察到,不同传感器的时序数据间存在复杂的空间相关性。高维特征图的每个通道可视为空间关系的表示,不同空间表示相互关联。 图2 传统SA与所提LECSA的对比 图3 所提通道自注意力机制本文设计中,通过卷积操作生成的 与 不仅包含局部区域的退化信息,还包含多通道的空间特征关系。因此,为更好提取不同通道的相关性,本文设计新型CSA机制探索通道间交互。其可使模型自适应对不同通道特征图分配不同注意力,更好地表示 与 以实现最终RUL预测。CSA机制工作流程如图1所示。CSA机制首先将输入 重塑为 ,计算 与其转置的点积(除以 缩放)。随后沿通道方向应用softmax函数得到不同通道的权重信息,公式如下: 其中 表示不同通道间的权重。最后,通过CSA加权的不同通道信息计算为 与 的乘积,公式如下: 其中 。不同颜色的通道表示带不同权重的多传感器序列空间关系。将 重塑为 ,并通过Conv2d输出最终提取的空间关系表示,公式如下: 其中 ,将被重塑为 作为CSA的输出。通过该方式,将 与 输入CSA得到 与 ,公式如下: 其中 与 包含发动机退化的局部变化特征及不同传感器间的空间相关特征,有效提升模型的特征表示能力。随后,对 矩阵中的每个元素,通过 与 的点积计算当前位置与其他局部区域的注意力分数,确定与局部区域的相关性。沿时序维度应用softmax函数得到不同局部区域相对于当前位置的权重,公式如下: 其中 表示学习到的当前位置与局部区域的注意力权重。最后,LECSA的输出计算为 与 的乘积,公式如下: 其中 是LECSA的输出,与输入 维度相同。此外,LECformer融合多头机制,可更全面地分析数据,大幅提升特征提取能力。多头LECSA过程如下: 其中 是多头LECSA的输出, 表示线性投影矩阵参数, 是头数, 。3.4 LECformer的输出层LECformer中,编码层可统一堆叠 层,使模型获取深度特征。提取的这些特征将作为输出层的输入,用于预测RUL。输出层结构包含展平层与两个全连接层(Fully Connected Network, FCN)。这些层内的计算过程如下: 其中 是RUL预测结果,ReLU是激活函数, 与 是可学习参数矩阵。随后,将进行实验分析,以评估LECformer的核心组件及其整体性能。3.5 相较传统Transformer自注意力的优势(1)增强局部特征提取:Transformer中的传统自注意力机制主要通过计算序列中所有位置对的注意力分数捕获全局依赖,但可能忽略对精准建模RUL预测中细粒度退化模式至关重要的局部上下文信息。通过融入卷积操作,LECSA显式捕获局部模式与变化,增强模型学习细节局部特征的能力。(2)建模多通道空间相关性:RUL预测通常涉及来自多个传感器的数据,每个传感器捕获系统状态的不同方面。传统Transformer独立处理每个特征维度,可能忽略不同传感器通道间复杂的空间相关性。LECSA中的CSA机制通过计算跨通道注意力权重有效建模这些空间关系,使模型能动态强调更具信息性的通道,提升特征融合效果。(3)高效捕获长期依赖:尽管Transformer通过自注意力机制天生具备建模长期依赖的能力,结合卷积操作可确保高效捕获全局与局部依赖。该双重能力使LECformer优于传统Transformer,尤其在RUL预测这类需理解整体趋势与局部异常的任务中。4 案例研究1:基于C-MAPSS与N-CMAPSS数据集的实验4.1 数据集描述4.1.1 C-MAPSS数据集商用模块化航空推进系统仿真(Commercial Modular Aero-Propulsion System Simulation, C-MAPSS)(Saxena等,2008)数据集是RUL预测方法性能验证中最常用的数据集之一,根据不同运行条件与故障模式分为FD001–FD004四个子数据集。C-MAPSS数据集的相关细节见Saxena等(2008)。相较于FD001与FD003数据集,FD002与FD004数据集的运行环境更复杂,使RUL预测更具挑战性。每个子数据集均包含训练集与测试集,目标是在训练集上训练模型,预测测试集中每个发动机的RUL。在监测的21个传感器中,7个传感器(编号 1、5、6、10、16、18、19)数值恒定,对预测结果无影响,因此从序列分析中剔除这些传感器的数据。RUL定义为发动机发生故障前的剩余运行周期数。值得注意的是,发动机在出现故障前通常经历稳定运行阶段。为与其他方法标准化对比(Song等,2020;Li等,2018),本研究将最大RUL值设为 125,超过该值则认为发动机进入退化阶段。4.1.2 N-CMAPSS数据集N-CMAPSS(Arias Chao等,2021)数据集更详细精准地描述运行条件,贴近涡扇发动机的实际退化过程。因此,N-CMAPSS对RUL预测任务提出更大挑战,是评估RUL预测方法泛化性与鲁棒性的理想基准。本文选取N-CMAPSS数据集中的DS02子数据集评估所提LECformer的性能。DS02子数据集包含来自不同涡扇发动机的数百万条退化轨迹,每个发动机具有独特初始条件,详情见表1。实验中,按照Ren等(2023)的建议,以0.001Hz的速率对DS02进行下采样。DS02数据集中采集的多传感器数据包括14个实测传感器信号、2个虚拟传感器信号与4个场景描述符,具体细节见Arias Chao等(2021)。表1 N-CMAPSS中DS02数据集的描述 重要的是,C-MAPSS与N-CMAPSS数据集包含各类噪声与异常值,模拟实际运行条件。这些干扰可能来自传感器误差、环境因素与意外运行异常,在实际场景中频繁发生。此类噪声与异常值的存在是对所提模型的关键测试,考验RUL预测的鲁棒性与可靠性。通过在该数据集上训练与评估模型,可有效评估模型过滤无关数据、在干扰因素下保持精准预测的能力。这使C-MAPSS与N-CMAPSS数据集在展示模型处理非理想实际数据的适应性与鲁棒性方面极具价值。4.2 实验设置4.2.1 数据预处理输入数据为多传感器时序数据,每个数据具有不同单位与尺度,可能增加模型训练难度。为解决该问题,本文采用最小-最大归一化(min–max normalization)(Ding等,2022)预处理采集的数据 。第 个传感器的时序数据记为 ,归一化公式如下: 其中 与 分别表示 中的最大值与最小值。该归一化过程确保采集数据的数值缩放至0到1区间。随后,本文采用滑动时间窗(Zhang等,2022)方法处理归一化后的多传感器数据,该方法常用于时序数据分割。滑动时间窗的操作如图4所示。滑动时间窗大小记为 ,滑动步长固定为1。当前时间窗内的最后一个时间步指定为RUL标签,其计算方式如下: 其中 表示发动机故障的周期数, 表示当前周期数。 图4 滑动时间窗的操作过程4.2.2 评估指标本研究采用三个关键评估指标确定所提方法的有效性。第一个是广泛使用的均方根误差(Root Mean Square Error, RMSE)函数,另外两个是评分(Score)与修正评分(Score )函数(Saxena与Goebel,2008)。与RMSE不同,Score函数对预测RUL超过实际RUL的情况施加更严重的惩罚,这符合实际中延迟预测可能导致更严重后果的情况,公式如下: 其中 表示样本总数, 与 分别是预测与实际RUL值。为抵消不同划分方式的差异(Ren等,2023;Tian等,2023),本文N-CMAPSS数据集定义 。实验中,RMSE、Score与 数值越低,表示预测精度与性能越好。4.2.3 实验设置训练阶段采用 Adam 优化器,总训练轮次(epoch)设为 150。为降低过拟合风险,采用早停策略,耐心值设为 20 个轮次。训练数据集按20%验证集、80%实际训练集划分。批大小设为256,损失函数采用均方误差(Mean Square Error, MSE)函数。FD001与FD003数据集的学习率设为0.001;FD002、FD004与DS02数据集的学习率设为0.0005。全连接层采用dropout技术,丢弃率为0.3。通过网格搜索确定LECformer结构的最优配置,如表2所示。为更好验证LECformer的泛化性能,本文在C-MAPSS数据集上确定LECformer的模型参数,并将相同结构参数应用于N-CMAPSS实验。为降低随机性影响,所有实验重复十次,计算平均性能作为最终实验结果。表2 LECformer的实验参数设置 4.3 实验分析本节全面分析LECformer的各方面性能,包括滑动时间窗大小的影响、核心组件分析、与其他方法的对比分析。此外,提供学习到的注意力权重可视化,深入理解模型的决策过程,突出预测RUL中 特定特征的重要性。通过详细分析,本文旨在凸显LECformer框架的优势与潜在改进方向,为预测性维护技术的未来发展奠定基础。4.3.1 滑动时间窗大小的影响选择合适的滑动时间窗大小对实验至关重要。时间窗过大可能包含无关信息,降低预测速度;时间窗过小可能导致模型缺乏多传感器时序数据的有用信息,降低预测性能。为验证该参数的影响,本文在四个数据集上采用不同窗大小开展实验,结果如图5所示。可观察到,FD001与FD003数据集在w=40时RMSE与Score值最小,FD002与FD004数据集在w=70时数值最小。该观察结果与C-MAPSS数据集的分析一致,即FD002与FD004发动机的RUL预测比FD001与FD003更困难。因此,更大的窗大小更有利,可包含更多退化信息。据此,DS02数据集的窗大小设为70,与FD002与FD004设置一致。后续实验将采用该选定窗大小。 图5 不同滑动时间窗大小下LECformer的性能4.3.2 LECformer的预测性能分析为更全面分析所提LECformer的预测能力,从 FD001–FD004 数据集的测试集中随机选取一台发动机,预测其全生命周期运行至故障过程的 RUL。同时,为验证所提深度架构的有效性,将LECformer与三种代表性深度网络架构对比,包括基于深度 LSTM 的架构(双向LSTM(BiLSTM)(Wang等,2018))、基于深度CNN(DeepCNN,DCNN)的架构(Li等,2018)与基于深度Transformer的架构(双视角自注意力 Transformer(DAST)(Zhang等,2022))。如图6所示,实验结果表明,与其他方法相比,LECformer更贴近发动机实际RUL轨迹。此外,尽管复杂故障模式与运行条件使FD002与FD004发动机预测更具挑战性,LECformer仍保持良好的预测精度。此外,DS02测试集上发动机单元11、14、15的预测结果如图7所示。可看出,尽管模型结构基于C-MAPSS数据集选定,LECformer在DS02数据集上仍展现出优异的预测结果,验证了其出色的泛化性能。实际应用中,维护人员可根据实时预测RUL制定更合理的维护计划。 图6 FD001-FD004上的预测结果 图7 DS02上的发动机单元11、14和15的预测结果4.3.3 与当前最优方法对比为全面评估所提LECformer的性能,本文在相同案例研究中将其与多种当前最优 RUL 预测方法基准测试。对比方法包括纯基于RNN/CNN的方法(DCNN(Li等,2018)、BiLSTM(Wang等,2018)与混合CNN-W(Wen等,2023));此外,还考虑融合RNN/CNN与注意力机制的方法,包括分布式注意力时序卷积网络(DA-TCN)(Song等,2020)、注意力门控CNN(AGCNN)(Liu等,2020a)与双注意力 Transformer(DA-Transformer)(Liu等,2022);对比分析还包括纯基于 Transformer 自注意力机制的方法,即多尺度集成深度自注意力网络(MSIDSN)(Zhao等,2023)、距离自注意力网络(DSAN)(Xia等,2022)、DAST(Zhang 等人,2022)、动态长度 Transformer(DLformer)(Ren 等人,2023)、集成多头双稀疏自注意力网络(DSSN)(Zhang等,2023)与遗传算法优化Transformer(GA-Transformer)(Mo与Iacca,2023)。不同模型的选择可全面评估LECformer的相对性能,为其在 RUL 预测中的有效性提供有价值参考。表3与表4展示C-MAPSS数据集与DS02数据集的性能对比实验结果。显然,与其他方法相比,LECformer展现出最佳预测性能,尤其在具有挑战性的FD002与FD004数据集上。这表明LECformer能更好应对复杂环境下的预测任务。值得注意的是,LECformer在Score指标上提升更显著,体现其在实际应用中的优势。与基于RNN/CNN框架的预测方法相比,LECformer采用Transformer架构提升捕获序列单元间长期依赖信息的能力。与传统基于自注意力的方法相比,LECformer提出新型LECSA机制替代自注意力,可自适应融合局部上下文信息与全局依赖及多传感器空间相关特征,提升模型预测性能。综上,上述结果与讨论表明,所提LECformer具备出色的多传感器时序数据建模能力。表3 C-MAPSS数据集上与先进方法的对比结果 表4 DS02数据集上的对比结果 4.3.4 与Transformer变体对比本节开展多项实验,将所提LECformer与三种时序领域代表性Transformer变体(Wu等,2020;Kitaev等,2020;Zhou等,2021)的性能对比。由于这些Transformer 变体最初为时序预测设计,而非直接应用于RUL预测,本文将其核心组件用于特征提取任务。提取的特征随后通过LECformer的统一输出层处理,得到最终RUL预测。该方式可在RUL预测特定场景下重点对比 Transformer变体的特征提取效率,凸显LECformer在提升预测精度方面的独特 贡献。深度Transformer(Deep Transformer)(Wu等,2020)采用传统自注意力架构;Reformer(Kitaev 等,2020)采用局部敏感哈希自注意力替代传统自注意力;Informer(Zhou等,2021)采用概率稀疏自注意力与蒸馏操作。实验设置与LECformer保持一致。C-MAPSS与N-CMAPSS数据集的实验结果如表5所示,表明LECformer具有更优的预测性能。不同基于Transformer 变体在DS02数据集上的预测结果如图7所示。从结果可观察到,LECformer的预测误差显著小于其他几种基于Transformer的方法。与其他自注意力变体相比,LECSA在同时从多传感器数据中提取长期依赖、局部上下文信息与空间相关特征方面表现更出色。因此,LECformer在RUL预测任务中表现更优。表5 和Transformer变体的对比结果 4.3.5 LECformer消融实验为验证所提LECformer核心组件的有效性,本文开展消融实验,包括LECformer、无局部增强的LECformer(LECformer w/o Local)、无CSA的LECformer(LECformer w/o CSA)、采用自注意力机制的传统Transformer。无局部增强或CSA的LECformer分别表示LECformer中不使用局部增强或CSA。传统Transformer与LECformer的区别在于采用传统自注意力机制。消融实验结果如表6所示。显然,在对比模型架构中,LECformer的RMSE与Score值最低,表明预测性能最优。可看出,移除局部增强或CSA后,预测性能显著下降,说明发动机的局部上下文特征与不同传感器间的空间相关特征对RUL预测同样具有重要价值。此外,LECformer的预测性能显著优于传统Transformer,表明所提LECSA机制相较于传统自注意力机制在RUL预测中更有效。传统Transformer架构采用点积注意力逐点计算每个时间步的相关性,更易受噪声与异常值影响。同时,LECformer中的LECSA机制可直接替代传统Transformer中的自注意力机制,展现出良好的实用性。表6 消融实验结果 4.3.6 模型复杂度与预测效率分析为更好分析所提方法的效率,本文对比多种代表性深度预测方法,包括基于Transformer的架构(深度Transformer(Wu等,2020)、DA-Transformer(Liu 等,2022)与DSSN(Zhang等,2023))、基于RNN的架构与基于CNN的架构(DCNN(Li等,2018))。结果如表7所示。DCNN 的复杂度主要由卷积操作决定,复杂度为 ,其中n是序列长度(输入标记数量), 是特征向量维度, 是卷积核大小。BiLSTM的复杂度主要由时序处理单元决定,复杂度为 ,其中 是隐藏状态维度。深度Transformer(Wu等,2020)的复杂度为 ,主要来自自注意力机制,导致序列的二次复杂度。DSSN(Zhang等,2023)的复杂度为 ,采用稀疏特征向量生成方法降低复杂度。DA-Transformer(Liu等,2022)与LECformer的复杂度为 ,其中 是通道数。通常,最大复杂度为 。可看出,LECformer额外引入与序列长度线性相关的计算复杂度,不会导致模型过度复杂增长。同时,LECformer融入卷积操作与CSA机制,提升模型捕获局部与多通道信息的能力,使RUL预测性能更优。 此外,本文还对比不同深度预测模型的预测时间。实验在相同实验条件下执行,以C-MAPSS的FD001数据集为例。预测时间结果如表7所示。从结果可看出,LECformer在GPU上对全部100台发动机的预测时间为0.057秒,即单台发动机预测时间为0.57毫秒。尽管LECformer单台发动机的预测时间相较传统Transformer有所增加,但可满足 RUL 预测的实时需求。表7 模型复杂度和预测效率的对比 4.3.7 学习到的LECSA权重可视化所提LECformer不仅能有效提取序列单元间的长期依赖,还能增强模型学习局部细粒度特征的能力。此外,其内部CSA机制可动态建模不同通道间的空间相关关系。为更好分析该特性,以FD001数据集的发动机单元34为例,可视化最后一个运行周期中LECSA与CSA组件学习到的注意力权重。学习到的注意力权重分布如图8所示,颜色越深表示权重值越高、相关性越强。LECSA中学习到的全局与局部注意力权重分布如图 8(a)所示,第i行第j列表示第i个时间步与第j个局部区域的相关程度。显著的是,可观察到LECSA机制使输入位置可与任意局部区域相关,无需考虑它们之间的距离。此外,某些颜色更深、有时位于远离当前位置的局部区域表明,LECformer具备有效识别长距离依赖信息的能力。图 8(b)中,不同颜色表示不同通道间的空间相关性。高维特征的每个通道映射可视为不同传感器间空间关联的表示。可看出,LECformer能动态提取空间相关特征,自适应关注通道信息,显著提升特征表示与模型预测性能。 图8 学习到的注意力权重可视化5 案例研究2:基于FEMTO轴承数据集的实验5.1 FEMTO轴承数据集描述为验证所提LECformer在实际设备中的有效性,采用FEMTO轴承数据集开展实验验证,该数据集源自加速退化PRONOSTIA平台(Nectoux等,2012),如图9所示。PRONOSTIA平台旨在真实反映轴承全生命周期的渐进退化过程。该数据集包含三种不同运行条件下17个轴承的运行至故障振动信号数据,详情见表 8。振动信号采样频率为25.6kHz,每10秒采集2560个数据点。本研究采用所有运行条件的训练数据训练LECformer,预测测试集中所有轴承的RUL。特别地,仅采用水平振动信号进行分析。这是因为水平振动信号比垂直振动信号包含更多与RUL预测相关的信息(Ren 等,2022)。 图9 用于轴承加速退化的PRONOSTIA平台表8 轴承数据集描述 5.2 实验设置5.2.1 轴承振动信号处理本节仅对原始振动信号采用快速傅里叶变换(Fast Fourier Transform, FFT)获取频谱特征信息,不采用复杂信号处理方法。随后,按频率范围求和能量得到一组频域特征。频率范围设为64,得到20个频域特征。经FFT变换后的振动信号数据采用与案例1相同的数据归一化与滑动时间窗处理。RUL标签归一化至0到1区间,作为轴承健康状态指标。该归一化方案中,0表示故障状态,1表示完全健康、无退化状态。该归一化过程更直观地反映轴承随时间的状态,便于直接应用预测模型评估健康退化与预测即将发生的故障。确定频谱特征与对应RUL标签后,可构建基于LECformer的深度 RUL 预测模型。5.2.2 评估指标采用三个广泛使用的指标评估性能。其中两个是知名的RMSE与平均绝对误差(Mean Absolute Error, MAE),另一个是修正评分 函数(Nectoux等,2012),已被众多研究者采用,定义如下: 其中 表示轴承总数, 与 分别表示每个轴承的实际与预测 RUL。 与C-MAPSS数据集中的 函数(Saxena与Goebel,2008)不同,数值越大表示预测性能越好。5.2.3 超参数设置训练阶段采用 MSE 损失函数与Adam优化器促进网络学习。最大轮次设为100,学习率配置为0.0005。数据按8:2划分为训练集与验证集,采用dropout率0.3降低过拟合风险。通过大量不同窗大小实验,确定滑动时间窗大小为10最优。LECformer的参数配置与C-MAPSS数据集实验一致,如表2所示。5.3 LECformer预测结果分析本节评估所提LECformer用于轴承退化RUL预测的性能。本文开展多项轴承预测实验以展示其有效性。选取三种运行条件下的所有测试轴承,预测其从健康到故障的RUL。采用三种代表性方法对比,包括基于RNN的架构(BiLSTM(Wang等,2018))、基于CNN的架构(DCNN(Li等,2018))与基于Transformer的架构(DAST(Zhang等,2022))。测试数据的RUL预测结果如图10所示。预测结果表明,所提 LECformer 能很好地预测轴承退化趋势。值得注意的是,尽管LECformer的预测值与实际RUL值非常接近,但在真实RUL值附近存在一定波动。这些结果凸显模型有效捕获与预测轴承随时间退化的能力,尽管精度因案例不同略有差异。与其他三种代表性深度预测方法相比,本文LECformer在不同运行条件下均具备良好预测性能,证明其有效捕获不同退化模式的能力。此外,LECformer提供的RUL预测值大多接近或小于真实RUL值。该特性具有优势,因为高估RUL可能比低估带来更严重的后果。实验结果表明,LECformer可很好地应用于从轴承振动信号中提取退化特征信息,执行实时 RUL 预测,在工程领域具有良好应用前景。 图10 不同方法在测试轴承上的预测结果比较5.4 与当前最优方法对比为进一步验证所提LECformer在轴承振动信号上的RUL预测性能,本文在该预测问题上实现不同当前最优方法进行对比。这些预测方法包括:基于RNN/CNN的方法(BiLSTM(Wang等,2018)与 DCNN(Li等,2018))、纯基于Transformer的方法(DAST(Zhang等,2022))与融合RNN/CNN与Transformer的方法(卷积Transformer(CoT)(Ding与Jia,2021)与注意力双向LSTM(A-BiLSTM)(Rathore与Harsha,2022))。预测结果如表9所示。LECformer在大多数轴承上显著优于对比方法,实现最高的平均预测性能。具体而言,LECformer的预测精度大幅提升,与现有当前最优模型相比,平均RMSE降低41.7%,平均MAE降低 33.4%, 指标提升22.2%。值得注意的是,作为预测性能实际衡量指标的 凸显了LECformer的优越性,证明其在该关键方面的显著优势。总体而言,LECformer展现出强大的复杂振动信号建模能力,凸显其在高精度、高可靠预测轴承RUL方面的有效性。6 讨论本研究展示的实验结果全面证实了所提LECformer模型在多个基准数据集(包括C-MAPSS、N-CMAPSS与FEMTO数据集)的RUL预测中具有优越性能。这些结果与本文初始研究目标高度契合,即开发一种新型基于Transformer的架构,能有效捕获全局依赖与局部上下文信息,同时建模多传感器通道间的空间相关性。LECformer在所有评估数据集上始终优于现有当前最优方法。具体而言,在 C-MAPSS 数据集(FD001–FD004)中,与DCNN、BiLSTM 及各类基于Transformer的基线模型相比,LECformer实现最低的RMSE与Score指标。该提升凸显LECformer通过有效融合长期依赖与局部特征提取,精准预测RUL的能力增强。类似地,在N-CMAPSS(DS02)数据集上,LECformer的RMSE与Score指标大幅降低,凸显其在更复杂运行环境中的鲁棒性与泛化能力。消融实验进一步验证LECformer核心组件的有效性。移除LECSA或CSA机制均导致预测性能显著下降,表现为RMSE与Score值升高。此外,学习到的注意力权重可视化表明LECformer能动态优先关注相关时序与空间特征,进而提升预测精度。尽管LECformer因融入卷积操作与CSA机制引入额外计算复杂度,模型仍足够高效以满足实时应用需求。单台发动机约0.57毫秒的预测时间完全符合实时RUL预测的要求。最后,LECformer成功应用于FEMTO轴承数据集(涵盖不同运行条件下的实际轴承退化),证明模型的泛化能力。LECformer在不同轴承与运行设置下保持高预测精度,展现其在多样工业环境中的适应性与有效性。尽管具备优势,LECformer存在一定局限性。因融入卷积操作与注意力机制导致计算复杂度增加,可能对资源受限环境或需实时处理的应用部署带来挑战。此外,模型性能高度依赖大量高质量多传感器数据的可用性,而实际场景中并非总能获取。LECformer在完全新型设备类型或训练数据中未出现的未知故障模式上的泛化能力也存在潜在局限性。未来工作将聚焦于优化模型计算效率,探索数据增强与迁移学习技术提升适应性,改进模型鲁棒性与可解释性,以促进在多样工业环境中的更广泛应用。7 结论深度学习方法因擅长处理多传感器工业时序数据,被广泛应用于RUL预测。但现有模型通常难以同时提取全局与局部特征,无法有效建模多传感器间的空间相关性。为解决上述问题,本文提出LECformer,一种专为工业RUL预测设计的新型基于Transformer的架构。与传统基于RNN/CNN的方法不同,LECformer利用Transformer捕获序列数据中长期依赖的能力。相较于原生Transformer,LECformer采用LECSA机制替代线性逐点点积自注意力,融合线性投影与卷积操作,更好地捕获长期依赖与更精细的局部特征。此外,LECformer中的CSA机制动态优先考虑不同通道的重要性,优化特征融合。本文通过一系列消融实验严格验证LECformer的有效性。在C-MAPSS、N-CMAPSS与FEMTO数据集上的大量实验表明,LECformer始终优于现有当前最优方法,在RUL预测中实现更优精度与可靠性。未来工作将探索将LECformer与迁移学习和数据增强技术融合,进一步提升其在多样RUL预测场景中的适应性与性能。 编辑:陈宇航校核:李正平、陈凯歌、曹希铭、赵学功、白亮、任超、海洋、赵栓栓、Kira、Tina、王金、赵诚、肖鑫鑫、张优该文资料搜集自网络,仅用作学术分享,不做商业用途,若侵权,后台联系小编进行删除来源:故障诊断与python学习

未登录
还没有评论
课程
培训
服务
行家
VIP会员 学习计划 福利任务
下载APP
联系我们
帮助与反馈