首页/文章/ 详情

中科院一区Top论文学习|传感器感知胶囊网络:面向可信的多传感器融合剩余使用寿命预测

5月前浏览1148

本期给大家推荐传感器感知胶囊网络:面向可信的多传感器融合剩余使用寿命预测在工业预测与健康管理领域,基于深度学习与多传感器数据融合的剩余使用寿命预测技术,因能更全面捕捉机械设备的退化过程而备受关注。然而,现有研究多聚焦于预测精度的提升,对模型可信性,尤其是含不确定性感知的预测合理性及可解释性的重视仍显不足。为解决这一问题,最新研究提出了一种名为传感器感知胶囊神经网络(Sensor-aware Capsule Neural Network, SACN)的新型框架,专门面向多传感器融合场景下的RUL预测任务。该框架不仅通过胶囊网络的动态路由机制增强特征表达能力,还研发了一种基于胶囊激活水平的蒙特卡洛丢弃法,用于实现预测结果的不确定性量化。此外,该方法具备多传感器融合解释能力,可将预测结果及其不确定性归因至各传感器的原始特征,揭示输入与输出之间的关联机制。


论文基本信息

论文题目:Sensor-aware CapsNet: Towards trustworthy multisensory fusion for remaining useful life prediction  

论文期刊:Journal of Manufacturing Systems

Doihttps://doi.org/10.1016/j.jmsy.2023.11.

009

作者:Dongpeng Li (a,b), Jiaxian Chen (a,b), Ruyi Huang *(a,b), Zhuyun Chen (b,c), Weihua Li (b,c)
论文时间: 2024年
机构: 

a: Shien-Ming Wu School of Intelligent Engineering, South China University of Technology, Guangzhou 511442, China 

b: Pazhou Lab, Guangdong Artificial Intelligent and Digital Economy Laboratory, Guangzhou 510335, China 

c: School of Mechanical and Automotive Engineering, South China University of Technology, Guangzhou 510641, China

作者简介:黄如意,香港城市大学博士后研究员,他的研究主要聚焦于人工智能方法在工业设备智能故障诊断与预测中的应用,尤其擅长利用深度学习和迁移学习技术处理复合故障诊断问题。(摘自Researchgate
通讯作者邮箱:huangruyi@scut.edu.cn

摘要

基于深度学习技术的多传感器数据驱动型剩余使用寿命(Remaining Useful Life, RUL)预测因能更全面捕捉机械设备的退化过程而愈发受到关注,其预测性能通常也更优。然而,现有研究对提升模型的可信性重视不足,尤其是在含不确定性感知的预测中,模型的合理性与可解释性方面的研究较为欠缺。为解决这一问题,本文提出一种名为传感器感知胶囊神经网络(Sensor-aware Capsule Neural Network, SACN)的新型框架,用于RUL预测中的多传感器融合任务。同时,研发了一种基于胶囊激活水平、结合蒙特卡洛方法的新型丢弃法,实现不确定性量化。此外,该方法还支持多传感器融合解释,能将预测结果和不确定性归因于各传感器的相关特征。在C-MAPSS数据集上的案例研究表明,所提方法的性能优于主流的深度学习方法。具体而言,通过传统精度指标和本文提出的不确定性覆盖分数评估发现,基于胶囊丢弃法的SACN在预测精度和合理性上均优于高斯丢弃法;同时,可通过多传感器融合解释揭示输入特征与最终预测结果之间的关联,量化每个传感器对给定输入的贡献度。

关键词剩余使用寿命预测;可信人工智能;多传感器融合;不确定性量化;胶囊神经网络

目录

1 引言

2 基础理论

2.1 结合期望最大化路由的胶囊网络

2.2 多头注意力机制

3 方法

3.1 问题定义

3.2 传感器级注意力封装

3.3 基于胶囊的预测

3.4 基于胶囊丢弃法的不确定性估计

3.5 多传感器融合解释

4 实验研究

4.1 数据集

4.2 数据预处理与实验设置

4.3 实验结果

4.4 不确定性与解释性分析

结论与未来展望

1 引言

故障预测与健康管理(Prognostics and Health Management, PHM)是一种预测性维护技术[1, 2],旨在革新设备维护保障模式,提升机械运行的安全性。其中,剩余使用寿命预测(Remaining Useful Life, RUL)是预测技术中最具挑战性的核心环节[3]。该技术基于传感器监测数据、设备运行环境,亦可结合物理模型或其他信息,预测设备未来的故障发生时间。借助涡轮风扇发动机、齿轮箱等关键工业设备的RUL预测结果,可及时制定设备运行计划和维护方案,从而避免突发事故的发生。

RUL预测的研究方法主要分为三类:基于物理模型的方法、数据驱动的方法以及二者的融合方法[4]。基于物理模型的方法需要大量先验知识,对于涡轮风扇发动机这类复杂结构,其模型构建难度大,实际应用可行性较低[5, 6]。而数据驱动的方法则利用监测数据,通过线性或非线性方式捕捉设备固有的退化规律并拟合模型,这类方法对先验知识的需求较少,还可进一步细分为基于随机过程的方法、基于传统机器学习的方法和基于深度学习的方法。基于随机过程的方法将传感器数据拟合成维纳过程、伽马过程、逆高斯过程等随机过程模型,以此估算机械设备的RUL;基于机器学习的方法无需将数据拟合至随机过程模型即可实现RUL估算,但需要进行特征提取与选择,以保证预测性能。

过去数十年间,深度学习技术的出现为PHM领域中直接将监测数据映射至最终预测结果提供了可行方案[7, 8],越来越多的研究开始融合压力、温度、振动等多传感器数据来评估设备健康状态。多传感器数据能从多个维度反映设备的退化特征,进而提升预测的准确性[9, 10]。Zhang等[11]通过感知从传感器数据中提取健康指标,并利用长短期记忆网络(Long Short Term Memory, LSTM)追踪设备历史退化规律,实现对未来健康状态的预测;Aydemir等[12]提出了一种异常触发的RUL预测方案,采用软多数投票法实现传感器融合。近年来,部分学者将胶囊网络应用于PHM领域[13, 14]。Andreas等[15]首次将胶囊网络用于RUL预测,取得了当前最优的性能;Li等[16]提出了一种基于胶囊网络的多模态数据融合框架,用于涡轮风扇发动机的RUL估算,该框架按模态提取监测数据特征,并在胶囊层直接实现特征融合,最终依据最后一层胶囊姿态矩阵的欧几里得范数得到模型预测结果。

尽管基于深度学习的方法在RUL推断中被证实能实现较高的预测精度,但其 “黑箱” 特性导致的不可解释性,阻碍了该类方法在实际工业场景中的进一步应用。为此,众多学者开展了提升模型可信性的相关研究[17]。

提升模型可信性的一种实用方法是实现含不确定性感知的预测,即量化模型对给定输入的不确定性程度[18]。目前已有多种方法可实现特定输入下的不确定性量化,包括蒙特卡洛丢弃法[19]、局部不确定性估计模型[20]、自助法[21]以及上下界估计法[22]等。She等[23]基于自助法提出了双向门控循环单元(Bidirectional Gated Recurrent Unit, BiGRU)方法,获取RUL的置信区间,该方法能有效利用机械设备的历史和未来退化状态。此外,也有研究聚焦于RUL预测的不确定性从部件级向系统级的传播,以及基于不同系统架构的系统可靠性评估[24]。

同时,学者们还尝试将领域知识嵌入模型框架,或挖掘与最终预测结果相关的关键特征[25]。例如,Li等[26]将传感器间的关联关系表示为流程图,并转化为嵌入向量进行聚类,利用聚类结果指导传感器数据的排列,提升模型的透明性;Xiong等[27]提出了一种集成物理信息故障模式识别器的RUL预测框架,该框架便于融合与故障相关的特征,实验结果表明,该模型不仅能实现准确的故障模式识别,还具备一定的层级可解释性;Wang等[28]通过事后解释技术解析设备健康状态模型,并将得到的洞察用于指导模型训练。

现有文献主要从不确定性量化、嵌入领域知识或挖掘推理依据以提升可解释性这两个独立方面开展研究,构建可信的RUL预测模型,但仍存在一些研究空白亟待填补:(1)现有方法仅能对输出结果进行不确定性量化,无法揭示输入数据中不确定性的来源,在多传感器融合场景中尤为明显,因此无法明确输入的具体部分对预测不确定性的贡献;(2)现有研究极少探讨估算置信区间的合理性,这可能导致得到不合理的含不确定性感知的预测结果。如图1所示,合理性指模型能感知自身对预测值的不确定程度。例如,图1中案例3和案例4的模型均对预测值表现出高置信度,但案例4的预测值与真实值存在显著偏差,该结果缺乏合理性,可能误导决策者制定不当的维护计划。

 

图1 RUL不确定性量化中的合理性

为解决上述问题,本文研发了一种新型的统一框架——传感器感知胶囊网络(Sensor-aware Capsule Neural Network, SACN),用于实现可信的RUL估算,该框架可完成多传感器融合解释,并对预测结果的不确定性进行合理量化。具体而言,本文设计了传感器级注意力封装模块和基于胶囊的预测模块,融合多传感器监测数据以推断RUL值;在模型的训练和测试阶段,执行基于激活水平的胶囊丢弃法,结合先验知识得到更合理的置信区间,并通过提出的不确定性覆盖分数(Uncertainty Coverage Score, UCS)对置信区间的合理性进行对比评估;最后,基于胶囊网络[29]固有的可解释性,并受贝叶斯神经网络[30]解释思路的启发,提出多传感器融合解释方法,将含不确定性感知的预测结果转化为多传感器特征的贡献度和不确定性。本文的主要贡献总结如下:    

(1)提出SACN,以统一的方式实现可信的RUL推断,将多传感器融合解释与合理的不确定性估计有机结合,输出兼具可解释性和不确定性感知的预测结果。    

(2)基于SACN的层级结构,设计了一种结合反向追溯的多传感器融合解释分析方法,揭示各传感器特征的贡献度和不确定性。    

(3)考虑预测偏差和评估得到的不确定性,提出UCS这一指标,用于评估RUL值置信区间的合理性。    

(4)提出基于胶囊激活值的胶囊丢弃法,实现不确定性估计,该方法在含不确定性感知的RUL预测中,在精度和合理性上均表现出优势。    

本文的后续结构安排如下:第2节介绍本文所用的胶囊网络基础理论以及不确定性估计的合理性相关概念;第3节详细阐述所提方法;第4节以涡轮风扇发动机数据集为研究对象开展案例研究;最后,第5节给出研究结论与未来展望。

2 基础理论

2.1 结合期望最大化路由的胶囊网络

胶囊网络最初被提出用于捕捉图像中的空间关联关系,在处理视角变化识别和目标解耦任务时表现出良好的鲁棒性[31]。胶囊网络的建模灵感源于人类的视觉认知机制:人类仅通过一次观察,就能不受视角变化影响识别目标的外观,这是因为人类能为观察到的目标建立坐标系,并将目标的高层特征解耦为底层组成部分。在胶囊网络中,这种部分-整体的关联关系通过多层胶囊进行建模,上层胶囊由下层胶囊通过所谓的“协议路由”过程生成,最后一层胶囊则用于编码观测数据的高级特征,即神经网络通过该层胶囊实现预测。    

胶囊网络模型的实现主要分为两个基本步骤:封装和路由。在封装步骤中,先对输入数据进行预处理,生成初级胶囊层;随后,在每一层胶囊中执行路由过程,通过寻找下层胶囊投票结果之间的一致性,生成更高级的胶囊。在介绍具体的过程和算法前,先对胶囊网络的相关符号总结如下

 

本文采用期望最大化(ExpectationMaximizationEM)路由作为高层胶囊的推理算法[32]。与上述基本步骤类似,在封装步骤中,分别通过传统卷积操作从先前的特征图中生成姿态矩阵和激活值。在期望最大化路由过程中,通过迭代执行期望最大化算法,将下层胶囊的投票值V聚类为高斯混合分布,以此构建部分-整体的关联关系,每个高斯分布对应一个特定的高层胶囊,下层胶囊的激活值则代表其特征强度。关于期望最大化路由的详细过程,可参考下文总结的算法1[32]

 

2.2 多头注意力机制    

多头注意力机制最早文献[33]提出,该机制通过查询向量和一系列键-值向量对生成注意力向量,输出向量则由值向量的加权和得到。加权系数通过查询向量与键向量的缩放点积计算得到;当查询、键、值向量属于同一序列时,该机制被称为自注意力机制。    

多头自注意力层首先通过不同的线性投影矩阵,将维度为    的输入矩阵映射为h组矩阵,每组矩阵包含查询矩阵Q、键矩阵K和值矩阵V三个不同矩阵,其中查询矩阵Q和键矩阵K的维度为    ,值矩阵V的维度为    。随后,对h组矩阵分别执行如公式(1)所示的自注意力操作。最后,将自注意力操作得到的h个输出矩阵拼接为维度为    的输出矩阵R,如公式(2)所示。

         

其中,线性映射矩阵    的维度为    。需要说明的是,注意力分数通过      函数计算得到,这意味着输入元素之间存在竞争关系,只有对模型性能贡献更大的元素会获得更高的注意力分数。

3 方法

本节首先明确研究问题的数学定义,随后详细阐述所提的SACN,该网络由传感器级注意力封装模块和基于胶囊的预测模块组成,最后进一步说明基于胶囊丢弃法的不确定性量化方法和多传感器融合解释方法。

3.1 问题定义

本文的研究核心为基于多传感器监测数据的RUL预测问题。具体而言,将数据集表示为D={x(t),y(t)∣t=w,(w+1),...,L},其中x(t)为t时刻处的滑动窗口输入特征(窗口长度设为w),y(t)为t时刻的RUL值,L为设备全生命周期的长度。输入特征可进一步表示为s个传感器监测数据的拼接,即每个滑动窗口输入为一个二维矩阵,形式如下:

     

神经网络的训练目标为学习非线性映射关系    ,使得预测值    ,从而基于实时监测数据实现RUL的预测。

3.2 传感器级注意力封装

设计传感器级注意力封装模块,对多传感器输入进行按传感器的独立处理,增强提取到的特征,以实现多传感器监测数据的差异化区分。该封装模块的处理流程如图2底部所示。

 

图2 所提SACN概览    

如图2所示,输入数据的维度为      ,分别代表输入通道数、窗口长度和传感器数量。首先,通过残差卷积块提取每个传感器的高维特征,本文中所有残差卷积核均设计为一维,并沿时间维度滑动。此外,为便于后续分组生成姿态矩阵和激活值,将卷积后特征的时间维度尺寸调整为      ,通道数扩展至      。随后,将传感器数量作为序列长度,将特征输入至多个多头注意力层,同时加入残差连接和层归一化操作,避免梯度消失问题[33]。 

为生成初级胶囊,将得到的多源传感器特征分为两个输出分支:一个分支直接将特征分组,生成姿态矩阵;另一个分支通过核大小为      (与姿态矩阵维度一致)的卷积操作,将最后一个维度的尺寸缩小      倍,再分组生成激活值。最后,将生成的姿态矩阵和激活值拼接,得到初级胶囊层。    

3.3 基于胶囊的预测

本文采用胶囊网络捕捉多传感器间的关联关系,同时实现模型的可解释性分析[14]。在封装阶段得到多传感器初级胶囊后,通过期望最大化路由过程融合各传感器的独立特征,该过程如图2右上部分所示。

 在胶囊层之间,下层胶囊通过多次路由迭代生成上层胶囊。首先,将通道数为        的下层胶囊转换为        组,作为生成不同通道上层胶囊的投票值;随后执行期望最大化路由过程,在M步计算分配责任系数,在E步计算姿态矩阵、方差和激活值。

 将最后一层胶囊的数量设为1,即特征图的尺寸和通道数均为1。结合期望最大化路由的基本思想,每个上层胶囊可视为其下层胶囊的均值,其激活值反映了下层胶囊的聚类程度。将最后一层胶囊姿态矩阵的欧几里得范数作为模型输出,该范数代表聚类中心到原点的距离,其物理意义为设备的退化程度。

3.4 基于胶囊丢弃法的不确定性估计

蒙特卡洛丢弃法是一种简便且应用广泛的方法,用于量化大型或复杂神经网络模型预测结果的不确定性,其优化目标本质是最小化近似变分分布与深度高斯过程之间的KL散度[34]。换言之,在模型训练和测试阶段加入丢弃层,从数学角度等价于对网络参数进行变分推理[19]。 为便于阐释胶囊丢弃法,首先介绍如公式(4)所示的高斯丢弃法。高斯丢弃法并非以伯努利分布的方式丢弃神经元,而是从以变分参数      为均值的高斯分布中采样网络权重      ,具体可通过从均值为1、标准差为的高斯分布中采样乘法掩码      实现。其中,                        分别代表第      行、第      列、第      行的所有元素和按元素相乘,      为神经元的丢弃概率。

       

本文中,每一层的胶囊均通过高斯混合建模生成,每个胶囊都带有由输入数据推导得到的固有不确定性,可为蒙特卡洛采样提供先验知识,本文将该方法命名为胶囊丢弃法。对于胶囊的每个姿态矩阵M,其采样过程如公式(5)所示,对姿态矩阵的每个维度从高斯分布中采样,等价于将姿态矩阵与服从      分布的掩码元素      按元素相乘,其中      通过算法1计算得到。实验部分将对比所提胶囊丢弃法与高斯丢弃法的有效性,并定义一个新指标,让评估结果更直观。

     

3.5 多传感器融合解释

本节首先介绍基于胶囊网络固有特性的传感器贡献度解释方法,随后结合基于胶囊丢弃法的不确定性量化方法,详细阐述所提的多传感器融合解释方法。    

胶囊网络本身具备通过反向追溯,揭示路由过程中上层胶囊贡献度的能力[14],该过程需要将下层胶囊的贡献度与期望最大化路由中对应的耦合矩阵    相乘(见算法1)。如图3所示,反向追溯从最后一层胶囊开始,结合耦合矩阵和最后一层胶囊的贡献度(特值设为1),得到高层胶囊层对最后一层胶囊的贡献度;通过类似的追溯过程,可得到初级胶囊层的贡献度,将每个通道的贡献度取均值,即为对应传感器的贡献度。

 

图3 反向追溯以解释传感器贡献

为进一步实现多传感器融合解释,揭示与不确定性相关的传感器贡献度,本文受贝叶斯神经网络解释思路的启发开展研究[30]。在该研究中,Kirill等人提出,可通过聚合蒙特卡洛丢弃法模型所有采样实例的事后解释技术得到的特征归因热力图,实现贝叶斯神经网络的不确定性解释。类似地,本文通过聚合基于胶囊丢弃法的SACN得到的所有传感器贡献度模式,得到与不确定性相关的传感器贡献度,该解释方法即为多传感器融合解释。如图4所示,首先通过蒙特卡洛采样得到N个SACN模型实例,利用这些实例得到N个RUL预测值    ;随后对每个预测结果进行反向追溯,挖掘传感器特征的贡献度;综合所有贡献度模式,可明确多传感器特征中对预测结果贡献最大的部分,以及每个特征对特定预测结果的贡献度不确定性,实验部分将开展进一步分析。

 

图4 基于胶囊丢弃与多传感器融合解释的不确定性量化

4 实验研究

4.1 数据集

本文选用美国国家航空航天局艾姆斯研究中心提供的商用模块化航空推进系统仿真(Commercial Modular Aero-Propulsion System Simulation, C-MAPSS)数据集开展实验[35],该公共数据集被广泛应用于健康指标构建和RUL预测的相关研究,能实现不同方法性能的公平对比。图5展示了 C-MAPSS 数据集中涡轮风扇发动机的仿真模型结构,该模型包含发动机风扇、低压压缩机LPC、高压压缩机HPC、燃烧室、风扇轴(N1)、核心轴(N2)、低压涡轮LPT、高压涡轮HPT和喷管。    

 

图5 发动机的仿真模型结构    

C-MAPSS数据集包含4个子数据集,模拟了涡轮风扇发动机在不同运行工况和故障模式下的传感器数据,数据集的详细描述如表1所示。子数据集FD001和FD002模拟高压增压器性能退化故障,其余两个子数据集则模拟高压压气机性能退化和风扇退化两种故障模式;此外,子数据集FD001和FD003的设备运行工况为1种,其余子数据集的运行工况为6种,因此子数据集FD004的预测难度最大。每个子数据集均包含训练集和测试集:训练集记录了发动机从正常状态到完全故障的每个飞行循环的信息,包括运行工况和传感器数据;测试集仅记录了另一组发动机在特定时间的监测数据,并给出对应的RUL值。传感器数据包含21项传感器测量值,运行工况数据包含高度、马赫数和油门解算器角度三项发动机运行环境参数。    

数据集描述    

 

4.2 数据预处理与实验设置    

4.2.1 数据归一化与标签标注    

由于各传感器的量纲不一致,会影响不同传感器数据之间的可比性和模型的收敛速度,因此需要将传感器数据归一化至[-1,1]区间,本文采用的最小-最大归一化法在该任务中比Z-score归一化法更有效。具体而言,训练数据的归一化计算如公式(6)所示:

     

其中,        分别为第j个传感器归一化前后的训练数据,        为训练数据中第j个传感器在设备全生命周期内的最小值和最大值。 

在实际场景中,无法获取测试设备的全生命周期信息,因此测试数据的归一化以训练数据集的最小值和最大值为先验,计算如公式(7)所示:

     

其中,        分别为第j个传感器归一化前后的测试数据。

在对输入样本进行标签标注时,采用分段函数:在设备初始故障发生前,RUL标签值保持恒定;进入退化阶段后,标签值呈线性下降。与输入数据的处理方式一致,为便于模型训练,对RUL值进行最小-最大归一化处理。    

4.2.2 传感器选择    

在选择网络架构超参数前,首先开展探索性数据分析,结果表明,21项传感器测量值中,部分数据始终保持恒定,直观来看不包含有效信息,即这些数据无法反映发动机的退化状态,应予以剔除。本文根据训练数据的方差进行传感器筛选,剔除方差小于      的传感器数据,仅将有价值的传感器数据作为模型输入。    

4.2.3 实验设置    

神经网络的结构配置如表2所示,列出了每个阶段各层的参数值及对应的输出尺寸;与网络训练相关的其他参数如表3所示。需要说明的是,为提升模型的鲁棒性并减少过拟合,在训练过程中采用添加高斯噪声、随机缩放和随机放大等数据增强手段。

表2 网络结构

 

表3 网络训练超参数设置

 

为验证模型预测结果的有效性和准确性,采用两个常用指标进行评估:均方根误差(RootMeanSquareErrorRMSE)和评分函数(Score),两个指标的数值越小,代表预测性能越好。RMSE广泛应用于大多数回归任务,计算如公式(8)所示:    

其中,    为预测误差。可见,RMSE对迟预测(预测值大于真实值)和早预测(预测值小于真实值)施加相同的惩罚。 与之不同,评分函数通过为迟预测和早预测分配不同的系数,对可能导致设备健康管理滞后的迟预测施加更严厉的惩罚,计算如公式(9)所示:

     

4.3 实验结果    

4.3.1 RUL预测结果    

本节展示4个子数据集的RUL预测结果,直观体现模型性能。图6为4个子数据集中,每个测试发动机最后一个记录时间步的RUL预测结果,横轴(发动机编号)按最后一个记录时间的标签值升序排列。可见,子数据集FD001和FD003的大部分预测值与真实值接近,尤其是记录时间周期较晚的发动机;而FD002和FD004的预测性能相对较差,原因是这两个数据集的运行工况数增至6种,增加了退化相关特征的提取难度。    

 

图6 各子数据集最后记录时间步的RUL预测值    

此外,图7展示了全生命周期的RUL预测结果,从每个数据集中选取2台生命周期记录相对完整的发动机作为示例。总体而言,所有测试发动机的预测曲线均能通过多源监测数据刻画设备的退化趋势。其中,FD001和FD003中发动机的RUL估计值在设备运行初期基本保持恒定,虽存在局部预测波动,但与分段式的RUL标签一致;尤其是在设备接近使用寿命末期时,模型能准确刻画其整体退化过程,这是因为设备的退化规律在该阶段通常会愈发明显。值得注意的是,模型输出的不确定性在预测值接近真实值时通常较小,而在预测值偏离真实值时较大,这为这类关键任务提供了合理且可靠的预测结果。

 
 

图7 各子数据集所选发动机的预测结果    

4.3.2 对比分析    

为验证所提方法的优越性,选取多种基于C-MAPSS数据集的相关预测方法进行对比,结果如表4所示。首先选取经典的深度学习算法,包括卷积神经网络(ConvolutionalNeuralNetwork,CNN)、BiGRU、LSTM等循环神经网络,以及深度置信网络(DeepBeliefNeuralNetwork,DBN);同时选取融合了不确定性量化技术的预测方法进行对比,包括蒙特卡洛模拟法和自助法。需要说明的是,表中各类算法的量化结果均直接引自其原始文献,避免作者为优化所提方法而产生的偏差。表末列出了所提方法分别在加入和未加入胶囊丢弃法(丢弃概率为 0.5)时的实验结果,即基于胶囊丢弃法的SACN (CapsDrop)和SACN。表中每一列的最小指标值以粗体标出。    

表4 在C-MAPSS数据集上与相关预测方法的比较    

 

总体而言,未加入胶囊丢弃法的所提网络在几乎所有子数据集中,两个评估指标均取得最优性能。其中,FD001和FD003的RMSE相较于次优结果,分别提升了13.21%和7.42%;而FD002和FD004的推理性能略优于基于哈密顿蒙特卡洛的卷积神经网络[36],提升幅度分别为2.69%和6.85%。此外,评分函数的结果也呈现出类似的规律。值得注意的是,在丢弃概率p=0.5时,加入胶囊丢弃法的SACN在几乎所有子数据集中的指标值略高,但其在整个训练轮数内的验证损失远低于未加入胶囊丢弃法的模型,稳定性更强。由此可见,所提的SACN在预测精度方面具有有效性。    

4.4 不确定性与解释性分析    

4.4.1 不同丢弃法的对比分析    

本节从预测精度和置信区间合理性两个角度,对比胶囊丢弃法和高斯丢弃法的性能。如表5所示,选取两个子数据集,在不同丢弃概率下,训练并评估基于两种丢弃法的SACN模型。总体而言,基于胶囊丢弃法的不确定性估计性能优于高斯丢弃法,且随着丢弃概率的增大,性能提升的幅度也随之增加。具体在FD001中,即使丢弃概率p达到 0.9,模型的预测精度仍保持在较低的误差水平。    

表5 不同丢弃法的精度对比    

 

在合理性分析方面,由于目前尚无公认的不确定性估计评判标准,本文提出UCS这一新指标。首先,结合绝对误差和68%置信区间,按公式(10)计算不确定性覆盖误差θ

       

随后,受评分函数思想的启发[37],对处于置信区间内θ<0和置信区间外(θ≥0的不确定性覆盖误差进行差异化处理,即对正的      施加更严厉的惩罚,对负的      施加较轻的惩罚。据此,按公式(11)定义UCS:

     

为对比在相同预测精度下,哪种丢弃法能得到更小的UCS(即更合理的预测结果),在每个训练轮数对测试数据集进行评估,得到UCSRMSE的关系,如图8所示。可见,胶囊丢弃法的指数趋势线均低于高斯丢弃法,表明胶囊丢弃法能实现更合理的不确定性建模。    

 

图8 在训练周期中的测试数据集上UCS和RMSE的表现对比

4.4.2 多传感器融合的不确定性解释    

根据第3节提出的反向追溯方法,可揭示传感器特征对预测值的贡献度及其相关的不确定性。因此,本节首先通过分析各传感器特征的影响,验证反向追溯方法的有效性,随后深入探究输入特征与预测结果之间的关联关系。    

为量化特定传感器特征的影响,在模型推理过程中屏蔽该通道的胶囊,计算预测结果与原始RUL值的绝对偏差。图9和图10分别展示了FD001和FD003中传感器特征的影响,每个子图代表一个阶段(40 个时间周期)的平均影响。其中,横轴和纵轴分别为传感器贡献度和其对预测的影响,散点颜色代表传感器贡献度的不确定性,红线为线性回归拟合线。理想情况下,传感器贡献度与其对预测的影响应呈正相关,图中结果总体符合这一规律,验证了反向追溯方法的有效性。但部分散点虽贡献度较低,却对预测产生较大影响,原因是RUL值通过高维空间中的欧几里得范数计算得到,部分贡献度低的特征可能会导致范数发生显著变化。    

 

图9 传感器特性对RUL预测的影响(FD001中的2台发动机)    

 

10 传感器特性对RUL预测的影响(FD003中的2台发动机)    

为探究输入特征与预测不确定性σ之间的关联,将所有时间周期内最终预测结果的标准差与特定传感器特征的标准差绘制成散点图,如图11所示,同时通过高斯过程回归拟合曲线和置信区间。按贡献度从高到低选取3个传感器特征进行分析,每个子图中的三种颜色分别对应这三个特征(蓝色、橙色、绿色)。每个子图的左侧部分显示,RUL预测的不确定性与传感器贡献度的不确定性呈正相关,且二者能明显区分,原因是模型对推理结果的置信度较高;此外,与具有相同预测不确定性水平的其他特征相比,贡献度更高的传感器特征,其自身的不确定性也更大。随着σ的增大,模型对推理结果的置信度降低,传感器特征之间的差异也愈发模糊。综上,多传感器融合解释结果证实,所提的SACN能在实现优秀RUL预测性能的同时,有效融合含不确定性感知的多传感器数据。

 

图11 传感器贡献不确定度与预测不确定度的关系

5 结论与未来展望

本文提出了一种基于多传感器数据驱动的SACN,实现可信的RUL预测。与现有的多传感器融合RUL预测方法相比,该方法取得了具有竞争力的预测精度:在子数据集FD001和FD003中,RMSE分别提升了13.21%和7.42%,而在FD002和FD004中的性能略差。通过传统精度指标和本文提出的UCS评估发现,所提的胶囊丢弃法能在降低预测偏差的同时,实现更合理的不确定性估计。此外,多传感器融合解释方法能揭示输入特征与含置信区间的RUL值之间的关联。但该方法尚未能实现数据层面的归因,即无法揭示监测数据中 特定部件或部分的贡献度。    

在未来的研究中,可将专用建模技术引入特征提取模块,使提取的特征能更透明地与监测数据关联;同时,可进一步探索将设备的物理先验知识与胶囊网络深度融合,提升模型在小样本、跨工况场景下的泛化能力;此外,还可开展RUL预测的不确定性从传感器级到系统级的传播研究,为复杂工业系统的预测性维护提供更全面的决策依据。 

编辑:陈宇航

校核:李正平、陈凯歌曹希铭、赵学功、白亮、任超、海洋、赵栓栓、Kira、Tina、王金、赵诚、肖鑫鑫、张优

该文资料搜集自网络,仅用作学术分享,不做商业用途,若侵权,后台联系小编进行删除

来源:故障诊断与python学习


ACTMechanicalSystemHPC振动疲劳非线性燃烧旋转机械航空航天海洋理论电机数字孪生人工智能
著作权归作者所有,欢迎分享,未经许可,不得转载
首次发布时间:2026-03-25
最近编辑:5月前
故障诊断与python学习
硕士 签名征集中
获赞 87粉丝 152文章 327课程 0
点赞
收藏
作者推荐

中科院一区论文推荐 | 一种适用于时变工况下机械故障迁移诊断的新分布差异度量指标:集成离散流形距离

分布差异度量指标是实现域混淆的核心基础,因此它们在很大程度上决定了深度迁移诊断模型的性能。然而,这些指标的有效性依赖于数据局部分布的稳定性,使其不适用于连续时变工况下的跨域机械诊断任务。本文作者提出一种新的集成离散流形距离,以增强动态数据结构中的差异表征能力,供大家参考学习。论文基本信息论文题目:Integrated-Dispersion Manifold Distance: A New Distribution Discrepancy Metric for Machine Fault Transfer Diagnosis Under Time-Varying Conditions论文期刊:IEEE TRANSACTION ON CYBERNETICS论文日期:2026论文链接:https://doi.org/10.1109/TCYB.2025.3630879 作者:Quan Qian[a,b], Jiusi Zhang[a], Jun Luo[b], and Yi Qin[b]机构:a: the Schoolof Automation Engineering, University of Electronic Science and Technology of China, Chengdu b: the State Key Laboratory ofMechanical Trans mission, College of Mechanical and Vehicle Engineering, Chongqing University, Chongqing 作者简介:钱泉,1998年10月生,重庆巫山人,工学博士,首批中国科协青年人才托举工程博士生专项计划入选者,获宝钢优秀学生奖、国家奖学金、重庆大学在校生最高个人荣誉&quot;学生年度人物&quot;、重庆大学&quot;十佳学术之星&quot;。2016.09-2020.06期间于西南交通大学机械设计制造及其自动化专业学习,获工学学士学位;2020.09-2025.06期间于重庆大学机械电子工程专业学习,获工学博士学位;2025年7月于电子科技大学自动化工程学院任教。 研究兴趣主要包括工业大数据特征挖掘与人工智能、智能故障诊断与预测性维护、电磁微弱信号检测等领域 。主持国家自然科学基金博士生项目、重庆市研究生科研创新项目,参与国家自然科学基金重点项目/面上项目、JKW基础加强项目、华为企业委托横向项目等。以一作/通讯身份在IEEE TNNLS/TCYB/TII/TIE/TS MC/TMECH、MSSP、RESS、EAAI、KBS等领域权威期刊上发表SCI论文中科院一区Top15篇和中科院二区Top1篇,其中入选ESI高被引论文7篇和ESI热点论文3篇,谷歌学术引用1500余次,获IEEE可靠性重庆协会最佳论文奖和川渝科技学术大会优秀论文二等奖。担任IEEE Trans系列与爱思唯尔旗下等60余种期刊审稿人,获《Measurement Science and Technology》期刊杰出审稿人。以第一完成人身份获中国研究生创新实践系列大赛一等奖1项、二等奖3项和三等奖1项。(来源:电子科技大学教师主页) 目录摘要1 引言2 相关工作3 IDMD分布差异度量指标 3.1 问题定义与动机分析 3.2 MELD选择机制 3.3 EGMG度量方法 3.4 算法概述4 实验研究 4.1 MELD选择机制分析 4.2 案例1:实验室时变行星齿轮箱 4.3 案例2:实时时变风力涡轮机轴承 4.4 局限性与未来工作5 结论摘要分布差异度量指标是实现域混淆的核心基础,因此它们在很大程度上决定了深度迁移诊断模型的性能。然而,这些指标的有效性依赖于数据局部分布的稳定性,使其不适用于连续时变工况下的跨域机械诊断任务。为此,本文提出一种新的集成离散流形距离(Integrated-Dispersion Manifold Distance,IDMD),以增强动态数据结构中的差异表征能力。设计基于最大熵的局部分布(Maximum Entropy-based Local Distribution,MELD)选择机制,自适应地表征时变监测信号的全局分布信息;此外,构建集成格拉斯曼流形测地线(Ensemble Grass mann Manifold Geodesic, EGMG)度量方法,以表征高维数据复杂非线性结构所导致的内在分布差异信息。通过在时变工况下的两个故障迁移诊断实验(包括实验室行星齿轮箱和实际风力发电机轴承)对所提出的 IDMD 分布差异度量指标进行验证,实验结果表明其相较于现有先进方法具有有效性和优越性。 关键词:分布差异;故障诊断;时变工况;迁移学习(TL)1 引言机械故障诊断技术在现代工程领域(如制造业、能源、电力和铁路运输等)中至关重要。该技术能够及时发现设备潜在故障,避免生产过程中出现意外停机;同时,还可提高设备可靠性和使用寿命,降低维护成本和能耗 [1-3]。随着新一代信息技术的发展,基于深度学习的故障诊断方法取得了显著成果,尤其在处理大规模、复杂的机械监测数据方面展现出强大潜力 [4-7]。然而,深度学习技术通常依赖大量带标签的故障样本进行训练。在工程实际中,机械设备的故障样本稀缺且标注成本高昂,这限制了基于深度学习的故障诊断方法的实际应用。此外,由于运行工况变化、环境改变、传感器精度不足等因素,历史训练数据与测试数据之间存在分布差异,使得模型难以在所有潜在故障工况下实现泛化 [8]。 幸运的是,基于迁移学习(Transfer Learning, TL)的诊断方法为减小训练数据(源域)和测试数据(目标域)之间的分布差距提供了可行方案 [9-11]。迁移学习大致可分为域自适应(Domain Adaptation, DA)和域泛化(Domain Generalization, DG)两类。域自适应通过利用源域和目标域数据调整模型,以确保模型对目标域特征具有更好的适应性。根据源域和目标域标签空间的关系,域自适应可进一步分为闭集域自适应 [12]、部分集域自适应 [13]、开集域自适应 [14] 和通用域自适应 [15] 等子领域。相比之下,域泛化仅通过源域数据训练模型,增强模型的跨域泛化能力,使其能够在未见过的目标域上表现良好,主要包括单源域泛化 [16] 和多源域泛化 [17-18]。由于域自适应在训练过程中可以访问目标域数据,其诊断精度通常高于域泛化,但诊断实时性较低。 基于域自适应和域泛化的诊断方法核心在于 “减小域间差异”,这通常通过边际分布对齐、联合分布对齐等技术实现。然而,这些方法忽略了 “发现差异” 这一基础环节,即核心层面的分布差异度量指标。分布差异度量指标可分为隐式距离基和显式距离基两类 [19]。隐式距离基指标中常用的有基于单分类器的 A 距离 [20] 和基于双分类器 “异或” 运算的 H∆H 距离 [21],它们通过神经网络基于对抗机制的自适应学习获得。显式距离基指标通过样本统计量测量分布差异,例如最大均值差异(Maximum Mean Discrepancy, MMD)[22]、相关性对齐(Correlation Alignment, CORAL)[23] 以及其他距离度量方法 [24-26]。由于 MMD 在希尔伯特空间中具有出色的差异表征能力,因此成为故障迁移诊断中应用最广泛的指标。 尽管上述分布差异度量指标在许多诊断场景中取得了成功,但它们仅适用于数据局部分布与整体分布近似一致的情况(即图 1 (a) 所示的恒定工况)。在实际应用中,部分机械设备(如风力发电机)运行在时变工况下,风速和风力随时间随机波动 [27]。在这种动态条件下,局部分布数据可能与整体分布产生显著偏差(如图 1 (b) 所示)。然而,传统分布差异度量指标通常以整体分布作为最终观测对象,导致时变工况下局部分布表征不准确,分布差异度量出现失真 [28]。因此,迫切需要一种考虑时变工况下局部分布不确定性的分布差异度量指标,以提高动态环境下故障迁移诊断的精度。 图 1 局部分布变化示意图(a)恒定工况 (b)时变工况 为解决上述问题,本文构建了一种新的分布差异度量指标 —— 集成离散流形距离(IDMD),用于时变工况下的故障迁移诊断。IDMD 指标主要由基于最大熵的局部分布(MELD)选择机制和集成格拉斯曼流形测地线(EGMG)度量方法组成。MELD 选择机制通过自适应分割多个局部分布,最大化表征时变整体分布的信息;随后,提出 EGMG 度量方法,以捕捉时变工况下流形空间中源域和目标域的内在分布差异。基于 IDMD 指标构建模型,实现了实验室行星齿轮箱和实际风力发电机轴承的时变故障迁移诊断。本文的主要贡献和创新点如下: 为避免动态环境下数据分布测量失真,提出新的 MELD 选择机制,通过多个局部分布自适应地表征整个时变监测信号的信息。 考虑到振动监测数据具有复杂的非线性数据结构,基于测地线投影构建新的 EGMG 度量方法,从非线性样本空间中挖掘源域和目标域之间的内在分布差异信息。 针对典型分布差异度量指标仅适用于稳定数据结构的问题,结合 MELD 选择机制和 EGMG 度量方法,提出适用于时变工况的新分布差异度量指标 IDMD,并通过两个故障迁移诊断实验验证了其相对于现有先进方法的优越性。2 相关工作本文主要关注分布差异度量指标,这类指标用于捕捉两个域的内在差异表征。将从隐式距离类和显式距离类两个角度进行文献综述。2.1 隐式距离类指标隐式距离类指标主要包括基于单分类器的 距离 [20]和基于双分类器的&quot;异或&quot;运算的 距离 [21],其数学形式如下: 其中, 表示数据样本, 表示对应的样本空间, 和 分别表示源域和目标域, 表示指示函数, 表示神经网络函数空间 中的分类函数,“⊕” 符号表示 “异或” 运算。在实际应用中,分类函数通常与对抗机制结合使用。例如,文献 [29] 提出了一种利用 距离的对抗性域自适应模型,通过训练域判别器来区分源域和目标域;焦等人 [30] 结合信息熵和 H∆H 距离,开发了一种自训练行星齿轮箱诊断网络;潘等人 [31] 构建了一种基于 距离和对比学习的开集域自适应诊断模型,并在多个轴承数据集上验证了其有效性。2.2 显式距离类指标与隐式距离类指标不同,显式距离类指标具有更清晰的数学表达式和更稳定的分布对齐效果,MMD [22] 和 CORAL [23] 是故障迁移诊断领域最常用的距离指标: 其中, 和 分别为源域和目标域的数据样本, 为希尔伯特空间 中的核函数, 为样本维度, 和 分别为源域和目标域的协方差矩阵。这些距离指标常作为自适应层,通过转导训练实现域混淆:例如卢等人 [32] 基于自适应带宽诱导高斯核函数构建新的峰度 MMD,用于跨轴承诊断;文献 [33] 基于 MMD 的高维空间测量原理,结合机械监测信号的振动特性,开发新型分布差异度量指标以增强差异表征能力。 部分研究者将隐式距离类指标和显式距离类指标结合,开发混合分布差异度量指标,以获得更强的差异表征能力,提升域混淆程度 [34-35]。尽管这些指标在诸多场景中表现出优异的诊断性能,但仍不适用于时变工况下的分布差异测量。3 IDMD分布差异度量指标本节首先介绍研究的问题定义与动机分析,随后详细阐述 MELD 选择机制和 EGMG 度量方法,最后给出 IDMD 指标的算法伪代码。 3.1 问题定义与动机分析本研究在恒定↔连续时变工况的迁移诊断场景中验证所提 IDMD 分布差异度量指标。该场景下仅单个域(源域或目标域)的数据分布稳定,即局部分布与整体分布一致;分布对齐形式基于无监督迁移学习,仅源域样本带标签,目标域样本完全无标签,且源域与目标域的标签空间关系为闭集。 图2 提出的IDMD分布差异度量原理图以图 2 所示的 “恒定源域→时变目标域” 迁移诊断场景为例(第三节 B-D 小节均基于该设定):由于目标域持续时变,其局部分布与整体分布不一致且难以稳定观测(图 1 (b)),直接用整体分布表征整个时变监测信号会导致实际数据分布测量失真。因此,可将连续时变场景视为 “未见过的目标域”(目标域数据分布不可观测),假设实际最优目标域分布 位于由 个目标域局部分布 构成的凸包 内(即 ),凸包 定义如下: 其中, 表示 维单纯形, 表示归一化权重。恒定源域分布 与凸包 之间的分布差异 可表示为: 其中, 表示 距离。最优目标域分布 可通过理想归一化权重 近似表示: 凸包 的直径 定义为: 根据式 (5)-(8) 及迁移学习理论 [36],可推导出时变目标域的经验误差界: 其中, 和 分别表示源域和目标域的经验风险; 表示目标域多个局部分布构成的凸包与恒定源域的分布差异; 为凸包的直径大小; 表示不可观测的最优分布差异。若令 ,可得 。基于上述分析,需通过以下两步减小目标域的诊断误差: 1.寻找多个局部分布表征整个时变监测信号的信息,满足 (对应所提 MELD 选择机制); 2.减小源域分布与每个目标域局部分布的差异(对应所提 EGMG 度量方法,可从非线性样本空间中提取内在分布差异信息)。 IDMD 分布差异度量指标的原理如图 2 所示,MELD 选择机制和 EGMG 度量方法将在第三节 B、C 中详细介绍。3.2 MELD 选择机制 基于前述迁移诊断理论,确保 IDMD 指标有效性的前提是最大化表征连续时变监测信号的分布信息。因此,设计 MELD 选择机制自适应搜索多个最优局部分布:首先假设监测信号的分布服从高斯分布 (与图 1 所示实际数据特征一致),其概率密度函数定义为: 其中, 表示第 个高斯分量下的样本分布概率, 和 分别为第 个样本集的均值和协方差, 为样本维度。整个连续时变监测信号的内在分布 可表示为: 其中, 为参数集, 为第 个高斯分布的权重。分布参数 的求解可转化为高斯混合模型的求解问题 [37],给定样本数量 ,优化目标定义为: 直接通过偏导数求解 难以实现,利用詹森不等式和 “懒惰统计学家法则”,将式 (12) 中的目标函数 重写为: 采用期望最大化算法迭代计算式 (13),其数学表达式为: 通过式 (10)-(15) 可得到最终的分布参数 接下来需确定表征时变监测信号全部信息所需的高斯局部分布数量:根据前述理论,选择多个局部分布需最大化包含所有分布信息(满足 ),即捕捉更多信息。熵表示信息的不确定性和丰富度,其大小反映系统中信息的多样性,因此选择局部分布数量的目标是实现更高的信息熵。考虑到 表示第 个高斯分布在所有高斯分布混合中的占比,最优数量 可通过下式求解: 其中, 表示C个高斯分布下的信息熵; 为温度系数,用于控制 之间的差异, 越小差异越大。根据式 (16), ,无法通过穷举搜索求解,因此将其重写为:其中, 为指示函数,即若则,反之则为 0; 为判别阈值。仅当当前 对应的信息熵高于 时,才选择 作为局部分布数量(满足。为确保高置信度,本研究设定阈值 ,通过式 (17) 选择最小的 作为最终局部分布数量 。3.3 EGMG 度量方法 基于上述 MELD 选择机制和图 2 的设定,通过对应局部分布参数采样可得到时变目标域中的多个子域 : 其中, 表示给定样本维度 和显著性水平 下的卡方分布; 从分布 中以 置信水平采样得到,即数据样本 位于超球面内。 在复杂时变工况下,测量两个域的内在分布差异信息面临巨大挑战:现有多数方法依赖欧氏度量,其本质假设数据样本空间为线性,但实际监测数据通常呈现复杂的非线性结构 [38],导致欧氏度量可能对分布差异做出不准确甚至误导性的评估。为克服这一局限,本文提出 EGMG 度量方法(图 3):与欧氏度量不同,测地线度量明确考虑数据空间的非线性几何特性,能够捕捉域间的内在结构变化,更准确地表征分布差异信息,从而提升迁移诊断任务中的域混淆效果。 图3 欧几里得测量和测地线测量原理 由于直接在样本空间中测量测地线的计算复杂度极高,将源域和目标域的多个子域嵌入到格拉斯曼流形中,得到其子空间表示 ,可通过样本协方差矩阵的特征值分解求解: 图 3 中源域和目标域第 个子域分别表示为 和 ,对应的测地线子空间流(图 3 中蓝线)可表示为: 其中, , 。若能构建 的表达式,即可得到测地线度量 。根据流形理论 [39]: 其中, , 和 为正交矩阵,满足: 其中, 和 为与子空间 和 之间的主角度 [40] 相关的奇异对角矩阵: 式 (22) 中 和 对应的元素分别为 和 。由于测地线度量 为无穷维向量,无法直接计算。样本向量 和 分别来自源域和目标域的第 个子域。因此最终的 IDMD 分布差异距离 是在 和 之间的内积基础上定义的: 令 , 以积分项 为例,其详细数学推导如下: 其中: IDMD 满足距离定义的证明见附录。 由 EGMG 的推导过程可知,式 (20) 中子空间的维度对最终分布差异有显著影响,因此确定该维度也是关键问题。首先根据迁移学习理论 [20],定义跨域的 范数自然度量 : 其中, 为 和 下的可测集。根据上述定义,分布差异度量指标应捕捉源域与目标域的最大差异,因此子空间维度 可通过以下规则选择: 其中, 表示分布距离 [41],其数学表达式为: 表示简单二元判别神经网络的分类误差。需注意的是, 计算效率高,且能通过神经网络自适应测量非线性数据结构下的差异,因此式 (29) 未采用 EGMG、MMD、CORAL 等度量方法。3.4 算法概述 所提 IDMD 分布差异度量指标的算法概述如表 1 所示。 表 1 IDMD 指标的算法概述 为验证 MELD 选择机制能否选择多个局部分布表征全局信息,通过三个正态分布 模拟简单阶段时变信号,对应公式如下: 模拟时变信号及 MELD 选择的局部分布如图 4 所示:MELD 选择的局部分布数量与式 (31) 一致 ,且通过 MELD 得到的分布参数与三个采样正态分布近似相等,验证了 MELD 选择机制的有效性。 图4 模拟的时变信号和来自MELD机制的局部分布 4 实验研究 本节首先在模拟信号上评估 MELD 选择机制的准确性,随后通过两类迁移诊断案例(实验室时变行星齿轮箱和实际时变风力涡轮机轴承),验证所提 IDMD 指标在时变动环境下的有效性。4.1 MELD 选择机制分析(注:对应原文第四节 A,主要验证 MELD 选择机制的有效性,前文已通过模拟信号验证,此处不再赘述)4.2 案例 1:实验室时变行星齿轮箱1) 实验台描述 时变行星齿轮箱数据集通过图 5 所示的实验台采集。该 HD-CL-012X 实验台由无锡厚德自动化仪表有限公司搭建,主要包括控制器、驱动电机、扭矩传感器、单级行星齿轮箱和磁粉制动器五个部分;模拟故障部件为行星齿轮箱中的行星轮,在齿轮箱壳体上安装振动加速度传感器进行健康监测。采集的振动监测信号包含六种健康状态:正常状态(NC)、表面剥落(SP)、齿根裂纹(RC)、齿面磨损(TW)、微点蚀(MP)和轮齿断裂(TF);加速度信号采样频率设为 16384 Hz,模拟三种时变转速工况(0-600 r/min(V1)、0-1200 r/min(V2)、0-2400 r/min(V3)),转速变化率分别为 100、200、400 r/min/s,同时模拟一个恒定转速工况(600 r/min(C))。每种转速工况下施加 5 N・m 的恒定负载,振动信号采样时长为 10 s;样本长度设为 3072(确保每个样本至少包含一个故障周期),通过滑动采样技术将每种健康状态下采集的信号分为 1000 个样本(相邻样本重叠 2911 个数据点)。为更严格地验证诊断性能,直接使用原始振动信号进行故障诊断,未进行预处理。 图5 单级行星齿轮箱测试台2) 实验结果与分析 本研究选择一维卷积神经网络作为特征提取器,将所提 IDMD 指标 作为域混淆损失以提取域不变故障特征,采用分类交叉熵损失学习可分离特征,通过两种损失实现跨域诊断: 其中, 为权衡参数,通过二分查找使上述两种损失保持同一数量级。 基于上述模拟的三种时变转速和一种恒定转速工况,构建六个迁移诊断任务(C→V1、C→V2、C→V3、V1→C、V2→C、V3→C),验证所提方法的有效性。选取三种显式距离基指标(MMD [22]、MMSD [33]、CORAL [23])和两种隐式距离基指标(A [20]、H∆H [21])作为对比方法,评估 IDMD 的优越性。所有方法的诊断精度如图 6 所示:IDMD 显著提升了诊断精度,在所有任务中较其他指标提升近 40%,平均精度超过 90%,表明其在连续时变工况下更有效;但在 “恒定→时变” 迁移任务(C→V1、C→V2、C→V3)中,IDMD 的精度低于反向任务(V1→C、V2→C、V3→C),这主要是因为所有时变工况(V1、V2、V3)均包含 600 r/min 恒定工况(C)的故障信息。 图6 实验室时间变行星齿轮箱的实验结果3) 域混淆能力分析以 V3→C 迁移任务为例,通过各故障类型提取特征的概率密度图(图 7)直观展示所提 IDMD 指标的域混淆能力:源域和目标域中所有类别的特征分布完全重叠,表明 IDMD 能在时变动环境下实现分布对齐;此外,从每个子图中水平轴上特征分布的数值范围可以看出,IDMD 能学习到类内紧凑、类间分离的故障特征。综合实验结果进一步验证了 IDMD 具有强大的差异表征能力和迁移诊断能力。 图7 在V3-&gt;C转移任务下不同故障特征的概率密度图。(a)NC,(b)SP,(c)RC, (d) TW, (e) MP和(f) TF4) 多种评估指标分析 与精度相比,混淆矩阵不仅能反映整体正确性,还能捕捉类间误分类分布,评估更全面。以 C→V3 迁移任务为例,六种不同分布差异度量指标的分类结果混淆矩阵如图 8 所示:图 8 (f) 中主对角线元素在对应行中最大,表明 IDMD 总体上学习到了域不变且具有判别性的故障特征;但 IDMD 在 SP(标签 0)和 MP(标签 4)故障类别的诊断性能相对较弱,这可能是由于剥落和点蚀故障尺寸较小,导致冲击信号不明显。从上述混淆矩阵中可轻松推导各类别的精确率、召回率和 F1 分数,其 “宏平均” 值如表 2 所示。综合图 8 和表 2 可知,IDMD 相较于其他方法取得了最优的诊断性能。 图8 C到V3迁移任务的混淆矩阵。(a)MMD,(c)(b)MMSD,CORAL, (d) A, (e) HAH和 (f) IDMD. 表 2 多种典型评估指标的实验结果 5) 计算效率分析 为进一步评估 IDMD 分布差异度量指标的计算效率,以 V1→C 迁移任务为例,测量所有方法每个 epoch 的训练时间和测试时间(图 9)。实验平台配置为 Intel Core i7-9700 CPU、16 GB RAM 和 GeForce GTX 3080 GPU:由于 MELD 选择机制中的穷举搜索操作和 EGMG 度量方法中的大量矩阵计算,IDMD 的训练时间达到 48.56 s,计算复杂度高于其他基线方法;但 IDMD 的测试时间仅为 0.16 s,表明其适用于实际工程中的实时故障诊断。 图9 不同方法的训练时间和测试时间6) 消融实验 为进一步验证所提 IDMD 的有效性,进行消融实验:“w/o-MELD mechanis m” 表示域混淆训练过程中不考虑时变工况下的局部分布不确定性,直接应用所提流形距离进行对齐;“w/o-EGMG measurement” 表示使用传统 MMD 而非所提 EGMG 度量方法测量分布差异。以 C→V1 和 V1→C 迁移任务为例,结果如图 10 所示:C→V1 任务中 IDMD 的诊断精度为 85.43%,而移除 MELD 机制或替换 EGMG 度量方法后,精度分别降至 55.68% 和 69.23%;V1→C 任务中,“w/o-MELD mechanis m” 和 “w/o-EGMG measurement” 的精度分别为 77.36% 和 68.45%,显著低于 IDMD 的 94.75%。这些结果表明,忽略局部分布不确定性或采用典型分布度量会严重降低跨域泛化能力和诊断性能,而所提 MELD 机制和 EGMG 度量方法在增强分布对齐和提升模型鲁棒性方面发挥关键作用,验证了所设计模块的合理性和有效性。 图10 在迁移任务C&gt;V1和V1一C下的消融实验结果4.3 案例 2:实际时变风力涡轮机轴承1) 数据集描述工程实际中机械设备的历史故障监测数据稀缺,导致源域诊断知识获取困难。测试台采集的故障数据成本较低且获取迅速,因此受到广泛关注;但实际机械设备的故障监测信号复杂度高,可能导致源域与目标域之间存在较大分布差异,进而引发诊断知识的负迁移(尤其对于未知设备)。为解决这一挑战,本节利用实际风力涡轮机齿轮箱轴承(WTGB)监测数据和公开的东南大学(SEU)轴承测试台数据集,构建时变条件下的跨域诊断任务,评估所提 IDMD 诊断模型的工程应用潜力,以下详细介绍两类数据集: ● WTGB 数据集:来自某风电场的多台 2-MW 风力涡轮机,其传动结构如图 11 所示,主要包括一级行星齿轮传动系统和两级平行轴齿轮传动系统;在低速轴轴承附近安装加速度传感器采集振动数据,采样频率为 25.6 kHz;为降低数据存储成本,每天仅保留 5.12 s 的数据。WTGB 数据集记录的故障类型包括正常状态(NC)、内圈故障(IF)、滚动体故障(BF)和外圈故障(OF),均发生在平行轴齿轮箱的低速轴轴承上,且在不同运行工况下采集。与测试台人工加工的规则轴承故障形状不同,实际风力涡轮机的轴承故障由于降解过程缓慢且运行工况复杂,形状不规则;此外,监测信号中包含故障信息的冲击分量常被背景噪声和其他分量淹没,这两点增加了诊断模型提取故障特征的难度。同时,风速变化导致转速持续非线性波动(图 12)。每个故障类别的样本大小和数量与前一小节一致,且对实际服役环境中传感器采集的数据进行了异常值去除处理。 图11 实际2兆瓦风力涡轮机的传动结构 图12 风力涡轮机的实际时变工作条件:(a)输出速度信息和(b)振动加速度波 ● SEU 数据集[42]:来自动态传动系统模拟器(图 13),该测试台由电机、电机控制器、行星齿轮箱、平行轴齿轮箱、制动器和制动控制器组成,通过调节制动控制器的电压改变负载。实验中施加两种电压(0 V 和 2 V),设置两种转速工况(1200 r/min 和 1800 r/min),故障类型与 WTGB 一致(NC、IF、BF、OF),采样频率为 5120 Hz。通过迁移能力判别分析方法 [43],选择 2 V&amp;1800 r/min 的恒定工况作为本案例的源域,每个故障类型的样本大小和数量分别设为 3072 和 1000。2) 实验结果与分析利用 WTGB 和 SEU 轴承数据集构建两个跨设备迁移诊断任务(WTGB→SEU 和 SEU→WTGB):由于两类数据集的采样频率、机械结构和噪声环境完全不同,其迁移诊断任务比图 6 中的任务更具挑战性。本案例的实验设置与案例 1 一致,结果如图 14 所示:所提 IDMD 指标表现突出,在 WTGB→SEU 和 SEU→WTGB 任务中的精度分别达到 86.65% 和 81.13%,较其他知名指标提升近 30%,进一步证明了 IDMD 在实际工程场景中的优越迁移诊断性能。 3) 进一步实验研究为评估所提 IDMD 指标的抗噪声鲁棒性,以 WTGB→SEU 迁移任务为例,在原始监测信号中添加随机噪声,设置不同噪声水平(通过信噪比(SNR)评估),信噪比定义如下: 其中,Psignal 和Pnoise 分别表示信号和噪声的功率。选取多种最先进的 MMD 变体(KMMD [32]、LMMD [44]、MKMMD [45])作为基线方法进行对比,进一步评估 IDMD 的优越性。结果如图 15 所示:IDMD 在所有噪声水平下均取得最高诊断精度,鲁棒性强于其他指标;尤其在噪声功率与信号功率相等的极端高噪声条件下(SNR=0 dB),IDMD 仍能达到 70.61% 的诊断精度,验证了其在严重噪声干扰下仍能保持可靠的诊断性能。与先进 MMD 变体相比,IDMD 在所有噪声水平下的平均精度提升约 36.5%,突出了其捕捉域不变特征的卓越能力,表明 IDMD 为实际场景中的故障诊断提供了稳健可靠的方法。 基于事后弗里德曼检验的临界差异(CD)图 [46],可清晰可视化多种算法在不同噪声水平下的统计显著性,通过展示平均排名,直观对比方法性能和显著性关系。为系统评估 IDMD 的鲁棒性,在所有 SNR 水平下将其与其他指标进行对比,采用威尔科克森 - 霍尔姆程序进行事后非参数弗里德曼检验,诊断精度的 CD 图如图 16 所示(CD 值越小,迁移诊断性能越好):图中粗水平线表示一组方法处于同一显著性水平,综合来看,CD 图明确证实了所提 IDMD 指标在连续时变条件下跨域故障诊断的优越能力和鲁棒性。4.4 局限性与未来工作尽管所提 IDMD 在跨域故障诊断中表现出强大性能,但仍存在以下局限性:1.IDMD 已在行星齿轮箱和风力涡轮机齿轮箱上验证,但在其他机械系统和超高维数据结构中,其稳定性和优越性可能下降;此外,由于实验装置的限制,未探索快速转速变化等极端运行工况;2.MELD 机制假设局部分布近似服从高斯分布,在处理高度非高斯数据集时有效性可能降低;3.该方法依赖源域与目标域故障类别相同的假设,限制了其在标签空间关系不同场景中的适用性。未来工作将探索超越高斯假设的更灵活分布建模方法、通用伪标签权重策略,拓展所提方法在更多机械系统中的应用,并评估其在更复杂严苛工作条件下的鲁棒性。 五 结论本文提出一种新型 IDMD 分布差异度量指标,以提升连续时变工况下的差异表征和迁移诊断能力。首先深入分析和探索 IDMD 指标的迁移诊断理论,基于该理论开发 MELD 选择机制和 EGMG 度量方法,确保 IDMD 的有效性:MELD 选择机制自适应搜索多个局部分布,准确表征时变监测信号的全局分布;针对高维数据样本的复杂非线性结构,基于测地线度量和流形子空间构建 EGMG 度量方法,挖掘源域与目标域之间的内在分布差异信息。通过实验室时变行星齿轮箱和实际时变风力涡轮机轴承的故障迁移诊断实验,验证了所提 IDMD 指标优于其他最先进的分布差异度量指标,尤其在所有迁移任务中,IDMD 的平均诊断精度超过 88%,表明其在实际工程中具有巨大的应用潜力。编辑:李正平校核:陈凯歌、赵栓栓、曹希铭、赵学功、白亮、任超、海洋、陈宇航、Tina、王金、Kira、赵诚、肖鑫鑫、张优该文资料搜集自网络,仅用作学术分享,不做商业用途,若侵权,后台联系小编进行删除来源:故障诊断与python学习

未登录
还没有评论
课程
培训
服务
行家
VIP会员 学习计划 福利任务
下载APP
联系我们
帮助与反馈