首页/文章/ 详情

域泛化开源代码分享| 平衡差异性与一致性:单域泛化故障诊断方法研究

1年前浏览1550
本期给大家推荐的文章是《平衡差异性与一致性:单域泛化故障诊断方法研究》。本文以当前对于单域泛化故障诊断方法研究过程中的局限性为切入点,提出一种建模“差异性—一致性”对抗交互机制的单域泛化故障诊断框架。

论文基本信息

论文题目:Balancing Discrepancy and Consistency:Adversarial Single Domain Generalizationin Fault Diagnosis

论文期刊:IEEE TRANSACTIONS ON INDUSTRIAL INFORMATICS

论文日期:2025年

作者:

Guowei Zhang , Xianguang Kong , Qibin Wang , Jingli Du , and Hongbo Ma

机构:
College of Mechanical and Electrical Engineering, Xidian University, Xi’an 710071, China; 
State Key Laboratory of Electromechanical Integrated Manufacturing of High-performance Electronic Equipments, Xidian University,Xi’an 710071, China
第一作者简介:

张国伟,西安电子科技大学机电工程学院博士研究生,新加坡国立大学联合培养博士。研究聚焦于旋转机械智能故障诊断与跨域泛化建模,致力于提升诊断模型在复杂工业环境中的鲁棒性与实用性。以第一作者或通讯作者在IEEE TII、MSSP等国际权威期刊发表SCI论文10篇。入选首届中国科协青年人才托举工程博士生专项计划,曾获国家奖学金等多项荣誉。

目录

摘要
1 引言
2 问题定义  
2.1 基于SDG的故障诊断问题建模  
2.2 训练目标与理论动机  
        2.2.1 基于分布扰动的鲁棒学习  
        2.2.2 领域自适应理论的泛化保证  
        2.2.3 对抗结构设计的稳定性分析  
3 所提出方法  
3.1 基于域差异感知的可学习统计扰动  
3.2 一致性引导的协方差与语义对齐  
3.3 训练与推理流程  
4 实验验证
4.1 数据集介绍
4.2 实验设置
        4.2.1 参数配置  
        4.2.2 对比方法  
        4.2.3 评估指标  
4.3 结果与讨论
              4.3.1 主要结果分析  
      4.3.2 消融实验分析            
      4.3.3 计算开销评估    
5 结论    

摘要

单域泛化(Single-domain Generalization, SDG)故障诊断旨在仅利用单一工况下的数据训练模型,使其具备在未知工况下的推广能力。尽管该策略具有良好的应用前景,但仍面临诸多挑战。现有研究主要通过生成新域特征以扩展数据分布,并提取域不变特征,然而在实践中存在三方面问题:(1)域扩展与域不变特征提取相互独立,限制了两者的协同作用与泛化能力;(2)域扩展过程常采用随机或方向不一致的增强策略,易引入噪声或产生不可靠特征;(3)域不变特征提取方法多侧重于全局或类别层面对齐,忽略了特征间关系的优化。为此,本文提出一种基于差异性与一致性对抗交互的SDG故障诊断框架,通过反复对抗训练动态平衡域间差异性与一致性,避免模型泛化受单向偏差影响。具体而言,设计了一个可学习的统计特征扰动模块以感知域间差异,引导模型生成能有效表征域差异的统计扰动,从而提升域扩展的可靠性。此外,提出协方差对齐与语义对齐策略,在原始特征与扰动特征之间保持全局及类别层面的一致性。协方差对齐用于减缓扰动特征引入的风格变化,并保留关键诊断信息,显式语义约束则进一步提升模型预测结果的一致性。最后,本文在五个公开数据集上开展大量实验,验证所提方法的有效性。

1 引言

随着工业领域加速迈向智能制造,设备智能化程度和运行标准不断提升。旋转机械作为关键组成部分,其运行需满足更高的可靠性与安全性要求。在此背景下,人工智能,尤其是深度学习,成为智能设备健康管理的重要技术手段,广泛应用于状态监测、故障诊断和剩余寿命预测等任务中,具备自动特征提取、模式识别鲁棒性强、预测建模精度高等优势。

早期的智能故障诊断研究主要依赖于在固定工况下的监督学习,假设训练与测试数据分布一致。然而,在实际工业场景中,设备运行常伴随负载、转速及环境条件变化,导致数据分布发生偏移,严重影响模型的诊断性能。

 为应对上述问题,领域自适应(Domain Adaptation, DA)方法被提出,用于将标注源域的诊断知识迁移至无标签但相关的目标域,通过对齐特征分布实现跨域泛化。尽管DA方法在跨工况故障诊断中取得一定进展,但通常依赖于训练阶段访问目标域数据,这一假设限制了其在工业场景中的应用价值。

图1 不同领域泛化故障诊断方法流程对比图

为摆脱对目标域数据的依赖,领域泛化(Domain Generalization, DG)故障诊断方法提出在训练阶段引入多个源域数据,使模型具备迁移至未知目标域的能力,如图 1(a)所示。此类方法主要分为两类:一类通过数据增强提升样本多样性,另一类从多域数据中提取域不变特征。总体来看,传统DG方法多依赖于来自多个源域的故障数据,但在实际工业中,多源故障数据往往难以获取,难以满足多源域泛化方法的训练需求。 

近年来,单域泛化(Single-domain Generalization, SDG)故障诊断方法受到广泛关注,其核心在于无需多源训练数据,仅基于单一源域完成对多个未知目标域的故障识别。这一策略大幅降低了模型训练与部署所需数据量,缓解了工业场景中普遍存在的数据匮乏问题。因此,工业用户可在无需大量数据采集的前提下,快速部署智能诊断系统,降低应用成本并简化系统结构。目前,SDG 故障诊断研究主要通过数据或特征增强扩展源域分布,并结合域不变特征提取策略。

Wang 等人提出风格补全模块,通过生成多样化分布样本提升模型泛化能力,缓解了SDG场景中目标样本分布不足的问题。Zhao 等人提出基于对抗互信息的SDG网络,通过生成与源域差异较大的伪目标域,提升模型泛化能力,有效缓解未知域偏差问题。Wang 等人提出多尺度风格生成与对抗对比网络,通过域生成模块构造多样化扩展域样本,并结合多尺度卷积与风格学习策略提取域不变特征,实现单一工况下的泛化诊断。Zhang等人构建伪目标域以模拟域偏差,推理域偏差原因并执行自适应迁移,解决了现有方法对源域与目标域偏差估计不足的问题。Li 等人提出基于域扩展融合的SDG框架,通过域扩展模块、双分支特征融合网络、多分类器状态识别模块以及对抗对比训练策略,在未知工况下提升故障诊断的鲁棒性与准确性。Jiang 等人提出基于不确定性自举的对抗增强域网络,通过生成模块与跨域辅助模块构建增强域,结合对抗训练与不确定性估计,解决了SDG场景下未知故障模式识别与跨域诊断的问题。如图1(b)所示,为应对更具挑战性的SDG任务,当前方法普遍采用数据或特征增强技术提升样本多样性,并结合域不变特征提取以提升泛化能力。

尽管相关研究取得显著进展,但当前SDG方法仍面临三项关键挑战:

  • 现有方法普遍将域扩展与域不变特征提取视为两个相互独立的过程,实质上将SDG问题转化为多源域泛化问题。尽管此类方法在一定程度上提升了模型的泛化能力,但两阶段之间联系薄弱,限制了整体框架的协同效能。在实际工业环境中,设备运行条件(如负载、转速及环境因素)往往呈现不可预测的动态变化,现有方法未能充分挖掘潜在域迁移带来的多样性,导致模型整体泛化性能受限。
  • 多数方法在进行域扩展时,通常采用随机扰动方式,或刻意增强与源域分布的差异性。然而,这并不能确保生成特征与目标域内在分布保持一致。此外,增强方向缺乏可控性,难以实现特征学习的有效优化。
  • 传统域不变特征提取方法多基于距离度量或对比学习,但往往忽略了全局分布对齐与类别层面特异性之间的交互关系。尤其是全局对齐过程可能引入无关或误导性特征,导致与任务相关的关键信息丢失,影响诊断准确性。 
    为应对上述限制,源于对抗学习思想的对抗训练策略,已成为无监督领域自适应中提升模型泛化能力的重要手段。对抗式领域自适应方法通过极小极大优化过程对齐不同域间的特征分布,实现域不变表示的学习。同时,对抗式数据增强策略利用对抗扰动构建虚拟目标域分布,以提升模型在域偏移情形下的鲁棒性。受此启发,本文将SDG问题建模为“差异性–一致性”之间的对抗优化过程,如图1(c)所示。首先最大化原始特征与扰动特征分布之间的差异性以模拟多样化的域偏差,随后引入一致性引导下的协方差与语义对齐机制,增强模型预测的稳定性。通过差异性与一致性之间的对抗训练,逐步提升模型的泛化能力。上述机制协同作用,有效增强模型在工业应用中的可靠性与鲁棒性。本文的主要贡献如下:      
  1. 提出一种建模“差异性–一致性”对抗交互机制的SDG故障诊断框架。该框架借助对抗训练思想,在迭代优化过程中动态平衡域间差异性与一致性,有效缓解单向泛化偏差问题。模型能够逐步学习更加稳健且具判别性的特征表示,保障在复杂多变工况下的诊断精度与稳定性,为工业场景中运行条件频繁变化的智能诊断系统部署提供切实可行的解决方案。
  2. 设计一个可学习的统计扰动模块(Learnable Statistical Perturbation, LSP),用于建模域间差异感知。该模块引导模型学习能反映工况变化的统计扰动特征,有效捕捉工业设备在不同工作环境下的域特异性属性。与传统固定增强策略相比,所提模块基于域特异性距离度量生成更具针对性和目标导向的扰动,从而提升特征增强的可控性与相关性。
  3. 提出一种一致性引导下的协方差与语义对齐策略,用于有效解耦域间变化与语义特征之间的耦合关系。该策略在表示层面对原始样本与增强样本的全局特征分布进行对齐,既保留关键诊断信息,又缓解特征扰动带来的风格变化。同时引入显式语义约束,进一步提升模型预测结果的一致性与稳定性。

2 问题定义

2.1 基于SDG的故障诊断问题建模

在故障诊断场景下,单域泛化任务可表述为从输入数据          到预测标签          的映射学习,其中          来自单一源域         。设          为模型集 合,训练数据          服从源域分布         ,目标是从中学习到一个模型         ,使其能够在未知目标域分布          上具备良好的泛化能力。因此,SDG 可形式化为如下优化问题:

     
   

其中,         表示交叉熵损失函数,         表示在目标域分布上的期望风险。由于SDG故障诊断的主要挑战在于无法获取目标域分布         ,因此经验风险最小化(Empirical Risk Minimization, ERM)成为求解式1的基本策略,其通过最小化源域数据上的平均误差来训练模型:

     
   

其中,         表示训练集的经验分布。然而,已有研究表明,基于ERM的训练方法在泛化场景下表现出较差的鲁棒性,领域自适应理论指出,其根本原因在于源域训练风险与源目标域之间的分布差异。

2.2 训练目标与理论动机

为克服前述问题,受对抗式数据增强研究启发,本文将 SDG 问题建模为“差异性–一致性”之间的对抗优化过程。

     
   

其中,         表示由扰动函数          对源域潜在特征生成的虚拟目标域分布,         与          分别为源域特征与虚拟目标域特征,         表示两组特征的对齐损失,         为扰动强度的超参数。然而,从实践角度看,如何选择合适的域偏移幅度          具有挑战性,因此我们引入拉格朗日松弛形式,将其转化为如下优化目标:

     
   

其中,         表示概率分布空间中的距离度量,         为惩罚因子,用于控制扰动的幅度。从式4可见,该优化目标旨在最大化源域与虚拟目标域间的分布差异,同时最小化模型在目标分布上的风险。

式4所定义的训练目标建立在两个经典理论基础之上:分布鲁棒优化理论与领域自适应泛化界理论。下文从三个方面对该目标函数的理论基础与结构设计进行解释。

2.2.1 基于分布扰动的鲁棒学习

为克服式2中 ERM 策略的局限性,本文引入分布鲁棒优化思想。参考Sinha等人之前研究,我们考虑所有位于以源域分布          为中心、半径为          的Wasserstein球体内的扰动分布集 合         ,其鲁棒优化目标可表示为:

     
   

其中,         表示在距离度量          下,从          出发半径为          的可接受分布集 合。

为实现可行的优化,本文采用扰动函数          对源域进行变换以构造虚拟分布         ,并通过拉格朗日松弛策略引入正则项         ,从而得到式4的优化形式。该策略通过最小化潜在最坏情况下的预测风险,使模型在不同形式的域偏移下具备更强的鲁棒性与泛化能力。

2.2.2 领域自适应理论的泛化保证

从领域自适应理论角度出发,本文目标函数亦符合中提出的泛化上界理论。该理论指出目标域误差可由以下上界描述:

其中,         与          分别为假设          在目标域与源域上的分类误差;         为源域与目标域在假设空间          下的         -距离,衡量两域分布差异;         表示源-目标共同最优假设下的不可约误差。

该上界表明,若欲降低目标域误差,不仅需减少源域经验误差         ,亦需控制源目标域间的分布差异。由于 SDG 场景下无法访问真实目标域         ,本文采用虚拟目标域          近似代替,并在式4中引入特征对齐项         ,以缓解源域与扰动域之间的语义偏移。

2.2.3 对抗结构设计的稳定性分析

尽管式4中采用了极小极大的对抗优化结构,其并非典型生成对抗网络(GAN)式动态博弈模型。本文采用固定结构分支引入扰动,仅对浅层特征进行扰动变换,而深层特征则保持与原始流一致,并实施特征对齐。该结构实现了扰动生成与优化过程的解耦,有效规避了对抗优化过程中常见的不稳定性问题,从而实现了具有结构约束的稳定对抗优化目标。

综上所述,式4所构建的训练目标在分布鲁棒性与领域泛化理论的指导下,统一引入分布扰动与特征一致性约束,使模型在单域条件下具备对未知目标域的良好泛化能力。

下节将进一步分析式4中各组成部分的具体损失函数设计。首先,为增强源域与虚拟目标域之间的分布差异性,提出一种基于域差异感知的统计扰动机制。该机制不同于传统的样本级生成策略,而是在潜在空间中基于可学习的统计特征引入扰动。其次,为确保源域特征与其扰动版本之间的语义一致性,进一步引入一致性引导的协方差与语义对齐策略。该策略在缓解风格差异的同时,通过显式语义约束提升模型预测结果的一致性。由于源域与虚拟目标域的构造需满足式4所定义的结构,本文采用如图2所示的双流网络结构实现,该结构将在后文详细介绍。

图2 通过差异性与一致性对抗机制实现的智能故障诊断 SDG 流程图

图3 基于域差异感知的可学习统计扰动模块示意图

3 所提方法

3.1 基于域差异感知的可学习统计扰动

在对抗式 SDG 框架(式4)基础上,本节首先设计用于域差异感知的可学习统计扰动模块(Learnable Statistical Perturbation, LSP)。其具体实现过程如图3所示。已有先前研究表明,通过扰动网络浅层中实例归一化后的仿射变换的均值与方差,可有效模拟域偏移,同时保留类别判别信息。设浅层特征表示为         ,其中          与          分别表示样本通道维度上的均值与标准差:

     
     
   

由于特征统计量编码了与域相关的信息,AdaIN(Adaptive Instance Normalization)方法通过将源域特征          的统计量替换为目标域特征          的统计量,以实现域风格迁移:

     
   

然而在 SDG 场景下,目标域特征统计量无法获取,成为建模过程中的关键难点。部分研究尝试通过线性插值或不确定性建模方式增强统计多样性,虽在一定程度上提升了泛化能力,但往往存在特征扰动空间探索不足、结构不明确等问题。为此,本文提出基于可学习统计偏移的 LSP 模块,生成统计可靠的伪目标域特征:

     
   

其中,         与          分别为可学习的均值与标准差偏移项。该模块克服了传统扰动策略的局限性,能够更有效地扩展原始特征与扰动特征之间的分布差异。

鉴于对抗式 SDG 的关键目标在于最大化源域与虚拟目标域之间的分布差异,需引入合适的域感知距离度量引导模型学习合理的统计特征。先前研究表明,网络浅层特征主要捕捉风格信息,虽具有域相关性但与故障类别弱相关。受之前研究启发,深层协方差对齐(CORAL)可通过对齐源/目标域的二阶统计量降低域偏移。因此,本文利用协方差刻画网络浅层特征中的域差异性。整体网络由一系列顺序特征提取器          和一个分类器          构成,其结构可表示为:

     
   

其中          表示特征提取器的总层数。我们从浅层特征提取器中计算出一组协方差矩阵         ,并定义用于域差异感知的统计扰动损失为:

     
   

其中,         为特征向量维度,         表示矩阵的 Frobenius 范数平方,         为用于计算扰动损失的网络层数。         与          分别表示原始分支与扰动分支特征提取器,         为协方差矩阵计算操作,具体定义如下:

     
     
   

其中,         表示元素为1的列向量,         表示转置操作,         为样本数。

3.2 一致性引导的协方差与语义对齐

图4 一致性引导的协方差与语义对齐模块示意图

延续对抗式 SDG 的建模思想(式4),另一项关键优化目标是在特征与语义层面对源域与虚拟目标域进行对齐。其具体实现过程如图4所示。为增强模型的一致性,我们从域特征与语义预测两个维度出发,对两个子网络进行对齐设计。

在域级特征对齐方面,通过对浅层特征施加可学习统计扰动以模拟域偏移。然而,常用的对抗式学习或基于距离的对齐方法常存在训练不稳定或关键信息丢失的问题 。受实例白化(Instance Whitening)方法启发,去除对域变化敏感的协方差分量有助于提取域不变特征。因此,本文采用协方差对齐(Covariance Matching, CM)策略,在保留关键任务信息的同时,降低域偏移影响。具体地,分别计算原始特征与扰动特征的非中心协方差矩阵:

     
   

其中,         和          分别表示原始与扰动特征的非中心协方差矩阵,用于表征其二阶统计特性。通过最小化二者之间的          距离,实现协方差匹配以对齐两子网络:

     
   

尽管 CM 能在一定程度上对齐原始与扰动特征的整体分布,但未显式建模两者之间的直接关联。为此,本文进一步引入成对一致性损失(Pairwise Consistency, PC),通过交叉协方差矩阵刻画原始与扰动特征之间的一致性:

     
   

鉴于原始与扰动特征应保留相同的任务相关信息,理想情况下其交叉协方差矩阵应接近单位阵。因此,PC 损失通过约束该矩阵的对角元素接近1来保证特征表达的一致性:

     
   

其中,         表示提取交叉协方差矩阵的对角元素组成的列向量,         表示元素全为1的向量。

在语义对齐方面,期望模型在嵌入空间中能够对具有相同语义标签的样本进行聚类,从而确保语义一致性。为此,本文采用最大化原始与扰动特征输出之间互信息(Mutual Information, MI)的方法,以保持语义表达一致性。互信息          定义为:

     
   

其下界可表示为:

     
   

其中,         为判别函数(critic function)。尽管直接最大化该下界有助于增强语义一致性,但可能抑制同类样本间的共享信息。为此,引入监督对比损失(Supervised Contrastive Loss, SCL),以显式增强同标签样本之间的互信息:

     
   

其中,        ,         表示与第          个样本类别一致的所有原始与扰动特征的输出集 合,         为温度系数。 

此外,为进一步提升两子网络之间的语义一致性,最小化两分支网络的交叉熵损失:

     
   

3.3 训练与推理流程

本文所提方法采用双分支网络结构,并通过交替训练的方式进行优化,训练过程分为两个阶段。

在第一个阶段,执行一致性引导的协方差与语义对齐,以在源域与虚拟目标域特征之间保持全局与类别层面的一致性,从而在降低域间差异的同时保留任务相关信息。此外,引入显式语义约束以提升模型预测的稳定性与准确性。该阶段的损失函数定义如下:

     
   

其中,        、         和          分别为对应损失项的超参数权重。

在第二个阶段,引导 LSP 模块在潜在特征空间中建模域间差异,生成更加多样且可靠的特征分布,以增强模型对域偏移的感知能力。其损失函数如下:

     
   

其中,         为域差异建模损失的超参数。

最终,SDG 故障诊断通过上述两个阶段的交替对抗训练实现模型优化。在推理阶段,仅使用基于统计扰动特征训练得到的子网络进行预测,因为扰动特征有助于缓解域偏移对模型性能的影响。

4 实验验证

4.1 数据集介绍

为全面评估所提 SDG 框架在故障诊断任务中的有效性,本文在五个具有代表性的旋转机械基准数据集上开展实验,覆盖多种运行工况与健康状态。数据集详情如下所示:

帕德博恩大学(PU)数据集:该数据集包含 2100 条轴承振动样本,采集于三种运行工况(C1: 1500 RPM, 0.7 Nm, 400 N;C2: 1500 RPM, 0.1 Nm, 1000 N;C3: 900 RPM, 0.7 Nm, 1000 N)下的七种健康状态,每条样本包含 2048 个时域数据点,采样频率为 64 kHz。

华中科技大学(HUST)数据集:该数据集包含 2100 条样本,覆盖三种运行工况(70 Hz、75 Hz、80 Hz)和七种健康状态(健康、内圈中/重度故障,外圈中/重度故障,滚动体中/重度故障),每条样本含有 2048 个时域数据点,采样频率为 25.6 kHz。

北京工业大学(BJUT)数据集:该数据集采集自行星齿轮箱,在三种转速(1800、2100、2400 RPM)下记录了 3000 条样本,涵盖损齿、齿面磨损、齿根断裂和缺齿等四种故障模式,每种状态包含 200 条样本,采样频率为 48 kHz。

山东科技大学(SDUST)数据集:该数据集包含 6000 条样本,覆盖三类故障位置、三个故障程度,共 10 种健康状态,采样于 2000、2500 和 3000 RPM 三种转速下。每条样本均包含 2048 个时域数据点,采样频率为 12.8 kHz。

真实工厂轴承(RFB)数据集:该数据集来自工业生产线,包含 2400 条真实故障轴承样本,涉及四种状态(健康、滚动体缺失、纱卡、滚针偏移)与三种转速(100、200、300 RPM)。采样频率为 20.48 kHz,每条样本包含 2048 个时域数据点。

4.2 实验设置

4.2.1 参数配置

所用特征提取器为五层卷积神经网络(CNN),后接两层全连接分类器。模型的学习率设为 0.0005,迭代轮数为 300,批次大小为 40。输入信号经快速傅里叶变换(FFT)转化为频域表示,未额外进行去噪或归一化处理。LSP 模块部署于 CNN 的前两层,其超参数设置为 -1;         和          部署于第三层,对应超参数分别为 10 和 1;         部署于分类器输出端,超参数设为 0.1。

4.2.2 对比方法

本文方法与多个现有主流 SDG 方法进行了性能对比,具体包括:

基线模型:使用本文所构建的 CNN 结构,但不引入任何泛化策略。 

先进 SDG 方法:包括 MEADA 、L2D、AMINet、MSG-ACN、ACL和 DEFSDG。

4.2.3 评估指标

在 SDG 故障诊断任务中,从一个运行工况中选取数据作为源域用于训练,其余工况数据作为目标域用于测试。为全面评估模型性能,采用分类准确率(Accuracy)、宏平均召回率(Macro Recall)和宏平均 F1 分数(Macro F1 Score)作为评估指标。

准确率定义如下:

     
   

其中,正确预测样本数为模型预测结果与真实标签一致的样本数量,分母为测试集中样本总数。

宏平均召回率表示对各类召回率求平均,具体定义为:

     
   

其中,         表示类别总数,         与          分别为第          类的真正例与假负例数。

宏平均 F1 分数结合了精度与召回率,定义如下:

     
   

其中,         和          分别表示第          类的精度与召回率。

4.3 结果与讨论

4.3.1 主要结果分析

表1至表5展示了在五个基准数据集上的 15 个领域泛化故障诊断任务中,本文方法与现有典型 SDG 方法的诊断性能对比结果。表头中的“S”表示每个泛化任务所使用的源域。所有任务均重复运行五次,并报告主要性能指标的平均值与标准差。 

首先,可以观察到,基线 CNN 模型在所有任务中性能最差,表现出较弱的泛化能力。其次,与基线模型相比,多个先进的 SDG 方法在诊断性能上均取得显著提升,这主要得益于它们在训练中引入了数据增强、特征多样化策略,并融合了域泛化机制,从而增强了模型的特征表示能力。最后,在大多数实验设置下,本文方法在准确率、宏平均召回率和宏平均 F1 分数三项指标上均显著优于现有方法,且表现出更小的标准差,充分验证了所提方法在工业诊断任务中的鲁棒性与泛化能力。 

为直观验证本文方法在缓解域偏差方面的有效性,我们在 HUST 数据集上设计了一个泛化任务(源域:70 Hz,目标域:75 Hz)。将不同方法学习到的源域与目标域特征表示通过 t-SNE 降维至一维后,采用核密度估计(KDE)进行可视化,所得密度曲线可用于评估两个域特征分布的重叠程度,从而判断其相似性。结果如图5所示。 

由图可见,基线模型所学习的源域与目标域特征之间存在显著分布差异,主要由于其未能有效缓解源目标域之间的数据分布不一致问题。其他典型 SDG 方法(如 L2D、AMINet、MSG-ACN、DEFSDG)通过特征生成和域不变特征学习在一定程度上缓解了分布偏差。而本文方法通过交替执行扰动特征生成与域不变特征学习,更有效地优化了域对齐过程,最终在分布重叠程度上优于其他方法,表现出更强的特征泛化能力。 

表1 不同方法在PU 数据集泛化任务中的结果对比

表2 不同方法在HUST 数据集泛化任务中的结果对比

   

图5 不同方法在源域与目标域中的特征分布可视化:(a) CNN,(b) L2D, (c) AMINet,(d) MSG-ACN,(e) DEFSDG,(f) 本文方法 表3 不同方法在BJUT 数据集泛化任务中的结果对比

表4 不同方法在SDUST 数据集泛化任务中的结果对比

表5 不同方法在RFB 数据集泛化任务中的结果对比

   

4.3.2 消融实验分析

为分析所提方法中各个模块的作用,表6给出了在五个数据集上不同消融策略下的诊断准确率(%)对比结果。表中 Method 1 至 Method 4 分别对应具体的模块组合策略。 

从表中可观察到:与基线模型相比,Method 1 引入 LSP 模块后,模型能够探索更广泛的潜在域空间,显著提升了其泛化能力。Method 1、2 和 4 的对比表明,无论是增强协方差对齐,还是语义对齐,都能明显提升泛化准确率。此外,Method 3 与 Method 4 的对比结果表明,将协方差匹配与成对一致性联合使用,可有效抑制风格特征干扰,进一步改善模型的泛化性能。 

最终,本文方法在整合全部模块的基础上,在五个数据集上均取得最佳性能,说明各模块协同优化对于提升故障诊断准确性具有重要作用。 

表6 不同方法在各类数据集泛化任务中的结果对比

为进一步验证各模块策略在 SDG 故障诊断中的有效性,本文在 HUST 数据集上进行泛化任务,并采用 t-SNE 将不同消融方法所得源/目标域特征降维为二维后进行可视化,结果如图6所示。图中使用不同颜色表示不同健康状态,不同形状表示不同域,以便于理解。

图6 在HUST 数据集上不同消融设置下的特征表示二维可视化:(a) 基础 模型,(b) M1,(c) M2,(d) 本文方法

图7 在不同协方差对齐策略下双流网络学习的特征协方差矩阵对比 

首先,如图6(a) 所示,在基线模型下,源域与目标域特征高度重叠,类别边界模糊。引入 LSP 策略后(图6(b)),源/目标域特征间分布距离明显扩大,表明该策略能够有效引入域差异性。进一步引入协方差对齐(图6(c))后,源/目标域特征间距离缩小,域偏差得到缓解。当加入语义对齐策略后(图6(d)),同一类别的特征在源域与目标域中形成更加紧密的聚类。 

为验证所提协方差对齐策略的有效性,图7展示了在不同对齐策略下,双流网络学习到的特征协方差矩阵对比。基线网络中的协方差矩阵差异明显,对角特征几乎无法分辨;引入协方差匹配策略后,矩阵整体更趋一致,但对角信息仍不明显,表明虽然实现了原始与扰动特征的整体对齐,但存在信息丢失风险。引入成对一致性后,对角特征增强,保留了部分任务信息,但矩阵仍存在不一致;联合两种策略后,不仅实现了矩阵结构的一致性,还保留了清晰的对角线特征,实现了原始与扰动特征在保留关键信息基础上的有效对齐。

图8 模型第一层中原始与可学习扰动特征统计量在不同训练迭代下的对比

图9 模型第一层中原始与扰动特征的可视化对比:(a)10 次迭代,(b)30 次迭代,(c)60 次迭代

图10 基线模型与本文方法在不同数据集上的混淆矩阵对比:(a) HUST,(b) SDUST,(c) PU,(d) RFB,(e) BJUT 

为直观展示模型如何学习统计特征的变化,图8展示了第一层卷积中 16 个通道在不同训练阶段的统计量变化。图中蓝色条表示原始特征的均值与方差,黄色条表示扰动特征。在第 10 次迭代时,两者差异较小;到第 30 次迭代,部分通道出现明显偏移;第 60 次迭代时,多个通道在均值与方差上差异显著,说明扰动特征逐步扩大了统计空间的分布差异。 

进一步,图9利用 t-SNE 对上述原始与扰动特征进行可视化。图中不同颜色表示不同类别,不同形状区分原始与扰动特征。从结果可见,初期(10 次迭代)原始与扰动特征基本重合;随着训练推进,它们之间的分布距离逐渐扩大,体现出模型构造的域差异性增强。 

图10展示了基线模型与本文方法在五个数据集上的混淆矩阵对比。可以看出,本文方法在所有数据集上均显著降低了误分类情况,提升了故障可分性。其中,HUST 与 SDUST 数据集中的分类混淆显著减少;而在 PU 数据集中,第四类故障的识别仍具挑战性,但本文方法在该类上也优于基线模型;在 RFB 与 BJUT 数据集上,本文方法相较基线模型展现出更强的泛化能力与诊断鲁棒性。

4.3.3 计算开销评估

表7 不同方法在模型复杂度与推理效率方面的对比

表7对比分析了不同代表性方法在模型复杂度与推理效率方面的差异。评估指标包括参数量(Params)、浮点运算次数(FLOPs)、推理时间、内存占用与单样本能耗,旨在反映模型在实际部署中处理每个样本的资源开销。所有指标均在 Jetson Nano 平台上进行测量,推理批次大小设为 1,以模拟典型边缘设备的应用场景。内存使用表示模型在单样本推理过程中的运行时内存占用,单样本功耗为处理一个样本所需的平均能量。 

从表中可见,本文方法在保持准确性的同时具备良好的计算效率,参数量为 16.34M,FLOPs 为 21.18M,平均推理时间仅为 31.27 ± 0.72 毫秒,内存占用为 73.24 MB,单位样本功耗为 0.15 W,展现出极低的部署开销。与 ACL 与 DEFSDG 等多分支设计方法相比,本文方法在推理成本方面具有显著优势。

 值得注意的是,MEADA、L2D、AMINet 及 MSG-ACN 等方法虽在训练阶段引入样本生成策略,但其推理阶段结构与本文方法保持一致。因此,本文在表7中省略了这些方法,以避免冗余对比。

结论

本文针对工业设备的故障诊断任务,提出了一种基于单域泛化(SDG)的诊断方法,利用差异性与一致性的对抗建模机制提升模型在复杂工况下的泛化能力。该方法在浅层特征空间引入可学习统计扰动(LSP),主动模拟由负载、转速等运行条件变化引起的域偏移,从而增强模型对环境变化的鲁棒性与适应性。此外,结合协方差对齐与语义一致性对齐策略,从全局与类别层面对原始特征与扰动特征进行对齐,有效提升了模型在多变工业场景下的预测稳定性与一致性。

为验证所提方法的实际效果,本文在五个典型旋转机械数据集上开展了系统实验,主要结论如下:

  1. 所提方法在准确率、宏平均召回率和宏平均 F1 分数等指标上显著优于现有主流 SDG 方法,验证了其在工业相关泛化场景下的诊断可靠性;
  2. LSP 模块在潜在特征空间中显式模拟统计扰动,使模型能够更有效地捕捉复杂工况下可能出现的域偏移。与传统的随机扰动方式相比,LSP 提供了更具可控性和泛化性的分布建模能力,展现出良好的工业应用潜力;
  3. 协方差对齐机制有效抑制风格特征干扰,语义对齐策略进一步增强了故障类别识别的稳定性,使该方法尤为适合部署于高动态变化的工业现场环境。
需要指出的是,本文方法假设训练域与目标域在潜在空间中存在共享结构,在面对严重分布偏移时仍存在泛化失效的风险。为缓解该问题,可结合数字孪生技术与高保真仿真生成物理先验增强数据,从而提升训练数据多样性与模型适应性。此外,本文方法主要基于浅层网络中的统计特征建模,对于复杂域偏移的表达能力仍有限。未来可进一步探索高阶统计量、协方差结构或深度生成模型,以提升模型对复杂领域间差异的感知能力和跨域泛化性能。

编辑:曹希铭

校核:李正平、陈凯歌、赵栓栓、赵学功、白亮、任超、Tina、陈宇航、海洋、陈莹洁、王金、赵诚、肖鑫鑫

该文资料搜集自网络,仅用作学术分享,不做商业用途,若侵权,后台联系小编进行删除



来源:故障诊断与python学习
ACTMechanical振动断裂旋转机械航空电子ANSA海洋理论电机化机Electric多尺度数字孪生控制人工智能SCL
著作权归作者所有,欢迎分享,未经许可,不得转载
首次发布时间:2025-09-18
最近编辑:1年前
故障诊断与python学习
硕士 签名征集中
获赞 87粉丝 153文章 336课程 0
点赞
收藏
作者推荐

小样本与抗噪RUL预测新范式|基于元知识随机注意力更新的深度网络模型

本期关注小样本与抗噪声条件下的设备剩余寿命(RUL)预测新范式:在复杂的工业系统中,准确评估设备的剩余寿命对于保障系统稳定运行与优化维护策略至关重要。然而,受限于高质量退化数据的获取成本与现场噪声干扰,当前主流RUL预测模型在小样本、强噪声等极端场景下面临泛化能力差等关键瓶颈。为应对这一挑战,本文提出一种融合元知识建模与随机注意力机制的深度预测框架——元知识随机注意力更新网络(Meta-Knowledge Random Attention Update Network)。该方法首先通过将核特征视为随机潜变量,借助蒙特卡洛采样增强样本表达的鲁棒性;进一步在随机核中引入注意力机制,实现对局部退化信息的精细控制;同时,在知识更新过程中有机融合共享与特定知识,显著降低冗余噪声对模型泛化的干扰。在发动机与轴承退化数据集上的系统实验验证了该模型在抗噪与小样本场景下的显著性能提升,为实现工业设备的可靠预测与智能维护提供了前瞻性技术支撑。论文链接:通过点击本文左下角的阅读原文进行在线阅读及下载。论文基本信息论文题目:Meta-knowledge random attention update network for few-shot and anti-noise remaining useful life prediction论文期刊:Advanced Engineering Informatics论文日期:2025年论文链接:https://doi.org/10.1016/j.aei.2025.103358作者:Jing Yang (a), Xiaomin Wang (a*), Minglan Zhang (b), Lin Liu (c), Jiuyong Li (c)机构:a: School of Information Science and Technology, Southwest Jiaotong University, Chengdu, 610031, China; b: School of Computing and Artificial Intelligence, Southwest Jiaotong University, Chengdu, 610031, China; c: UniSA STEM, University of South Australia, Adelaide, SA, 5095, Australia团队带头人简介:王小敏老师,现任西南交通大学教授、博士生导师,系“交通运输工程/交通信息工程及控制”国家一流学科中青年学术带头人及四川省杰出青年学科带头人。依托“交通信息工程及控制”国家重点学科及科研平台,长期从事轨道交通运行控制、智慧铁路、人工智能与大数据运维、数字铁路信息安全等方向的研究。王老师主持和参与了40余项国家自然科学基金、863计划、教育部、铁道部/铁路总公司/国铁集团、四川省及轨道交通行业企业等国家级和省部级科研项目,同时承担6项高等教育教学改革项目。已在IEEE TNNLS、IEEE TITS、Information Sciences、Reliability Engineering and System Safety、Energy等国内外知名期刊,以及《软件学报》《计算机学报》《自动化学报》等核心期刊发表学术论文160余篇。(来源: https://faculty.swjtu.edu.cn/wangxiaomin/zh_CN/index.htm)目录1 摘要2 引言3 所提方法3.1 随机注意力核网络3.2 元知识更新网络3.3 MeRAU的参数优化4 实验与结果分析4.1 数据集描述与预处理4.2 噪声设置与评估指标选择4.3 剩余寿命预测结果分析4.4 消融实验分析4.5 抗噪性能对比分析4.6 小样本性能对比分析4.7 与已有方法的对比分析5 结论1 摘要在工业系统中,设备的剩余寿命(Remaining Useful Life,RUL)预测对于保障系统的安全运行至关重要。现有的RUL预测模型已取得显著进展,其核心多依赖于具有相似退化模式或近似分布的大量退化数据。然而,当标注的退化数据较为有限,且数据受到噪声干扰时,不同RUL数据之间的分布差异将进一步扩大,导致现有方法难以有效提取数据间的共享知识,从而难以实现令人满意的预测性能。针对这一问题,本文提出了一种用于小样本与抗噪声RUL预测的元知识随机注意力更新网络模型。首先,将学习得到的核特征视为随机潜变量,并采用蒙特卡洛采样方法进行建模;随后,在随机核中引入注意力机制,以控制局部退化信息,从而增强模型对特定知识的学习能力。此外,为降低冗余或噪声信息对元知识的干扰,在知识更新过程中融合共享知识与特定信息。本文在发动机与轴承退化相关数据集上开展了全面实验,结果验证了所提模型在预测性能方面的优越性。关键词:工业系统,剩余寿命预测,抗噪声,小样本,元学习,元知识更新2 引言随着工业物联网(Industrial Internet of Things, IoT)与先进传感技术的快速发展,以及现代工业系统的不断演化,如何有效降低系统的运维成本并保障其长期稳定运行显得尤为重要。作为确保系统与设备高效运行的重要手段,剩余寿命(Remaining Useful Life, RUL)预测受到了广泛关注。近年来,尽管循环神经网络、卷积神经网络、Transformer以及混合模型等深度学习方法已被广泛应用于RUL预测任务中,但这些方法在训练阶段通常依赖于大量退化数据以更新模型参数。然而,获取大规模退化数据往往成本高昂。当可用的退化数据较为有限时,这些深度学习方法的模型参数难以得到有效更新,进而导致预测性能大幅下降,缺乏竞争力。因此,如何在仅有少量退化数据的情况下实现准确的RUL预测,已成为当前研究的热点问题。目前,从少量训练数据中学习并完成预测的过程通常被称为小样本学习(Few-Shot Learning, FSL)。在小样本学习问题中,元学习(meta-learning)因能够利用历史任务中的经验信息推广至新任务而展现出独特优势。元学习将有限的训练数据划分为多个包含少量样本的任务,并通过跨任务搜索无偏初始化参数,使模型的损失在全局范围内快速收敛,从而实现对新任务的快速适应。已有研究尝试将元学习与卷积神经网络相结合,应用于RUL预测任务中;也有研究通过引入注意力机制增强信号特征,以提升元学习模型的预测能力。然而,在面对复杂依赖关系与高维特征时,此类模型难以有效捕捉全局依赖与局部特征表示,导致退化特征提取过程不稳定的问题。此外,在实际工业环境中,受限于传感器负载与外部环境的影响,大多数采集到的数据不可避免地包含不同程度的噪声干扰。这些噪声信号会扰乱原始序列数据中的特征模式与趋势,增加模型提取真实特征的难度,甚至可能引发过拟合问题。目前,常见的解决策略包括:设置多尺度卷积核以提取短时特征,从而增强对噪声信号的鲁棒性;设计专用的网络结构以自动识别与去除噪声;以及在某些场景下,通过加深网络层数提升模型的抗噪能力与复杂模式的学习能力。尽管上述方法在抗噪性能方面取得了一定成果,但它们主要依赖于对数据中 特定特征的增强。这些方法普遍假设噪声与有效特征之间具有清晰的区分界限,然而现实场景中,噪声往往具备与退化特征相似的多尺度属性,使得在噪声与退化特征存在重叠的情况下,难以实现有效分离。在当前的RUL预测任务中,退化数据中的噪声干扰不仅会显著扭曲原始数据所包含的固有信息,而且噪声与退化特征重叠所带来的非平稳性问题,使得现有预测方法难以彻底消除噪声干扰。此外,噪声干扰与数据量大小密切相关:当样本量不足时,噪声数据所占比例相对较高,模型难以准确捕捉退化数据中的真实模式,导致训练阶段无法学习到足够的规律性,进而严重影响预测性能。因此,如何在强噪声干扰与小样本条件下构建高性能的RUL预测模型,成为当前亟需解决的重要挑战。为应对这一问题,本文提出一种基于元知识随机注意力更新网络的RUL预测新模型MeRAU(Meta-knowledge Random Attention Update),专用于小样本与抗噪声情境下的退化寿命预测。该方法的核心思想是将随机核网络与模型无关元学习框架(model-agnostic meta-learning)相融合,通过数据驱动方式提取随机核特征,并引入注意力机制以捕捉不同任务间共享的退化特征信息。此外,本文设计了元知识更新网络,在抗噪推理过程中,借助精简高效的结构对历史任务中获取的先验信息与共享知识进行更新与记忆,从而提升模型在噪声干扰下的推理与预测能力。本文的主要贡献如下: 提出一种基于元学习框架的元知识随机注意力更新模型(MeRAU),用于应对小样本与强噪声条件下的剩余寿命预测任务。该方法引入元知识更新网络,通过对多个关联任务中的信息进行快速而精准的推理,获取通用的元知识,从而显著降低模型参数规模,并实现对新任务的快速适应与高精度预测。 在RUL预测中,将注意力机制引入到随机核网络中。该技术有效增强了变分后验在小样本与抗噪学习场景下的特征表征能力,提升了模型对关键退化信息的捕捉能力。通过大量实验验证,所提出的MeRAU模型在RUL预测任务中相较于多种先进方法表现出更优的性能,充分展示了其在应对复杂小样本与抗噪退化寿命预测任务中的巨大应用潜力。3 所提方法3.1 随机注意力核网络 在缺乏完整生命周期数据且对预测精度要求较高的场景下,小样本元学习为剩余寿命(RUL)预测提供了一种全新的策略。其中,模型无关元学习(Model-Agnostic Meta-Learning, MAML)是一种具有代表性的算法,因其能够从大量相似的元任务中学习先验知识,并有效地将该知识泛化到新任务中。本研究将随机核网络(Random Kernel Network)与MAML框架相结合,能够更有效地适应个体任务的复杂性与特征分布。在RUL预测任务中,假设存在总计 个任务 ,每个任务由任务分布 中均匀采样得到。对于某一任务 ,其训练集为 ,验证集为 ,其中 。本文使用带有核技巧(kernel trick)的标准学习算法,通过公式 来学习预测器 的参数 ,其中训练集记作 ,验证集为 。在该公式中, 表示基础学习器(base learner), 表示输入数据经过随机核映射后的特征表示。元学习器(meta-learner)主要用于学习不同退化任务之间的共性,并生成基础学习器的初始模型参数 。随后, 会基于 个基础学习器的参数进行计算,其过程可描述如下: 其中, 表示均方误差损失函数, 为特征映射函数。在本研究中,采用多层感知器(MLP)回归器作为小样本学习中的基础学习器 。Gram 矩阵中的核函数值 的计算方式为 ,其中 表示转置操作。单个任务的基础学习器 通过求解以下目标函数获得。 假设该多层感知器(MLP)具有 层,每一层 具有权重矩阵 、偏置向量 ,以及激活函数 。那么,对于任意输入为 、输出为 的第 层,其计算关系如公式所示: 其中, 表示输入层中的数据, 表示输出层中的预测值, 表示最顶层的权重,该权重是通过构建条件单层感知器作为生成器生成的: 随后,所学习到的回归器被应用于验证集 中的样本。 其中, , ,其每个元素表示训练集样本与验证集样本之间的核函数值 。通过引入元学习策略,元学习器通过学习所有参数以获取知识。从概率角度来看,小样本RUL预测的目标是:在给定训练集 的条件下,估计验证集中退化数据 所对应标签 的后验预测分布,其表示形式如下: 该模型首先通过随机傅里叶特征核 提取训练样本 与验证样本 的随机特征: 其中, 表示与退化数据 对应的随机向量集 合。 。当随机向量的后验分布能够刻画训练过程时,即可通过 来预测验证集中退化样本的标签分布: 然而,直接求解随机向量的真实后验分布非常困难,通常采用变分推断方法进行处理。通过最小化目标分布 与一个更简单的分布 之间的Kullback–Leibler(KL)散度,实现对目标分布的近似。由此,后验预测分布可近似为以下分布: 其中,𝜙 是推断网络的参数,𝜃 是随机网络的参数。当退化数据中包含大量噪声且退化信息较为模糊时,从随机向量的后验分布中获取元知识的重要性会有所不同。基于此,模型进一步引入局部潜变量 ,用于表示与每个退化任务相关的注意力映射,其后验预测分布的对数似然函数表达如下: 其中,局部潜变量 的条件先验分布为 ,这是因为注意力向量应针对每个单独的验证集 进行建模。然而,直接求解这些问题非常困难。通过引入变分后验分布,并通过最小化其与真实后验的KL散度来进行逼近。对于随机向量 和注意力向量 ,分别采用变分分布 和 进行近似。基于此,可以构建对数似然函数的下界,并通过最大化该下界来寻找最优解,其表达式如下: 该证据下界(ELBO)的第一项是基于推断出的随机向量 和注意力向量 ,对条件生成分布 对数似然的期望值。第二项是后验分布 与先验分布 之间的KL散度的估计值。通过最小化该项,模型被鼓励利用有限的退化信息捕获验证集中的共享知识。第三项KL散度的最小化则使模型生成的注意力向量更少受到噪声影响。随机注意力核网络的结构如图1所示。 图1 随机注意力核网络的结构框架3.2 元知识更新网络 为了实现针对上下文RUL预测任务的抗噪声推理,本文设计了一种元知识更新网络(Meta-Knowledge Update Network, MKUN),以实现共享知识与特定信息的高效融合。其中,共享知识通过随机核特征提取,用于捕捉任务之间的全局模式;而特定信息则借助注意力机制获取,用以聚焦于局部特征。MKUN采用一种非参数结构的滤波函数,并结合带有时空信息传递控制机制的卷积长短期记忆网络(ConvLSTM),构建出一个简洁而高效的元知识更新网络架构。该网络结构如图2所示。 图 2 元知识更新网络结构示意图 对于当前预测任务 ,元知识更新网络(MKUN)的输入为元知识 ,由随机向量 与注意力向量 组成,即 。在提取上下文时空信息的过程中,采用基于双向 ConvLSTM 的推理网络,以缓解任务顺序对推理过程的影响。该网络旨在捕捉更丰富的上下文时空特征,并融合来自前序预测任务与后续任务的时空信息。MKUN 可表示为: 其中, 的输入包括元知识 、隐藏状态 以及记忆单元 。 为可学习参数。 表示通过抗噪声推理获得的元知识,即 。 其中, 表示更新后的隐藏状态, 、 和 分别为可学习的权重与偏置参数, 和 是激活函数, 和 $$ 分别表示按元素乘法操作符与卷积操作。 是滤波单元,用于度量元知识并剪除冗余信息,其计算公式为:其中, 是用于过滤所选任务元知识的滤波函数,即 。 是衡量元知识间差异的距离函数。当两个元知识之间的差异大于阈值 时,说明未滤波的元知识 与滤波后的元知识 之间存在一定差异,此时可以在一定程度上保留不同任务的特定信息;当差异值小于阈值 时,仅考虑滤波后的元知识。该滤波单元能够对元知识进行非参数化过滤,选择性地保留任务特定的经验信息,从而实现元知识的混合式过滤,并有效缓解任务特定信息的灾难性遗忘问题。3.3 MeRAU的参数优化为了使 MeRAU 模型能够在含噪测试集上实现准确的RUL预测,要求推理网络 所对应的近似后验预测分布能够获得最优参数。为此,可通过最小化各任务的平均预测损失来实现,即通过最大化证据下界(ELBO)来寻找随机映射网络的最优参数 。这需要缩小近似后验分布与真实后验分布之间的差距,即最小化 和 两项散度。对于一批任务 ,采用基于蒙特卡洛采样估计的随机优化方法可以获得目标函数的近似表达式,用于基于梯度的优化。共享参数 和 的训练目标如下所示: 其中,𝐿 和 𝑀 表示样本数量。蒙特卡洛采样分别在索引 𝑖 和 𝑗 上进行,𝑖 的取值范围为 1 到 𝐿,𝑗 的取值范围为 1 到 𝑀。考虑到不同任务可能具有不同的特征和数据分布,优化过程通过对各任务之间的损失进行平均,以寻求在不同场景下具有良好泛化能力的参数。同时,两项KL散度的引入也保证了模型训练过程的稳定性。为了在训练过程中使用采样操作实现反向传播,采用了重参数化技术: 其中, 为参数化函数, 表示服从均值为零、单位协方差的正态分布的随机变量。 和 共同构成基学习器的顶层权重,记作 。元知识随机注意力更新网络的整体架构如图 3 所示。 图 3 元知识随机注意力更新网络架构4 实验验证和结果分析4.1 数据集描述与预处理4.1.1 C-MAPSS数据集 C-MAPSS数据集由NASA研究中心提供,是RUL预测领域中常用的基准数据集之一。该数据集是一组由分布在涡扇发动机不同位置的传感器采集的多维度退化数据,如图4所示。C-MAPSS数据集被划分为四个子集:FD001与FD003在单一工况下采集,FD002与FD004在控制变量随机调整且工况更复杂的条件下采集。具体而言,FD001和FD003均包含100个训练单元和100个测试单元,FD002包含260个训练单元和259个测试单元,FD004则包含248个训练单元和249个测试单元。 图 4 航空发动机示意图 考虑到设备在数据采集初期可能尚未出现明显的退化现象,本文采用分段线性方式对 RUL 进行表示。具体而言,数据集中每个发动机的退化周期均按照设定的 进行分段,当剩余寿命大于 时,统一设定为 。为与多数文献保持一致,本文将 设定为125。4.1.2 智能维护系统数据集(IMS Dataset) 智能维护系统(Intelligent Maintenance Systems, IMS)数据集是用于轴承相关设备 RUL 预测研究的重要基准数据集之一。该数据集的测试平台与传感器安装位置如图 5 所示。平台上安装有四个 Rexnord ZA-2115 型双列轴承,旋转速度为2000 r/min,承载负荷为 6000 磅,采样频率为20 kHz。该数据集完整记录了轴承从正常运行逐步退化直至发生故障的全生命周期振动信号。 图 5 IMS 测试平台示意图本文选取 IMS 数据集中的 Case2 和 Case3 进行实验。Case2 是从正常运行到失效的自然退化测试过程,而非加速退化实验,因此能够更真实地反映模型在实际工况下的 RUL 预测效果;而 Case3 表现出更复杂的退化模式,轴承在其生命周期中出现了两次“自愈”行为。考虑到 IMS 数据集的使用寿命较长,本文参考相对损伤指标(Relative Damage Indicators, RDI)来确定退化起始时间点,发现 Case2 和 Case3 分别在第 234 小时和第 1000 小时后开始出现退化现象。因此,本文分别截取两种工况从退化开始到停止运行之间的振动信号作为 Case2 和 Case3 的实验样本。由于相邻样本的 RDI 变化较小,进一步对数据进行划分:Case2 的退化数据被划分为两组共 162 个样本,Case3 被划分为两组共 140 个样本。同样采用分段线性形式对 RUL 进行标注,其中 Case2 和 Case3 的 分别设置为 140 与 125。4.2 噪声设置与评估指标选择 4.2.1 噪声设定 在本研究中,所使用的 C-MAPSS 和IMS 数据集并非完全由纯净的全生命周期退化源数据构成,而是包含了一定程度的噪声。然而,与实际复杂应用场景相比,在受控实验环境中采集的退化数据具有相对较高的信噪比(SNR)。因此,为了增强对未知真实噪声的表示能力,并探讨其对 RUL 预测的影响,本文在 C-MAPSS 和IMS 数据集的全生命周期退化数据中引入了不同信噪比水平的白高斯噪声。信噪比(SNR)的定义如下: 其中, 和 分别表示所添加噪声信号的功率与原始退化源数据的功率。4.2.2 评估指标 本文采用四种评估指标来量化 MeRAU 模型在 RUL 预测任务中的性能,包括:均方根误差(Root Mean Squared Error,RMSE)、平均绝对误差(Mean Absolute Error,MAE)、 以及评分函数(Score Function,SCORE)。其中,RMSE 可同时衡量剩余寿命早期与晚期预测值的离散程度;MAE 能够准确反映实际 RUL 预测误差的大小; 能够直观表示 RUL 预测模型的拟合精度;而 SCORE 指标则区别对待提前 预测与滞后预测结果,对滞后预测施加更大惩罚。4.3 剩余寿命预测结果分析 为直观展示所提模型的抗噪声效果,本文选取了两个具有代表性的子集进行 RUL 预测结果分析,分别为C-MAPSS 数据集中的 FD001 和FD004 以及 IMS 数据集中的 Case2 和Case3。图 6(a)–(d) 展示了所提MeRAU 模型提取特征的概率密度函数(PDF),用于评估其在强噪声干扰下对真实退化信息的建模能力。 图 6 不同子集上的概率密度函数结果:(a)–(d)为 MeRAU 模型的结果,(e)–(h)为未引入抗噪机制的结果作为对比,图 6(e)–(h) 给出了不含抗噪网络的模型无关元学习(MAML 或 “No Anti-noise Network”)的PDF 曲线,该方法仅使用 10% 的训练数据,在信噪比 SNR = −6 的情况下,直接对测试集进行 RUL 预测。从图中可观察到,MeRAU 模型在“无噪” 与 “抗噪”情况下的 PDF 曲线基本一致,明显优于未引入抗噪机制的 MAML,表明MeRAU 能够有效从强噪声退化数据中学习到真实信息,准确捕捉设备的退化趋势。图 7 展示了在 FD001、FD004、Case2和 Case3 测试集上随机选取的退化单元的 RUL 预测结果。结果显示,相较于无抗噪能力的 MAML 方法,所提MeRAU 模型在小样本抗噪分析中表现出更优的预测效果。通过将随机特征与 MAML 框架融合,并引入随机注意力潜变量,MeRAU 模型显著提升了抗噪性能,在新颖的小样本抗噪场景下实现了出色的 RUL 预测性能。 图 7 不同子集上退化单元的RUL预测结果 4.4 消融实验分析 为了评估MeRAU模型中各组成成分对 RUL 预测的影响,本文在仅使用10%训练数据且信噪比(SNR)分别为−6和6的条件下,采用均方根误差(RMSE)和标准差作为评估指标,开展了消融实验。MeRAU包含四个变体,如表1所示。其中, 由随机核网络与元知识更新网络组成, 由随机核网络、元知识更新网络及滤波单元组成, 由随机注意力核网络与元知识更新网络组成,而 则为纯随机注意力核网络。表 1 消融实验的详细设置 MeRAU 及其各变体在 FD001、FD002、Case2 和 Case3 子集上的 RMSE 结果如图 8 所示。MeRAU 模型在整体性能上优于 、 、 和 模型,验证了在小样本抗噪 RUL 预测中引入带滤波单元的随机注意力核网络与元知识更新网络的有效性。 图 8 MeRAU 及其变体方法在不同子集上的消融实验结果具体而言, 、 、 与 在大多数场景下均表现出较差的预测性能,且在不同噪声条件下稳定性不足。明显可见, 在所有测试场景中的 RMSE 和标准差均处于较低水平,表明其难以在小样本与抗噪情境下捕捉复杂模式,进而导致预测性能不佳。 通过引入滤波单元降低了 RMSE,但在 Case2 和 Case3 中其标准差显著上升,反映出其在复杂场景中仍存在稳定性不足的问题。 采用随机注意力机制以增强特征提取能力,其 RMSE 与稳定性优于 ,但在复杂退化模式下仍表现出一定程度的波动。 在大多数情形下的 RMSE 和标准差介于 与 之间,说明其所使用的随机注意力核网络具有一定的鲁棒性,但由于缺乏元知识更新网络,其抗噪能力受到限制。相比之下,所提出的 MeRAU 模型融合了包含滤波单元的元知识更新网络与随机注意力核网络,能够有效学习多任务经验与全局上下文信息,从而在 RMSE 和标准差两个指标上均展现出最优性能,证明了 MeRAU 模型在小样本与抗噪条件下兼具优异的预测精度与稳定性。 为进一步验证选用 MLP 作为基学习器的合理性,本文开展了消融实验,分别将 MLP 替换为 CNN 和 SVR 回归模型。与主实验一致,消融实验同样仅使用训练数据的 10%,并选择信噪比分别为 和 的噪声条件,采用 RMSE 作为评估指标。表 2 不同基学习器在 FD001 与Case2 数据集上的 RMSE 结果 表 2 的结果显示,选用 MLP 作为基学习器能够获得更优的 RUL 预测性能。相比之下,采用 SVR 作为基学习器时性能最差,这主要是由于在高维特征且受噪声干扰的条件下,SVR 更易产生过拟合问题。相比使用 CNN 作为基学习器,MLP的预测效果更加突出,其原因在于 MLP 模型结构相对简单,在有限数据条件下更易实现复杂的非线性映射。因此,以元知识更新网络和随机注意力核网络作为元学习器,结合 MLP 作为基学习器共同构建MeRAU 模型,能够有效实现小样本条件下的抗噪 RUL 预测。4.5 抗噪性能对比分析 为研究不同噪声水平对 RUL预测性能的影响,选取 FD001、FD004、Case2 和 Case3 四个子集,在仅使用有限退化数据且不添加额外噪声的条件下进行模型训练,随后利用信噪比分别为 、 和 的不同噪声条件下的退化数据进行测试。评估指标采用 MAE(平均绝对误差)。表 3 对用于抗噪性能对比的 9 种方法进行了详细描述。表 3 用于抗噪性能对比的方法说明 不同模型在不同噪声条件下的 RUL 预测效果如图 9 所示。显然,MeRAU 模型在各类噪声条件下对两个数据集均展现出显著优于其他九种预测方法的预测性能与泛化能力。相比于所提出的 MeRAU,随着 SNR 的降低,其余九种方法的 MAE 均显著上升。这是因为 SNR 的降低使退化数据中包含更多噪声,导致这些方法对健康状态的预测难度增加。 图 9 不同信噪比条件下各模型在不同子集上的 MAE 结果具体而言,不具备抗噪能力的方法(A1-A3)难以从含噪退化数据中有效学习真实的特征知识;具备抗噪能力的浅层网络方法(A4-A6)虽借助信号处理相关手段进行处理,但其特征提取的质量和效率高度依赖于先验经验,难以有效应用于 RUL 预测任务;具备抗噪能力的深层网络方法(A7-A9)则通过加深网络结构或记忆不变特征提升模型抗噪能力,但在 SNR 降低时,这类方法的参数调整所需时间显著增加,导致预测结果出现较大偏差。4.6 小样本性能对比分析 工业实际中退化数据的缺乏会显著影响 RUL 的预测准确性。为评估所提出的 MeRAU 模型在该问题下的鲁棒性,选取了 FD001、FD004、Case2 和 Case3 数据集,设定 ,在不同训练样本比例 条件下进行模型训练(其中 、 、 、 ),并采用 作为性能指标。表 4 对比了 9 种用于小样本学习情境下的预测方法及其实现细节。表 4 用于小样本学习性能对比的方法说明 图 10 呈现了各模型在不同训练样本比例下的 RUL 预测效果。实验结果表明,MeRAU 模型在小样本条件下依旧表现出色,具有良好的鲁棒性与预测能力。与 MeRAU 相比,其他九种方法在训练样本比例下降时 明显降低,主要原因是样本不足加剧了模型训练的难度,同时训练数据中混杂噪声,也进一步削弱了模型对设备健康状态的准确预测能力。 图 10 各模型在不同训练样本比例与子集条件下的表现不具备小样本学习能力的方法(B1–B3)无法从有限退化数据中提取稳定可靠的特征;浅层小样本方法(B4–B6)主要依赖专家经验建立先验知识,但该过程对人工依赖性高,缺乏普适性,不适于复杂的 RUL 预测任务;深层小样本学习方法(B7)虽然通过多层结构的自适应调整提升了表现,但仍不如基于元学习的方法(B8–B9)稳定。这是由于元学习方法能够借助预训练所学初始化参数,在面对新任务时快速适配,从而更好地应对小样本挑战。最终,MeRAU 模型通过融合随机注意力核网络与元知识更新网络,不仅在训练样本有限的情况下能为基础学习器提供更优的初始化参数,还能保持优异的 RUL 预测性能,显示出其在小样本学习场景下的强大优势。4.7 与已有方法的对比分析为验证所提出模型的有效性,本文与多个已有的先进方法进行了对比分析,包括 LSTM-RUL、CNN-RUL、Hetero-ConvLSTM、Attention GRU-CP、Kdnet-RUL、SD-TemCapsNet、MDER以及Siamese。参考上述方法的实验设置,将不同运行工况下的数据采用最大最小值归一化方式标准化至区间 [0,1]。该归一化过程有助于避免不同尺度的特征在建模过程中对结果产生不均衡影响。C-MAPSS 与 IMS 数据集的测试结果如图 11(a)–(b)所示。 图 11 MeRAU 与其他已有方法在不同数据集上的 结果在 C-MAPSS 数据集上,KDnet-RUL 和 MDER 采用知识蒸馏方式压缩复杂模型,SD-TemCapsNet 结合 LSTM 与 CapsNet 机制以建模时序动态特征,Siamese 模型则通过孪生网络捕捉退化趋势。然而,这些模型在面对复杂退化模式与噪声干扰时,稳定性与精度仍存在一定局限。相较之下,MeRAU 通过引入蒙特卡洛采样提升对退化动态分布的建模能力,并借助注意力机制实现对局部退化特征的动态控制,从而在 C-MAPSS 数据集上获得更优预测性能。在该数据集上,MeRAU 在 RMSE、SCORE 和 指标上分别相较其他模型提高了 13.47%、9.1% 和 13.3%,展现出显著的综合优势。在 IMS 数据集上,LSTM-RUL、CNN-RUL、Hetero-ConvLSTM 以及 Attention GRU-CP 等方法主要基于退化数据的相关性特征进行建模,但忽略了退化数据中存在的非平稳性与信息丢失问题,从而影响了模型的预测精度。相比之下,MeRAU 通过融合共享知识与特定知识,实现了对复杂退化动态的快速适应与对噪声的鲁棒性,因此在 IMS 数据集上获得了更优的预测结果。同样地,MeRAU 模型在 IMS 数据集上的 RMSE、SCORE 和 指标分别较其他模型提升了 16.41%、4.86% 和 9.61%。 进一步在 XJTU-SY 轴承数据集上进行了实验验证。该数据集通过多种加速疲劳实验,记录了 15 个滚动轴承从正常状态到故障的完整退化过程,涵盖三种工况:40 Hz/10 kN、37.5 Hz/11 kN 与 35 Hz/12 kN。轴承信号以每分钟采样一次的频率记录,采样率为 25600 Hz,每次采样共 32768 个数据点。实验中,每种工况下最后一个轴承数据作为测试集,其余数据用于模型训练。本研究将 MeRAU 模型与多个已有方法进行对比,包括 RVM、DSCN、TCN-RSA及 STD。性能评估指标包括 RMSE、SCORE、 和模型推理时间。图 11(c) 汇总了各方法在四项指标下的对比结果。结果显示,MeRAU 模型在所有指标上均优于现有方法。具体来看,RVM、DSCN、TCN-RSA 与 STD 等方法结合特征提取与时序建模,并借助卷积结构与自注意力机制对退化特征进行建模,但面对退化过程中的非平稳性与噪声干扰,容易出现特征与信息损失,进而影响预测精度。相反,MeRAU 所引入的随机注意力核网络能够有效提升模型对动态退化过程的响应能力,并增强其对复杂退化模式的识别性能,从而在 XJTU-SY 数据集上取得更佳表现。对比结果表明,MeRAU 模型在 RMSE、SCORE 和 三项指标上的性能分别较现有最佳方法提升了 83%、74% 和 19%,同时具备更低的推理时间与更高的运算效率。上述实验结果进一步验证了 MeRAU 模型在 RUL 预测任务中的稳健泛化能力与卓越的预测性能。5 结论本研究提出了一种基于元学习的 MeRAU 模型,用以应对剩余寿命(RUL)预测中的小样本抗噪挑战。该模型能够有效实现小样本条件下的抗噪预测,并在从退化数据中提取任务知识方面展现出较强的适应性与鲁棒性。通过引入蒙特卡洛采样,模型在潜在空间中获取共享知识,并利用注意力机制调控注意力核中的特定信息。随后,设计了元知识更新网络,将有效的先验共享知识与任务特定信息整合到当前任务中,通过元知识实现先验知识的更新与保留。接着,模型基于贝叶斯理论,结合变分后验分布与元知识,学习小样本抗噪任务的 RUL 预测。最后,在 C-MAPSS、IMS 与 XJTU-SY 等公开数据集上的实验验证了模型在小样本与抗噪 RUL 预测任务中的优越性能。编辑:Jin校核:李正平、陈凯歌、赵栓栓、曹希铭、赵学功、白亮、任超、海洋、Tina、陈宇航、陈莹洁、赵诚该文资料搜集自网络,仅用作学术分享,不做商业用途,若侵权,后台联系小编进行删除来源:故障诊断与python学习

未登录
还没有评论
课程
培训
服务
行家
VIP会员 学习计划 福利任务
下载APP
联系我们
帮助与反馈