本期给大家推荐基于多源对抗性在线知识蒸馏的跨设备剩余寿命预测。剩余寿命预测是设备运维的核心环节,深度迁移学习虽已广泛应用于此领域,却始终受两大痛点掣肘:多数方法仅适配同一设备内不同工况,面对跨设备的严重数据分布偏移束手无策;少数探索跨设备预测的研究,又依赖海量带标签数据,难以落地工业场景。为此,该论文提出全新的多源对抗性在线知识蒸馏方法,通过多级域适配与动态加权在线知识蒸馏的双重知识迁移机制,突破数据限制,全面提取跨设备多工况下的预测知识,提升剩余寿命预测精度!
论文链接:通过点击最左下角的阅读原文进行在线阅读及下载。
论文题目:Remaining useful life prediction across machines using multi-source adversarial online knowledge distillation
论文期刊:Engineering Applications of Artificial Intelligence
Doi:
https://doi.org/10.1016/j.engappai.2023.107726
a: School of Mechanical Engineering, Southwest Jiaotong University, Chengdu 610031, China
b: Technology and Equipment of Rail Transit Operation and Maintenance Key Laboratory of Sichuan Province, Southwest Jiaotong University, Chengdu 610031, China
深度迁移学习在滚动轴承剩余寿命(Remaining Useful Life, RUL)预测领域已得到广泛应用,因其能够降低对大量带标签数据的依赖,并鲁棒地提取适应性特征。目前大多数研究仅针对同一设备内不同工况下的RUL进行预测,因此这些方法不适用于存在严重分布偏移的数据。仅有少数研究探索了跨设备RUL预测,但这些研究的成功依赖于存在大量带标签数据这一前提条件。综上,现有模型的适用性和预测性能在工业场景中受到极大限制。为解决上述不足,本文提出一种多源对抗性在线知识蒸馏方法,用于跨设备滚动轴承RUL预测。在集成学习架构中,设计了包含多级域适配和动态加权在线知识蒸馏的双重知识迁移机制。该方法能够更全面地提取和迁移不同设备间多工况下的预测知识,从而提升RUL预测性能。在两个公开的滚动轴承数据集上进行的实验表明,所提方法在预测精度方面具有有效性和优越性。
1 引言
2 问题描述
3 方法
3.1 在线知识蒸馏
3.2 所提方法
4 实验结果与讨论
4.1 数据集描述
4.2 实验设置
4.3 实验结果与分析
5 结论
滚动轴承的健康状态直接影响机械设备的运行效率与安全性(Li等,2023a)。准确且可靠的剩余寿命(Remaining Useful Life, RUL)预测能够预防事故发生,并降低维护成本(Feng等,2023a)。
近年来,基于数据驱动的RUL预测方法得到了广泛研究。这类方法从大量监测数据中自动提取退化特征,随后通过浅层机器学习或深度学习技术实现回归预测。典型方法包括支持向量机(Benkedjouh等,2013)、高斯回归过程(Aye和Heyns,2017)、深度置信网络(Deep Belief Network, DBN)(Deutsch和He,2018)、长短期记忆(Long Short-Term Memory, LSTM)网络(Mao等,2018)、卷积神经网络(Convolutional Neural Network, CNN)(Li等,2019)、门控循环单元(Feng等,2023b)等。此外,知识蒸馏(Knowledge Distillation, KD)技术也被引入RUL预测领域(Xu等,2022;Ren等,2023)。其中,Xu等(2022)提出了一种KD框架,将复杂 LSTM 模型中的KD到简单CNN模型中,用于RUL预测,这是该领域的代表性研究成果。Ren等(2023)设计了多教师KD机制与动态退出方法,实现了轻量化的自适应设备RUL预测。尽管这些方法(Xu等,2022;Ren等,2023)取得了较好的预测结果,但它们需要大量带标签数据,且仅适用于相同工况下的RUL预测。换言之,训练数据与测试数据需服从同一分布,而不同工况下的数据难以满足这一条件。
为解决该问题,深度迁移学习(如模型微调、域适配、对抗学习等)已被应用于滚动轴承RUL预测(Chen等,2023)。这类方法的核心思想是将源域中包含的预测知识迁移到相关但不同的目标域中,从而减少数据分布偏移。Cheng等(2021)构建了一种可迁移CNN,用于学习域不变退化特征,并将多核最大均值差异(Maximum Mean Discrepancy, MMD)融入优化函数,以提升不同失效模式下的RUL预测性能。Costa等(2020)基于LSTM开发了域对抗神经网络(Domain-Adversarial Neural Network, DANN),有效减少了RUL预测中的域偏移。Li等(2023b)提出了一种基于域对抗的RUL预测方法,该方法同时挖掘不同工况下全局特征与部分传感器数据的共享特征,实现了可靠的RUL预测。综上,文献(Chen等,2023;Cheng等,2021;Costa等,2020;Li等,2023b)解决了同一设备内两种工况间的RUL迁移预测问题。这些方法之所以能够成功,很大程度上是因为同类型滚动轴承具有高度一致的退化特性,这为预测知识的提取与迁移提供了便利(Zhu等,2020)。然而,在实际应用中,滚动轴承的监测数据通常来自多工况(多源域),且不同工况下的数据退化特性差异较大。若直接采用上述方法(Chen等,2023;Cheng等,2021;Costa等,2020;Li等,2023b),预测性能会显著下降。
针对多源RUL预测,目前最先进的研究可分为同一设备内多工况下的RUL预测与不同设备内多工况下的RUL预测两类。对于前者,Ding等(2022)建立了多源域适配网络,该网络融合了域特定分布适配与域特定回归器适配,用于评估多工况下的RUL。Fang等(2021)提出了一种用于建筑能耗预测的多源集成迁移学习框架,该框架集成了多个LSTM-DANN模型与相似度度量方法。Tian等(2023)将KL(Kullback-Leibler)散度与双向LSTM模型相结合,提出了一种新的迁移集成学习框架,用于评估多工况下工业系统的RUL。尽管文献(Ding等,2022;Fang等,2021;Tian等,2023)取得了一定的研究成果,但实现不同设备间可靠的RUL迁移预测仍面临挑战。如图1所示,不同的机械设备与工作环境导致数据分布存在显著差异,这增加了从不同设备内多工况数据中提取预测知识的难度。
图1 不同设备多工况下的概率密度函数(Probability Density Functions, PDFs)与均方根(RootMeanSquares, RMS)。为计算特征的PDFs,将训练轴承的特征组合在一起,并通过主成分分析将其降维至一维。
通过文献综述发现,目前尚无研究报道不同设备内多工况下的RUL预测方法。仅有文献(Mao等,2022)开展了两种设备内两种工况下的RUL预测研究。具体而言,该研究首先根据几何相似度与趋势相似度将源域划分为多个子源域,然后利用带标签训练数据构建了带有选择性迁移学习的堆叠LSTM模型。需要注意的是,该方法对源域和目标域均采用监督学习方案。然而,在工程实际中,从不同设备获取充足的带标签数据是不现实的。据我们所知,目前针对不同设备场景的研究主要集中在故障诊断领域,而非RUL预测领域(Zhang等,2023a;Jia等,2023)。RUL预测本质上是一个回归问题,其特征提取与模型训练过程比故障诊断更为复杂。因此,跨设备RUL迁移预测面临着更大的挑战。
通过上述分析可知,不同设备内多工况下RUL预测的关键问题在于:1)缩小不同设备间多源域与目标域数据的分布差异,以实现正向迁移;2)在目标域数据不足且标签缺失的情况下,有效提升时序退化特征的多样性。
本文提出一种多源对抗性在线KD方法,用于不同设备内多工况下的RUL预测。该方法的核心思想是通过多级域适配与动态加权在线KD,双重提升预测知识的提取与迁移效果。具体而言,多级域适配属于特征级迁移学习,借助全局对抗学习与回归特征适配修正不同域间的分布差异;动态加权在线KD属于标签级迁移学习,旨在将从多源RUL预测器中学习到的退化信息自适应地集成到目标RUL预测器中。此外,基于多源域与目标域数据退化相似度更新的动态权重,能够提升预测知识的多样性。因此,在集成学习架构中,两种方案的协同作用进一步保障了多源域与目标域的知识共享能力,从而提升了不同设备内多工况下RUL预测的精度与稳定性。
本文的主要贡献总结如下:
1)提出了一种适用于不同设备内多工况下的新型RUL迁移学习方法,据我们所知,目前尚无相关研究报道。
2)设计了多级域适配策略,用于全面提取与迁移不同设备内的退化知识。该策略有效消除了严重的分布差异,提升了RUL预测的精度与稳定性。
3)提出了一种新的动态加权在线KD集成方法,用于RUL预测。该策略实现了多源模型与目标模型之间的闭环互学习。与现有RUL迁移预测方法不同,本文方法同时提升了不同设备间退化信息的迁移多样性与收敛速度,且是首次将在线KD融入RUL预测迁移学习的尝试。
本文其余部分结构安排如下:第2节简要描述研究问题;第3节详细阐述所提RUL预测方法;第4节展示实验结果并进行讨论;最后,第5节总结全文。
假设从不同设备的N个工况中采集的监测数据
RUL预测的目标是建立故障数据与其对应RUL标签之间的非线性映射关系。然而,目标域数据通常无标签,直接构建回归预测模型并不可行。因此,需从多源域中提取有效且多样的退化信息,并将其迁移到目标域,以提升RUL预测的精度与稳定性。
本节首先介绍在线KD的基本概念,随后详细阐述所提多源对抗性在线KD方法。
3.1 在线知识蒸馏
KD作为一种特定的迁移学习技术,旨在将预训练复杂教师模型所学KD到轻量化学生模型中,且该过程为单向迁移(Zhou等,2022)。KD不仅可用于模型压缩(减小模型参数规模),还能实现教师模型与学生模型之间的知识迁移,从而提升学生模型性能。KD也被称为离线蒸馏,需经过两阶段训练过程,但该过程仅关注学生模型的训练。特别地,当预训练教师模型与学生模型差异较大时,学生模型的预测性能不可避免地会出现偏差。
与传统KD不同,在线KD为解决上述局限性提供了有效且合理的方案(Yang等,2023)。通常,在线KD可简化为单阶段训练过程,教师模型与学生模型从初始状态开始联合训练,能够充分实现互学习。在线KD可表示为:
等式右侧前两项为教师模型与学生模型的监督损失,最后一项为教师模型与学生模型之间的蒸馏损失。教师模型表示为
本文中,在线KD主要用于知识迁移。类比迁移学习的概念,教师模型属于源模型,学生模型属于目标模型。在线KD的应用进一步促进了多样化退化信息的迁移,使目标模型能够从源模型中继承知识。
3.2 所提方法
本文在集成学习架构中,提出一种适用于不同设备内多工况下RUL预测的新型多源对抗性在线KD方法。该方法的核心思想是充分利用并迁移多源域中的预测知识,以提升目标域无标签且有限数据下RUL预测的精度。
图2展示了所提方法的整体框架,该框架包含四个主要模块:特征提取器、多源RUL预测器、多级域适配和目标RUL预测器。各模块的具体功能如下:
图2 所提方法框架
(1)特征提取器
由于不同设备的数据具有不同的分布特征,直接进行RUL预测并不可行。直观思路是为每个源域和目标域数据构建回归适配网络,但这种方式会导致整体网络权重显著增加,且计算成本较高。因此,有必要为不同域设置共享特征表示层,以提取原始数据的域不变时序特征。
首先,原始数据不可避免地包含噪声和冗余特征,需先提取更具代表性的特征作为网络输入数据。本文采用希尔伯特-黄变换与深度自编码器(Deep Autoencoder, DAE)(Mao等,2020)的组合对原始数据进行预处理。具体而言,深度自编码器由编码器和解码器组成:编码器用于建立输入层到隐藏层的映射关系,解码器用于实现隐藏层到输出层的重构。通过最小化重构误差
其中,
(2)多源RUL预测器
该模块旨在从特定源域中分别学习退化信息,挖掘每个源域退化特征与其对应RUL标签之间的映射关系。具体而言,构建N个源RUL预测器(每个预测器包含4个全连接层和1个输出层),以提升网络的表示能力。通过最小化所有源RUL预测器的预测损失,充分利用监督知识。损失函数表示如下:
其中,
(3)多级域适应
① 全局对抗学习
该模块用于缩小不同域间的分布偏移。具体而言,联合使用多源域与目标域特征训练域判别器,通过最大化对抗学习损失,判断训练数据所属的域。损失函数可表示为:
其中
② 回归特征适配
考虑到不同设备中每个源域具有各自的退化过程,仅依靠全局对抗学习难以有效缩小每个源域与目标域之间的决策差异。因此,在多源RUL预测器中加入回归特征适配,实现不同域分布的细粒度对齐。由于全连接层特征所包含的回归知识优于输出预测值的回归知识,通过计算并最小化每个源域与目标域全连接层的MMD正则项(Zhang等,2023b),进一步提升对齐效果。MMD正则项损失计算如下:
其中,
(4)目标RUL预测器
通常,在缺乏目标域标签的情况下,无法直接训练目标RUL预测器。该模块旨在借助多源RUL预测器所学的目标数据软监督知识(即软标签),指导目标RUL预测器的构建。这是因为目标数据的软监督知识包含内在的退化信息。因此,计算每个多源RUL预测器输出的目标数据软标签与目标RUL预测器输出的预测标签之间的在线KD损失,公式如下:
其中
公式(10)为每个源域分配相等的权重系数,未能体现源域的多样性与重要性差异。因此,本文采用Wasserstein距离(Ni等,2023)衡量每个源域特征与目标域特征的相似度,动态生成一组权重系数以反映各源域对目标域的重要性,从而促进预测知识的多样性迁移。其中,Wasserstein距离计算如下:
其中,γ属于联合概率分布;
最后,将动态权重引入公式(10),以整合相对均衡且准确的监督信息,此时在线KD损失函数可重写为:
由于滚动轴承退化过程缓慢,难以获取每个工况下的全寿命数据。此外,即使在相同工况下,数据分布也可能发生偏移。因此,更合理的策略是在获取目标域新数据时,实时更新预测网络。本文在优化目标函数中加入同一工况下新到达测试数据与目标域数据之间的MMD适配,该适配过程有助于提取合适的监督知识,公式如下:
其中,
需要注意的是,目标RUL预测器(包含2个全连接层和1个输出层)初始状态未经过训练。若将目标域数据直接输入训练好的多源RUL预测器以生成最终预测值,易出现过拟合现象,且获取的退化信息较少。因此,本文选择带有动态权重的在线KD方法,而非直接输出预测值作为最终RUL结果。
(5)联合优化
整合上述所有损失函数,得到所提方法的整体优化函数:
其中
其中
综上,所提方法的优势可总结为:1)改进了对预训练多源RUL预测器的需求。该方法采用在线KD框架,联合训练多源RUL预测器与目标RUL预测器,降低了计算成本,并避免了训练过程中的过拟合风险。2)通过全局对抗学习与回归特征适配提取细粒度可迁移特征,有效对齐多源域与目标域的数据分布。3)根据不同的数据分布自适应选择多源域的监督知识,而非将所有多源域视为同等重要,有效提升了多源域间的多样性,促进了不同域间退化信息的迁移,实现了准确的目标域RUL预测。
为验证所提方法在不同设备内多工况下RUL预测的有效性,在IEEE PHM Challenge 2012轴承数据集与XJTU-SY轴承数据集上开展了一系列实验。
4.1 数据集描述
IEEE PHM Challenge 2012轴承数据集(以下简称PHM数据集)来自PRONOSTIA实验平台(Nectoux等,2012),如图3(a)所示。该数据集包含3种不同工况下17个全寿命轴承的监测数据。
XJTU-SY轴承数据集由西安交通大学与长兴Sumyoung科技公司联合采集(Wang 等,2020),实验平台如图3(b)所示。该数据集包含3种不同工况下15个全寿命轴承的监测数据。两个数据集的详细实验工况如表1所示。
表1 PHM和XJTU-SY数据集的实验工况
4.2 实验设置
首先,采用文献(Cheng等,2022)提出的状态评估方法确定早期故障发生的起始点,并使用快速退化阶段的数据进行模型训练。随后,从PHM数据集中随机选取一个工况作为源域1(S1),从XJTU数据集中随机选取一个工况作为源域2(S2),开展迁移预测任务;目标域为从PHM数据集或XJTU数据集中随机选取的另一个工况。详细实验设置如表2所示。
所提方法的网络结构如表3所示。对于特征提取器(即堆叠LSTM),所有LSTM网络采用相同的参数设置:时间步长为8,dropout率为0.2,学习率为动态调整(初始值为0.0004)。公式(15)中的参数λ、μ、γ分别设置为100、100、50。为验证所提方法的预测精度,选取均方根误差(Root Mean Squared Error, RMSE)和平均绝对误差(Mean Absolute Error, MAE)作为评价指标。
表2 实验设置
表3 所提方法的网络结构
4.3.1 RUL预测结果
图4展示了表2中6个任务的RUL预测结果及对应的95%置信区间。所有任务均重复10次以降低随机性。所提方法取得了良好的预测结果,其预测曲线在很大程度上呈现出与真实RUL一致的下降趋势。这一结果表明,所提方法能够从多源域中挖掘域不变特征,并提升故障退化信息的多样性迁移效果。同时,后期预测精度优于其他阶段,这一发现对工业场景中的设备维护具有重要意义。
为进一步验证多级域适配、在线KD和多源域在该方法中的作用与重要性,开展了5组消融实验。表4和表5详细描述了消融实验的设置及其对应的结果。实验中,所有输入数据、参数和网络结构均与所提方法保持一致,以确保实验的公平性。
表4 消融实验的详细描述
表5 六个任务上消融实验的RMSE和MAE
所提方法(实验F)取得了最小的RMSE和MAE,表明该方法中的每个组件均能提升预测性能。具体而言,实验A(移除多级域适配)由于未能充分提取通用可迁移特征,无法保证多源RUL预测器的预测知识能正确指导目标RUL预测,可能导致RUL预测的泛化能力下降。对比实验B(移除在线KD)与所提方法可知,通过动态加权在线KD获取每个源RUL预测器的多样性信息至关重要。同样,实验C(同时移除多级域适配和在线KD)的结果进一步证明了双重知识迁移机制在提升RUL预测精度与稳定性方面的优越性。实验D(仅使用源域1)和实验E(仅使用源域2)的结果存在显著预测误差,表明当监测数据缺失时,难以训练出可靠的预测器。
同时,可观察到一个有趣的现象:在任务1、任务2和任务5中,消融实验C的结果仍优于实验D和实验E。因此,增加数据规模与数据类型对分析具有积极意义。当然,若不同设备间的数据分布偏移较大(如任务6),仅依靠单一源域可能更有效。此外,无论是跨工况还是跨设备RUL预测,实验D的结果均优于实验E。这是因为PHM数据集中轴承的退化序列具有更明显的趋势性和单调性,且其退化特征差异相对较小。综上,这些结果表明所提方法能够有效利用预测知识,在不同设备内多工况下实现良好的RUL迁移预测。
多级域适配在该方法中发挥着关键作用,有助于提升通用特征的提取能力。为验证这一作用,计算并可视化了多源域与目标域的概率密度函数。由于篇幅限制,仅绘制了任务1和任务6的概率密度函数,如图5和图6所示。
在图5(f)和图6(f)中,所提方法的适配效果优于其他消融实验,其概率密度函数曲线呈现出更一致的分布峰值和更大的重叠区域。实验A和实验B的概率密度函数在两个源域中服从相同分布,但与目标域分布存在偏差,这表明所提方法中的多级域适配和在线KD具有有效性。对比图5(a)和图5(b)中消融实验A和B的概率密度函数曲线,实验A的重叠区域更大,这表明多级域适配更有利于回归适配中退化信息的提取与迁移。图5(c)和图6(c)显示,实验C中多源域与目标域的适配效果较差。此外,实验D和E(仅使用单一源域)的结果(图5(d)、(e)和图6(d)、(e))表明,仅使用单一源域难以维持分布的一致性。图5和图6的结果与表5的定量结果一致。
图5 任务1中消融实验的适应效应:(a)消融实验A,(b)消融实验B,(c)消融实验C,(d)消融实验D,(e)消融实验E,(f)提出的方法
图6 任务6消融实验的适应效应。各图下方标签的定义与图5相同。
为说明在线KD集成方法中引入动态权重对模型性能的影响,在任务1和任务6中,将所提方法与“在线KD中无动态权重”的简化算法、“无在线KD”的简化算法进行对比。图7和图8展示了预测效果与训练损失收敛程度。所提方法的RUL预测结果呈现出更优的下降趋势,且训练损失更早收敛。相比之下,两种对比方法的预测RUL值与真实RUL标签存在偏差。图7和图8的结果表明,在在线KD集成方法中使用动态权重,能够从多源域数据中再次筛选出多样的预测知识,从而提升预测性能与收敛速度。
图7 任务1和6的预测效果比较
图8 任务1和6的训练损失比较
本节选取8种最先进的RUL预测方法,对表2中的任务进行性能分析。这些方法包括DBN(Deutsch和He,2018)、LSTM(Mao等,2018)、子空间对齐(Subspace Alignment, SA)(Fernando等,2013)、迁移成分分析(Transfer Component Analysis, TCA)(Pan等,2010)、可迁移CNN+MMD(Cheng等,2021)、DANN(Ganin等,2016)、LSTM-DANN(Costa等,2020)以及多LSTM-DANN(Fang等,2021)。性能对比结果如图9所示。需要注意的是,T-DVI(Transfer Domain Validity Index)+堆叠LSTM(Mao等,2022)是一种监督式RUL迁移预测方法,需要目标域拥有充足的全寿命带标签数据。然而,本文所研究的跨设备RUL预测中,目标域数据不足且无标签,因此难以与该方法进行直接对比。
由图9可知,所提方法在所有任务中均具有最小的预测误差。DBN(Deutsch和He,2018)和LSTM(Mao等,2018)属于深度学习方法,能够自适应提取深度特征,但当跨设备数据存在分布差异时,无法取得理想的预测结果。SA(Fernando 等,2013)和 TCA(Pan等,2010)是典型的浅层迁移学习技术,它们将多源域与目标域数据映射到特征子空间,通过高斯过程回归(Gaussian Process Regression, GPR)模型实现RUL预测。遗憾的是,浅层算法无法充分提取和迁移退化知识,导致预测性能下降。文献(Cheng等,2021;Ganin等,2016;Costa等,2020;Fang等,2021)采用对抗学习或域适配方法提取域不变特征,进而构建预测模型。由于不同工况具有不同的退化趋势,仅使用单一预测模型难以充分挖掘每个源域的特定退化信息,因此这些方法的性能均不如所提方法。尽管文献(Fang等,2021)提出了多源集成对抗适配策略用于建筑能耗预测,但在给定网络参数下,该方法在两个轴承数据集上的性能最差,原因是该方法训练多个判别器时未考虑多源域之间的关联。
图9 任务1、3和6中八种先进RUL预测方法的RMSE和MAE
本文所提方法通过多级域适配,将动态权重引入在线对抗性KD,能够充分提取多源域的退化信息,在数据分布存在差异且数据多样性不足的情况下,显著提升了预测结果。
本文提出一种多源对抗性在线KD方法,用于不同设备内多工况下的RUL预测。该方法设计了包含多级域适配和动态加权在线KD的双重知识迁移机制:前者能够消除不同设备间数据分布的不一致性,充分利用数据中的细粒度通用信息,促进正向迁移;后者能够提升多源域预测知识的多样性,同时对目标域进行监督,以提升RUL预测的鲁棒性与精度(尤其在目标域数据不足且标签缺失的场景下)。两种机制的协同作用,促进了不同域间退化信息的提取与迁移,从而有效应对复杂工况。
未来研究计划将所提RUL预测方法扩展到时变工况场景中;同时,考虑从多视角(如失效模式、物理机制)引入先验监督知识,进一步提升RUL预测效果。
编辑:陈宇航
校核:李正平、陈凯歌、曹希铭、赵学功、白亮、任超、海洋、赵栓栓、陈莹洁、Tina、王金、赵诚、肖鑫鑫、张优
该文资料搜集自网络,仅用作学术分享,不做商业用途,若侵权,后台联系小编进行删除