首页/文章/ 详情

MSSP代码开源||受音素启发的声学帧嵌入轻量级Transformer用于滚动轴承故障诊断

2月前浏览996

声学故障诊断如何兼顾精度与轻量化?这篇文章受语音音素处理启发,提出ASFE-Transformer:过解析振幅-相位双通道表征、声学帧嵌入降维及SD-GLU局部增强,以0.09M参数实现99.75%+准确率,为边缘端实时诊断开辟新路径。  

本期受作者邀请,给大家推荐这篇安徽大学机器人学院刘方教授团队的论文,论文第一作者为团队博士生彭麟昊。作者提出了一种受音素处理范式启发的轻量级声学帧嵌入Transformer,用于动轴声学故障诊断。针对声学信号短时非平稳特征难辨识及Transformer计算开销大的问题,该方法首先通过解析振幅-相位表示模块构建包含瞬时幅值相位的双通道物理表征;其次设计声学帧嵌入模块将连续波形聚合为紧凑的帧级token序列,在保留瞬态故障线索的同时显著降低序列长度与计算复杂度;最后提出Swish-深度门控线性单元替代传统前馈网络,通过嵌入轻量级深度可分离卷积增强局部上下文感知。在两个轴承声学数据集上的实验表明,ASFE-Transformer(Acoustic Segment-Frame Embedded Transformer,声学段帧嵌入Transformer)以仅0.09M参数和13.66M FLOPs(Floating Point Operations,浮点运算次数)的极轻量设计,实现了99.75%和99.90%的诊断准确率,并在强噪声环境下展现出优异的鲁棒性,为工业边缘设备实时部署提供了可行方案。  

为了感谢大家长期以来的支持,作者特地公开了代码,希望对大家学习有所帮助,同时文章质量很高,希望大家多多引用,支持为爱发电大佬们。  

论文基本信息

论文题目: Phoneme-inspired acoustic frame embedded lightweight transformer for rolling bearing fault diagnosis

论文期刊:Mechanical Systems and Signal Processing

Doihttps://doi.org/10.1016/j.ymssp.2026.114030

作者: Linhao Peng aFang Liu aZhongliang Lv bYongbin Liu a, Min Xia c
 
论文时间: 2026年3  
机构:   

School of Electrical Engineering and Automation, Anhui University, Hefei 230601, China

School of Mechanical and Intelligent Manufacturing, Chongqing University of Science & Technology, Chongqing 401331, China

Department of Mechanical and Materials Engineering, The University of Western Ontario, London, Ontario, Canada

作者简介:  

彭麟昊安徽大学电气工程与自动化学院电气工程专业在读博士生,入选2025年中国科协青年科技人才培育工程博士生专项计划。以第一作者身份在MSSPIEEE TIM等国际权威期刊发表SCI论文6篇。曾获研究生国家奖学金,省级三好学生,省级优秀硕士毕业论文,主持安徽省教育厅科学研究项目(自然科学类)博士生专项1项。邮箱:z24101006@stu.ahu.edu.cn
刘方安徽大学电气工程与自动化学院教授、博士生导师、机器人学院副院长,研究方向为机电系统动态监测与智能运维,主持国家自然科学基金项目3项、安徽省重点研发计划1项(省市联合资助600万元)、安徽省自然科学基金优秀青年项目、青年项目各1项(青年项目获评A类结题)。与科大讯飞、富煌科技等上市公司开展多项产学研合作研究。在国内外重要学术期刊发表SCI/EI收录论文60余篇,包含多篇ESI高被引论文,第一发明人授权发明专利19项。核心成果发表于MSSPIEEE Transactions系列汇刊等国内外本领域权威期刊。邮箱:ufun@ahu.edu.cn

吕中亮,重庆科技大学机械与智能制造学院教授,博士生导师,院长兼任重庆市高校重点实验室主任,致力于智能运维与大数据分析研究。主持国家/省部级重点及一般项目17项。发表论文37篇,其中被SCI/EI收录25篇,3篇论文入选中国知网《学术精要数据库》高影响力论文。申请专利25项,已授权21项。曾获重庆市科技进步一等奖、二等奖及中国产学研合作创新奖等荣誉。邮箱:2010024@cqust.edu.cn

刘永斌,安徽大学电气工程与自动化学院教授、博士生导师,安徽省学术和技术带头人,智慧电网数字协同技术安徽省联合共建学科重点实验室主任。长期从事高端装备智能诊断与运维、智能材料驱动与传感、机器人及工业现场自动化等方向的研究。主持基础加强计划子项目1项,国家自然科学基金面上项目3项,安徽省科技攻坚创新计划、中国博士后科学基金特别资助项目、中国博士后科学基金面上资助项目、安徽省重点研发计划、安徽省自然科学基金,安徽安徽省教育厅自然科学基金重点项目及企业委托项目多项;在国内外知名期刊会议上发表了学术论文100余篇,其中SCI/EI检索期刊论文80余篇;获授权发明专利30余项。邮箱:ybliu@ahu.edu.cn

夏敏,加拿大Western University机械与材料工程系副教授,机器智能实验室(MIN Lab)主任,研究领域涵盖机器学习、状态监测、先进制造过程监控与优化、工业数据挖掘及智慧清洁能源系统。在机电一体化和工业信息学领域的顶级期刊及会议上发表论文100余篇,自2020年起连续入选斯坦福大学发布的"全球前2%顶尖科学家"榜单(基于学术成果影响力)。主导过加拿大、英国和日本的19个科研项目,总经费达2000万加元(其中作为首席研究员获资370万加元)。邮箱:min.xia@uwo.ca

摘要

基于声学的故障诊断因其在不同运行条件下具有高度灵活性和适用性而受到越来越多的关注。近期研究表明,基于Transformer的架构在建模长时程时间依赖关系方面表现出卓越能力,因此特别适用于复杂时间序列的表示与分析。然而,将Transformer应用于声学故障诊断仍面临以下关键挑战:首要难题在于如何在复杂的环境干扰中区分短时程非平稳声学特征;同时,在计算资源有限的情况下如何保证模型的诊断性能也是一大挑战。受音素处理范式(即将连续语音离散化为有意义单元)的启发,本文提出了一种轻量级声学片段帧嵌入Transformer,称为ASFE -Transformer,以有效解决这些问题。首先,引入解析振幅-相位表示模块以生成物理意义明确的表征,确保多维声学信号的瞬时演变特性得到准确保留;其次,开发声学帧嵌入模块,在嵌入阶段将连续分析样本聚合为单一标记。该策略不仅生成了更高效的标记序列,显著提升了瞬态故障信号的可识别性,同时大幅降低了计算负担。最后,提出新型Swish深度门控线性单元对Transformer的前馈网络进行重构,在Swish激活门控机制中嵌入轻量级深度卷积层,使编码器具备局部感知偏置能力。针对两个轴承声学数据集的全面实验表明,所提出的框架在保持轻量化设计的同时实现了稳健的诊断性能,并突出了其在实际工业部署中的强大潜力。
关键词滚动轴承;故障诊断;Transformer;幅度-相位表示;帧嵌入;轻量级框架

目录

1 引言

理论背景

   2.1 声学信号的振幅与相位表征

   2.2 基于Transformer的神经网络

所提方法

   3.1 ASFE-Transformer架构

   3.2 解析振幅-相位表征

   3.3 声学帧嵌入模块

   3.4 所提方法的整体诊断流程

研究结果

   4.1 方法描述与参数设置对比

   4.2 案例一:基于抛物面端盖声学镜的声学信号数据集

   4.3 案例二:来自KAIST的轴承声学数据集

5 讨论

   5.1 所提模块有效性分析

   5.2 帧长度影响分析

   5.3 可解释性分析

结论

论代码可用性


注:小编能力有限,如有翻译不恰之处,请多多指正~
     若想进一步拜读完整版,请下载原论文进行细读。

1 引言

滚动轴承作为旋转机械中的关键支撑部件,其运行状况直接影响工业设备的稳定性和安全性。随着自动化和智能制造的不断发展,机械系统的运行条件变得越来越复杂,轴承故障成为性能下降和意外停机的主要原因之一。因此,监测和诊断轴承健康状况对于确保机械系统长期可靠、高效运行具有重要意义和工程价值。 

目前,滚动轴承运行状态的表征主要依赖于振动、电流、温度和声学等多种物理信号。其中,振动和声学信号是反映轴承系统动态特性最广泛使用的两种模态。振动信号对结构响应变化极为敏感,已成为传统监测中的主要诊断源。相比之下,声学信号能够进行非接触测量,部署灵活且成本低,并且可以在不干扰设备运行的情况下捕获结构振动和能量辐射特性。因此,分析运行信号的声学特性已成为一种有前景的故障识别方法。Chen等人开发了一种基于声学标识符的特征提取框架,该框架显著提高了机器人砂带系统的监测效率,而Jiang等人提出了一种自适应复合加权索引图,增强了基于声学特征的机械诊断的鲁棒性。数据驱动技术的最新进展,特别是深度学习,进一步提高了故障检测的能力。通过分析声学信号,这些技术可以直接处理原始数据并自动学习基本特征表示。其中,以卷积神经网络为代表的数据驱动方法在基于声学的故障诊断中取得了显著进展。例如,Ayantha等人首先进行声源分离以恢复与故障相关的声学成分,然后通过一维CNN(Convolutional Neural Network,卷积神经网络)实现机械故障诊断。Wang等人提出了一种混合注意力驱动的卷积对抗网络,该网络在强噪声条件下实现了鲁棒的诊断性能。Yin等人开发了一种多任务学习时间卷积网络,该网络结合声场信息,能够在低信噪比下实现准确的变速箱诊断。然而,当应用于声学故障诊断时,基于CNN的方法面临固有的局限性。卷积操作主要捕获局部幅度变化,但缺乏对声学信号中的长时时间依赖性和相位连续性进行建模的能力。 

与卷积网络不同,Transformer利用自注意力在所有时间步动态建模依赖性,以实现全局感受野和更有效的时间表征。受益于这种能力,越来越多的研究将Transformer架构引入故障诊断。Ding等人提出了一种时频Transformer模型,能够有效地从振动信号中提取特征表示。Dong等人在Transformer架构中引入了多专家反馈层,并提高了机械故障诊断中决策的可靠性。尽管Transformer擅长捕获全局时间依赖性,但它们在对细粒度局部特征进行建模方面效果较差。为了解决这个问题,最近有研究将这两种架构集成到统一框架中,以实现更全面、高效的故障诊断。Kim等人提出了一种时频融合框架,该框架将卷积编码器与Transformer层集成,以从非平稳信号中提取分层表示。Yang等人开发了一种基于分层Transformer架构的全局特征感知机制,该机制有效地融合了局部和全局特征,并在有限的训练数据和复杂的运行条件下表现出卓越的诊断性能。尽管这些混合框架已显示出有前景的性能,但它们的高计算成本和内存需求限制了它们在实时、资源受限的工业环境中的适用性。一些研究人员已经认识到这些局限性,并提出了有效的改进方法,如轻量级架构设计和改进的注意力机制,以减轻计算负担同时保持诊断准确性。Fang等人引入了一种基于Transformer结构的改进卷积单元,该单元在保留特征提取能力的同时,大大减少了模型参数的数量。Yan等人提出了一种轻量级故障诊断框架,称为LiConvFormer,该框架在多个基准数据集上展示了效率和鲁棒性。Shao等人提出了一种LSFConvformer框架,该框架将轻量级Convformer建模与打乱的时频融合相结合,以提高特征提取效率和诊断鲁棒性。 

虽然数据驱动方法在基准数据集上取得了令人印象深刻的准确性,但它们通常依赖大量参数冗余和计算资源来隐式学习特征表示。除了这种计算开销外,一个基本限制在于信号模态本身:现有的诊断框架主要是为振动信号设计的,而从麦克风获得的声学测量的性质在根本上是不同的。对于滚动轴承,麦克风捕获整个过程中产生的空气传播声音,在此过程中滚动元件接近缺陷、进入缺陷区域、与局部损伤相互作用,随后离开该区域。在这种相互作用期间,滚动、滑动和冲击行为以不同的比例、持续时间和能量分布发生,并且这些特征与故障类型和严重程度密切相关。这种复杂性意味着声学信号中具有诊断信息的成分是高度瞬态的且结构多样。这就引出了一个关键的研究问题:通过显式编码这些判别的声学进化模式,以显著最小化的模型复杂性来实现具有竞争力的诊断准确性是否可行?

通过类比,故障诱发声波的产生机制与人类语音产生具有显著相似性。图1表明,如果将局部缺陷区域视为声源通道,滚动体与缺陷相互作用时产生的每个短声脉冲可被视为类似于单个音节的发音。随着轴承持续旋转,这些连续的声脉冲形成一个连贯的声学序列,类似于一个口语句子。此外,每次相互作用中的滚动、滑动和冲击分量在概念上可与音素进行比较,音素是语音中最小的区别单元。受音素处理范式启发,即连续语音被离散为有意义的单元,这项工作提出了一种轻量级的声学段帧嵌入Transformer。所提出的方法基于三项核心架构创新。 

图1. 轴承故障声波与人类语音产生之间的概念类比

(1) 在输入层,引入解析幅度-相位表示以构建具有物理意义的双通道表示,并实现幅度和相位的联合建模 

(2) 开发了一个声学帧嵌入模块,将连续的声学波形转换为紧凑的帧级令牌。这种令牌化策略保留了滚动、滑动和冲击相互作用产生的短时时间结构,类似于捕捉语音中的音素细节。通过将长波形转换为简洁的信息令牌序列,AFEM(Acoustic Frame Embedding Module,声学帧嵌入模块)在保留关键瞬态故障信息的同时,明确缩短了序列长度并大幅降低了计算复杂度。

 (3) 通过一种新颖的Swish深度门控线性单元对Transformer的前馈网络进行重新设计。引入门控机制以选择性地控制信息流,并允许模型专注于信息丰富的故障特征,同时抑制无关噪声。这种设计加强了全局时间依赖性建模,同时通过高效的局部特征大幅降低了计算复杂度。

本文的其余部分组织如下。第2节介绍了通过希尔伯特变换表征声学幅度和相位的理论基础,以及标准Transformer。第3节详细阐述了所提出的ASFE-Transformer、AAPR(Analytic Amplitude-Phase Representation,解析幅度-相位表示)、AFEM和改进的Transformer编码器。第4节展示了在两个基准数据集上的广泛实验结果,以验证所提方法的优越性。第5节讨论了模型的内部机制,包括模块有效性、帧长度影响和特征可解释性。最后,第6节总结了研究并展望了未来的挑战。

2 理论基础

在本节中,首先介绍解析信号构建的原理,并解释这种方法如何表征声学信号的瞬时幅度和相位以揭示完整的瞬态故障特征。随后,回顾标准Transformer的基本架构,为本文引入的具体改进提供结构基础。

2.1 声学信号的幅度和相位表征

在轴承运行期间,麦克风捕获的声学信号是潜在声场的实值投影。尽管这种实际测量反映了瞬时压力波动,但它本质上掩盖了与机械组件内能量传输延迟、结构共振和模态散射紧密相关的伴随相位变化。最近的研究表明,这种与相位相关的信息在表征瞬态传播行为以及声发射和旋转机械声学中的共振引起的失真方面起着关键作用。 为解决这一限制,从实信号重建潜在的正交分量,如图2(b)所示,以形成解析信号表示。这种解析表示提供了对瞬时幅度和相位的直接访问,能够更完整地描绘信号的时变动态,并提高故障诱发声学响应的描述保真度。

其中,      表示希尔伯特算子,      表示柯西主值,x(t)是实际声压信号,       是其相位偏移90°的正交分量。在频域中,

其中,      是傅里叶变换,x(f)是x(t)的频谱,f是频率(Hz),sgn(f)是符号函数。

公式(2)表明 x(t) 的正频率和负频率分量经历相反的相位旋转,抑制冗余频谱对称性,并产生片面解析表示:

其中z(t)为复解析信号,      表示与局部声能成比例的瞬时幅度包络,      表示跟踪共振和阻尼时间演化的瞬时相位。为了进一步表征振荡分量的动态变化,即瞬时相位的时间导数。

可得到瞬时角频率,并反映由不同机械起源的缺陷引起的局部调制或共振频率偏移。例如,滚动型缺陷通常会在A(t)中引入周期性幅度调制,摩擦磨损会在      中产生连续的宽带相位波动,而碰撞故障会在A(t)和      中产生尖锐的相位跳变并伴有瞬态峰值。

图2. 解析信号构造及复表示生成的机制

图2(a)展示了复平面中方程(3)的几何解释。解析向量z(t)随时间旋转并形成一条螺旋轨迹,其在实轴和虚轴上的投影分别对应于x(t)和      。这种演化共同表征了声传播过程中的幅度衰减和相位延迟,并提供了更完整的瞬时信号动态表示。

2.2基于Transformer的神经网络

Transformer通过自注意力机制建立全局交互,并能够在整个序列上进行动态上下文聚合。其计算过程可总结如下,整体架构如图3所示。

给定一个输入特征序列

其中N表示序列长度(时间位置数量),D是特征维度,并且向每个token添加位置编码      以保留时间上的顺序信息。组合表示写为

Transformer编码器由M个相同的层组成,每个层包含一个多头自注意力块和一个逐位置前馈网络,通过残差捷径和层归一化连接。对于第m层,计算可表示为

其中      表示层归一化,以及m=1,2,...,M。

MHSA(Multi-Head Self-Attention,多头自注意力)模块通过      的查询、键和值投影计算所有时间位置之间的成对相关性,并允许模型根据特征相似性自适应地处理相关时间步。然后FFN(Feed-Forward Network,前馈网络)对每个位置独立应用两次带有非线性激活的线性变换,并在特征空间中扩展模型的表示能力。通过堆叠的编码器层,Transformer逐步整合局部变化和长程时间依赖性,并形成分层表示      

图3 基于Transformer的神经网络架构

3 提出的方法

在本节中,将系统地阐述所提出的轻量级帧嵌入声学Transformer的架构。基于此架构,构建了一个用于基于声学的滚动轴承故障诊断的端到端ASFE-Transformer框架。该框架由三个核心模块组成: AAPR、AFEM和改进的Transformer编码器。以下小节将对每个组件进行详细描述。

3.1 ASFE-Transformer架构

所提出的ASFE-Transformer构成了一个专门为高效声学故障诊断设计的端到端框架。图4表明,在输入阶段,使用AAPR将真实声学信号转换为双通道解析表示,该表示产生捕获瞬时幅度和相位的同相和正交分量。

然后,AFEM将连续波形划分为重叠的短时帧,并将每个帧线性投影到一个紧凑的嵌入向量中。得到的帧令牌与一个可学习的类别令牌和位置编码一起,形成一个序列表示。 这些帧令牌随后由改进的Transformer编码器进行处理,该编码器将低维MHSA与轻量级SD-GLU(Swish-Depthwise Gated Linear Unit,Swish深度门控线性单元)集成在一起。MHSA模块通过在整个声学序列中建立全局相关性来捕获帧之间的长程依赖性,而SD-GLU通过通道级门控和令牌轴深度卷积增强局部时间连续性。在整个编码器中应用层归一化和残差连接以稳定训练并确保高效的特征传播。

最后,编码器输出的全局类别令牌聚合来自所有帧令牌的判别信息,并被馈送到线性分类器中以产生最终的故障类别。

以下各节将对所提出框架中的每个组件进行深入说明。

图4 ASFE-Transformer架构

3.2 解析幅度-相位表示

实值信号X(t)通过AAPR转换为其解析对应物。该转换产生一个正交分量      ,它相对于X(t)相位偏移90°,并形成一个复值表示。

因此,声学信号可以表示为

其中            分别表示实部和虚部。

这种解析公式提供了幅度和相位演变的统一描述,并作为后续深度表示学习的输入基础。

3.3声学帧嵌入模块

在3.2节中获得的解析声学信号      通过AFEM转换为逐帧序列表示。这一步将波形重新构造为与Transformer的建模要求相匹配的短时声学单元,其详细架构如图5所示。

图5 声学框架嵌入模块的框架

考虑到轴承声学信号在短时间间隔内保持准平稳,应用长度为L, 且步长为R的滑动窗口将信号分割为重叠帧。

对于第i帧,分割后的数据表示为

其中      是起始索引,N=[(T-L)/R]+1表示总帧数。这种分割保留了与瞬态声学事件相关的局部幅度-相位结构。

每个帧被展平并映射为一个D维嵌入,如下所示

其中vec(        )将2×L帧展开为一个2L维向量,        是可学习的投影参数。此操作将每个短时幅度和相位模式转换为具有统一特征维度的紧凑令牌。

为了聚合用于故障分类的全局信息,在帧嵌入序列之前添加一个可学习的类别令牌      。得到的令牌序列表示为:

其中,      用作占位符,用于在通过Transformer层后捕获整个信号的全局语义表示。

为了编码时间顺序,将位置编码      添加到令牌序列中。如图所示,特定的位置向量      按元素添加到其相应的令牌中:

其中P保留了每个帧的相对位置,并使Transformer能够对周期性冲击行为和传播引起的时间延迟进行建模。得到的H,从类别令牌嵌入      开始,用作后续编码器层的输入。

通过将连续波形转换为紧凑的帧序列,AFEM有效地将序列长度从T减少到N=T/(L-R)。由于自注意力操作的计算复杂度与输入长度成二次方关系,即      ,N的减少导致理论复杂度与直接处理原始波形相比降低了约      。因此,AFEM不仅保留了短时声学特征,还显著提高了计算效率。

3.4 Transformer编码器

按照3.3节中描述的声学帧嵌入,序列表示      由一个改进的Transformer编码器处理,该编码器旨在对跨帧令牌的全局和局部依赖性进行建模。此编码器保留了标准Transformer的自注意力架构,同时引入了结构改进以更好地适应准平稳声学特征。图6说明了整个过程。每个编码器层接收输入      并产生输出      。该层由两个子模块组成:MHSA和前馈子网络,它们与残差连接和层归一化操作交错。

MHSA机制通过计算所有令牌对之间的注意力权重来捕获帧令牌之间的全局相关性。与传统Transformer将嵌入维度D均匀分配给头不同,所提出的结构对查询、键和值映射采用固定的低维投影:

其中      ,h是头的数量。每个头在维度为            的紧凑子空间上操作,这大大降低了注意力操作的二次复杂度。

注意力分布的计算方式如下

然后将上下文表示进行聚合,如下所示

     将拼接后的头部输出投影回模型维度。

此操作产生一个全局注意力表示,对声学帧之间的长程依赖关系进行编码。

为了增强局部建模能力,前馈子网络被重新设计为SD-GLU,如图6下部所示。受注意力机制中的门控机制启发,SD-GLU引入了非线性调制和令牌级卷积上下文。该过程定义如下

其中      是一个扩展投影,F是隐藏维度。激活采用SwiGLU公式,

其中      表示Sigmoid线性单元函数,并确保平滑但响应灵敏的门控行为。 与传统的逐点前馈网络不同,所提出的SD-GLU在令牌维度上纳入了一维深度卷积:

其中每个通道独立地与大小为k=5的内核进行卷积。从物理意义上讲,这个内核大小被设计为与故障脉冲的时间尺度对齐。鉴于每个帧令牌代表一个亚毫秒级的音素单元(0.3-0.8毫秒),5的内核大小将局部感受野扩展到大约1.5-4.0毫秒。这个持续时间有效地覆盖了故障诱发共振事件的特征演变(通常由起始、峰值和衰减阶段组成)。因此,深度卷积使模型能够捕捉相邻帧形成的声学音节的形态连续性,弥合离散令牌和连续故障瞬变之间的差距。然后将局部增强后的输出投影回嵌入空间:

其中            表示来自前一个归一化的残差输入。这个深度卷积引入了一种声学感知归纳偏差,补充了MHSA的全局感受野,并使模型能够有效地捕捉轴承声学信号中固有的瞬态脉冲特征和周期性调制。

在堆叠      个这样的编码器层之后,最终的类别令牌聚合来自所有帧令牌的判别信息,并被输入到线性分类器进行故障识别。

图6 Transformer编码器的详细架构

3.5所提出方法的整体诊断过程

基于ASFE-Transformer,本文提出了一种用于滚动轴承声学诊断的轻量级框架。图7显示整个过程包括三个主要阶段。首先,从轴承试验台采集声学信号,并通过滑动窗口进行分割,以构建训练集、验证集和测试集。其次,通过AAPR获得解析后的声学信号,由声学帧嵌入模块转换为段帧序列表示,然后输入到轻量级改进的Transformer编码器进行有监督的故障分类。第三,将训练好的模型应用于测试样本,并从多个角度进行综合评估。

图7 所提出方法的整体诊断过程

4 实验分析

本节首先阐述了各案例研究的实验平台、数据采集及实现细节,随后通过多维度性能分析,将 ASFE -Transformer与当前最先进的模型在诊断性能、计算效率以及不同噪声条件下的鲁棒性方面进行了对比评估。

4.1方法描述与参数设置的比较

为全面评估所提出方法的有效性和优越性,我们在两个基准数据集上进行了大量实验:一个采用抛物面声学镜自开发的轴承声学数据集,以及KAIST(Korea Advanced Institute of Science and Technology,韩国科学技术院)提供的轴承声学数据集。所有实验均在统一的计算环境中完成,所用软件包括PyTorch 2.1、 NVIDIA RTX 3060(12 GB内存)、Intel i5-12600KF处理器及32 GB内存。

为了进行公平比较,所有模型在两个数据集上都使用相同的训练设置从头开始训练。初始学习率固定为0.001,并在整个训练过程中使用余弦退火调度器进行动态调整。模型参数使用Adam优化器进行优化。采用32的批量大小,每个模型训练50个轮次。为确保统计可靠性,所有实验独立重复进行五次,并报告平均性能。为便于重现性并清晰概述模型配置,表1总结了所提ASFE-Transformer的核心参数和实现细节。

表1 所提出的ASFE-Transformer的核心参数和实现细节总结

所提出的框架与一组全面的基线模型进行了比较,这些模型包括具有代表性的经典架构和近期的先进Transformer变体。这些被比较的模型涵盖了广泛的设计理念,从专注于局部特征提取的卷积增强网络到强调全局依赖性建模的先进注意力驱动架构,并建立了一个全面、平衡的评估基准。被比较的方法总结如下。

(1) MA1DCNN:一个由堆叠的一维卷积和池化层组成的经典轻量级基线,它专注于通过固定的感受野和静态权重滤波来提取局部判别特征。

(2) Transformer:最初为序列数据建模而开发的基于标准注意力的编码器,能够通过自注意力机制捕捉长程时间依赖性,而无需依赖卷积层或循环层。

(3) ViT:一种用于声学分析的视觉Transformer架构的改编版本,将帧级声学片段视为视觉令牌,并通过逐块注意力操作捕捉全局上下文信息。

(4) MCSwinT:一种多尺度Swin Transformer变体,通过移位窗口分区对局部和全局依赖性进行分层建模,并增强多分辨率特征表示。

(5) CLFormer:一种对比轻量级Transformer,将紧凑的自注意力块与对比学习目标相结合,以提高在噪声数据条件下的特征可辨别性。

(6) ConvFormer-NSE:一种卷积增强Transformer,结合了邻域自增强机制,以加强局部感受野交互,同时保持全局上下文感知。

(7) LiConvFormer:一种轻量级卷积Transformer,在Transformer主干中嵌入共享的多尺度卷积模块,并在计算效率和诊断准确性之间实现了有效的权衡。

4.2 案例一:基于抛物面端盖声镜的声学信号数据集

4.2.1 实验平台和数据描述

我们开发了一个基于声镜的轴承诊断平台来验证所提出的方法。图8显示实验装置由一台三相异步电动机、一台西门子变频器、一个声学故障轴承基座速度显示器和一个数据采集单元组成。测试轴承是一个LYCN/NU407圆柱滚子轴承,其详细结构参数总结在表2中。

图8 实验平台及其示意图

图9 不同类型故障的测试轴承

表2 LYC N/NU407ECM的轴承参数

图10 案例一中不同轴承状态下解析声学信号和相平面轨迹的可视化

模拟典型的轴承退化状况,通过精密加工在内圈、滚动体和外圈中引入了三种局部故障,即磨损、点蚀和裂纹。图9表明,实验设计包括九种故障组合和一种正常状况,从而产生10种轴承状态。在测试过程中,主轴转速在900 r/min下保持恒定,径向载荷为5kN。以20Hz的采样率采集声学信号,每种轴承状态的记录持续时间为30秒。为确保数据一致性和严格评估,在模型输入之前实施了标准化的预处理流程。首先,通过Z分数归一化对原始声学信号进行标准化,以消除幅度缩放差异。其次,使用长度为1024个点、步长为512个点(50%重叠)的滑动窗口将归一化后的连续信号切片为离散的模型输入样本。最后,为防止时间依赖性偏差,在将生成的样本划分为训练集、验证集和测试集之前,对其进行随机打乱,每个类别分别包含300、100和200个样本,详见表3。为直观展示处理后数据的特征,图10可视化了经过预处理层后的10种轴承状态的双通道声学信号及其相应的相平面轨迹。

表3 案例一中10种轴承数据的详细信息

4.2.2 案例一的诊断结果与性能比较

图11表明,在声学故障诊断任务的训练过程中,所有模型都呈现出明显的收敛趋势。值得注意的是,MA1DCNN基线表现出快速收敛和稳定的优化。大多数Transformer变体在20个epoch内实现了稳定优化,而标准Transformer收敛缓慢且残差损失较高,这表明其对声学特征的表示能力有限。CLFormer在训练和验证阶段也表现出不稳定的波动,泛化能力较弱。相比之下,其他模型,特别是改进的Transformer变体,收敛平稳,验证损失持续较低且准确率高,对声学数据表现出更好的适应性。

为了进一步量化诊断性能和计算效率,评估结果列于表4和图12中。标准的1D - CNN基线在诊断性能方面表现出色,准确率达到99.60%,证实了卷积架构在特征提取方面的有效性。所有基于Transformer的模型在声学故障诊断任务中表现都很强劲,而提出的ASFE-Transformer总体准确率最高,达到99.75%,比基线Transformer高出5.4%。值得注意的是,ASFE-Transformer保持了轻量级设计,具有0.09M参数和13.66M FLOPs,展现出高计算效率。相比之下,ViT和MCSwinT达到了相当的准确率(分别为98.50%和99.55%),但需要更高的计算成本。模型复杂度和训练时间并没有严格的正相关关系。需要承认的是,上述计算指标主要关注神经网络推理。理论上,预处理阶段(希尔伯特变换和帧分割)会带来额外开销。然而,帧分割实际上是零成本的内存索引操作,对于1024的输入长度,希尔伯特变换仅增加约0.10 MFLOPs。与模型的推理成本相比,这种开销可以忽略不计(<1%),且比标准深度网络低几个数量级。此外,由于预处理不涉及可学习参数,存储优势(0.09M)不受影响。至关重要的是,这种参数减少代表了硬件部署的决定性阈值,而不仅仅是数值上的减少。资源受限的边缘设备(如Cortex-M系列微控制器)通常片上内存有限(通常<512 KB)。一个具有0.32M参数(在Float32中占用~1.28MD)的标准“轻量级”基线将超过此容量,需要进行耗能的片外内存访问。相比之下,ASFE - Transformer(约360 KB)完全适合片上SRAM(Static Random-Access Memory,静态随机存取存储器),实现“零拷贝”推理,消除内存访问瓶颈,确保工业物联网节点的实时响应能力。图13展示了八个基于Transformer的模型的混淆矩阵。标准Transformer在几个类别中表现出明显的误分类,而ViT和CLFormer有所改进但仍存在不完美的区分。相比之下,MA1DCNN、LiConvFormer、Convformer-NSE和提出的ASFE-Transformer显示出几乎对角线的矩阵,非对角线误差最小,在声学诊断中表现出高度可靠、一致的故障识别。

图11 案例一中不同方法的准确率和损失曲线:(a) 训练损失,(b) 训练准确率,(c) 验证损失,(d) 验证准确率

表4 案例一中不同方法的诊断性能和模型复杂度

4.2.3 各类别中不同方法的性能分析

为评估不同方法在各类故障分类中的性能表现,图13展示了八种基于Transformer模型的混淆矩阵。标准Transformer在多个类别中存在明显的误分类现象,而ViT和CLFormer虽有所改进,但区分能力仍不完善。相比之下,MA1DCNN、LiConvFormer、Convformer-NSE及本文提出的 ASFE -Transformer均呈现出近乎对角线的混淆矩阵,离对角线误差极小,且在声学诊断中展现出高度可靠且一致的故障识别能力。

图12 基于5次重复试验的案例一中不同方法诊断性能比较的可视化

图13 案例一中不同方法的混淆矩阵:(a) MA1DCNN,(b) Transformer,(c) ViT,(d) CLFomer,(e) MCSwinT,(f) Convfomer-NSE,(g) LiConvFormer,以及(h) ASFE-Transformer

4.2.4 案例一中不同方法的噪声鲁棒性分析

为系统评估不同干扰水平下模型的鲁棒性,向原始样本中注入加性高斯白噪声。注入噪声的强度由SNR(Signal-to-Noise Ratio,信噪比)控制,定义为:

其中            分别表示原始信号的功率和添加噪声的功率。

实验涵盖了从5dB到-5dB的信噪比水平范围。为消除特定噪声实现的随机性并确保统计可靠性,在每个信噪比水平下使用不同的随机种子重复评估5次,并将平均准确率作为最终结果报告。表5和图14展示了不同模型在不同噪声水平下的诊断鲁棒性。MA1DCNN基线在干净数据上表现良好,证实了一维卷积神经网络在理想条件下的有效性。然而,在信噪比=-5dB时其准确率降至94.10%,表明静态卷积特征对强干扰有些敏感。相比之下,ASFE-Transformer表现出卓越的稳定性,实现了98.33%的最高平均准确率,在信噪比=-5dB时仍保持96.85%。这表明与固定的局部卷积相比,内容自适应注意力机制对声学噪声具有更强的抵御能力。同时,标准Transformer在信噪比=-5dB时大幅降至79.48%,而ViT和CLFormer等其他变体对噪声干扰也表现出不同程度的敏感性。

表5 不同方法在各种信噪比条件下的诊断准确率

图14 各种方法在不同信噪比条件下的性能变化曲线

基于稳健性分析,进一步评估了诊断性能与模型复杂度之间的关系。图15显示,所提出的ASFE-Transformer在保持0.09M参数的紧凑架构和13.66 M FLOP的同时,实现了最高的平均准确率(98.33%)。LiConvFormer获得了相当的准确率(98.13%),但复杂度略高。虽然MA1DCNN基线产生了具有竞争力的平均准确率97.29%,但它需要2.63 M参数。相比之下,MCSwinT需要大量的计算,但没有成比例的收益,而标准Transformer的准确率和效率较低。

图15 平均准确率与模型复杂度之间的关系:(a) FLOPs与平均准确率;(b) 参数与平均准确率

4.2.5 案例一中不同方法的T-SNE可视化

为了进一步评估在严重噪声条件下的特征可分性,图16显示了在SNR =-5dB时不同模型的T-SNE可视化。标准Transformer和CLFormer表现出相当大的类别重叠,表明在噪声环境中的判别能力有限。ViT和MA1DCN 有适度的改进,但相邻类别之间仍存在边界模糊问题。相比之下,LiConvFormer,特别是所提出的ASFE-Transformer显示出紧凑、分离良好的聚类,并在声学故障诊断中展示了其强大的噪声鲁棒性和卓越的特征表示。

图16 案例一中不同方法在SNR下的T-SNE可视化:(a) MA1DCNN (b) Transformer, (c) ViT, (d) CLFomer, (e) MCSwinT, (f) Convfomer-NSE, (g) LiConvFormer, 和 (h) ASFE-Transformer

4.3 案例二:来自KAIST 的轴承声学数据集

4.3.1 实验平台和数据描述

由KAIST开发的轴承故障测试台由三相感应电动机、齿轮箱、两个轴承壳体、扭矩计以及用于负载控制的滞后制动器组成,其详细布局如图17所示。该系统在0、2和4 Nm三种不同负载条件下,以3010转/分钟的额定速度运行。利用放置在轴承壳体A附近的PCB378B02麦克风,以51.2 KHz的采样频率收集声学信号。该数据集包括四种轴承健康状态,即正常、内圈故障、外圈故障和滚动体故障。通过精密加工,人工引入了不同严重程度的故障,其中内外圈缺陷的裂纹尺寸分别为0.3和1.0毫米,如图18所示。每次声学记录持续60秒,以确保足够的时间分辨率,从而实现可靠的信号分析。仅利用来自KAIST轴承数据集的声学信号进行模型验证,而未考虑其他传感器模式。声学数据根据与案例一相同的程序进行预处理,确保信号分段、归一化和样本划分的一致性。表6总结了所使用声学数据的详细信息。类似地,图19展示了预处理的双通道信号和相位轨迹的可视化。

图17 旋转机械试验台及其组件的布局图18 按裂纹尺寸的轴承:(a)内圈0.3毫米,(b)内圈1.0毫米,(c) 外圈0.3mm,和(d) 外圈1.0mm

表6 案例二中五种类型轴承数据的详细信息

图19 案例二中不同轴承状态下分析声学信号和相平面轨迹的可视化

图20 案例二中不同方法的精度和损失曲线:(a)训练损失,(b)训练精度,(c)验证损失,以及(d)验证精度

4.3.2案例二的诊断结果与性能比较

图20展示了不同基于Transformer的模型在案例二中的训练与验证曲线,而表7与图21汇总了相应的定量结果。所有模型在50轮次内均实现了令人满意的收敛,但其性能差异显著。所提出的ASFE-Transformer取得了最高准确率99.90%,较基线Transformer提升4.2%,且保持最低计算成本,仅需0.24 M参数量及15.69 M浮点运算次数。LiConvFormer与MA1DCNN亦达到具有竞争力的准确率,但需更高计算资源。相比之下,CLFormer表现出较低准确率(87.50%)及不稳定收敛,表明其特征表征能力较弱。这些结果进一步证明了所提方法在声学故障识别中的卓越效率与诊断能力。

4.3.3各类别中不同方法的性能分析

图22展示了案例二不同基于Transformer模型的混淆矩阵。结果表明,所有模型都能有效区分主要的轴承故障类别,但其分类可靠性有所不同。标准Transformer和CLFormer表现出明显的误分类,特别是在内圈和外圈故障之间,并且特征辨别能力有限。ViT和MCSwinT改善了类别分离,但在相似故障类型中仍表现出轻微混淆。相比之下,MA1DCNN、LiConvFormer和所提出的ASFE-Transformer产生了几乎完美的对角矩阵。

表7 案例二中不同方法的诊断性能和模型复杂度

4.3.4 案例二中不同方法的噪声鲁棒性分析

图21 基于5次重复试验的案例二中不同方法诊断性能比较的可视化图

表8和图23展示了不同基于Transformer的模型在各种信噪比(SNR)下的诊断准确率。随着SNR降低,所有模型的性能都有不同程度的下降。所提出的ASFE-Transformer保持了最高的整体稳定性,平均准确率达到95.11%,在SNR=-5dB时仅有轻微下降。LiConvFormer也表现出很强的鲁棒性,平均超过94%。相比之下,标准Transformer和CLFormer在低SNR条件下准确率大幅下降,在SNR 时分别降至71.75%和65.00%。

图22 案例二中不同方法的混淆矩阵:(a)MA1DCNN,(b)Transformer,(c)ViT,(d)CLFomer,(e)MCSwinT,(f)Convfomer-NSE,(g)LiConvFormer,以及(h)ASFE-Transformer图23 各种方法在不同SNR条件下的性能变化曲线

表8 不同方法在各种SNR条件下的诊断准确率

样,图24展示了案例二中模型复杂度与诊断性能之间的关系。所提出的ASFE-Transformer在仅具有 0.09 M参数和13.66 M FLOP的情况下,在准确率(95.11%)和效率之间实现了最佳平衡。LiConvFormer在中等复杂度下也表现良好,而MCSwinT和ViT则产生了高计算成本且没有显著收益。标准Transformer和CLFormer显示出低准确率和效率。

图24 平均准确率与模型复杂度之间的关系:(a)FLOP与平均准确率,以及(b)参数与平均准确率

4.3.5 案例二中不同方法的T-SNE可视化

为了评估在严重噪声条件下的特征分布,不同基于Transformer的模型的T-SNE可视化结果如图25所示。所有模型在故障类别之间都表现出一定程度的重叠,但分布紧凑性有所不同。标准Transformer和CLFormer显示出较大的类间混合,表明特征辨别能力较弱。ViT和MCSwinT实现了更清晰的边界,但仍存在部分重叠。相比之下,MA1DCNN、LiConvFormer和所提出的ASFE-Transformer显示出更紧凑且可区分的聚类。

图25 案例二中不同方法在SNR下的T-SNE可视化:(a)MA1DCNN,(b)Transformer,(c)ViT,(d)CLFomer,(e)MCSwinT,(f)Convfomer-NSE,(g)LiConvFormer,以及(h)ASFE-Transformer

5 讨论

进一步分析所提出的ASFE-Transformer的配置属性,在本节中,详细研究分为三个部分:首先,进行消融研究以验证每个核心模块的有效性。其次,分析帧长度对模型性能和效率的影响。最后,对学习到的特征的可解释性进行可视化,以验证所提出的方法如何进一步促进瞬态故障线索的局部归因。

5.1 所提出模块的有效性分析

为了评估所提出架构中每个组件的贡献,设计了六种比较方法。方法1去除AAPR以验证双通道声学表示的作用,而方法2排除AFEM以评估帧级时间特征提取的有效性。方法3-5用三种常见的前馈结构(即MLP、GLU和SwiGLU)替换所提出的SD-GLU进行结构比较。为确保公平比较,所有这些变体的隐藏维度扩展率严格固定为r=2(导致隐藏维度为128)。这种严格控制确保任何观察到的性能差异仅归因于所提出模块的结构优势,而不是模型容量的变化。方法6对应于完整的ASFE-Transformer框架。

表9 不同模块对诊断性能和复杂度影响的结果

图26 不同模块对诊断性能影响的柱状图

表9和图26表明,去除AAPR(方法1)使准确率从99.75%降至97.95%,而消除AFEM(方法2)则使其降至98.85%         。准确率分别下降1.8%和0.91%,证实了双通道声学表示和帧级时间嵌入在提高故障可分离性方面的关键作用。至关重要的是,这两个模块之间的相互作用是协同作用而非冗余作用。AAPR充当“特征增强器”,明确解耦复杂的调制信息,确保输入特征包含丰富的物理归纳偏差(例如,瞬时动态)。与此互补的是,AFEM充当“结构组织者”,将这些动态特征稳定为准平稳的帧令牌。这种组合建立了一种相互增强的“双流”表示:AAPR确保令牌包含有区分性的物理内容,而AFEM为有效的注意力建模提供必要的结构连贯性

在FFN变体中,所提出的SD-GLU实现了最高的诊断准确率(99.75%),比标准的SwiGLU(方法5)高出2.15%,同时保持了几乎相同的计算成本。这一结果表明,纳入轻量级深度卷积有效地增强了局部令牌交互和特征辨别能力,而不会大幅增加模型复杂性

表10 不同帧长度对诊断性能和复杂性的影响

5.2 帧长度的影响分析

为研究时间粒度对模型表示和计算效率的影响,在AFEM中通过改变帧长度L进行了分析。在重叠率固定为0.5的情况下,增加L会减少总帧数P=2T/L-1并降低注意力成本        ,但会增大嵌入和FFN计算量。表10显示,当L=16时,所提出的模型实现了99.75%的最高诊断准确率,具有中等复杂度参数(13.66M FLOPs)和高吞吐量(1594.31样本/秒)。从物理角度来看,最佳帧长度(L=16)对应于大约0.31-0.80ms的持续时间,这取决于采样率。鉴于故障引起的结构共振通常表现出多毫秒的衰减,这种亚毫秒级粒度有效地起到了组成音素的作用,在单个脉冲内捕获瞬时上升沿和相位调制。这种精确的分辨率减轻了较长帧(例如L=48,≈2.4ms)中固有的时间模糊性,而较长帧有将高频判别细节平均化的风险。

定量比较证实了这种物理特性。极短的帧(例如L=6)限制了时间上下文,削弱了特征辨别能力并将准确率降低到97.20%。相反,延长帧长度(L≥40)会增加模型复杂度(0.33-0.44M参数)和计算成本(17.18-18.51M FLOPs),但不会提高准确率;实际上由于信息冗余和有效帧交互减少,准确率下降到了98.65%。值得注意的是,随着L增加,吞吐量从1549提高到了1760样本/秒,这表明推理延迟与理论计算复杂度并非严格正相关。

5.3 可解释性分析

为了更好地理解所提出模型的行为,应用Grad-CAM++来可视化所提出的ASFE-Transformer在真实(AC)和虚拟(PC)声学通道上对10种故障类别的时间注意力。在图27中,突出显示的区域对应于具有高诊断重要性的时间段。通过将波形分割成短时声学帧,该模型使Grad-CAM++能够在特定帧内精确地定位瞬态故障脉冲并增强时间可解释性。该模型始终专注于包含故障引起的脉冲的瞬态、高能区域,同时抑制以噪声为主的段。两个通道都表现出互补的激活模式,并证实基于希尔伯特的双通道表示使网络能够更有效地捕获幅度和相位信息。这些结果表明,所提出的模型不仅实现了准确的故障识别,还提供了清晰的时间可解释性。图27 使用Grad - CAM++对10个随机样本的可视化:(a) NOR,(b)INC,(c)INP,(d)INW,(e)BAC,(f)BAP,(g)BAW,(h)ORC,(i)ORP,和(j)ORW

6 结论

为了解决表征声学信号的短时非平稳性与保持计算效率之间的矛盾,本研究受音素处理范式启发,提出了一种轻量化 ASFE-Transformer。具体而言,该模型通过 AAPR 表征声学信号的瞬时演化过程,并显式分离其中的复杂调制成分,从而提升对非平稳声学特征的刻画能力。在此基础上,AFEM 将连续波形离散为准平稳的帧级标记,在保持瞬态故障线索结构完整性的同时,有效稳定特征学习过程。此外,所提出的 SD-GLU 弥补了标准 Transformer 局部归纳偏置不足的问题,使编码器能够兼顾全局依赖建模与局部形态细化。综合验证结果表明,该设计使模型优于现有先进基线方法,并在仅 0.09 M 参数量的超轻量化规模下分别取得 99.75% 和 99.90% 的诊断准确率,因而高度适用于资源受限边缘设备上的实时部署,可解释性进一步证实了模型能够精准关注由故障诱发的判别性声学冲击片段。

未来的研究将通过开发自适应帧分割策略,将该框架扩展到变速工况,该策略能使嵌入粒度与瞬时旋转运动学动态同步,从而减轻时间扭曲效应,并在非平稳条件下保持特征不变性。此外,虽然本研究中使用的AWGN(Additive White Gaussian Noise,加性高斯白噪声)是一个标准基准,但需要认识到,实际工业声学环境通常具有非平稳、“有色”噪声和谐波干扰的特征。因此,后续研究的一个关键方向是使用现场工业数据验证模型的鲁棒性。这一阶段将专注于通过实证验证“音素启发式”架构在复杂运行环境中区分故障瞬态的形态特征与结构化背景干扰方面的理论优势。

7 代码可用性

为了促进重现性和进一步的研究,我们提供了提出的ASFE-Transformer的完整实施代码:https://github.com/ Lab-of-AMFD/ASFE-Transformer

编辑:赵栓栓

校核:李正平、陈凯歌曹希铭、赵学功、白亮、任超、海洋、陈宇航、Kira、Tina、王金、赵诚、肖鑫鑫、张优

该文资料搜集自网络,仅用作学术分享,不做商业用途,若侵权,后台联系小编进行删除



来源:故障诊断与python学习
ACTMechanicalAdditiveSystemInspire结构基础振动碰撞非线性化学航空海洋裂纹理论电机材料机器人数字孪生
著作权归作者所有,欢迎分享,未经许可,不得转载
首次发布时间:2026-06-01
最近编辑:2月前
故障诊断与python学习
硕士 签名征集中
获赞 87粉丝 152文章 327课程 0
点赞
收藏
作者推荐

中科院一区Top论文学习|用于机械装备RUL预测的特征预测双空间域泛化框架

本期给大家推荐一区TOP期刊RESS的论文。为解决在未知工况下基于域适应的方法对旋转机械进行的剩余使用寿命预测需要在训练期间访问目标域数据的实际应用局限性。文章提出了一种面向机械可靠RUL预测的特征-预测双空间域泛化框架。该框架通过一种贝叶斯正则化随机特征分布扩展方法在潜在空间中产生受控的随机扰动,在保持退化一致性的同时扩展特征分布。此外,设计了一种结构一致性损失来正则化预测行为,以保持长期退化趋势、减轻预测偏差并抑制局部波动。并在齿轮和轴承全寿命数据集上对提出方法的有效性进行了验证。论文基本信息论文题目: Feature-prediction dual-space domain generalization framework for reliable RUL prediction of machinery 论文期刊:Reliability Engineering and System SafetyDOI:https://doi.org/10.1016/j.ress.2026.112510作者:Xuegang Li a,b, Yuanyue Pu a,b, Huajun Cao a,b, Xiaoxi Ding a,b, Wenbin Huang a,b,* 论文时间: 2026年 机构: a State Key Laboratory of Mechanical Trans mission, Chongqing University, Chongqing 400044, China b College of Mechanical and Vehicle Engineering, Chongqing University, Chongqing 400044, China作者简介:黄文彬,教授、博士生导师,重庆市杰青,重庆市英才计划青年拔尖人才,重庆市巴渝青年学者,重庆市海外高层次人才,机械工业智能轴承技术与系统实验室副主任。研究团队主要面向重大机械装备服役状态智能监测需求,从事智能感知与自供电、端边云协同智能嵌入式系统等领域的研究,承担了科技部重点研发青年科学家项目、国家自然科学基金重点、面上等10余项国家级科技项目,与华为、中船、兵器、航发、英特尔、天马等多家行业龙头骨干企业产学研合作,荣获国防科技进步一等奖、中国机械工业技术发明二等奖等。在Nature Materials/AFM/IEEE TII/MSSP/AEI/APL等国际顶级期刊发表学术论文100余篇,其中一作/通讯70篇,JCR Q1期刊60篇,自然指数期刊9篇,IEEE汇刊33篇,WOS被引3400余次;出版英文专著2部;授权发明专利20项。 通讯作者邮箱:whuang@cqu.edu.cn摘要在未知工况下对旋转机械进行可靠的剩余使用寿命(RUL)预测对于确保安全运行至关重要。然而,现有的基于域适应(DA)的方法需要在训练期间访问目标域数据,这限制了它们的实际应用性。为解决这一问题,本研究提出了一种面向机械可靠RUL预测的特征-预测双空间域泛化(FPDDG)框架。具体而言,一种贝叶斯正则化随机特征分布扩展(BFDE)方法在潜在空间中产生受控的随机扰动,在保持退化一致性的同时扩展特征分布。此外,设计了一种结构一致性损失(SCL)来正则化预测行为,以保持长期退化趋势、减轻预测偏差并抑制局部波动。在齿轮和轴承全寿命数据集上的实验结果表明,FPDDG框架优于现有最先进的方法,在齿轮数据集上RMSE和MAE分别至少降低15.3%和13.27%,在轴承数据集上分别降低6.33%和12.74%。关键词:旋转机械;域泛化;未知工况;剩余使用寿命预测目录1 引言2 方法2.1 问题定义2.2 总体方法2.3 贝叶斯正则化随机特征分布扩展2.4 结构一致性损失2.5 总体优化目标3 案例研究3.1 数据描述3.2 实施细节和比较方法3.3 数据集A的实验结果和比较分析3.4 数据集B的实验结果和比较分析3.5 讨论4 结论1 引言在智能和预测性维护需求的驱动下,对旋转机械(如齿轮和轴承)关键部件进行可靠的剩余使用寿命(RUL)预测对于确保系统安全和减少意外停机至关重要[1]。然而,这些部件经常在高度可变和复杂的工况下运行,这显著改变了它们的退化行为和剩余寿命[2]。因此,稳健的RUL预测对于向主动维护过渡并最大化工业系统的可靠性至关重要[3]。数据驱动方法,特别是深度学习(DL),由于其强大的非线性特征提取能力,近年来在RUL预测中取得了显著成效[4]。各种先进的深度学习架构已成功应用于该领域[5]。例如,Magadan等人[6]集成了时频分析、堆叠变分去噪自编码器和双向长短期记忆网络,以实现精确的轴承RUL预测。Cen等人[7]利用特征序列注意力模块和多源信息融合,通过利用传感器和时间步长之间的交互来增强RUL预测。Truong等人[8]提出了一种贝叶斯正则化人工神经网络模型,以精确预测铣削刀具的磨损。尽管取得了这些成功,但大多数现有的基于深度学习的模型依赖于一个严格的假设,即训练数据和测试数据具有相同或高度相似的分布[9]。在现实世界的工业应用中,历史训练数据与部署的可变环境之间不可避免的分布偏移构成了一个严峻的挑战,严重限制了传统深度学习模型的泛化能力和鲁棒性[10-11]。为了解决变工况带来的挑战,许多研究引入了域适应(DA)方法,这些方法促进了知识从标记良好的源域到未标记目标域的迁移[12]。目前,基于DA的跨域RUL预测策略已被广泛探索[13]。例如,Wang等人[14]提出了一种由图结构数据增强的元学习网络,以支持不同工况下的RUL预测。Neijar等人[15]开发了对抗性DA方法,分别对齐不同操作阶段的边缘分布,以提高RUL预测精度。Kim等人[16]利用Fisher信息和结构正则化来减轻灾难性遗忘,实现了高效的切削刀具RUL预测。尽管在目标域数据可访问时有效,但这些基于DA的模型在部署到完全未知的目标域(无法事先收集数据)时往往无法泛化[17]。 域泛化(DG)通过从多个源域学习不变知识而不需要任何目标域数据,为这一限制提供了一个有前景的解决方案[18]。DG中的一个关键策略是数据增强,它扩大了训练样本的多样性并减轻了对特定工况的过拟合[19]。例如,Luu等人[20]将基于ResNet的自编码器与软演员-评论家算法相结合,以动态预测机械RUL。Xia等人[21]构建了一个域条件不变性和特异性解耦网络以解决域不平衡问题。Niazi等人[22]集成了时间变换器、ConvLSTM和多头自注意力机制以捕获时空依赖性,实现了精确的轴承RUL预测。尽管取得了这些进展,现有的基于DG的机械RUL方法仍然面临两个主要挑战。首先,当前的增强策略通常依赖于固定规则(例如,添加高斯噪声),这无法捕捉机械退化的非线性特性,并且可能扭曲生成轨迹的物理合理性。其次,许多模型依赖于逐点损失函数,忽略了数据中的时间和结构依赖性,常常导致波动大且有系统性偏差的预测。因此,迫切需要更有效的方法,同时在特征空间和预测空间中增强泛化能力。为解决这些挑战,本研究提出了一种新颖的用于未知工况下机械RUL预测的特征-预测双空间域泛化(FPDDG)框架。首先,提出了一种贝叶斯正则化随机特征分布扩展(BFDE)方法,该方法扰动特征表示以生成多样化但退化一致的变体。此过程扩展了域不变特征的分布范围,增加了与潜在未知域分布的重叠,从而增强了特征空间泛化。通过这种方式,所提方法克服了固定规则增强的局限性,并更好地反映了真实的退化动态。其次,设计了结构一致性损失(SCL),通过保持长期退化趋势、控制预测偏差和抑制局部波动来增强预测空间泛化,从而确保可靠性一致的RUL轨迹。通过结合BFDE和SCL,提出了一个新颖的FPDDG框架,通过联合改进域不变特征空间的重叠和预测空间的稳定性来增强泛化能力,并实现在未知工况下的可靠机械RUL预测。本研究的主要贡献总结如下:(1) 提出了一种BFDE方法,以扩展退化特征的多样性和重叠范围,并增强特征空间泛化。(2) 设计了SCL以增强预测空间泛化,并提高RUL预测结果的稳定性和可靠性。(3) 构建了一个新颖的FPDDG框架,用于在未知工况下实现机械的可靠RUL预测。本文的其余部分结构如下。第2节详细介绍了所提出的FPDDG框架。第3节介绍了实验细节和结果。最后,第4节对全文进行了总结。2 提出方法 本节详细描述了用于未见工况下机械RUL预测的所提FPDDG框架。它首先形式化了基于DG的RUL预测问题,然后介绍了整体方法论、BFDE方法和SCL。最后,概述了总体优化目标以指导模型训练并增强泛化性能。2.1. 问题定义令 为 个源域的集 合,其中每个域 是从同一类型机器(例如,具有相同规格的轴承或齿轮)但在不同工况(如载荷和转速)下收集的,即不同域之间样本的边缘分布通常不一致。对于每个域 ,它包含全寿命数据,形式为样本-标签对 ,其中 表示第 个源域中的样本数。每个 表示长度为 的一维时间序列片段,对应的标签 是与该时间序列相关联的RUL值。基于DG的机械RUL预测的目标是仅使用来自 的样本-标签对学习一个映射函数 ,使其能够很好地泛化到未知的目标域 ,其中 且在训练期间没有来自 的样本可用。由于分布差异 ,本文的核心目标是通过随机特征扰动和改进的预测损失,扩展从源域学习的退化行为特征分布的覆盖范围,从而增强模型 对未见域的泛化能力。给定一个随机特征扰动函数 ,对于每个输入 ,模型在其特征扰动变体 上进行训练。训练目标是最小化特征扰动变体上的预测损失: 其中 表示改进的预测损失函数。这种形式化确保模型从丰富且多样的退化模式中学习,使其能够有效地泛化到未见工况,而无需访问任何目标域数据。2.2. 整体方法本节概述了所提出的FPDDG框架,而BFDE、SCL和优化过程的具体公式和实现分别在第2.3-2.5节中给出。所提框架用于在未见工况下实现机械鲁棒RUL预测的整体过程分为五个主要步骤,下面进行描述,并在本节末尾的图1中进行了可视化总结。步骤1:数据预处理。使用可用的传感器设备(例如编码器或加速度计)收集原始传感器数据,随后根据工况分割为源域和目标域。然后构建健康指标以表征机械退化。FPDDG框架具有高度的灵活性,可以适应各种健康指标,如统计特征(脉冲因子、峰峰值)、能量熵或基于深度学习的虚拟指标。接下来,应用3σ准则[24]来确定第一预测时间(FPT),标记退化的开始。使用健康指标,通过长度为 、步长为1的滑动窗口生成训练样本。对于标签,FPT之前的样本被分配一个恒定的 100% RUL。在FPT之后,剩余寿命线性下降到故障时的 0%,从而定义了一个单调的真实RUL曲线。步骤2:特征提取。一个特征提取器将健康指标序列转换为鲁棒且域不变的潜在表示。源域训练样本被输入该提取器,以学习退化一致且具有判别性的特征。在本研究中,采用残差网络(ResNet)[25]作为特征提取器,提供可靠的表示,为后续的BFDE和RUL预测奠定基础。步骤3:特征分布扩展。提取的特征通过所提出的BFDE方法进行处理,该方法扰动潜在表示以生成多样化但退化一致的变体,如第2.3节所述。此过程扩展了域不变特征的分布范围,增加了与潜在未见域分布的重叠,并增强了特征空间泛化。步骤4:RUL预测。由ResNet提取的原始特征和BFDE生成的扰动特征都被输入到一个多层感知器(MLP)预测器[26]中以获得预测结果。预测损失使用所提出的SCL计算,该SCL包含四个部分:均方误差 、偏差损失 、波动损失 和趋势损失 。这些部分被联合优化以确保预测准确性、保持退化趋势、控制偏差并抑制波动。最后,计算得到的损失被反向传播以更新模型参数。步骤5:未见条件下的推理。一旦训练完成,模型直接应用于未见工况下的目标域数据,以预测机械RUL,无需进一步的适应。如图1所概括,所提出的FPDDG框架分为训练和测试阶段。在源域和目标域模块中,上方的图表示原始传感器信号,而下方的图表示数据预处理后的健康指标。在测试阶段,在先前未见工况下收集的样本由训练好的模型处理。具体地,仅使用训练好的特征提取器 和预测器 来预测机械的RUL,其中 和 *表示它们各自的可训练参数。为了进一步促进实际应用和可复现性,所提FPDDG框架的整体训练和推理过程总结在算法1中。 图1 所提出的FPDDG框架的总体架构算法1 提出的FPDDG框架 2.3. 贝叶斯正则化随机特征分布扩展所提出的BFDE方法集成在特征提取器之后,其整体结构如图2所示。给定一个提取的特征 ,一个编码器将其映射到潜在表示 。从这个表示 中,生成一个由可学习的均值 和对数方差 参数化的随机高斯分布。通过从该分布中采样,产生一个潜在变量 以模拟对应潜在未见域的特征变化。然后一个解码器将潜在变量 重建为 。同时,通过将原始输入特征 与扰动的潜在表示 融合,得到分布扩展后的特征 。这种扩展促进了特征多样性并增加了与目标域分布的重叠。该过程使用结合重建损失和Kullback-Leibler(KL)散度[27]的联合损失函数进行优化,定义如下: 其中 表示编码器, 表示全连接层, 表示从标准正态分布采样的随机噪声, 表示解码器, 表示特征随机扰动策略, 表示dropout层,它可以控制扰动的幅度, 是一个二元随机函数,以概率 翻转输入特征 中元素的符号,这控制了扰动的方向, 表示逐元素相乘操作。 图2 BFDE方法的结构 KL散度用于量化潜在变量 的分布 与标准正态先验分布 之间的差异。最小化该散度可防止采样的潜在变量 过度偏离,确保生成的扩展特征既多样化又物理上合理。此过程增强了模型的泛化能力和训练鲁棒性。KL散度正式定义为: 为了防止关键退化信息的丢失并保持语义完整性,对解码器输出应用了重建损失。该约束鼓励生成的特征在保持原始分布核心特征的同时表现出合理的偏差。因此,它有效地扩展了源域特征的支持范围,以模拟未见的目标域特征。重建损失定义为: 最后,通过联合优化重建损失和KL散度项,得到BFDE方法的损失函数 : 2.4. 结构一致性损失虽然BFDE方法增强了特征空间泛化,但确保预测空间的一致性和稳定性同样至关重要。在RUL预测任务中,传统的损失函数如均方误差(MSE)仅关注逐点准确性。它们未能捕捉时间依赖性和结构特性,常常产生具有相似逐点误差但不一致趋势、过度波动和偏差的预测。这些问题在DG场景中尤其突出。为了克服这一缺点,设计了结构一致性损失(SCL)以强制实现结构一致且物理上有意义的RUL预测。通过约束全局趋势、抑制波动和减少预测偏差,SCL减轻了对源域数据的过拟合,并增强了对未见域偏移的鲁棒性。具体来说,SCL包含四个互补的部分:偏差损失、波动损失、趋势损失和MSE。令 和 分别表示一个批次大小为B的预测RUL值和真实RUL值。首先,偏差损失 约束预测序列以减轻系统性高估或低估。它包括预测序列和真实序列均值的绝对差以及Sinkhorn距离[28],后者量化了全局分布差异。偏差损失 的公式为: 其中 和 分别表示预测序列和目标序列的均值。其次,引入基于方差的波动损失 以鼓励预测更平滑,与真实RUL曲线紧密对齐。该项惩罚每个批次内预测值与真实值之间的相对方差差异。应用对数变换以减轻方差尺度对优化的影响、缓解梯度消失并确保数值稳定性。波动损失 的数学表达式为: 其中 是用于计算稳定性的极小值。第三,设计趋势损失 以保持方向一致性。通过结合皮尔逊相关系数和余弦相似度,该损失同时捕获线性依赖和角度对齐,为退化趋势提供了全面的约束。趋势损失 定义如下: 最后,标准的MSE作为衡量逐点偏差的基线指标。其定义为: 整体SCL表示为上述各部分的加权组合: 为了平衡不同结构约束的贡献,使用单个权衡系数 联合调节辅助项。由于这些部分相互补充以强制结构一致性,统一的系数有效地保持了平衡,同时避免了多个独立超参数带来的不必要的调参复杂性。2.5. 总体优化目标所提框架的优化过程涉及三个主要部分:特征提取器 、BFDE模块 和预测器 的参数 、 和 。这些部分通过最小化框架内定义的总体目标函数进行联合训练。通过整合式(12)和式(17)中的损失函数,总体网络优化目标 可以表示为: 参数优化和模型训练使用自适应矩估计优化器[29]通过梯度反向传播进行。每个模块参数的具体更新规则如下: 其中 是自适应矩估计优化器中的学习率。3 案例研究 本节通过在两个全寿命数据集上的综合实验证明了所提框架的有效性。实验过程严格遵循第2节和算法1中详述的训练和测试协议。具体地,模型仅在源域数据上训练,并直接对未见的目标域进行评估,无需任何进一步适应,确保严格且可复现的评估。3.1. 数据集描述本节介绍了两项实验研究中所采用的数据集:一个包含齿轮全寿命周期数据,另一个包含轴承全寿命数据。通过使用代表不同机械部件的两个不同数据集,所提框架的有效性和泛化能力得到了更全面和综合的评估。下面提供两个数据集的详细描述。数据集A:该数据集来源于自制的齿轮全寿命试验台。它主要用于评估所提框架在未见载荷条件下的可行性、可靠性和泛化能力。图3中试验台的核心部件包括驱动电机、扭矩计、主试验齿轮箱、联轴器、陪试齿轮箱、负载电机、稀油站和控制柜。在恒定转速1200 rpm和不同载荷水平(25 Nm、30 Nm和35 Nm)下对齿轮进行全寿命实验,以模拟不同的工况。在这些测试期间,从编码器获得的转速信号在整个退化过程中连续采集,直到齿轮失效。每种工况下的采样频率设为5000 Hz。 图3 自制齿轮全寿命试验台由于脉冲因子对早期退化特征高度敏感[23],它被选为健康指标来构建样本。脉冲因子的数学表达式为: 其中 表示长度为 的一维时间序列样本, 表示序列中的第 个点, 是样本内的最大绝对值, 是该片段的算术平均值。提取的脉冲因子按顺序排列以表征健康退化过程。真实的RUL标签按照退化假设定义。具体地,应用 准则来确定第一预测时间(FPT),在此之前认为机械在稳定状态下运行,RUL设为100%。在FPT之后,假设RUL线性下降至故障时的0%。该标记策略被一致地用于生成实验结果中显示的真实RUL曲线。最后,使用滑动窗口策略(窗口长度512,步长1)构建训练和测试样本。利用该数据集,设计了三个RUL预测任务以评估所提方法的有效性。这些任务的训练和测试条件在表1中概述。表1 为数据集A设计DG任务 数据集B:为了进一步证明所提框架的鲁棒性,使用了公开的XJTU-SY轴承数据集[30]。数据集A侧重于变载荷条件,而数据集B评估模型在转速和径向载荷同时变化下的性能。该数据集包含全寿命轴承测试,以25.6 kHz采样频率(1.28秒持续时间,1分钟间隔)采集振动信号。符号Bearing i_j表示在第 种工况(由电机转速和径向载荷定义)下测试的第 个轴承。本研究选择了三个代表性轴承:Bearing 1_1(2100 rpm,12 KN载荷)、Bearing 2_5(2250 rpm,11 KN载荷)和Bearing 3_2(2400 rpm,10 KN载荷)。遵循与数据集A相同的预处理协议,提取脉冲因子作为健康指标。使用滑动窗口(长度16,步长1)生成数据样本。真实的RUL标签再次基于FPT和线性退化假设确定,以确保一致性。基于该数据集构建了三个RUL预测任务,以评估所提框架的性能和有效性。关于这些任务的详细信息在表2中给出。 表2 为数据集B设计DG任务 3.2. 实现细节与对比方法为了严格评估所提框架在DG RUL预测中的有效性,进行了两组实验:(1) 与广泛采用的RUL预测方法的比较,以及 (2) 对框架各组件的消融研究。所有方法均使用Adam优化器进行训练,学习率 ,训练100个epoch,批次大小 。实验使用PyTorch实现,并由NVIDIA GeForce RTX 3060 GPU加速。为了确保公平客观的比较,所有基线方法均使用其原始网络架构(例如ResNet)按照各自文献中的描述实现。此外,所有与训练相关的超参数,如优化器、学习率、批次大小、输入长度和评估指标,在所有模型中都保持严格一致[3,25,31-33]。对比方法和消融方法的具体细节总结在表3中。 表3 比较和消融方法的细节 为了定量评估预测性能,采用了三个广泛使用的评估指标:均方根误差(RMSE)、平均绝对误差(MAE)、决定系数( )[34]。这些指标共同反映了模型的预测精度、鲁棒性和拟合优度,其数学公式如下: 其中 和 分别表示第 个预测样本的真实RUL和预测RUL, 是样本总数, 是真实RUL值的均值。3.3. 数据集A上的实验结果与对比分析3.3.1. 与现有方法的比较为了评估所提方法在未见工况下的泛化能力,在数据集A(任务A1-A3,详见表1)上进行了全面的实验研究。图4-6展示了所有方法的预测性能。Base方法在任务A1和A3中具有较大的RMSE和MAE以及较低的R。很明显,仅在源域数据上训练的传统基于深度学习的RUL预测方法难以泛化到目标域。 图4 通过RMSE评估不同方法在不同预测任务下的预测性能 图5 通过MAE评估不同方法在不同预测任务下的预测性能 图6 不同预测任务的不同方法的R2值基于DA的RUL预测方法,如DANN和MMD,通过利用未标记的目标域数据来减少分布差异,取得了中等性能。例如,DANN在A1中达到了10.084的较低RMSE,MMD在A3中达到了17.545,优于Base方法。然而,这些方法依赖于对目标域数据的访问,限制了它们在未见工况场景中的适用性。相比之下,仅依靠标记源域数据训练的基于DG的RUL预测方法对域偏移表现出更强的鲁棒性。Mixup和RSC在A1和A2中取得了良好的结果,而RSC在所有任务中表现出比Mixup更好的预测稳定性。特别是,RSC在A1中达到了4.320的RMSE和0.980的 。尽管如此,所提出的FPDDG框架在所有任务和指标上始终优于所有竞争者,产生了最低的误差和最高的 得分。这些结果清楚地证明了其在捕获鲁棒退化模式并将知识迁移到未见目标条件方面的有效性。为了进一步说明预测质量和不确定性,图7可视化了RUL预测曲线以及95%置信区间(CI)。真实RUL(粗黑色虚线)在第一预测时间之前保持恒定的 100%,随后线性下降。CI使用预测误差的标准差乘以1.96的z分数计算得到。CI反映了预测不确定性,这些区域的宽度表明了模型随时间推移的置信度。在绘制的可视化结果中,Base和DA方法显示出较大的偏差和更宽的置信带,特别是在早期和晚期退化阶段。而基于DG的RUL预测方法如RSC和Mixup产生了更平滑的曲线,但它们阴影化的不确定区域仍然明显比所提方法更宽。相比之下,所提出的FPDDG框架不仅产生了紧密跟踪真实RUL的预测曲线,而且呈现出最窄的CI,意味着高预测确定性和稳定性。这些结果证明了所提FPDDG框架在未见工况下RUL预测中的可靠性和优越性。 图7 RUL预测比较结果的可视化3.3.2. 消融研究为了研究所提框架内每个组件的贡献,本节进行了全面的消融研究。数据集A上的预测结果总结在图8-10中。如结果所示,引入SCL(Base+S)一致地提高了相对于Base模型的预测精度。例如,在任务A1中,RMSE从19.562降低到15.586,在任务A3中从30.270降低到17.931,而在A1中 得分从0.595增加到0.743。这表明SCL有效地引导模型学习域不变和可泛化的退化特征。 图8 通过RMSE评估不同消融方法在不同预测任务下的预测性能 图9 通过MAE评估了不同消融方法在不同预测任务下的预测性能 图10 不同消融方法对不同预测任务的R2值此外,应用特征分布扩展,如高斯(Base+G)、VAE(Base+V)和所提出的BFDE(Base+B),增强了在未见工况下的泛化能力。值得注意的是,Base+B产生了最显著的收益,在任务A1-A3中分别达到了6.696、6.860和8.662的RMSE值。这证实了所提出的BFDE提供了比高斯和VAE方法更强的泛化能力。最后,组合策略(Base+GS和Base+VS)进一步减少了预测误差,突显了特征空间和预测空间泛化的互补作用。例如,Base+GS在任务A3中将RMSE降低到11.175,而Base+VS在任务A1中达到了9.340,两者都明显优于它们各自的单独对应项。通过联合集成SCL和BFDE,所提出的FPDDG框架在所有任务中一致地实现了最佳性能,产生了最低的RMSE值和最高的 得分。如图11中RUL预测曲线和95% CI的可视化所证实,这些组件的联合集成显著增强了模型的整体有效性和鲁棒性。 图11 不同预测任务的不同消融方法的可视化3.4. 数据集B上的实验结果与对比分析3.4.1. 与现有方法的比较为了进一步评估所提方法在未见工况下的鲁棒性和泛化能力,在数据集B(任务B1-B3)上进行了实验。RMSE、MAE和 的结果总结在图12-14中。为确保公平比较,所有方法均在与数据集A一致的设置下进行评估。如图所示,基线(Base)方法表现出不令人满意的泛化能力,在大多数任务中产生最差的性能(例如,在B1中 低至0.246)。 图12 通过RMSE评估不同方法在不同预测任务下的预测性能 图13 通过MAE评估不同方法在不同预测任务下的预测性能 图14 不同预测任务的不同方法的R2值基于DA的RUL预测方法(DANN和MMD)显示出部分改进。虽然DANN在B2中表现良好(RMSE = 10.983, ),但其性能在B3中严重下降(RMSE = 26.512, 2=0.179)。这表明当目标域表现出显著分布偏移时,对抗性对齐策略难以应对。类似地,MMD未能提供一致的迁移能力,表明仅依赖统计距离对齐的局限性。在基于DG的RUL预测方法中,Mixup表现出中等的鲁棒性,但在B1和B3中保持了较高的误差幅度,表明样本级插值不足以实现全面的泛化。RSC尽管在数据集A上表现强劲,但在数据集B上性能显著下降(例如,在B3中获得30.760的RMSE和仅0.105的 )。这揭示了特征抑制策略在高度可变未见域中可能会过度约束模型。相比之下,所提出的FPDDG框架在所有指标上始终优于所有基线和最先进的方法,实现了最低的误差和最高的 得分。这些结果清楚地证明了所提模型的有效性和优越的泛化能力。这些定量优势通过图15中的预测曲线和95% CI得到了直观的证实。所提方法的预测RUL轨迹紧密跟踪真实值,并具有一贯窄的置信带,反映了高精度和低不确定性。相反,竞争方法在未见工况下表现出更宽的CI和显著的预测偏差,反映了较差的预测和不稳定性。 图15 RUL预测比较结果的可视化3.4.2. 消融研究为了进一步研究所提框架中每个单独组件的贡献,在数据集B上进行了全面的消融研究。预测结果总结在图16-18中。如结果所示,与Base方法相比,引入SCL(Base+S)显著提高了性能。例如,在任务B1中,RMSE从32.339下降到16.843, 从0.246增加到0.669。这证实了SCL在未见工况下引导模型的鲁棒性。 图16 通过RMSE评估不同消融方法在不同预测任务下的预测性能 图17 通过MAE评估了不同消融方法在不同预测任务下的预测性能 图18 不同消融方法对不同预测任务的R2值此外,应用特征分布扩展相比Base模型带来了显著的改进。虽然Base+G在B2中达到了0.849的 ,Base+V在B1中将RMSE改善到17.461,但所提出的BFDE(Base+B)在不同条件下始终提供更优的泛化能力。通过在B3中达到0.743的 ,Base+B明显优于高斯和VAE扩展,证明了BFDE策略的优越性。最后,完整的所提框架在所有指标和任务上取得了最佳结果(例如,在B2中RMSE为8.336,在B3中 为0.895)。与单独的Base+B相比,添加SCL进一步提高了准确性和稳定性,突显了其在完整框架中的关键作用。总体而言,数据集B上的消融研究证实了数据集A的发现:每个模块都有积极贡献,并且SCL和BFDE的联合集成提供了最显著的性能提升。这些改进通过图19所示的RUL预测曲线和95% CI得到了直观的证实。 图19 不同预测任务的不同消融方法的可视化3.5. 讨论所提出的FPDDG框架严格独立于特定的机械、传感器或健康指标。因为它仅需要序列化的退化表示作为输入,并利用与模型无关的BFDE和SCL模块,该框架可以轻松应用于不同的机械部件和工况,而无需结构修改。为了进一步研究模型复杂度、超参数敏感性和特征可解释性,使用数据集A中的任务A1进行了附加实验。3.5.1. 模型复杂度表4总结了不同机械RUL预测方法在参数量(Params)、浮点运算次数(FLOPs)和推理延迟方面的模型复杂度和推理效率比较。与基线模型以及代表性的DA和DG方法相比,所提出的FPDDG框架由于额外的BFDE(涉及特征分布扩展和重建)而显示出略高的参数量(196.5 K)和FLOPs(7.12 M)。尽管如此,所提模型保持了极具竞争力的推理延迟(1.42 ms),表明没有显著的计算负担。此外,所提模型实现了最低的RMSE(3.659),展示了表达能力与计算效率之间的出色权衡。表4 不同机械RUL预测模型复杂度的比较方法。 3.5.2. 超参数敏感性为了评估所提FPDDG框架对总损失函数中权衡系数 的鲁棒性,将 从1变化到10,相应的RMSE、MAE和 显示在表5中。结果表明,模型性能在较宽的 值范围内保持稳定,RMSE、MAE和 仅有微小波动。这些结果表明,所提FPDDG方法对 不高度敏感,对超参数变化表现出良好的鲁棒性,并确保训练过程中的稳定收敛。表5 FPDDG框架的超参数敏感性 3.5.3. 特征可解释性为了研究所学退化表示的可解释性,图20展示了潜在特征的t-SNE可视化。源域特征用蓝色圆圈标记,而目标域特征用红色三角形表示。颜色强度(从浅到深)反映了退化严重程度的增加。如图20所示,Base模型表现出分散的分布,源样本和目标样本混合在一起,没有清晰的退化进程,表明泛化能力差。DA方法(DANN、MMD)实现了部分域对齐,表明对抗性和统计对齐策略可以减少分布差异。然而,这些退化特征仍然是碎片化的,不够连续。DG方法(Mixup、RSC)显示出改进的域内紧凑性和更平滑的轨迹,但域之间的聚类边界仍然明显。 图20 不同方法提取的潜在特征的t-SNE可视化相比之下,所提方法实现了物理上最一致和域不变的特征嵌入。源和目标样本沿着退化路径形成一个连续且有序的轨迹,颜色从浅到逐渐过渡,生动地反映了机械疲劳的渐进性质。这种可解释的分布表明,学习到的潜在空间有效地捕获了域不变和退化一致的特征。这反映了BFDE和SCL的双重贡献,其中BFDE扩展了特征分布以增强表示多样性,而SCL强制了预测RUL序列的结构一致性。因此,所提出的FPDDG框架不仅提高了预测精度,而且在潜在空间中提供了可解释的退化演化。4 结论本文提出了一个新颖的FPDDG框架,用于在未见工况下实现机械的可靠RUL预测。本研究的主要结论可总结如下:(1) 所提出的BFDE通过模拟随机的但退化一致的变体,扩展了退化特征的多样性和覆盖范围。该机制有效地增强了在未见工况下的特征空间泛化能力。(2) 设计的SCL联合强制了退化趋势保持、预测偏差控制和波动抑制。通过在预测空间中约束RUL预测,SCL提高了预测退化轨迹的稳定性。(3) 在齿轮和轴承数据集上的广泛实验评估表明,所提出的FPDDG框架始终优于DL、DA和DG方法。它实现了最低的预测误差,在齿轮数据集上RMSE和MAE分别至少降低15.3%和13.27%,在轴承数据集上分别降低6.33%和12.74%。此外,复杂度分析表明,所提FPDDG框架在计算效率和预测精度之间实现了平衡的权衡,而超参数敏感性实验验证了其鲁棒性。 本研究仍存在一些局限性。首先,当前框架依赖于离线训练和固定的损失权重,这可能限制其在高度动态或实时工业场景中的适应性。其次,尽管所提方法在齿轮和轴承数据集上表现出强大的泛化性能,但其对其他机械部件和更复杂退化机制的有效性需要进一步研究。因此,未来的工作将集中在将FPDDG框架扩展到实时和边缘部署,以及开发训练期间自动损失平衡的自适应加权策略。此外,未来的研究将探索更广泛的工业应用和更多样化的退化模式,以进一步验证所提框架的普适性。 编辑:Tina校核:李正平、陈凯歌、曹希铭、赵学功、白亮、任超、海洋、赵栓栓、Kira、陈宇航、王金、赵诚、肖鑫鑫、张优该文资料搜集自网络,仅用作学术分享,不做商业用途,若侵权,后台联系小编进行删除来源:故障诊断与python学习

未登录
还没有评论
课程
培训
服务
行家
VIP会员 学习计划 福利任务
下载APP
联系我们
帮助与反馈