声学故障诊断如何兼顾精度与轻量化?这篇文章受语音音素处理启发,提出ASFE-Transformer:通过解析振幅-相位双通道表征、声学帧嵌入降维及SD-GLU局部增强,以0.09M参数实现99.75%+准确率,为边缘端实时诊断开辟新路径。
本期受作者邀请,给大家推荐这篇安徽大学机器人学院刘方教授团队的论文,论文第一作者为团队博士生彭麟昊。作者提出了一种受音素处理范式启发的轻量级声学帧嵌入Transformer,用于滚动轴承声学故障诊断。针对声学信号短时非平稳特征难辨识及Transformer计算开销大的问题,该方法首先通过解析振幅-相位表示模块构建包含瞬时幅值和相位的双通道物理表征;其次设计声学帧嵌入模块将连续波形聚合为紧凑的帧级token序列,在保留瞬态故障线索的同时显著降低序列长度与计算复杂度;最后提出Swish-深度门控线性单元替代传统前馈网络,通过嵌入轻量级深度可分离卷积增强局部上下文感知。在两个轴承声学数据集上的实验表明,ASFE-Transformer(Acoustic Segment-Frame Embedded Transformer,声学段帧嵌入Transformer)以仅0.09M参数和13.66M FLOPs(Floating Point Operations,浮点运算次数)的极轻量设计,实现了99.75%和99.90%的诊断准确率,并在强噪声环境下展现出优异的鲁棒性,为工业边缘设备实时部署提供了可行方案。
为了感谢大家长期以来的支持,作者特地公开了代码,希望对大家学习有所帮助,同时文章质量很高,希望大家多多引用,支持为爱发电大佬们。
论文题目: Phoneme-inspired acoustic frame embedded lightweight transformer for rolling bearing fault diagnosis
论文期刊:Mechanical Systems and Signal Processing
Doi:https://doi.org/10.1016/j.ymssp.2026.114030
a School of Electrical Engineering and Automation, Anhui University, Hefei 230601, China
b School of Mechanical and Intelligent Manufacturing, Chongqing University of Science & Technology, Chongqing 401331, China
c Department of Mechanical and Materials Engineering, The University of Western Ontario, London, Ontario, Canada
彭麟昊,安徽大学电气工程与自动化学院电气工程专业在读博士生,入选2025年中国科协青年科技人才培育工程博士生专项计划。以第一作者身份在MSSP、IEEE TIM等国际权威期刊发表SCI论文6篇。曾获研究生国家奖学金,省级三好学生,省级优秀硕士毕业论文,主持安徽省教育厅科学研究项目(自然科学类)博士生专项1项。邮箱:z24101006@stu.ahu.edu.cn。
刘方,安徽大学电气工程与自动化学院教授、博士生导师、机器人学院副院长,研究方向为机电系统动态监测与智能运维,主持国家自然科学基金项目3项、安徽省重点研发计划1项(省市联合资助600万元)、安徽省自然科学基金优秀青年项目、青年项目各1项(青年项目获评A类结题)。与科大讯飞、富煌科技等上市公司开展多项产学研合作研究。在国内外重要学术期刊发表SCI/EI收录论文60余篇,包含多篇ESI高被引论文,第一发明人授权发明专利19项。核心成果发表于MSSP、IEEE Transactions系列汇刊等国内外本领域权威期刊。邮箱:ufun@ahu.edu.cn。
吕中亮,重庆科技大学机械与智能制造学院教授,博士生导师,院长兼任重庆市高校重点实验室主任,致力于智能运维与大数据分析研究。主持国家/省部级重点及一般项目17项。发表论文37篇,其中被SCI/EI收录25篇,3篇论文入选中国知网《学术精要数据库》高影响力论文。申请专利25项,已授权21项。曾获重庆市科技进步一等奖、二等奖及中国产学研合作创新奖等荣誉。邮箱:2010024@cqust.edu.cn。
刘永斌,安徽大学电气工程与自动化学院教授、博士生导师,安徽省学术和技术带头人,智慧电网数字协同技术安徽省联合共建学科重点实验室主任。长期从事高端装备智能诊断与运维、智能材料驱动与传感、机器人及工业现场自动化等方向的研究。主持基础加强计划子项目1项,国家自然科学基金面上项目3项,安徽省科技攻坚创新计划、中国博士后科学基金特别资助项目、中国博士后科学基金面上资助项目、安徽省重点研发计划、安徽省自然科学基金,安徽安徽省教育厅自然科学基金重点项目及企业委托项目多项;在国内外知名期刊会议上发表了学术论文100余篇,其中SCI/EI检索期刊论文80余篇;获授权发明专利30余项。邮箱:ybliu@ahu.edu.cn。
夏敏,加拿大Western University机械与材料工程系副教授,机器智能实验室(MIN Lab)主任,研究领域涵盖机器学习、状态监测、先进制造过程监控与优化、工业数据挖掘及智慧清洁能源系统。在机电一体化和工业信息学领域的顶级期刊及会议上发表论文100余篇,自2020年起连续入选斯坦福大学发布的"全球前2%顶尖科学家"榜单(基于学术成果影响力)。主导过加拿大、英国和日本的19个科研项目,总经费达2000万加元(其中作为首席研究员获资370万加元)。邮箱:min.xia@uwo.ca。
1 引言
2 理论背景
2.1 声学信号的振幅与相位表征
2.2 基于Transformer的神经网络
3 所提方法
3.1 ASFE-Transformer架构
3.2 解析振幅-相位表征
3.3 声学帧嵌入模块
3.4 所提方法的整体诊断流程
4 研究结果
4.1 方法描述与参数设置对比
4.2 案例一:基于抛物面端盖声学镜的声学信号数据集
4.3 案例二:来自KAIST的轴承声学数据集
5 讨论
5.1 所提模块有效性分析
5.2 帧长度影响分析
5.3 可解释性分析
6 结论
7 结论代码可用性
滚动轴承作为旋转机械中的关键支撑部件,其运行状况直接影响工业设备的稳定性和安全性。随着自动化和智能制造的不断发展,机械系统的运行条件变得越来越复杂,轴承故障成为性能下降和意外停机的主要原因之一。因此,监测和诊断轴承健康状况对于确保机械系统长期可靠、高效运行具有重要意义和工程价值。
目前,滚动轴承运行状态的表征主要依赖于振动、电流、温度和声学等多种物理信号。其中,振动和声学信号是反映轴承系统动态特性最广泛使用的两种模态。振动信号对结构响应变化极为敏感,已成为传统监测中的主要诊断源。相比之下,声学信号能够进行非接触测量,部署灵活且成本低,并且可以在不干扰设备运行的情况下捕获结构振动和能量辐射特性。因此,分析运行信号的声学特性已成为一种有前景的故障识别方法。Chen等人开发了一种基于声学标识符的特征提取框架,该框架显著提高了机器人砂带系统的监测效率,而Jiang等人提出了一种自适应复合加权索引图,增强了基于声学特征的机械诊断的鲁棒性。数据驱动技术的最新进展,特别是深度学习,进一步提高了故障检测的能力。通过分析声学信号,这些技术可以直接处理原始数据并自动学习基本特征表示。其中,以卷积神经网络为代表的数据驱动方法在基于声学的故障诊断中取得了显著进展。例如,Ayantha等人首先进行声源分离以恢复与故障相关的声学成分,然后通过一维CNN(Convolutional Neural Network,卷积神经网络)实现机械故障诊断。Wang等人提出了一种混合注意力驱动的卷积对抗网络,该网络在强噪声条件下实现了鲁棒的诊断性能。Yin等人开发了一种多任务学习时间卷积网络,该网络结合声场信息,能够在低信噪比下实现准确的变速箱诊断。然而,当应用于声学故障诊断时,基于CNN的方法面临固有的局限性。卷积操作主要捕获局部幅度变化,但缺乏对声学信号中的长时时间依赖性和相位连续性进行建模的能力。
与卷积网络不同,Transformer利用自注意力在所有时间步动态建模依赖性,以实现全局感受野和更有效的时间表征。受益于这种能力,越来越多的研究将Transformer架构引入故障诊断。Ding等人提出了一种时频Transformer模型,能够有效地从振动信号中提取特征表示。Dong等人在Transformer架构中引入了多专家反馈层,并提高了机械故障诊断中决策的可靠性。尽管Transformer擅长捕获全局时间依赖性,但它们在对细粒度局部特征进行建模方面效果较差。为了解决这个问题,最近有研究将这两种架构集成到统一框架中,以实现更全面、高效的故障诊断。Kim等人提出了一种时频融合框架,该框架将卷积编码器与Transformer层集成,以从非平稳信号中提取分层表示。Yang等人开发了一种基于分层Transformer架构的全局特征感知机制,该机制有效地融合了局部和全局特征,并在有限的训练数据和复杂的运行条件下表现出卓越的诊断性能。尽管这些混合框架已显示出有前景的性能,但它们的高计算成本和内存需求限制了它们在实时、资源受限的工业环境中的适用性。一些研究人员已经认识到这些局限性,并提出了有效的改进方法,如轻量级架构设计和改进的注意力机制,以减轻计算负担同时保持诊断准确性。Fang等人引入了一种基于Transformer结构的改进卷积单元,该单元在保留特征提取能力的同时,大大减少了模型参数的数量。Yan等人提出了一种轻量级故障诊断框架,称为LiConvFormer,该框架在多个基准数据集上展示了效率和鲁棒性。Shao等人提出了一种LSFConvformer框架,该框架将轻量级Convformer建模与打乱的时频融合相结合,以提高特征提取效率和诊断鲁棒性。
虽然数据驱动方法在基准数据集上取得了令人印象深刻的准确性,但它们通常依赖大量参数冗余和计算资源来隐式学习特征表示。除了这种计算开销外,一个基本限制在于信号模态本身:现有的诊断框架主要是为振动信号设计的,而从麦克风获得的声学测量的性质在根本上是不同的。对于滚动轴承,麦克风捕获整个过程中产生的空气传播声音,在此过程中滚动元件接近缺陷、进入缺陷区域、与局部损伤相互作用,随后离开该区域。在这种相互作用期间,滚动、滑动和冲击行为以不同的比例、持续时间和能量分布发生,并且这些特征与故障类型和严重程度密切相关。这种复杂性意味着声学信号中具有诊断信息的成分是高度瞬态的且结构多样。这就引出了一个关键的研究问题:通过显式编码这些判别的声学进化模式,以显著最小化的模型复杂性来实现具有竞争力的诊断准确性是否可行?
通过类比,故障诱发声波的产生机制与人类语音产生具有显著相似性。图1表明,如果将局部缺陷区域视为声源通道,滚动体与缺陷相互作用时产生的每个短声脉冲可被视为类似于单个音节的发音。随着轴承持续旋转,这些连续的声脉冲形成一个连贯的声学序列,类似于一个口语句子。此外,每次相互作用中的滚动、滑动和冲击分量在概念上可与音素进行比较,音素是语音中最小的区别单元。受音素处理范式启发,即连续语音被离散为有意义的单元,这项工作提出了一种轻量级的声学段帧嵌入Transformer。所提出的方法基于三项核心架构创新。
图1. 轴承故障声波与人类语音产生之间的概念类比
(1) 在输入层,引入解析幅度-相位表示以构建具有物理意义的双通道表示,并实现幅度和相位的联合建模
(2) 开发了一个声学帧嵌入模块,将连续的声学波形转换为紧凑的帧级令牌。这种令牌化策略保留了滚动、滑动和冲击相互作用产生的短时时间结构,类似于捕捉语音中的音素细节。通过将长波形转换为简洁的信息令牌序列,AFEM(Acoustic Frame Embedding Module,声学帧嵌入模块)在保留关键瞬态故障信息的同时,明确缩短了序列长度并大幅降低了计算复杂度。
(3) 通过一种新颖的Swish深度门控线性单元对Transformer的前馈网络进行重新设计。引入门控机制以选择性地控制信息流,并允许模型专注于信息丰富的故障特征,同时抑制无关噪声。这种设计加强了全局时间依赖性建模,同时通过高效的局部特征大幅降低了计算复杂度。
本文的其余部分组织如下。第2节介绍了通过希尔伯特变换表征声学幅度和相位的理论基础,以及标准Transformer。第3节详细阐述了所提出的ASFE-Transformer、AAPR(Analytic Amplitude-Phase Representation,解析幅度-相位表示)、AFEM和改进的Transformer编码器。第4节展示了在两个基准数据集上的广泛实验结果,以验证所提方法的优越性。第5节讨论了模型的内部机制,包括模块有效性、帧长度影响和特征可解释性。最后,第6节总结了研究并展望了未来的挑战。
在本节中,首先介绍解析信号构建的原理,并解释这种方法如何表征声学信号的瞬时幅度和相位以揭示完整的瞬态故障特征。随后,回顾标准Transformer的基本架构,为本文引入的具体改进提供结构基础。
在轴承运行期间,麦克风捕获的声学信号是潜在声场的实值投影。尽管这种实际测量反映了瞬时压力波动,但它本质上掩盖了与机械组件内能量传输延迟、结构共振和模态散射紧密相关的伴随相位变化。最近的研究表明,这种与相位相关的信息在表征瞬态传播行为以及声发射和旋转机械声学中的共振引起的失真方面起着关键作用。 为解决这一限制,从实信号重建潜在的正交分量,如图2(b)所示,以形成解析信号表示。这种解析表示提供了对瞬时幅度和相位的直接访问,能够更完整地描绘信号的时变动态,并提高故障诱发声学响应的描述保真度。
其中, 表示希尔伯特算子, 表示柯西主值,x(t)是实际声压信号, 是其相位偏移90°的正交分量。在频域中,
其中, 是傅里叶变换,x(f)是x(t)的频谱,f是频率(Hz),sgn(f)是符号函数。
公式(2)表明 x(t) 的正频率和负频率分量经历相反的相位旋转,抑制冗余频谱对称性,并产生片面解析表示:
其中z(t)为复解析信号, 表示与局部声能成比例的瞬时幅度包络, 表示跟踪共振和阻尼时间演化的瞬时相位。为了进一步表征振荡分量的动态变化,即瞬时相位的时间导数。
可得到瞬时角频率,并反映由不同机械起源的缺陷引起的局部调制或共振频率偏移。例如,滚动型缺陷通常会在A(t)中引入周期性幅度调制,摩擦磨损会在 中产生连续的宽带相位波动,而碰撞故障会在A(t)和 中产生尖锐的相位跳变并伴有瞬态峰值。
图2. 解析信号构造及复表示生成的机制
图2(a)展示了复平面中方程(3)的几何解释。解析向量z(t)随时间旋转并形成一条螺旋轨迹,其在实轴和虚轴上的投影分别对应于x(t)和 。这种演化共同表征了声传播过程中的幅度衰减和相位延迟,并提供了更完整的瞬时信号动态表示。
Transformer通过自注意力机制建立全局交互,并能够在整个序列上进行动态上下文聚合。其计算过程可总结如下,整体架构如图3所示。
给定一个输入特征序列
其中N表示序列长度(时间位置数量),D是特征维度,并且向每个token添加位置编码 以保留时间上的顺序信息。组合表示写为
Transformer编码器由M个相同的层组成,每个层包含一个多头自注意力块和一个逐位置前馈网络,通过残差捷径和层归一化连接。对于第m层,计算可表示为
其中 表示层归一化,以及m=1,2,...,M。
MHSA(Multi-Head Self-Attention,多头自注意力)模块通过 的查询、键和值投影计算所有时间位置之间的成对相关性,并允许模型根据特征相似性自适应地处理相关时间步。然后FFN(Feed-Forward Network,前馈网络)对每个位置独立应用两次带有非线性激活的线性变换,并在特征空间中扩展模型的表示能力。通过堆叠的编码器层,Transformer逐步整合局部变化和长程时间依赖性,并形成分层表示 。
图3 基于Transformer的神经网络架构
在本节中,将系统地阐述所提出的轻量级帧嵌入声学Transformer的架构。基于此架构,构建了一个用于基于声学的滚动轴承故障诊断的端到端ASFE-Transformer框架。该框架由三个核心模块组成: AAPR、AFEM和改进的Transformer编码器。以下小节将对每个组件进行详细描述。
所提出的ASFE-Transformer构成了一个专门为高效声学故障诊断设计的端到端框架。图4表明,在输入阶段,使用AAPR将真实声学信号转换为双通道解析表示,该表示产生捕获瞬时幅度和相位的同相和正交分量。
然后,AFEM将连续波形划分为重叠的短时帧,并将每个帧线性投影到一个紧凑的嵌入向量中。得到的帧令牌与一个可学习的类别令牌和位置编码一起,形成一个序列表示。 这些帧令牌随后由改进的Transformer编码器进行处理,该编码器将低维MHSA与轻量级SD-GLU(Swish-Depthwise Gated Linear Unit,Swish深度门控线性单元)集成在一起。MHSA模块通过在整个声学序列中建立全局相关性来捕获帧之间的长程依赖性,而SD-GLU通过通道级门控和令牌轴深度卷积增强局部时间连续性。在整个编码器中应用层归一化和残差连接以稳定训练并确保高效的特征传播。
最后,编码器输出的全局类别令牌聚合来自所有帧令牌的判别信息,并被馈送到线性分类器中以产生最终的故障类别。
以下各节将对所提出框架中的每个组件进行深入说明。
图4 ASFE-Transformer架构
实值信号X(t)通过AAPR转换为其解析对应物。该转换产生一个正交分量 ,它相对于X(t)相位偏移90°,并形成一个复值表示。
因此,声学信号可以表示为
其中 和 分别表示实部和虚部。
这种解析公式提供了幅度和相位演变的统一描述,并作为后续深度表示学习的输入基础。
在3.2节中获得的解析声学信号 通过AFEM转换为逐帧序列表示。这一步将波形重新构造为与Transformer的建模要求相匹配的短时声学单元,其详细架构如图5所示。
图5 声学框架嵌入模块的框架
考虑到轴承声学信号在短时间间隔内保持准平稳,应用长度为L, 且步长为R的滑动窗口将信号分割为重叠帧。
对于第i帧,分割后的数据表示为
其中 是起始索引,N=[(T-L)/R]+1表示总帧数。这种分割保留了与瞬态声学事件相关的局部幅度-相位结构。
每个帧被展平并映射为一个D维嵌入,如下所示
其中vec( )将2×L帧展开为一个2L维向量, 是可学习的投影参数。此操作将每个短时幅度和相位模式转换为具有统一特征维度的紧凑令牌。
为了聚合用于故障分类的全局信息,在帧嵌入序列之前添加一个可学习的类别令牌 。得到的令牌序列表示为:
其中, 用作占位符,用于在通过Transformer层后捕获整个信号的全局语义表示。
为了编码时间顺序,将位置编码 添加到令牌序列中。如图所示,特定的位置向量 按元素添加到其相应的令牌中:
其中P保留了每个帧的相对位置,并使Transformer能够对周期性冲击行为和传播引起的时间延迟进行建模。得到的H,从类别令牌嵌入 开始,用作后续编码器层的输入。
通过将连续波形转换为紧凑的帧序列,AFEM有效地将序列长度从T减少到N=T/(L-R)。由于自注意力操作的计算复杂度与输入长度成二次方关系,即 ,N的减少导致理论复杂度与直接处理原始波形相比降低了约 。因此,AFEM不仅保留了短时声学特征,还显著提高了计算效率。
按照3.3节中描述的声学帧嵌入,序列表示 由一个改进的Transformer编码器处理,该编码器旨在对跨帧令牌的全局和局部依赖性进行建模。此编码器保留了标准Transformer的自注意力架构,同时引入了结构改进以更好地适应准平稳声学特征。图6说明了整个过程。每个编码器层接收输入 并产生输出 。该层由两个子模块组成:MHSA和前馈子网络,它们与残差连接和层归一化操作交错。
MHSA机制通过计算所有令牌对之间的注意力权重来捕获帧令牌之间的全局相关性。与传统Transformer将嵌入维度D均匀分配给头不同,所提出的结构对查询、键和值映射采用固定的低维投影:
其中 ,h是头的数量。每个头在维度为 和 的紧凑子空间上操作,这大大降低了注意力操作的二次复杂度。
注意力分布的计算方式如下
然后将上下文表示进行聚合,如下所示
其中 将拼接后的头部输出投影回模型维度。
此操作产生一个全局注意力表示,对声学帧之间的长程依赖关系进行编码。
为了增强局部建模能力,前馈子网络被重新设计为SD-GLU,如图6下部所示。受注意力机制中的门控机制启发,SD-GLU引入了非线性调制和令牌级卷积上下文。该过程定义如下
其中 是一个扩展投影,F是隐藏维度。激活采用SwiGLU公式,
其中 表示Sigmoid线性单元函数,并确保平滑但响应灵敏的门控行为。 与传统的逐点前馈网络不同,所提出的SD-GLU在令牌维度上纳入了一维深度卷积:
其中每个通道独立地与大小为k=5的内核进行卷积。从物理意义上讲,这个内核大小被设计为与故障脉冲的时间尺度对齐。鉴于每个帧令牌代表一个亚毫秒级的音素单元(0.3-0.8毫秒),5的内核大小将局部感受野扩展到大约1.5-4.0毫秒。这个持续时间有效地覆盖了故障诱发共振事件的特征演变(通常由起始、峰值和衰减阶段组成)。因此,深度卷积使模型能够捕捉相邻帧形成的声学音节的形态连续性,弥合离散令牌和连续故障瞬变之间的差距。然后将局部增强后的输出投影回嵌入空间:
其中 , 表示来自前一个归一化的残差输入。这个深度卷积引入了一种声学感知归纳偏差,补充了MHSA的全局感受野,并使模型能够有效地捕捉轴承声学信号中固有的瞬态脉冲特征和周期性调制。
在堆叠 个这样的编码器层之后,最终的类别令牌聚合来自所有帧令牌的判别信息,并被输入到线性分类器进行故障识别。
图6 Transformer编码器的详细架构
基于ASFE-Transformer,本文提出了一种用于滚动轴承声学诊断的轻量级框架。图7显示整个过程包括三个主要阶段。首先,从轴承试验台采集声学信号,并通过滑动窗口进行分割,以构建训练集、验证集和测试集。其次,通过AAPR获得解析后的声学信号,由声学帧嵌入模块转换为段帧序列表示,然后输入到轻量级改进的Transformer编码器进行有监督的故障分类。第三,将训练好的模型应用于测试样本,并从多个角度进行综合评估。
图7 所提出方法的整体诊断过程
本节首先阐述了各案例研究的实验平台、数据采集及实现细节,随后通过多维度性能分析,将 ASFE -Transformer与当前最先进的模型在诊断性能、计算效率以及不同噪声条件下的鲁棒性方面进行了对比评估。
为全面评估所提出方法的有效性和优越性,我们在两个基准数据集上进行了大量实验:一个采用抛物面声学镜自开发的轴承声学数据集,以及KAIST(Korea Advanced Institute of Science and Technology,韩国科学技术院)提供的轴承声学数据集。所有实验均在统一的计算环境中完成,所用软件包括PyTorch 2.1、 NVIDIA RTX 3060(12 GB内存)、Intel i5-12600KF处理器及32 GB内存。
为了进行公平比较,所有模型在两个数据集上都使用相同的训练设置从头开始训练。初始学习率固定为0.001,并在整个训练过程中使用余弦退火调度器进行动态调整。模型参数使用Adam优化器进行优化。采用32的批量大小,每个模型训练50个轮次。为确保统计可靠性,所有实验独立重复进行五次,并报告平均性能。为便于重现性并清晰概述模型配置,表1总结了所提ASFE-Transformer的核心参数和实现细节。
表1 所提出的ASFE-Transformer的核心参数和实现细节总结
所提出的框架与一组全面的基线模型进行了比较,这些模型包括具有代表性的经典架构和近期的先进Transformer变体。这些被比较的模型涵盖了广泛的设计理念,从专注于局部特征提取的卷积增强网络到强调全局依赖性建模的先进注意力驱动架构,并建立了一个全面、平衡的评估基准。被比较的方法总结如下。
(1) MA1DCNN:一个由堆叠的一维卷积和池化层组成的经典轻量级基线,它专注于通过固定的感受野和静态权重滤波来提取局部判别特征。
(2) Transformer:最初为序列数据建模而开发的基于标准注意力的编码器,能够通过自注意力机制捕捉长程时间依赖性,而无需依赖卷积层或循环层。
(3) ViT:一种用于声学分析的视觉Transformer架构的改编版本,将帧级声学片段视为视觉令牌,并通过逐块注意力操作捕捉全局上下文信息。
(4) MCSwinT:一种多尺度Swin Transformer变体,通过移位窗口分区对局部和全局依赖性进行分层建模,并增强多分辨率特征表示。
(5) CLFormer:一种对比轻量级Transformer,将紧凑的自注意力块与对比学习目标相结合,以提高在噪声数据条件下的特征可辨别性。
(6) ConvFormer-NSE:一种卷积增强Transformer,结合了邻域自增强机制,以加强局部感受野交互,同时保持全局上下文感知。
(7) LiConvFormer:一种轻量级卷积Transformer,在Transformer主干中嵌入共享的多尺度卷积模块,并在计算效率和诊断准确性之间实现了有效的权衡。
我们开发了一个基于声镜的轴承诊断平台来验证所提出的方法。图8显示实验装置由一台三相异步电动机、一台西门子变频器、一个声学故障轴承基座速度显示器和一个数据采集单元组成。测试轴承是一个LYCN/NU407圆柱滚子轴承,其详细结构参数总结在表2中。
图8 实验平台及其示意图
图9 不同类型故障的测试轴承
表2 LYC N/NU407ECM的轴承参数

图10 案例一中不同轴承状态下解析声学信号和相平面轨迹的可视化
模拟典型的轴承退化状况,通过精密加工在内圈、滚动体和外圈中引入了三种局部故障,即磨损、点蚀和裂纹。图9表明,实验设计包括九种故障组合和一种正常状况,从而产生10种轴承状态。在测试过程中,主轴转速在900 r/min下保持恒定,径向载荷为5kN。以20Hz的采样率采集声学信号,每种轴承状态的记录持续时间为30秒。为确保数据一致性和严格评估,在模型输入之前实施了标准化的预处理流程。首先,通过Z分数归一化对原始声学信号进行标准化,以消除幅度缩放差异。其次,使用长度为1024个点、步长为512个点(50%重叠)的滑动窗口将归一化后的连续信号切片为离散的模型输入样本。最后,为防止时间依赖性偏差,在将生成的样本划分为训练集、验证集和测试集之前,对其进行随机打乱,每个类别分别包含300、100和200个样本,详见表3。为直观展示处理后数据的特征,图10可视化了经过预处理层后的10种轴承状态的双通道声学信号及其相应的相平面轨迹。
表3 案例一中10种轴承数据的详细信息
图11表明,在声学故障诊断任务的训练过程中,所有模型都呈现出明显的收敛趋势。值得注意的是,MA1DCNN基线表现出快速收敛和稳定的优化。大多数Transformer变体在20个epoch内实现了稳定优化,而标准Transformer收敛缓慢且残差损失较高,这表明其对声学特征的表示能力有限。CLFormer在训练和验证阶段也表现出不稳定的波动,泛化能力较弱。相比之下,其他模型,特别是改进的Transformer变体,收敛平稳,验证损失持续较低且准确率高,对声学数据表现出更好的适应性。
为了进一步量化诊断性能和计算效率,评估结果列于表4和图12中。标准的1D - CNN基线在诊断性能方面表现出色,准确率达到99.60%,证实了卷积架构在特征提取方面的有效性。所有基于Transformer的模型在声学故障诊断任务中表现都很强劲,而提出的ASFE-Transformer总体准确率最高,达到99.75%,比基线Transformer高出5.4%。值得注意的是,ASFE-Transformer保持了轻量级设计,具有0.09M参数和13.66M FLOPs,展现出高计算效率。相比之下,ViT和MCSwinT达到了相当的准确率(分别为98.50%和99.55%),但需要更高的计算成本。模型复杂度和训练时间并没有严格的正相关关系。需要承认的是,上述计算指标主要关注神经网络推理。理论上,预处理阶段(希尔伯特变换和帧分割)会带来额外开销。然而,帧分割实际上是零成本的内存索引操作,对于1024的输入长度,希尔伯特变换仅增加约0.10 MFLOPs。与模型的推理成本相比,这种开销可以忽略不计(<1%),且比标准深度网络低几个数量级。此外,由于预处理不涉及可学习参数,存储优势(0.09M)不受影响。至关重要的是,这种参数减少代表了硬件部署的决定性阈值,而不仅仅是数值上的减少。资源受限的边缘设备(如Cortex-M系列微控制器)通常片上内存有限(通常<512 KB)。一个具有0.32M参数(在Float32中占用~1.28MD)的标准“轻量级”基线将超过此容量,需要进行耗能的片外内存访问。相比之下,ASFE - Transformer(约360 KB)完全适合片上SRAM(Static Random-Access Memory,静态随机存取存储器),实现“零拷贝”推理,消除内存访问瓶颈,确保工业物联网节点的实时响应能力。图13展示了八个基于Transformer的模型的混淆矩阵。标准Transformer在几个类别中表现出明显的误分类,而ViT和CLFormer有所改进但仍存在不完美的区分。相比之下,MA1DCNN、LiConvFormer、Convformer-NSE和提出的ASFE-Transformer显示出几乎对角线的矩阵,非对角线误差最小,在声学诊断中表现出高度可靠、一致的故障识别。
图11 案例一中不同方法的准确率和损失曲线:(a) 训练损失,(b) 训练准确率,(c) 验证损失,(d) 验证准确率
表4 案例一中不同方法的诊断性能和模型复杂度
为评估不同方法在各类故障分类中的性能表现,图13展示了八种基于Transformer模型的混淆矩阵。标准Transformer在多个类别中存在明显的误分类现象,而ViT和CLFormer虽有所改进,但区分能力仍不完善。相比之下,MA1DCNN、LiConvFormer、Convformer-NSE及本文提出的 ASFE -Transformer均呈现出近乎对角线的混淆矩阵,离对角线误差极小,且在声学诊断中展现出高度可靠且一致的故障识别能力。
图12 基于5次重复试验的案例一中不同方法诊断性能比较的可视化
图13 案例一中不同方法的混淆矩阵:(a) MA1DCNN,(b) Transformer,(c) ViT,(d) CLFomer,(e) MCSwinT,(f) Convfomer-NSE,(g) LiConvFormer,以及(h) ASFE-Transformer
为系统评估不同干扰水平下模型的鲁棒性,向原始样本中注入加性高斯白噪声。注入噪声的强度由SNR(Signal-to-Noise Ratio,信噪比)控制,定义为:
其中 和 分别表示原始信号的功率和添加噪声的功率。
实验涵盖了从5dB到-5dB的信噪比水平范围。为消除特定噪声实现的随机性并确保统计可靠性,在每个信噪比水平下使用不同的随机种子重复评估5次,并将平均准确率作为最终结果报告。表5和图14展示了不同模型在不同噪声水平下的诊断鲁棒性。MA1DCNN基线在干净数据上表现良好,证实了一维卷积神经网络在理想条件下的有效性。然而,在信噪比=-5dB时其准确率降至94.10%,表明静态卷积特征对强干扰有些敏感。相比之下,ASFE-Transformer表现出卓越的稳定性,实现了98.33%的最高平均准确率,在信噪比=-5dB时仍保持96.85%。这表明与固定的局部卷积相比,内容自适应注意力机制对声学噪声具有更强的抵御能力。同时,标准Transformer在信噪比=-5dB时大幅降至79.48%,而ViT和CLFormer等其他变体对噪声干扰也表现出不同程度的敏感性。
表5 不同方法在各种信噪比条件下的诊断准确率
图14 各种方法在不同信噪比条件下的性能变化曲线
基于稳健性分析,进一步评估了诊断性能与模型复杂度之间的关系。图15显示,所提出的ASFE-Transformer在保持0.09M参数的紧凑架构和13.66 M FLOP的同时,实现了最高的平均准确率(98.33%)。LiConvFormer获得了相当的准确率(98.13%),但复杂度略高。虽然MA1DCNN基线产生了具有竞争力的平均准确率97.29%,但它需要2.63 M参数。相比之下,MCSwinT需要大量的计算,但没有成比例的收益,而标准Transformer的准确率和效率较低。
图15 平均准确率与模型复杂度之间的关系:(a) FLOPs与平均准确率;(b) 参数与平均准确率
为了进一步评估在严重噪声条件下的特征可分性,图16显示了在SNR =-5dB时不同模型的T-SNE可视化。标准Transformer和CLFormer表现出相当大的类别重叠,表明在噪声环境中的判别能力有限。ViT和MA1DCN 有适度的改进,但相邻类别之间仍存在边界模糊问题。相比之下,LiConvFormer,特别是所提出的ASFE-Transformer显示出紧凑、分离良好的聚类,并在声学故障诊断中展示了其强大的噪声鲁棒性和卓越的特征表示。
图16 案例一中不同方法在SNR下的T-SNE可视化:(a) MA1DCNN (b) Transformer, (c) ViT, (d) CLFomer, (e) MCSwinT, (f) Convfomer-NSE, (g) LiConvFormer, 和 (h) ASFE-Transformer
由KAIST开发的轴承故障测试台由三相感应电动机、齿轮箱、两个轴承壳体、扭矩计以及用于负载控制的滞后制动器组成,其详细布局如图17所示。该系统在0、2和4 Nm三种不同负载条件下,以3010转/分钟的额定速度运行。利用放置在轴承壳体A附近的PCB378B02麦克风,以51.2 KHz的采样频率收集声学信号。该数据集包括四种轴承健康状态,即正常、内圈故障、外圈故障和滚动体故障。通过精密加工,人工引入了不同严重程度的故障,其中内外圈缺陷的裂纹尺寸分别为0.3和1.0毫米,如图18所示。每次声学记录持续60秒,以确保足够的时间分辨率,从而实现可靠的信号分析。仅利用来自KAIST轴承数据集的声学信号进行模型验证,而未考虑其他传感器模式。声学数据根据与案例一相同的程序进行预处理,确保信号分段、归一化和样本划分的一致性。表6总结了所使用声学数据的详细信息。类似地,图19展示了预处理的双通道信号和相位轨迹的可视化。
图17 旋转机械试验台及其组件的布局
图18 按裂纹尺寸的轴承:(a)内圈0.3毫米,(b)内圈1.0毫米,(c) 外圈0.3mm,和(d) 外圈1.0mm
表6 案例二中五种类型轴承数据的详细信息
图19 案例二中不同轴承状态下分析声学信号和相平面轨迹的可视化
图20 案例二中不同方法的精度和损失曲线:(a)训练损失,(b)训练精度,(c)验证损失,以及(d)验证精度
图22展示了案例二不同基于Transformer模型的混淆矩阵。结果表明,所有模型都能有效区分主要的轴承故障类别,但其分类可靠性有所不同。标准Transformer和CLFormer表现出明显的误分类,特别是在内圈和外圈故障之间,并且特征辨别能力有限。ViT和MCSwinT改善了类别分离,但在相似故障类型中仍表现出轻微混淆。相比之下,MA1DCNN、LiConvFormer和所提出的ASFE-Transformer产生了几乎完美的对角矩阵。
表7 案例二中不同方法的诊断性能和模型复杂度
图21 基于5次重复试验的案例二中不同方法诊断性能比较的可视化图
表8和图23展示了不同基于Transformer的模型在各种信噪比(SNR)下的诊断准确率。随着SNR降低,所有模型的性能都有不同程度的下降。所提出的ASFE-Transformer保持了最高的整体稳定性,平均准确率达到95.11%,在SNR=-5dB时仅有轻微下降。LiConvFormer也表现出很强的鲁棒性,平均超过94%。相比之下,标准Transformer和CLFormer在低SNR条件下准确率大幅下降,在SNR 时分别降至71.75%和65.00%。
图22 案例二中不同方法的混淆矩阵:(a)MA1DCNN,(b)Transformer,(c)ViT,(d)CLFomer,(e)MCSwinT,(f)Convfomer-NSE,(g)LiConvFormer,以及(h)ASFE-Transformer
图23 各种方法在不同SNR条件下的性能变化曲线
表8 不同方法在各种SNR条件下的诊断准确率
同样,图24展示了案例二中模型复杂度与诊断性能之间的关系。所提出的ASFE-Transformer在仅具有 0.09 M参数和13.66 M FLOP的情况下,在准确率(95.11%)和效率之间实现了最佳平衡。LiConvFormer在中等复杂度下也表现良好,而MCSwinT和ViT则产生了高计算成本且没有显著收益。标准Transformer和CLFormer显示出低准确率和效率。
图24 平均准确率与模型复杂度之间的关系:(a)FLOP与平均准确率,以及(b)参数与平均准确率
为了评估在严重噪声条件下的特征分布,不同基于Transformer的模型的T-SNE可视化结果如图25所示。所有模型在故障类别之间都表现出一定程度的重叠,但分布紧凑性有所不同。标准Transformer和CLFormer显示出较大的类间混合,表明特征辨别能力较弱。ViT和MCSwinT实现了更清晰的边界,但仍存在部分重叠。相比之下,MA1DCNN、LiConvFormer和所提出的ASFE-Transformer显示出更紧凑且可区分的聚类。
图25 案例二中不同方法在SNR下的T-SNE可视化:(a)MA1DCNN,(b)Transformer,(c)ViT,(d)CLFomer,(e)MCSwinT,(f)Convfomer-NSE,(g)LiConvFormer,以及(h)ASFE-Transformer
进一步分析所提出的ASFE-Transformer的配置属性,在本节中,详细研究分为三个部分:首先,进行消融研究以验证每个核心模块的有效性。其次,分析帧长度对模型性能和效率的影响。最后,对学习到的特征的可解释性进行可视化,以验证所提出的方法如何进一步促进瞬态故障线索的局部归因。
表9 不同模块对诊断性能和复杂度影响的结果
图26 不同模块对诊断性能影响的柱状图
表9和图26表明,去除AAPR(方法1)使准确率从99.75%降至97.95%,而消除AFEM(方法2)则使其降至98.85% 。准确率分别下降1.8%和0.91%,证实了双通道声学表示和帧级时间嵌入在提高故障可分离性方面的关键作用。至关重要的是,这两个模块之间的相互作用是协同作用而非冗余作用。AAPR充当“特征增强器”,明确解耦复杂的调制信息,确保输入特征包含丰富的物理归纳偏差(例如,瞬时动态)。与此互补的是,AFEM充当“结构组织者”,将这些动态特征稳定为准平稳的帧令牌。这种组合建立了一种相互增强的“双流”表示:AAPR确保令牌包含有区分性的物理内容,而AFEM为有效的注意力建模提供必要的结构连贯性。
在FFN变体中,所提出的SD-GLU实现了最高的诊断准确率(99.75%),比标准的SwiGLU(方法5)高出2.15%,同时保持了几乎相同的计算成本。这一结果表明,纳入轻量级深度卷积有效地增强了局部令牌交互和特征辨别能力,而不会大幅增加模型复杂性。
表10 不同帧长度对诊断性能和复杂性的影响
为研究时间粒度对模型表示和计算效率的影响,在AFEM中通过改变帧长度L进行了分析。在重叠率固定为0.5的情况下,增加L会减少总帧数P=2T/L-1并降低注意力成本 ,但会增大嵌入和FFN计算量。表10显示,当L=16时,所提出的模型实现了99.75%的最高诊断准确率,具有中等复杂度参数(13.66M FLOPs)和高吞吐量(1594.31样本/秒)。从物理角度来看,最佳帧长度(L=16)对应于大约0.31-0.80ms的持续时间,这取决于采样率。鉴于故障引起的结构共振通常表现出多毫秒的衰减,这种亚毫秒级粒度有效地起到了组成音素的作用,在单个脉冲内捕获瞬时上升沿和相位调制。这种精确的分辨率减轻了较长帧(例如L=48,≈2.4ms)中固有的时间模糊性,而较长帧有将高频判别细节平均化的风险。
定量比较证实了这种物理特性。极短的帧(例如L=6)限制了时间上下文,削弱了特征辨别能力并将准确率降低到97.20%。相反,延长帧长度(L≥40)会增加模型复杂度(0.33-0.44M参数)和计算成本(17.18-18.51M FLOPs),但不会提高准确率;实际上由于信息冗余和有效帧交互减少,准确率下降到了98.65%。值得注意的是,随着L增加,吞吐量从1549提高到了1760样本/秒,这表明推理延迟与理论计算复杂度并非严格正相关。
为了更好地理解所提出模型的行为,应用Grad-CAM++来可视化所提出的ASFE-Transformer在真实(AC)和虚拟(PC)声学通道上对10种故障类别的时间注意力。在图27中,突出显示的区域对应于具有高诊断重要性的时间段。通过将波形分割成短时声学帧,该模型使Grad-CAM++能够在特定帧内精确地定位瞬态故障脉冲并增强时间可解释性。该模型始终专注于包含故障引起的脉冲的瞬态、高能区域,同时抑制以噪声为主的段。两个通道都表现出互补的激活模式,并证实基于希尔伯特的双通道表示使网络能够更有效地捕获幅度和相位信息。这些结果表明,所提出的模型不仅实现了准确的故障识别,还提供了清晰的时间可解释性。
图27 使用Grad - CAM++对10个随机样本的可视化:(a) NOR,(b)INC,(c)INP,(d)INW,(e)BAC,(f)BAP,(g)BAW,(h)ORC,(i)ORP,和(j)ORW
为了解决表征声学信号的短时非平稳性与保持计算效率之间的矛盾,本研究受音素处理范式启发,提出了一种轻量化 ASFE-Transformer。具体而言,该模型通过 AAPR 表征声学信号的瞬时演化过程,并显式分离其中的复杂调制成分,从而提升对非平稳声学特征的刻画能力。在此基础上,AFEM 将连续波形离散为准平稳的帧级标记,在保持瞬态故障线索结构完整性的同时,有效稳定特征学习过程。此外,所提出的 SD-GLU 弥补了标准 Transformer 局部归纳偏置不足的问题,使编码器能够兼顾全局依赖建模与局部形态细化。综合验证结果表明,该设计使模型优于现有先进基线方法,并在仅 0.09 M 参数量的超轻量化规模下分别取得 99.75% 和 99.90% 的诊断准确率,因而高度适用于资源受限边缘设备上的实时部署,可解释性进一步证实了模型能够精准关注由故障诱发的判别性声学冲击片段。
未来的研究将通过开发自适应帧分割策略,将该框架扩展到变速工况,该策略能使嵌入粒度与瞬时旋转运动学动态同步,从而减轻时间扭曲效应,并在非平稳条件下保持特征不变性。此外,虽然本研究中使用的AWGN(Additive White Gaussian Noise,加性高斯白噪声)是一个标准基准,但需要认识到,实际工业声学环境通常具有非平稳、“有色”噪声和谐波干扰的特征。因此,后续研究的一个关键方向是使用现场工业数据验证模型的鲁棒性。这一阶段将专注于通过实证验证“音素启发式”架构在复杂运行环境中区分故障瞬态的形态特征与结构化背景干扰方面的理论优势。
为了促进重现性和进一步的研究,我们提供了提出的ASFE-Transformer的完整实施代码:https://github.com/ Lab-of-AMFD/ASFE-Transformer。
校核:李正平、陈凯歌、曹希铭、赵学功、白亮、任超、海洋、陈宇航、Kira、Tina、王金、赵诚、肖鑫鑫、张优
该文资料搜集自网络,仅用作学术分享,不做商业用途,若侵权,后台联系小编进行删除