论文题目:Beyond CNN or Transformer Alone: A GADF-powered Dual-branch Network with KAN-Swin Transformer for Fault Diagnosis of Aerospace Bearing
论文期刊:IEEE Transactions on Automation Science and Engineering (T-ASE)
论文日期:2025
论文链接:10.1109/TASE.2025.3640120
作者:
Liubing Hu[a], Jinghong Tian[a], Zhilin Dong[a], Lingli Cui (Member, IEEE)[b], and Chengri Lang[a]
机构:
a:School of Engineering, Zhejiang Normal University, Jinhua 321004 China.
b:Key Laboratory of Advanced Manufacturing Technology, Beijing University of Technology, Beijing, 100124, China .
作者简介:
田景红,浙江师范大学副教授,硕士生导师,主要从事智能制造、工业互联网、供应链管理相关的教学与研究工作。熟悉数字化工厂相关运营管理理论、数字化智能化相关解决方案,有完整的信息化项目分析、设计、开发及实施经验。目前主持浙江省重点研发计划项目1项,完成横向项目十余项,发表论文二十余篇。
董治麟,现为浙江师范大学装备状态监测与智能维护技术研究所核心成员,硕士生导师,中共党员,中国计算机学会会员,中国振动工程学会会员,中国自动化学会制造自动化专业委员会会员,英国皇家物理学会会员,Robot Learning期刊青年编委,2025年中国振动工程学会动态信号分析学术会议大会主题报告人,永康市土丁五金制品股份有限公司科技副总,第四届“成泰共好”奖教金获得者,2025年留学基金委青年骨干教师出国研修项目获得者。学术研究方面,主持/参与项目共计12项,发表论文共计32篇,其中第一或者通讯作者发表26篇,ESI高被引论文4篇,总被引次数600余次;授权国际发明专利6项,国内发明专利5项,国内实用新型专利20余项,计算机软件著作权5项。积极投入科研活动,先后成为40余家期刊审稿人,被IOP出版社授予“IOP Trusted Reviewer Status”荣誉。研究方向:结构设计与运动仿真,机理建模与运动控制,信号分解与时频分析,健康特征指标构建,度量学习与深度学习,异常检测与系统辨识,状态监测与故障诊断,状态估计与寿命预测,可靠性设计与安全评估。
胡刘兵,浙江师范大学工学院机械工程在读研究生,研究方向为故障诊断和计算机视觉,聚焦深度学习在工业运维中的应用。
摘要
1 引言
2 基础理论
2.1 格拉姆角差场
2.2 CNN-Swin Transformer
2.3 全局注意力机制
3 所提方法
3.1 所开发的KAN-Swin Transformer模块
3.2 基于KAN-Swin Transformer的双分支网络
3.3 航空轴承故障诊断流程图
4 实验验证与对比分析
4.1 数据集描述
4.2 所提方法的实验结果
4.3 模型性能评估指标
4.4 消融实验
4.5 KAN模块超参数敏感性分析
4.6 双分支特征互补性的定量分析
4.7 与其他先进方法的对比分析
4.8 计算效率分析
4.9 噪声条件下的鲁棒性分析
4.10 不平衡数据集性能评估
4.11 跨域泛化分析
5 结论
针对航空轴承诊断中微弱故障特征淹没和极端工况变化的关键挑战,本研究提出了一种GADF驱动的KAN-Swin Transformer双分支网络用于航空轴承故障诊断。首先,通过格拉姆角差场(GADF)将一维振动信号编码为二维时频图像,利用极坐标映射保留时间依赖关系和频谱动态特性,同时解决了传统时频分析方法对噪声敏感的限制。随后,通过用B样条基函数替代传统多层感知机,开发了KAN-Swin Transformer模块,通过动态网格调整策略增强非线性映射能力,在降低参数复杂度的同时有效提升了对瞬态冲击和周期性模式的建模能力。此外,提出了一种双分支并行架构:KAN-Swin Transformer分支通过分层窗口注意力机制提取局部结构特征,而CNN-GAM分支通过多尺度卷积与通道-空间注意力融合增强全局纹理感知。最后,结合跨模态特征拼接与自适应池化实现全局-局部特征的协同优化,显著增强了复杂噪声环境下故障模式的可区分性。所开发的方法在两个不同的航空轴承数据集上进行了测试,分类精度达到了100%。同时,通过消融实验验证了包括KAN、Swin Transformer和CNN-GAM在内的模块集成的协同效应,显示出相比基线模型在跨转速工况识别率方面的提升,并确认了该框架对噪声和变载荷条件的鲁棒性。通过协同集成机制融合与注意力架构,所提出的框架为航空轴承智能健康监测提供了可靠解决方案,在轻量化边缘部署和跨域迁移学习方面具有潜在应用价值。
关键词:KAN,故障诊断,Swin Transformer,GAM,航空轴承
随着智能制造的不断发展,设备健康管理作为核心组成部分受到了广泛关注,特别是在航空航天领域。轴承作为传动系统的关键部件,在确保设备正常运行方面发挥着至关重要的作用。航空轴承在高速旋转和复杂载荷条件下运行,其故障不仅可能导致设备停机,还可能引发安全事故。因此,这些轴承的健康状况对机械的安全正常运行至关重要。然而,由于其内部结构的复杂性和外部干扰,航空轴承的健康状态诊断是一项巨大挑战。因此,提高复杂环境下故障诊断精度已成为紧迫的研究挑战,吸引了众多研究者关注此问题。
近年来,出现了各种传统故障诊断方法,主要依赖于时域、频域和时频域信号处理技术。然而,在实际工程应用中,这些方法的诊断效果往往受噪声干扰和工况变化的限制。为解决这些局限性,基于深度学习的方法逐渐成为研究热点。深度学习模型,如卷积神经网络(CNN)、生成对抗网络(GAN)和Transformer,在图像特征提取和故障模式识别方面展现出强大能力。例如,Zhang等人提出了基于深度卷积神经网络的故障诊断方法,显著提高了旋转机械故障的识别精度和抗噪性。Guo等人通过将迁移学习与深度CNN相结合实现了跨域故障诊断。Wang和Li利用GAN进行故障样本增强和特征提取,以解决小样本学习挑战。此外,Chen将改进的时频分析方法与CNN相结合,实现了滚动轴承故障的精细化诊断。Transformer和注意力机制也成为提高故障诊断精度的重要工具。Fu等人提出了具有分层窗口设计和窗口移位策略的Swin Transformer,展示了其在图像分类和故障诊断中的优异性能。Wu等人综述了深度学习在机械故障诊断中的应用,讨论了注意力机制在提取关键故障特征方面的优势。
此外,许多研究还将传统信号处理方法与深度学习模型相结合,如使用小波变换或经验模态分解进行预处理,然后将数据输入CNN或其他深度模型进行故障诊断。然而,它们往往面临单通道信号信息不足的问题。针对此问题,一些研究采用格拉姆角差场(GADF)或递归图等技术将时间序列数据转换为图像,然后通过CNN进行特征提取。此外,多传感器数据融合技术增强了复杂工况下的诊断鲁棒性。为克服传统局部特征提取模型的局限性,研究者引入全局注意力机制以全面捕获信号中的隐式全局信息。同时,为更有效地捕获信号中的潜在时空特征,研究者探索通过GADF等成像方法将一维振动信号转换为二维图像,结合视觉Transformer模型(如Swin Transformer)进行特征提取,实现对复杂故障模式的准确诊断。在航空应用中,该方法对提高轴承故障诊断精度具有重要意义。
除基于Transformer的模型外,还提出了一系列其他先进的数据驱动方法以应对日益复杂的工业诊断任务。例如,胶囊网络因其能够对特征的层次和空间关系进行建模而受到关注。为增强模型在不同工况下的泛化能力,研究者提出了深度对抗胶囊网络(DACN),引入对抗训练机制学习域不变特征,在跨域诊断任务中表现出色。此外,传感器感知胶囊网络(SACN)专注于融合多传感器数据进行剩余使用寿命(RUL)预测,通过胶囊dropout进行不确定性量化,实现对预测和不确定性的可解释归因,从而增强预后系统的鲁棒性和可信度。
另一方面,多尺度网络成为从复杂振动信号中提取更丰富故障信息的研究热点。例如,多尺度跨通道注意力网络利用不同尺寸的并行卷积核捕获各种频率和时间尺度的特征,结合注意力机制放大关键特征的权重,有效提高了微弱故障的识别能力。类似地,级联多感受野学习网络(DC-CMLN)等新架构引入了结构化方法,集成级联多感受野学习模块、多尺度特征聚合和自适应滤波,分层提取多级和多感受野特征。该设计使模型能够逐步细化特征表示,增强其在非平稳工况下辨别细微故障特征的能力。
为进一步推进该领域发展,研究者探索了专门架构以应对轴承故障诊断中固有的特定挑战。例如,Chen等人提出了一种抗噪模型,集成多尺度空间-通道重构卷积(ScConv)与混合注意力机制和四元数Transformer,通过在四元数域处理信号,展示了增强的特征提取和抗噪能力。同时,针对最优网络设计的挑战,另一项研究引入了层次灰狼优化器(HGWO)自动调整灵活残差神经网络的结构,利用并行注意力模块改进噪声和变载荷条件下的特征选择。类似地,为克服在不同工况或机器间迁移模型时遇到的显著域偏移问题,开发了三重域对抗神经网络。该方法利用三重分类器和自适应反向传播系数对齐源域和目标域的边缘分布和条件分布,从而提高模型的可迁移性和泛化能力。这些研究凸显了增强抗噪性、自动化架构设计和提高跨域适应性的关键趋势。
然而,尽管这些方法在一定程度上提高了故障诊断的精度和鲁棒性,但它们在航空轴承中的应用仍面临若干挑战。首先,许多现有模型在噪声干扰和变工况下缺乏有效的特征表示能力,导致故障特征不明显或难以区分,从而影响诊断精度。同时,虽然CNN和Transformer等方法已应用于该问题,但它们在复杂环境中的性能仍然有限。其次,现有局部特征提取模型在捕获信号内全局结构依赖关系方面不足,阻碍了对隐式信息的全面理解。
为克服这些局限性,本研究提出了一种GADF驱动的KAN-Swin Transformer双分支网络用于航空轴承故障诊断,以进一步提高多工况和高噪声环境下航空轴承中不明显的故障特征。该方法在以下方面具有独特优势:
a) KAN模块与Swin Transformer模块(KAN-Swin Transformer)相结合,增强模型捕获关键信息的能力,克服传统局部信息提取的不足;
b) 采用GADF方法将一维振动信号转换为二维图像,使KAN-Swin Transformer模型能够全面发挥其在多尺度特征提取方面的优势;
c) 将全局注意力机制纳入KAN-Swin Transformer框架,进一步提高模型在复杂工况下捕获全局特征的能力,从而增强诊断鲁棒性。
本文内容组织如下:第2节详细阐述GADF、CNN-Swin Transformer和GAM的理论基础;第3节介绍所提出的基于GADF驱动的KAN-Swin Transformer双分支网络故障诊断模型;第4节通过两个实验数据集上的诊断精度评估验证所提方法的有效性;第5节给出结论与展望。
本节主要介绍GADF、CNN-Swin Transformer和GAM的理论基础,分别为智能诊断提供时频图信息提取、局部信息特征分层提取和全局特征提取的基础支持。
2.1 格拉姆角差场
将一维振动信号转换为同时包含时间和频率信息的二维时频图像,能够更全面地表示信号特征,揭示频率成分随时间的动态变化。格拉姆角场(GAF)是一种有效实现一维信号转换为二维数据矩阵的算法,它集成坐标变换和格拉姆矩阵,便于一维数据向二维数据的转换。该技术允许提取反映时域和频域动态变化的特征,同时保留信号的时间依赖性,从而有效捕获一维数据中固有的特征信息。GAF包含两种变体:GADF(格拉姆角差场)和GASF(格拉姆角和场)。其中,GADF相比GASF展现出更优的分类性能。因此,本研究采用GADF方法进行图像编码转换。GADF的实现过程如下:
根据公式(1),将一维数据序列X中的值缩放到[-1,1]或[0,1]范围:

转换为极坐标时,归一化数据序列由公式(2)描述:
其中,
表示
在极坐标中映射的角度,
表示数据点的时间戳编码,N 是调节极坐标径向范围的常数因子,
是从时间戳![]()
映射的半径。
通过公式(3)中的角差公式,分析不同时间间隔的时间相关性,最终生成结果图像。该过程的可视化演示如图1所示。

振动信号本质上是一维时间序列数据。因此,直接使用视觉模型(如CNN或Transformer)提取时空特征存在挑战。为解决此问题,广泛采用信号成像方法(如GADF)将一维信号转换为二维图像,同时保留信号的动态时间特性和频率特征。生成的GADF矩阵构成编码原始信号时间相关性和动态频率变化的二维图像。与传统时频方法(如频谱图或小波变换)相比,GADF保留全局结构信息并降低对噪声的敏感性,使其更适合基于深度学习的特征提取。

图1 不同条件下轴承振动信号的GADF变换:(a)健康状态(周期性均匀性);(b)轻微内环故障(局部畸变);(c)严重内环故障(非线性模式);(d)外环故障(谐波集群)。
Swin Transformer是一种分层视觉Transformer,通过引入基于窗口移位的自注意力机制,在计算效率和全局特征建模能力之间取得平衡。与标准Transformer中的全局注意力计算不同,Swin Transformer将输入图像划分为不重叠的窗口(如4×4图像块),并在每个窗口内执行自注意力计算。为实现跨窗口信息交互,采用"窗口移位"策略在不同层次间交替使用常规窗口和移位窗口配置。
对于故障诊断任务,Swin Transformer与CNN(CNN-ST)相结合,同时利用局部归纳偏置和全局上下文建模能力。输入的GADF图像首先通过卷积层提取低级特征(如边缘和纹理),随后Swin Transformer模块通过多头自注意力和窗口移位操作逐步捕获分层特征。这种混合架构集成了CNN的空间敏感性和Transformer的长程依赖建模能力,增强了复杂故障模式下的判别特征学习。
Transformer架构最初为自然语言处理(NLP)中的序列建模而开发,在各类NLP基准测试中展现出突破性性能。基于此成功,Dosovitskiy等人率先将Transformer原理应用于计算机视觉,提出了视觉Transformer(ViT),通过将图像块作为序列token处理,在ImageNet分类上取得了竞争性性能。然而,全局自注意力机制固有的二次计算复杂性对高分辨率视觉数据的可扩展性构成挑战。为缓解这一计算约束同时保留全局建模能力,Liu等人提出了Swin Transformer,引入了两项主要技术创新。
首先,Swin Transformer融入了受卷积神经网络(CNN)启发的分层多尺度架构,建立了金字塔形特征表示结构。该设计用局部窗口注意力替代全局自注意力,自注意力操作被限制在不重叠的局部窗口(如7×7块)内。窗口策略可降低计算复杂度,实现对百万像素级图像的高效处理。其次,为促进跨窗口特征交互而不牺牲计算效率,架构在连续Transformer块之间实现了移位窗口分区方法。该机制通过连续的降采样阶段系统地扩展网络的有效感受野,逐步将局部特征集成到全局上下文中。
Swin Transformer是一种通用主干网络,其分层设计与CNN相似,包含四个阶段。图2展示了Swin Transformer网络的整体框架。如图2所示,输入图像首先通过块分区划分为不重叠的块,随后进行线性嵌入以调整通道数。除阶段1外,每个后续阶段采用块合并降低特征图分辨率,其中2×2相邻块在第一个块合并层中拼接。各阶段的输出分辨率分别为H/4×W/4、H/8×W/8、H/16×W/16和H/32×W/32,特征图分辨率与典型CNN相同。因此,该架构使现有方法中的主干网络能够被重新用于各种视觉任务。

图2 Swin transformer结构
为实现有效建模,最初的改进之一是将图像划分为不重叠窗口(基于窗口的多头自注意力,W-MSA),并在局部窗口内计算自注意力以实现线性计算复杂度。虽然该方法降低了计算复杂度,但缺乏不同窗口之间的连接。为解决此局限性,引入移位窗口分区(SW-MSA)。通过应用移位窗口分区策略,可以建立非重叠窗口之间的关系,并显著扩展感受野。Swin Transformer块的具体框图如图3所示。
通过使用图3所示的移位窗口划分方法,两个连续的Swin Transformer块的计算如公式(4):
其中,![]()
和
![]()
分别表示块中(S)W-MSA模块和MLP模块的特征输出。W-MSA和SW-MSA分别是常规层和滑动窗口多头自注意力层。在计算自注意力时,Swin Transformer为每个头引入相对位置偏置,如公式(5)所示。
其中,![]()
、
![]()
和
![]()
分别对应查询矩阵、键矩阵和值矩阵。参数
![]()
表示查询向量的维度,
![]()
表示可学习的相对位置偏置矩阵。
图3 Swin Transformer模块
卷积神经网络(CNN)以其局部连接和权重共享机制为特征,已成为计算机视觉的基础架构,在特征提取和分层表示学习方面表现出色。注意力机制与CNN的集成通过自适应特征重新校准进一步增强了其判别能力。虽然大量实证证据证实了注意力增强CNN在图像分类基准测试中的有效性,但现有实现仍存在关键局限性。
早期的通道注意力框架如SENet采用全局平均池化生成通道统计信息,但面临两个主要约束:
(1)由于空间压缩过于简化,对任务无关特征的抑制不足;
(2)计算开销随空间分辨率二次增长。后续改进如CBAM通过顺序的通道-空间压缩引入双注意力路径。
然而,这种串行处理造成信息瓶颈,根据理论分析损失了38%的跨维度相关性。并行架构如BAM试图通过独立注意力分支解决此问题,但忽视了通道和空间域之间的固有几何关系,导致参数效率次优。然而,GAM模型增强了空间和通道维度之间的交互,能够跨三个维度捕获关键特征信息。图4展示了GAM模块的结构。
图4 GAM模块结构图
GAM旨在通过集成通道注意力和空间注意力子模块的双分支架构优化神经网络性能。通道注意力分支采用参数高效的多层感知机(MLP),具有顺序的压缩-扩展层,其中通过线性投影进行维度降低,结合非线性激活(ReLU)建立通道间依赖关系。这种分层变换通过放大语义显著通道同时抑制冗余信息,实现判别性特征重新校准。互补地,空间注意力子模块利用包含两个7×7卷积层(穿插批归一化)的卷积范式。该配置通过局部感受野处理系统建模特征图上的位置关系,从而增强对关键空间模式的敏感性。两个子模块通过残差连接保持与输入张量的维度一致性,确保联合优化期间稳定的梯度传播。
双注意力组件的协同操作通过顺序的通道-空间重新校准实现全面特征细化。具体而言,通道加权优先处理判别性特征图,随后的空间掩码强调激活通道内的任务相关区域。这种分层注意力传播建立跨维度特征相互依赖性,有效将全局上下文线索聚合到紧凑的注意力图中。
注意力机制通过强调关键特征和抑制无关信息显著改善模型性能。GAM进一步集成通道注意力模块和空间注意力模块:
通道注意力:对于特征图![]()
,通道注意力权重
![]()
通过全局平均池化(GAP)和多层感知机(MLP)计算,计算过程如公式(6):
其中,σ 表示Sigmoid函数,GAP表示全局平均池化。
空间注意力:空间注意力权重![]()
通过通道池化特征拼接和卷积层生成,如公式(7):
![]()
最终输出特征![]()
通过输入特征与注意力权重的逐元素相乘获得,计算过程如公式(8):
![]()
GAM使模型能够自适应地关注信息丰富的通道和显著的空间区域,增强噪声和变工况下的鲁棒性。
在本节中,提出基于KAN模块的改进Swin Transformer(KAN-Swin Transformer),以在通过GADF进行时频信息特征提取的基础上增强故障诊断性能。随后,通过集成GADF和GAM引入新颖的模型框架。最后,提出基于GADF驱动的KAN-Swin Transformer双分支网络的航空轴承故障智能监测方法。
3.1 所开发的KAN-Swin Transformer模块
传统Swin Transformer模型通过基于窗口的多头自注意力(W-MSA)和移位窗口机制实现图像特征的全局建模。然而,其多层感知机(MLP)模块仍存在两个关键问题:
a) MLP的全连接结构导致参数数量随特征维度二次增长,在训练数据有限时容易过拟合;
b) 固定激活函数的线性组合限制了模型的非线性表示能力。
为解决这些局限性,本节基于Kolmogorov-Arnold定理提出改进的KAN-Swin Transformer模块。通过用可学习的B样条基函数替代传统MLP,构建了更具表达力的非线性映射结构。
根据Kolmogorov-Arnold定理,任何多元连续函数
可分解为有限个一元函数的嵌套叠加,该定理可由公式(9)表示:
其中,![]()
表示外层函数,
![]()
表示内层一元函数。受此启发,Liu等人提出将基函数参数化为B样条曲线,如公式(10):
![]()
其中,![]()
是基本样条函数,
![]()
是可训练系数。
通过将函数分解过程显式建模为神经网络层,形成Kolmogorov-Arnold网络(KAN)。在KAN中,每层定义为![]()
,p 和q 的值由层的输入和输出维度确定。KAN的结构如图5所示。在图5中,有n 个输入特征。输入层首先将这些特征引入隐藏层。对于每个输入
![]()
,通过m 个内函数
![]()
映射:
![]()
,其中,m 是隐藏层节点数。隐藏层通过对输入特征应用样条函数生成中间表示,然后传递到输出层。隐藏层输出
![]()
通过外函数
![]()
组合产生最终输出:
![]()
,其中,
![]()
和
![]()
通常采用样条函数。

图5 KAN网络结构图

图6 KAN-Swin Transformer模块结构图
在标准Swin Transformer块中,MLP模块负责对自注意力输出的特征进行非线性变换。然而,所提出的KAN-Swin Transformer模块将其替换为KAN结构。在标准Swin Transformer块的基础上,KAN-Swin Transformer模块通过引入Kolmogorov-Arnold网络(KAN)重构前馈层,形成双残差级联结构,如图6所示。其数学表述可分为两个特征变换阶段:
窗口自注意力变换:保留原始窗口自注意力机制。输出特征通过LayerNorm归一化后输入KAN层,该过程由公式(11)表示:
其中,![]()
表示基于窗口的多头自注意力,
![]()
表示LayerNorm操作,
是输入特征(B 为批量大小,![]()
为空间位置数,d 为特征维度)。
KAN前馈变换:该过程由公式(12)表示,其中传统MLP被替换为两阶段KAN结构:
![]()
其中,KAN(⋅) 表示改进的Kolmogorov-Arnold网络层。对于输入![]()
,单个KAN层输出
![]()
的第
![]()
个元素
![]()
由公式(13)计算:

其中,
![]()
是连接第
![]()
个输入
![]()
到第
![]()
个输出
![]()
的边上可学习的激活函数。该函数分解为B样条分量
![]()
和基函数分量
![]()
,如公式(14)定义:
其中,![]()
是输入张量
![]()
的第
![]()
个元素。
![]()
是阶数为
![]()
的第
![]()
个B样条基函数,定义在
![]()
个节点的网格上。
![]()
是可学习的B样条系数,这些系数的集 合形成张量
![]()
。
![]()
是固定的基激活函数(如SiLU)。
![]()
是基函数的可学习权重,这些权重的集 合形成矩阵
。
所提出的KAN模块由两个这样的KAN层堆叠而成,整体输出由公式(15)表示:
![]()
窗口自注意力输出![]()
通过跳跃连接与输入
![]()
相加以保留原始特征信息。KAN层输出
![]()
与
![]()
相加形成级联残差结构。窗口自注意力捕获空间局部相关性,而KAN层通过基函数组合建模全局频域特征以实现互补效果。与原始Swin Transformer相比,双残差结构有效增强梯度传播,缓解深层网络的退化问题。
在KAN网络中,引入动态网格调整策略以基于输入特征分布优化样条节点,计算过程如公式(16):
![]()
其中,![]()
表示均匀网格,
![]()
表示基于特征分位数计算的自适应网格,
![]()
是混合系数。
结合动态网格更新机制,残差连接结构确保有效的梯度反向传播,缓解深度网络训练中的梯度消失问题。与传统MLP的![]()
参数复杂度相比,KAN通过局部化B样条基函数将参数复杂度降低至
![]()
。
与标准Swin Transformer中MLP块使用的4倍维度扩展策略以增强线性可分性不同,本研究中的KAN模块采用![]()
(800→64→800)的瓶颈架构。该设计的基本原理是,KAN的非线性表达能力主要源于其边上可学习的B样条激活函数,而非高维投影。每个B样条函数本身是一个强大的非线性逼近器。因此,瓶颈结构在显著降低参数数量的同时,迫使网络学习更紧凑且信息丰富的中间表示,从而在不牺牲性能的情况下提高参数效率。
此外,为解决训练过程中激活分布的动态性问题,采用动态网格调整策略。B样条函数定义在有界域上,固定网格可能无法覆盖激活的演化范围。如公式(16)所示,该策略基于输入特征的分位数自适应更新网格节点,确保B样条在数据最密集区域进行细粒度建模。混合系数α 用于平滑此更新过程,增强训练稳定性。
所提出模型的整体架构如图7所示,包括GADF预处理模块和KAN-Swin Transformer与CNN-GAM的双分支网络。GADF通过格拉姆角差场将一维振动信号转换为二维时频图像,以捕获信号的周期性和瞬态冲击特性。KAN-Swin Transformer与GAM模型采用双分支并行架构,其中KAN-Swin Transformer分支通过分层窗口注意力提取局部纹理特征,而CNN-GAM分支通过多尺度卷积和全局注意力机制增强空间表示能力。因此,两个分支的特征经过跨模态融合以实现高精度的故障分类。完整模型结构如图7所示,各层的详细参数配置见表1。
图7 带有KAN-Swin Transformer的双分支网络结构
表1 所提模型各层参数

a) 时频特征编码
GADF模块通过格拉姆角差场将一维振动信号转换为二维时频图像。对于采样信号![]()
,GADF通过极坐标映射构建格拉姆矩阵,生成224×224尺寸的RGB图像。该过程将信号的时间依赖性计算转换为空间纹理特征,其中图像对角线表征时间序列的自相关,非对角元素用于表示跨时间步的相位关系,有效保留了信号的联合时频特性。
模型采用双分支并行架构进行多尺度特征提取:
(1) KAN-Swin Transformer作为主干网络:KAN-Swin Transformer的窗口注意力机制通过7×7局部窗口内的4头注意力计算空间相关性。同时,采用三阶B样条基函数,节点位置根据特征分布动态调整以实现动态KAN层。核心创新在于用KAN模块替代传统MLP层,通过自适应网格调整增强非线性拟合能力。
(2) CNN-GAM分支:构建深度卷积网络,每层集成GAM模块。该模块采用双注意力机制:通道注意力通过全连接层学习通道权重![]()
,空间注意力通过7×7卷积核(空间金字塔池化)生成空间掩码
![]()
,最终实现双重特征增强。
c) 多模态特征融合
来自KAN-Swin Transformer的局部特征和来自CNN-GAM的全局特征通过通道拼接融合为联合特征。自适应平均池化压缩空间维度同时保留最具判别性的通道响应。最终故障状态分类通过全连接层实现,采用交叉熵损失作为损失函数。该设计集成了KAN-Swin Transformer的长程依赖建模能力与CNN的局部特征提取优势,通过注意力驱动的特征增强提高复杂工况下的分类鲁棒性。
在上述部分,详细介绍了所提模型的理论。本节将所提方法应用于航空轴承故障诊断。基于所提模型的诊断流程图如图8所示,主要步骤如下:
步骤1:信号采集与GADF图像生成
通过通道传感器采集不同健康状态下轴承的振动信号。将原始时间序列数据分窗构建训练集和测试集。每个信号窗口通过GADF方法转换为二维图像,通过极坐标变换保留时间相关性特征。生成的GADF图像(尺寸224×224)进行归一化并以RGB格式存储为数据集,随后按7:2:1的比例划分为训练集、验证集和测试集。

图8 航空轴承故障诊断流程图
步骤2:混合特征提取与所提模型训练
将训练样本的GADF图像输入KAN-Swin Transformer和GAM架构进行拼接特征学习。模型通过双分支并行路径处理样本:
KAN-Swin Transformer分支:在此过程中,通过移位窗口自注意力机制捕获局部空间依赖性,4×4不重叠图像块由分层结构处理,传统MLP被替换为KAN进行分类,使用动态B样条网格优化非线性特征映射,共同生成多尺度特征。
CNN-GAM分支:通过堆叠Conv2D、ReLU和GAM注意力层的CNN主干网络提取全局纹理特征,其中GAM机制通过拼接通道注意力和空间注意力增强可区分特征。
来自KAN-Swin Transformer分支的分层特征和来自CNN-GAM分支的高维全局特征通过通道拼接和自适应平均池化进行跨模态融合。
步骤3:故障诊断与验证
将测试样本的GADF图像输入训练好的模型进行健康状态识别。结合KAN-Swin Transformer的结构感知能力和CNN-GAM分支的纹理敏感性,KAN-Swin Transformer与GAM框架通过多级特征融合机制实现故障特征的协同提取。
在本节中,使用两个数据集验证所提方法的有效性。后续小节简要介绍每个数据集。所有实验在单台设备上进行,详细硬件规格列于表2。训练集、验证集和测试集按7:2:1划分。使用AdamW优化器,固定学习率3×10−4 ,交叉熵损失,批量大小32,训练100个epoch。所有实验在固定随机种子下运行以保证确定性和可重复性。
表2 实验设备参数信息

哈尔滨工业大学航空轴承试验台如图9所示。该试验台主要由三部分组成:电机驱动系统、改装航空发动机和润滑系统。轴间轴承测试装置如图9(A)所示。在改装航空发动机中,拆除了原航空发动机原型机的转子叶片、燃烧室和部分辅助机匣,保留其核心部件——双转子结构,如图9(B)所示,包括低压(LP)压气机、高压(HP)压气机、低压涡轮和高压涡轮。双转子结构的关键部件包括机匣、轴间轴承和五个支承轴承。轴间轴承如图9(C)所示。如图9(B)所示,在轴间轴承中引入了三种人工故障。传感器1和2采集位移数据,传感器3、4、5和6采集加速度数据,如图9(A)所示。所有传感器以25,000Hz的采样频率工作。加速度计安装在航空发动机机匣上,因此故障特征在传递过程中发生畸变,连接结构的碰撞噪声也混入信号中。与传统轴承试验台数据相比,采集的振动信号更为复杂,对有效提取和识别故障特征构成挑战。此外,低压压气机(1000–5000r/min)和高压压气机(1200–6000r/min)的不同运行转速进一步增加了轴间轴承故障诊断的难度。
图9 航空发动机轴间轴承试验台
该轴承数据集包含三种故障状态和一种健康状态。轴承状态分别为:(A1)正常;(A2)外圈故障,尺寸0.5mm×0.5mm;(A3)轻微内圈故障,尺寸0.5mm×0.5mm;(A4)严重内圈故障,尺寸0.5mm×0.1mm。对于每种运行状态,从加速度计数据中选取2,500个不重叠样本构成数据集。每个样本以2,048个采样点进行分段。每个状态的样本按7:2:1划分为训练集、验证集和测试集。详情汇总于表3。
表3 哈尔滨工业大学数据集故障类型和数据划分

都灵理工大学轴承试验台概览如图10所示。该试验台主要由高速主轴和由主轴驱动的副轴组成,如图10(A)所示。主轴轴承固定在高刚性单支撑上,安装在大型钢底板上。实验数据通过位于图10(B)中A1和A2点的三轴加速度计采集,测量轴承支承和主轴三个空间方向的加速度。具体而言,从故障轴承B1的支承和轴承B2的支承采集加速度数据。加速度计为三轴IEPE型,频率范围1–12,000Hz(幅度±5%,相位±10°),标称谐振频率55kHz,标称灵敏度1mV/ms⁻²。实验中使用的滚子轴承如图10(C)所示。B1和B3位置滚子轴承的外圈由相同的轴承座支承,内圈连接到设计转速高达35,000rpm的短空心轴上。
本研究实验在51.2kHz采样频率和100Hz轴速(6,000rpm)无载荷条件下采集数据。数据集包含三种健康状态:内圈故障、滚子故障和正常。内圈故障和滚子故障各进一步细分为三个严重等级,共七种状态。每种故障类型包含六个通道的加速度数据,每通道512,000个数据点。对于每种运行工况,选取250个样本构成数据集。数据集B的划分方法与数据集A一致,详见表4。

图10试验台(A)总体视图 (B)两个加速度计的地方 (C)带有三个滚珠轴承的轴
表4 都灵理工大学数据集故障类型和数据划分

所提方法在两个数据集上取得了不错的结果。本部分将详细阐述该方法的诊断结果分析和T-SNE可视化分析。
为严格评估所提模型的泛化能力和统计可靠性,采用10折分层交叉验证协议替代基于单次运行的评估。该协议确保每个样本恰好被用于测试一次,从而提供全面且无偏的性能评估。
模型在两个数据集上表现出卓越的诊断性能。在数据集A上,达到99.80%±0.14%的平均精度。在更具挑战性的数据集B上,其特征为类别更多且每类样本更少,模型达到了98.06%±1.02%的高平均精度。这些结果及其他综合指标详见表5。高平均精度验证了模型的有效性,而低标准差突显了其在不同数据划分下的稳定性和鲁棒性。
为进一步剖析模型的类别特定性能,通过累积所有10个测试折的预测生成聚合混淆矩阵(图11)。对于数据集A(图11a),模型展现出近乎完美的分类。极小的非对角元素显示,仅在极少数情况下模型将轻微内圈故障(A3)与严重内圈故障(A4)混淆。这证明了模型对故障严重度细微变化的高敏感性,这是预后能力的关键。对于数据集B(图11b),模型同样表现出色,成功区分了细粒度的故障类型和尺寸,如内圈故障(B1、B2、B3)和滚子故障(B4、B5、B6)。
表5 所提模型在数据集A和B上的综合性能指标(10折交叉验证)


图11所提模型在10折交叉验证下的聚合混淆矩阵。(a)数据集A的结果。(b)数据集B的结果。2) T-SNE可视化结果分析
为进一步研究所提双分支网络在不同数据集上的内在特征学习机制,采用t-SNE可视化在三个关键阶段提取的特征:局部分支、全局分支和最终输出层。结果如图12所示。
可视化揭示了清晰、渐进的特征学习过程。如图12(a)和(d)所示,KAN-Swin Transformer分支提取的局部特征表现出显著的类别重叠。这一结果与我们的设计预期一致,因为该分支旨在捕获GADF图像内的基本细粒度模式。这些特征原语类似于字母表中的字母;它们在孤立状态下缺乏完整的语义含义,可在多种故障类型间共享,因此本身不具备高度的类别判别性。
相比之下,CNN-GAM分支提取的全局特征(如图12(b)和(e)所示)展现出显著改善的类别可分离性。这是因为CNN分支具有更大的感受野,并通过GAM模块增强,擅长识别宏观模式和周期性。例如,外圈故障的特征谐波簇表现为明显的重复纹理,这提供了与特定故障条件强相关的上下文线索,导致初始聚类的形成。
最令人信服的结果如图12(c)和(f)所示,展示了特征融合后最终输出logits的分布。对于两个数据集,所有样本形成异常紧凑的类内簇,类间间隔大。从部分重叠到完全分离的戏剧性进展为双分支架构的协同效应提供了强有力的证据。模型学会在全局特征提供的上下文中解释局部原语。例如,反复出现在全局周期模式(全局特征)中的瞬态冲击(局部特征)共同形成指向特定故障类型和严重度的高度判别性"证据链"。最终,这种局部细节和全局视角的智能集成构建了高度鲁棒且可分离的最终特征表示,直观解释了模型出色的分类性能。

图12 T-SNE视觉化显示与所提模型相对应的提取特征,分别对应于数据集A和B。(a)数据集A的局部特征,(b)数据集A的全局特征,(c)数据集A的输出层,(d)数据集B的局部特征,(e)数据集B的全局特征,(f)数据集B的输出层
F1分数、G-mean和精度是用于评估所提模型性能的指标。F1分数是精确率和召回率的调和平均值,用于量化分类器的精确率和召回率能力。G-mean试图在保持各类别精度平衡的同时最大化每个类别的精度。对于多分类任务,它定义为召回率和特异性的乘积的平方根。F1分数、G-mean和精度的计算过程如公式所示:

其中,![]()
表示类别i 的真阳性样本数;
![]()
表示类别i 中正确分类的阴性样本数;
![]()
表示类别i 中误分类的阳性样本数;
![]()
表示类别i 中误分类的阴性样本数。当灵敏度和特异性越高时,G-mean越大。F1分数用于分析阳性样本的分类率。这些评估指标的值越大,对应分类性能越好。
为进一步检验KAN、Swin Transformer和CNN-GAM模块在所提模型框架中的贡献,本小节进行消融实验。具体消融配置如下:
1、 CNN-Transformer:无额外模块的基线Transformer模型,作为对比基准。
2、 CNN-Swin Transformer:仅 incorporated Swin Transformer模块,评估其多尺度特征提取能力。
3、 KAN-Swin Transformer:组合KAN和Swin Transformer模块,移除CNN-GAM模块,评估将KAN集成到Swin Transformer中的性能提升。
4、 CNN-GAM:仅保留CNN-GAM模块,移除KAN和Swin Transformer,观察其对特征提取和模型性能的贡献。
5、 Swin Transformer-GAM:组合Swin Transformer和CNN-GAM模块,排除KAN,评估其交互影响。
6、 所提方法:通过GADF将一维信号转换为二维时频图像,集成KAN、Swin Transformer和CNN-GAM模块,测试其协同效应。
两个数据集上的消融结果如表6所示,列出了两个数据集上的各种指标。首先,所提方法在所有指标上持续优于所有其他方法,证明了其优越性。其次,与Swin Transformer-GAM相比,由于KAN结构在分类决策过程中引入的推理能力,所提方法实现了识别率的显著提升。
表6 两个数据集下的不同指标
两个数据集上的消融结果如图13所示。通过消融实验观察到,KAN-Swin Transformer模块和CNN-GAM双分支架构的联合设计显著增强了模型性能。在KAN-Swin Transformer模块中,标准Swin Transformer的MLP层被基于B样条的KAN替代,通过动态激活函数调整和自适应网格机制增强对高频瞬态冲击特征的非线性建模能力。与传统Swin Transformer达到97.5%的精度相比,KAN-Swin Transformer在数据集A上达到98.10%的精度并减少了参数数量,验证了其效率和参数有效性。
性能突破通过建立全局和局部特征互补性的双分支架构实现。在KAN-Swin Transformer分支中,通过移位窗口注意力机制捕获GADF图像中的长程依赖(如与格拉姆矩阵对角元素相关的周期性外圈故障模式)。同时,CNN-GAM分支旨在通过卷积空间注意力放大瞬态局部纹理(如数据集B中的滚子故障冲击),并通过通道注意力抑制噪声主导频段。这些互补特征通过通道拼接进行融合,使全局结构感知和局部判别模式能够协同集成。因此,所提框架在两个数据集上均达到100%的诊断精度,显著优于单模块配置。

图13在数据集A和B下,六种不同诊断模型的准确率精确率和F1分数比较
为确保所提模型的鲁棒性和可重复性,并为超参数选择提供明确依据,对Kolmogorov-Arnold网络(KAN)模块的关键参数进行敏感性分析。该分析涉及其实际应用的两个关键方面:有限B样条函数引入的逼近误差和动态网格调整策略的经验依据。
KAN的理论基础假设无限精细的函数分解,而实现采用有限数量的B样条基函数。该逼近的精细度由网格尺寸超参数控制,直接影响模型捕获复杂故障特征和避免逼近误差的能力。
为量化此效应,通过系统改变网格尺寸同时保持所有其他训练参数不变进行消融研究。模型在网格尺寸为[3,5,8,10]下训练和评估。结果汇总于表7。
表7 网格尺寸超参数的敏感性分析

分析表明,随着网格尺寸从3增加到5,模型性能显著提升,总体精度从0.9743上升至
0.9992。这表明更精细的网格使KAN层能够更准确地逼近与故障数据相关的底层非线性函数,从而降低逼近误差。然而,进一步将网格尺寸增加到8和10导致性能显著下降。这种退化归因于模型复杂度的增加,在给定有限训练数据集的情况下,可能导致过拟合。因此,选择网格尺寸为5,以达到该故障诊断任务中逼近精度与模型泛化的最优平衡。
动态网格调整策略如公式(16)所述,采用混合系数α 平衡数据自适应网格和均匀网格的影响。为验证α 的选择并评估其对该故障诊断应用的影响,进行了第二项消融研究。
基于最优网格尺寸5,评估模型在α 值为[0.0, 0.02, 0.05, 0.1, 0.2]下的性能。α 值0.0对应纯数据自适应网格。表8呈现的结果表明,虽然纯自适应网格(0.0)表现良好,但引入小的均匀分量(0.02)进一步提升性能至峰值。这表明均匀分量充当正则化器,改善模型对测试集中未见数据分布的泛化能力。随着α 超过此最优点,性能逐渐下降,表明过于均匀的网格在捕获故障数据的特定非均匀分布方面效果较差。
表8 混合系数α 的敏感性分析

该经验分析为选择0.02提供了坚实依据,该值也与原始KAN实现中的建议一致。这些发现证实所选超参数针对该任务进行了良好调优,确保高性能和方法论严谨性。
为验证双分支架构的核心假设——即KAN-Swin Transformer和CNN-GAM分支学习互补而非冗余的特征——采用中心核对齐(CKA)定量评估其特征表示的相似性。CKA通过计算两个特征空间Gram矩阵的归一化Hilbert-Schmidt独立性准则(HSIC)来衡量特征空间之间的相似性。其分数范围为0(完全不相似)到1(相同表示),较低值表示较强的互补性。
在数据集A和数据集B的测试集上进行此分析。过程如下:对于每个输入样本,在拼接层之前提取KAN-Swin Transformer分支(FKAN−SwinTransformer )和CNN-GAM分支(FCNN−GAM )的输出特征张量。然后计算这两个展平特征矩阵之间的线性CKA相似性分数。分析得出数据集A的线性CKA相似性分数为0.304,数据集B为0.275。这些低分数显著接近0而非1,表明两个分支学习的特征表示相似度很低。该结果定量证实了假设:KAN-Swin Transformer分支和CNN-GAM分支确实捕获了不同且互补的信息。因此,简单的拼接特征融合方法被证明是集成这两组不同特征的有效方法,它们协同贡献了模型鲁棒且高精度的诊断能力。
数据集B上的综合对比分析(详细结果见表9)证明了所提GADF驱动双分支网络的优越性能,达到98.06%的平均精度,以及高精确率、召回率和F1分数——超越所有其他评估模型。虽然基于CNN的架构如ResNet-50、EfficientNet和ConvNet,以及无卷积的MLP-Mixer展现出强大的诊断能力,精度范围为96.52%至97.15%,但其性能表明在捕获GADF图像中保留的长程依赖方面存在潜在局限性。类似地,Vision Transformer与CNN相比展现出竞争性但略低的结果,可能是由于其在建模细粒度局部模式方面的样本效率有限。CNN-Transformer混合模型改进了标准ViT,证实了结合局部和全局特征的价值。
表9 不同模型在数据集B上的性能对比

为阐明设计选择的实际意义,特别是在双分支架构背景下参数减少的说法,对模型的计算效率进行了定量分析。将所提模型与标准Swin-Tiny基线进行对比,后者作为典型高性能Transformer架构的参考。对比聚焦于三个关键指标:可训练参数总数(Parameters)、以Giga浮点运算衡量的计算复杂度(GFLOPs)和单样本推理延迟。所有测试在NVIDIA RTX 4090 GPU上进行以确保评估环境一致。
表10 模型计算效率对比

表10揭示的关键设计权衡表明,虽然所提模型实现了显著的40.8%参数减少,总参数仅16.27M(相比Swin-Tiny基线的27.50M),但这种效率以计算需求增加为代价。参数减少是直接用更高效的KAN模块替代标准MLP块的结果,使模型在存储方面更轻量化。然而,同时通过两个网络处理图像的双分支并行架构固有地增加了计算工作量。因此,所提模型的计算负载(8.39 GFLOPs)和推理延迟(18.75ms)约为单分支Swin-Tiny的两倍。
所提模型的优势源于其集成的双分支设计,利用互补优势:首先,KAN-Swin Transformer分支通过窗口注意力和参数高效非线性建模有效捕获多尺度局部特征和瞬态特性;同时,CNN-GAM分支通过强调显著谐波结构同时抑制噪声,专门感知全局纹理和周期模式。最后,这两个路径的协同融合将局部细节与全局上下文信息集成,形成判别性特征表示,显著增强诊断精度,特别是在区分细微故障类型和严重度方面。
总之,所提架构故意以更高计算成本换取更低参数数量。这使模型在存储或内存容量为主要约束的边缘设备部署方面具有特殊优势。然而,更高延迟对需要在计算受限硬件上进行实时推理的应用构成挑战。因此,边缘部署的可行性取决于目标应用的具体约束。
为严格验证模型在复杂噪声环境中的恢复能力,使用相同的10折交叉验证协议进行全面鲁棒性分析。对于每折,模型在干净训练数据上训练。随后,将相应测试集的一维振动信号叠加加性高斯白噪声,创建信噪比(SNR)为4dB、2dB、0dB、-2dB和-4dB的测试集。然后在这些噪声测试集上评估训练好的模型性能。
表11 不同信噪比下的模型精度

以均值±标准差形式报告的聚合结果汇总于表11。所提模型展现出显著的鲁棒性。随着噪声水平增加,性能优雅地退化。对于数据集A,即使在4dB的SNR下,平均精度仍高达99.20%±0.35%。在最严重的-4dB噪声条件下,模型仍保持97.10%±0.85%的可观精度。这一趋势证实了模型在显著噪声干扰下保持高性能的能力。
这种优越的抗噪性源于双分支架构的协同作用。GADF变换有效保留核心信号模式,同时将噪声扩散为结构性较弱的图像纹理。KAN-Swin Transformer分支鲁棒地捕获局部结构依赖,而CNN-GAM分支利用注意力抑制噪声并放大显著全局模式。这种协作机制确保模型能够可靠地区分故障特征与背景噪声,验证了其适用于实际航空应用。
为评估所提框架对类别不平衡的鲁棒性——实际故障诊断中的常见挑战——从数据集B构建了一个不平衡子集。虽然原始数据集是平衡的,通过欠采样若干故障类别模拟更真实的场景。具体而言,类别B0、B1和B4保留100%样本量(多数类),类别B2和B5减少至50%(少数类),类别B3和B6减少至20%(稀有类)。
然后使用10折分层交叉验证协议在该不平衡数据集上评估模型。为确保在倾斜分布下的公平评估,报告宏平均指标,无论样本量大小给予每个类别同等权重。聚合结果汇总于表12。
表12 数据集B不平衡子集上的性能

表12的结果明确证明了模型对类别不平衡的卓越恢复能力。尽管若干类别的样本量显著减少,模型仍达到96.91%的平均精度。更重要的是,宏平均召回率和F1分数均超过95%,表明模型不仅在多数类上表现出色,在稀有类上同样表现优异。这种鲁棒性归因于双分支架构的协同特征学习。KAN-Swin Transformer和CNN-GAM分支擅长提取高度判别性和泛化性特征,使模型即使从有限数量的训练样本中也能识别独特的故障模式。这证实了所提模型适用于实际工业应用中平衡数据罕见的情况。
为严格评估模型在变工况下的泛化能力——这对航空等实际部署领域至关重要——使用凯斯西储大学(CWRU)轴承数据集进行了一系列跨域实验。实验旨在模拟预训练模型部署在具有不同运行参数环境时遇到的"域偏移"现象。
利用CWRU数据集中的四种不同载荷条件(HP)构建四种具有挑战性的跨域诊断任务(表13)。每项任务涉及10类分类问题(正常,加上3种故障类型各3种严重等级)。与先前实验一致,原始1D时间序列信号被分段并使用格拉姆角差场(GADF)技术转换为224×224图像作为模型输入。
表13 CWRU跨域诊断任务定义
所提模型在四项跨域任务上的诊断性能汇总于表14。结果报告为五次独立运行的均值和标准差,以确保统计可靠性。
表14 CWRU数据集上的跨域诊断性能

结果明确表明,如预期,当面临域偏移时模型精度相比单域场景下的近乎完美分数有所下降。然而,模型展现出显著的恢复能力。即使在最具挑战性的任务T2(1HP→3HP)和T4(0HP→3HP)中,代表载荷和组合载荷/转速的显著变化,模型仍保持远高于90%的精度。随着源域和目标域之间差异的增加,性能优雅地退化,而非灾难性失效,这突显了模型固有的鲁棒性。
模型强大的跨域泛化性能可直接归因于其独特的双分支架构:KAN-Swin Transformer分支提取局部域不变特征,而CNN-GAM分支自适应地建模全局上下文。它们的融合使模型在域偏移下仍能保持鲁棒性能,确认了其在变化运行条件下的实际潜力。
针对航空轴承诊断中微弱故障特征和复杂工况的挑战,本文提出了GADF驱动的KAN-Swin Transformer诊断框架,集成多模态特征增强和注意力机制,提高了航空轴承故障数据集的故障识别率。
a) KAN-Swin Transformer模块的创新:用可学习的B样条基函数的KAN替代传统MLP,将KAN集成到Swin Transformer中。结合动态网格调整策略,增强非线性表示能力同时减少参数数量。双残差级联结构有效建模局部空间依赖和全局频域特征,实现轻微与严重内圈故障的准确区分。
b) GADF时频特征编码的优势:通过GADF极坐标变换将瞬态冲击和周期特性编码为判别性纹理模式。结合KAN-Swin Transformer双分支网络,在变速条件下实现多样故障的100%识别率。
c) KAN-Swin Transformer双分支网络的协同效应:通过跨模态特征拼接和自适应池化,结合KAN-Swin Transformer的局部结构感知与CNN-GAM的全局纹理敏感性。在两个航空轴承数据集上达到100%的分类精度,显著优于基线方法。
虽然所提方法在两个航空轴承数据集上取得了优异性能,但仍存在若干局限值得未来工作进一步研究:
计算复杂度和边缘部署可行性:设计的关键方面涉及参数数量和计算负载之间的权衡。虽然用KAN模块替代标准MLP显著减少了Swin Transformer分支的参数,使总模型大小降至16.27M参数(相比标准Swin-Tiny的27.50M),但双分支并行架构固有地增加了计算需求。分析显示模型需要8.39 GFLOPs,推理延迟为18.75ms,高于Swin-Tiny基线的4.37 GFLOPs和8.54ms延迟。这对航空应用中常见的资源受限嵌入式系统或边缘设备的实时部署构成挑战。未来工作将专注于模型轻量化技术——如知识蒸馏、结构化网络剪枝和量化——以开发在保持高精度的同时满足机载计算严格预算的高效模型版本。
数据多样性和真实世界条件泛化:本研究的验证基于两个实验室数据集。尽管我们在CWRU数据集上的跨域实验证明了模型对可变负载的鲁棒性,但真实的航空环境具有更复杂的多因素同时变化(如转速、负载和温度),这些因素会导致显著的域偏移。此外,现有数据集缺乏执行“留一轴承验证”协议所需的元数据,而该协议是评估模型对全新部件泛化能力的一种可靠方法。未来的研究应优先在更多样化、真实的现场数据以及按单个部件明确标注的数据集上验证模型性能,以便严格评估其在部件层面的泛化能力。同时,探索先进的迁移学习和域适应方法对于缩小实验室训练模型与实际现场应用之间的差距也至关重要。
扩展到多源数据融合:本研究仅利用振动信号进行故障诊断。在实际的航空健康监测中,融合多源信息(例如温度、声发射和油液分析数据)可以通过提供更全面的设备健康状态视图,显著提升诊断的准确性和可靠性。未来一个很有前景的研究方向是将我们的双分支框架扩展为多模态架构,使其能够有效整合这些异构数据流,从而构建一个更鲁棒、更全面的诊断系统。