首页/文章/ 详情

GADF驱动的KAN-Swin Transformer双分支网络用于航空轴承故障诊断

3月前浏览1375
    针对航空轴承诊断中微弱故障特征淹没和极端工况变化的关键挑战,本研究提出了一种GADF驱动的KAN-Swin Transformer双分支网络用于航空轴承故障诊断,供大家参考学习。

    论文基本信息

    论文题目:Beyond CNN or Transformer Alone: A GADF-powered Dual-branch Network with KAN-Swin Transformer for Fault Diagnosis of Aerospace Bearing

    论文期刊:IEEE Transactions on Automation Science and Engineering (T-ASE)

    论文日期:2025

    论文链接10.1109/TASE.2025.3640120

    作者:

    Liubing Hu[a], Jinghong Tian[a], Zhilin Dong[a], Lingli Cui (Member, IEEE)[b], and Chengri Lang[a]

    机构:

    a:School of Engineering, Zhejiang Normal University, Jinhua 321004 China.

    b:Key Laboratory of Advanced Manufacturing Technology, Beijing University of Technology, Beijing, 100124, China . 

    作者简介:

    田景红浙江师范大学副教授,硕士生导师,主要从事智能制造、工业互联网、供应链管理相关的教学与研究工作。熟悉数字化工厂相关运营管理理论、数字化智能化相关解决方案,有完整的信息化项目分析、设计、开发及实施经验。目前主持浙江省重点研发计划项目1项,完成横向项目十余项,发表论文二十余篇。

    董治麟现为浙江师范大学装备状态监测与智能维护技术研究所核心成员,硕士生导师,中共党员,中国计算机学会会员,中国振动工程学会会员,中国自动化学会制造自动化专业委员会会员,英国皇家物理学会会员,Robot Learning期刊青年编委,2025年中国振动工程学会动态信号分析学术会议大会主题报告人,永康市土丁五金制品股份有限公司科技副总,第四届“成泰共好”奖教金获得者,2025年留学基金委青年骨干教师出国研修项目获得者。学术研究方面,主持/参与项目共计12项,发表论文共计32篇,其中第一或者通讯作者发表26篇,ESI高被引论文4篇,总被引次数600余次;授权国际发明专利6项,国内发明专利5项,国内实用新型专利20余项,计算机软件著作权5项。积极投入科研活动,先后成为40余家期刊审稿人,被IOP出版社授予“IOP Trusted Reviewer Status”荣誉。研究方向:结构设计与运动仿真,机理建模与运动控制,信号分解与时频分析,健康特征指标构建,度量学习与深度学习,异常检测与系统辨识,状态监测与故障诊断,状态估计与寿命预测,可靠性设计与安全评估

    胡刘兵浙江师范大学工学院机械工程在读研究生,研究方向为故障诊断和计算机视觉,聚焦深度学习在工业运维中的应用。

    目录

    摘要

    1 引言

    2 基础理论

        2.1 格拉姆角差场

        2.2 CNN-Swin Transformer

        2.3 全局注意力机制

    3 所提方法

        3.1 所开发的KAN-Swin Transformer模块

        3.2 基于KAN-Swin Transformer的双分支网络

        3.3 航空轴承故障诊断流程图

    4 实验验证与对比分析

        4.1 数据集描述    

        4.2 所提方法的实验结果

        4.3 模型性能评估指标

        4.4 消融实验

        4.5 KAN模块超参数敏感性分析

        4.6 双分支特征互补性的定量分析

        4.7 与其他先进方法的对比分析

        4.8 计算效率分析

        4.9 噪声条件下的鲁棒性分析

        4.10 不平衡数据集性能评估

        4.11 跨域泛化分析

    5 结论

    摘要

    针对航空轴承诊断中微弱故障特征淹没和极端工况变化的关键挑战,本研究提出了一种GADF驱动的KAN-Swin Transformer双分支网络用于航空轴承故障诊断。首先,通过格拉姆角差场(GADF)将一维振动信号编码为二维时频图像,利用极坐标映射保留时间依赖关系和频谱动态特性,同时解决了传统时频分析方法对噪声敏感的限制。随后,通过用B样条基函数替代传统多层感知机,开发了KAN-Swin Transformer模块,通过动态网格调整策略增强非线性映射能力,在降低参数复杂度的同时有效提升了对瞬态冲击和周期性模式的建模能力。此外,提出了一种双分支并行架构:KAN-Swin Transformer分支通过分层窗口注意力机制提取局部结构特征,而CNN-GAM分支通过多尺度卷积与通道-空间注意力融合增强全局纹理感知。最后,结合跨模态特征拼接与自适应池化实现全局-局部特征的协同优化,显著增强了复杂噪声环境下故障模式的可区分性。所开发的方法在两个不同的航空轴承数据集上进行了测试,分类精度达到了100%。同时,通过消融实验验证了包括KAN、Swin Transformer和CNN-GAM在内的模块集成的协同效应,显示出相比基线模型在跨转速工况识别率方面的提升,并确认了该框架对噪声和变载荷条件的鲁棒性。通过协同集成机制融合与注意力架构,所提出的框架为航空轴承智能健康监测提供了可靠解决方案,在轻量化边缘部署和跨域迁移学习方面具有潜在应用价值。


    关键词:KAN,故障诊断,Swin Transformer,GAM,航空轴承

    1 引言

    随着智能制造的不断发展,设备健康管理作为核心组成部分受到了广泛关注,特别是在航空航天领域。轴承作为传动系统的关键部件,在确保设备正常运行方面发挥着至关重要的作用。航空轴承在高速旋转和复杂载荷条件下运行,其故障不仅可能导致设备停机,还可能引发安全事故。因此,这些轴承的健康状况对机械的安全正常运行至关重要。然而,由于其内部结构的复杂性和外部干扰,航空轴承的健康状态诊断是一项巨大挑战。因此,提高复杂环境下故障诊断精度已成为紧迫的研究挑战,吸引了众多研究者关注此问题。

    近年来,出现了各种传统故障诊断方法,主要依赖于时域、频域和时频域信号处理技术。然而,在实际工程应用中,这些方法的诊断效果往往受噪声干扰和工况变化的限制。为解决这些局限性,基于深度学习的方法逐渐成为研究热点。深度学习模型,如卷积神经网络(CNN)、生成对抗网络(GAN)和Transformer,在图像特征提取和故障模式识别方面展现出强大能力。例如,Zhang等人提出了基于深度卷积神经网络的故障诊断方法,显著提高了旋转机械故障的识别精度和抗噪性。Guo等人通过将迁移学习与深度CNN相结合实现了跨域故障诊断。Wang和Li利用GAN进行故障样本增强和特征提取,以解决小样本学习挑战。此外,Chen将改进的时频分析方法与CNN相结合,实现了滚动轴承故障的精细化诊断。Transformer和注意力机制也成为提高故障诊断精度的重要工具。Fu等人提出了具有分层窗口设计和窗口移位策略的Swin Transformer,展示了其在图像分类和故障诊断中的优异性能。Wu等人综述了深度学习在机械故障诊断中的应用,讨论了注意力机制在提取关键故障特征方面的优势。

    此外,许多研究还将传统信号处理方法与深度学习模型相结合,如使用小波变换或经验模态分解进行预处理,然后将数据输入CNN或其他深度模型进行故障诊断。然而,它们往往面临单通道信号信息不足的问题。针对此问题,一些研究采用格拉姆角差场(GADF)或递归图等技术将时间序列数据转换为图像,然后通过CNN进行特征提取。此外,多传感器数据融合技术增强了复杂工况下的诊断鲁棒性。为克服传统局部特征提取模型的局限性,研究者引入全局注意力机制以全面捕获信号中的隐式全局信息。同时,为更有效地捕获信号中的潜在时空特征,研究者探索通过GADF等成像方法将一维振动信号转换为二维图像,结合视觉Transformer模型(如Swin Transformer)进行特征提取,实现对复杂故障模式的准确诊断。在航空应用中,该方法对提高轴承故障诊断精度具有重要意义。

    除基于Transformer的模型外,还提出了一系列其他先进的数据驱动方法以应对日益复杂的工业诊断任务。例如,胶囊网络因其能够对特征的层次和空间关系进行建模而受到关注。为增强模型在不同工况下的泛化能力,研究者提出了深度对抗胶囊网络(DACN),引入对抗训练机制学习域不变特征,在跨域诊断任务中表现出色。此外,传感器感知胶囊网络(SACN)专注于融合多传感器数据进行剩余使用寿命(RUL)预测,通过胶囊dropout进行不确定性量化,实现对预测和不确定性的可解释归因,从而增强预后系统的鲁棒性和可信度。

    另一方面,多尺度网络成为从复杂振动信号中提取更丰富故障信息的研究热点。例如,多尺度跨通道注意力网络利用不同尺寸的并行卷积核捕获各种频率和时间尺度的特征,结合注意力机制放大关键特征的权重,有效提高了微弱故障的识别能力。类似地,级联多感受野学习网络(DC-CMLN)等新架构引入了结构化方法,集成级联多感受野学习模块、多尺度特征聚合和自适应滤波,分层提取多级和多感受野特征。该设计使模型能够逐步细化特征表示,增强其在非平稳工况下辨别细微故障特征的能力。

    为进一步推进该领域发展,研究者探索了专门架构以应对轴承故障诊断中固有的特定挑战。例如,Chen等人提出了一种抗噪模型,集成多尺度空间-通道重构卷积(ScConv)与混合注意力机制和四元数Transformer,通过在四元数域处理信号,展示了增强的特征提取和抗噪能力。同时,针对最优网络设计的挑战,另一项研究引入了层次灰狼优化器(HGWO)自动调整灵活残差神经网络的结构,利用并行注意力模块改进噪声和变载荷条件下的特征选择。类似地,为克服在不同工况或机器间迁移模型时遇到的显著域偏移问题,开发了三重域对抗神经网络。该方法利用三重分类器和自适应反向传播系数对齐源域和目标域的边缘分布和条件分布,从而提高模型的可迁移性和泛化能力。这些研究凸显了增强抗噪性、自动化架构设计和提高跨域适应性的关键趋势。

    然而,尽管这些方法在一定程度上提高了故障诊断的精度和鲁棒性,但它们在航空轴承中的应用仍面临若干挑战。首先,许多现有模型在噪声干扰和变工况下缺乏有效的特征表示能力,导致故障特征不明显或难以区分,从而影响诊断精度。同时,虽然CNN和Transformer等方法已应用于该问题,但它们在复杂环境中的性能仍然有限。其次,现有局部特征提取模型在捕获信号内全局结构依赖关系方面不足,阻碍了对隐式信息的全面理解。

    为克服这些局限性,本研究提出了一种GADF驱动的KAN-Swin Transformer双分支网络用于航空轴承故障诊断,以进一步提高多工况和高噪声环境下航空轴承中不明显的故障特征。该方法在以下方面具有独特优势:

    a) KAN模块与Swin Transformer模块(KAN-Swin Transformer)相结合,增强模型捕获关键信息的能力,克服传统局部信息提取的不足;

    b) 采用GADF方法将一维振动信号转换为二维图像,使KAN-Swin Transformer模型能够全面发挥其在多尺度特征提取方面的优势;

    c) 将全局注意力机制纳入KAN-Swin Transformer框架,进一步提高模型在复杂工况下捕获全局特征的能力,从而增强诊断鲁棒性。

    本文内容组织如下:第2节详细阐述GADF、CNN-Swin Transformer和GAM的理论基础;第3节介绍所提出的基于GADF驱动的KAN-Swin Transformer双分支网络故障诊断模型;第4节通过两个实验数据集上的诊断精度评估验证所提方法的有效性;第5节给出结论与展望。

    2 基础理论

    本节主要介绍GADF、CNN-Swin Transformer和GAM的理论基础,分别为智能诊断提供时频图信息提取、局部信息特征分层提取和全局特征提取的基础支持。

    2.1 格拉姆角差场

    将一维振动信号转换为同时包含时间和频率信息的二维时频图像,能够更全面地表示信号特征,揭示频率成分随时间的动态变化。格拉姆角场(GAF)是一种有效实现一维信号转换为二维数据矩阵的算法,它集成坐标变换和格拉姆矩阵,便于一维数据向二维数据的转换。该技术允许提取反映时域和频域动态变化的特征,同时保留信号的时间依赖性,从而有效捕获一维数据中固有的特征信息。GAF包含两种变体:GADF(格拉姆角差场)和GASF(格拉姆角和场)。其中,GADF相比GASF展现出更优的分类性能。因此,本研究采用GADF方法进行图像编码转换。GADF的实现过程如下:

    根据公式(1),将一维数据序列X中的值缩放到[-1,1]或[0,1]范围:

    转换为极坐标时,归一化数据序列由公式(2)描述:

    其中, 表示在极坐标中映射的角度,表示数据点的时间戳编码,N 是调节极坐标径向范围的常数因子,是从时间戳映射的半径。

    通过公式(3)中的角差公式,分析不同时间间隔的时间相关性,最终生成结果图像。该过程的可视化演示如图1所示。

    振动信号本质上是一维时间序列数据。因此,直接使用视觉模型(如CNN或Transformer)提取时空特征存在挑战。为解决此问题,广泛采用信号成像方法(如GADF)将一维信号转换为二维图像,同时保留信号的动态时间特性和频率特征。生成的GADF矩阵构成编码原始信号时间相关性和动态频率变化的二维图像。与传统时频方法(如频谱图或小波变换)相比,GADF保留全局结构信息并降低对噪声的敏感性,使其更适合基于深度学习的特征提取。

    图1 不同条件下轴承振动信号的GADF变换:(a)健康状态(周期性均匀性);(b)轻微内环故障(局部畸变);(c)严重内环故障(非线性模式);(d)外环故障(谐波集群)。

    2.2 CNN-Swin Transformer

    Swin Transformer是一种分层视觉Transformer,通过引入基于窗口移位的自注意力机制,在计算效率和全局特征建模能力之间取得平衡。与标准Transformer中的全局注意力计算不同,Swin Transformer将输入图像划分为不重叠的窗口(如4×4图像块),并在每个窗口内执行自注意力计算。为实现跨窗口信息交互,采用"窗口移位"策略在不同层次间交替使用常规窗口和移位窗口配置。

    对于故障诊断任务,Swin Transformer与CNN(CNN-ST)相结合,同时利用局部归纳偏置和全局上下文建模能力。输入的GADF图像首先通过卷积层提取低级特征(如边缘和纹理),随后Swin Transformer模块通过多头自注意力和窗口移位操作逐步捕获分层特征。这种混合架构集成了CNN的空间敏感性和Transformer的长程依赖建模能力,增强了复杂故障模式下的判别特征学习。

    a) 整体结构

    Transformer架构最初为自然语言处理(NLP)中的序列建模而开发,在各类NLP基准测试中展现出突破性性能。基于此成功,Dosovitskiy等人率先将Transformer原理应用于计算机视觉,提出了视觉Transformer(ViT),通过将图像块作为序列token处理,在ImageNet分类上取得了竞争性性能。然而,全局自注意力机制固有的二次计算复杂性对高分辨率视觉数据的可扩展性构成挑战。为缓解这一计算约束同时保留全局建模能力,Liu等人提出了Swin Transformer,引入了两项主要技术创新。

    首先,Swin Transformer融入了受卷积神经网络(CNN)启发的分层多尺度架构,建立了金字塔形特征表示结构。该设计用局部窗口注意力替代全局自注意力,自注意力操作被限制在不重叠的局部窗口(如7×7块)内。窗口策略可降低计算复杂度,实现对百万像素级图像的高效处理。其次,为促进跨窗口特征交互而不牺牲计算效率,架构在连续Transformer块之间实现了移位窗口分区方法。该机制通过连续的降采样阶段系统地扩展网络的有效感受野,逐步将局部特征集成到全局上下文中。

    Swin Transformer是一种通用主干网络,其分层设计与CNN相似,包含四个阶段。图2展示了Swin Transformer网络的整体框架。如图2所示,输入图像首先通过块分区划分为不重叠的块,随后进行线性嵌入以调整通道数。除阶段1外,每个后续阶段采用块合并降低特征图分辨率,其中2×2相邻块在第一个块合并层中拼接。各阶段的输出分辨率分别为H/4×W/4、H/8×W/8、H/16×W/16和H/32×W/32,特征图分辨率与典型CNN相同。因此,该架构使现有方法中的主干网络能够被重新用于各种视觉任务。

    Swin transformer结构

    bSwin Transformer块

    为实现有效建模,最初的改进之一是将图像划分为不重叠窗口(基于窗口的多头自注意力,W-MSA),并在局部窗口内计算自注意力以实现线性计算复杂度。虽然该方法降低了计算复杂度,但缺乏不同窗口之间的连接。为解决此局限性,引入移位窗口分区(SW-MSA)。通过应用移位窗口分区策略,可以建立非重叠窗口之间的关系,并显著扩展感受野。Swin Transformer块的具体框图如图3所示。

    通过使用图3所示的移位窗口划分方法,两个连续的Swin Transformer块的计算如公式(4):

    其中,分别表示块中(S)W-MSA模块和MLP模块的特征输出。W-MSA和SW-MSA分别是常规层和滑动窗口多头自注意力层。在计算自注意力时,Swin Transformer为每个头引入相对位置偏置,如公式(5)所示。

    其中, 、分别对应查询矩阵、键矩阵和值矩阵。参数表示查询向量的维度,表示可学习的相对位置偏置矩阵。

    图3 Swin Transformer模块

    2.3 全局注意力机制

    卷积神经网络(CNN)以其局部连接和权重共享机制为特征,已成为计算机视觉的基础架构,在特征提取和分层表示学习方面表现出色。注意力机制与CNN的集成通过自适应特征重新校准进一步增强了其判别能力。虽然大量实证证据证实了注意力增强CNN在图像分类基准测试中的有效性,但现有实现仍存在关键局限性。

    早期的通道注意力框架如SENet采用全局平均池化生成通道统计信息,但面临两个主要约束:

    (1)由于空间压缩过于简化,对任务无关特征的抑制不足;

    (2)计算开销随空间分辨率二次增长。后续改进如CBAM通过顺序的通道-空间压缩引入双注意力路径。

    然而,这种串行处理造成信息瓶颈,根据理论分析损失了38%的跨维度相关性。并行架构如BAM试图通过独立注意力分支解决此问题,但忽视了通道和空间域之间的固有几何关系,导致参数效率次优。然而,GAM模型增强了空间和通道维度之间的交互,能够跨三个维度捕获关键特征信息。图4展示了GAM模块的结构。

     

    图4 GAM模块结构图

    GAM旨在通过集成通道注意力和空间注意力子模块的双分支架构优化神经网络性能。通道注意力分支采用参数高效的多层感知机(MLP),具有顺序的压缩-扩展层,其中通过线性投影进行维度降低,结合非线性激活(ReLU)建立通道间依赖关系。这种分层变换通过放大语义显著通道同时抑制冗余信息,实现判别性特征重新校准。互补地,空间注意力子模块利用包含两个7×7卷积层(穿插批归一化)的卷积范式。该配置通过局部感受野处理系统建模特征图上的位置关系,从而增强对关键空间模式的敏感性。两个子模块通过残差连接保持与输入张量的维度一致性,确保联合优化期间稳定的梯度传播。

    双注意力组件的协同操作通过顺序的通道-空间重新校准实现全面特征细化。具体而言,通道加权优先处理判别性特征图,随后的空间掩码强调激活通道内的任务相关区域。这种分层注意力传播建立跨维度特征相互依赖性,有效将全局上下文线索聚合到紧凑的注意力图中。

    注意力机制通过强调关键特征和抑制无关信息显著改善模型性能。GAM进一步集成通道注意力模块和空间注意力模块:

    通道注意力:对于特征图,通道注意力权重通过全局平均池化(GAP)和多层感知机(MLP)计算,计算过程如公式(6):

    其中,σ 表示Sigmoid函数,GAP表示全局平均池化。

    空间注意力:空间注意力权重通过通道池化特征拼接和卷积层生成,如公式(7):


    最终输出特征通过输入特征与注意力权重的逐元素相乘获得,计算过程如公式(8):

    GAM使模型能够自适应地关注信息丰富的通道和显著的空间区域,增强噪声和变工况下的鲁棒性。

    3 所提方法

    在本节中,提出基于KAN模块的改进Swin Transformer(KAN-Swin Transformer),以在通过GADF进行时频信息特征提取的基础上增强故障诊断性能。随后,通过集成GADF和GAM引入新颖的模型框架。最后,提出基于GADF驱动的KAN-Swin Transformer双分支网络的航空轴承故障智能监测方法。

    3.1 所开发的KAN-Swin Transformer模块

    传统Swin Transformer模型通过基于窗口的多头自注意力(W-MSA)和移位窗口机制实现图像特征的全局建模。然而,其多层感知机(MLP)模块仍存在两个关键问题:

    a) MLP的全连接结构导致参数数量随特征维度二次增长,在训练数据有限时容易过拟合;

    b) 固定激活函数的线性组合限制了模型的非线性表示能力。

    为解决这些局限性,本节基于Kolmogorov-Arnold定理提出改进的KAN-Swin Transformer模块。通过用可学习的B样条基函数替代传统MLP,构建了更具表达力的非线性映射结构。

    根据Kolmogorov-Arnold定理,任何多元连续函数可分解为有限个一元函数的嵌套叠加,该定理可由公式(9)表示:

    其中,表示外层函数,表示内层一元函数。受此启发,Liu等人提出将基函数参数化为B样条曲线,如公式(10):

    其中,是基本样条函数,是可训练系数。

    通过将函数分解过程显式建模为神经网络层,形成Kolmogorov-Arnold网络(KAN)。在KAN中,每层定义为,p 和q 的值由层的输入和输出维度确定。KAN的结构如图5所示。在图5中,有n 个输入特征。输入层首先将这些特征引入隐藏层。对于每个输入,通过m 个内函数映射:,其中,m 是隐藏层节点数。隐藏层通过对输入特征应用样条函数生成中间表示,然后传递到输出层。隐藏层输出通过外函数组合产生最终输出:,其中,通常采用样条函数。

    图5 KAN网络结构图

    图6 KAN-Swin Transformer模块结构图

    在标准Swin Transformer块中,MLP模块负责对自注意力输出的特征进行非线性变换。然而,所提出的KAN-Swin Transformer模块将其替换为KAN结构。在标准Swin Transformer块的基础上,KAN-Swin Transformer模块通过引入Kolmogorov-Arnold网络(KAN)重构前馈层,形成双残差级联结构,如图6所示。其数学表述可分为两个特征变换阶段:

    窗口自注意力变换:保留原始窗口自注意力机制。输出特征通过LayerNorm归一化后输入KAN层,该过程由公式(11)表示:

    其中,表示基于窗口的多头自注意力,表示LayerNorm操作,是输入特征(B 为批量大小,为空间位置数,d 为特征维度)。

    KAN前馈变换:该过程由公式(12)表示,其中传统MLP被替换为两阶段KAN结构:

    其中,KAN(⋅) 表示改进的Kolmogorov-Arnold网络层。对于输入,单个KAN层输出的第个元素由公式(13)计算:

    其中,是连接第个输入到第个输出的边上可学习的激活函数。该函数分解为B样条分量和基函数分量,如公式(14)定义:

    其中,是输入张量的第个元素。是阶数为的第个B样条基函数,定义在个节点的网格上。是可学习的B样条系数,这些系数的集 合形成张量 。是固定的基激活函数(如SiLU)。是基函数的可学习权重,这些权重的集 合形成矩阵

    所提出的KAN模块由两个这样的KAN层堆叠而成,整体输出由公式(15)表示:

    窗口自注意力输出通过跳跃连接与输入相加以保留原始特征信息。KAN层输出相加形成级联残差结构。窗口自注意力捕获空间局部相关性,而KAN层通过基函数组合建模全局频域特征以实现互补效果。与原始Swin Transformer相比,双残差结构有效增强梯度传播,缓解深层网络的退化问题。

    在KAN网络中,引入动态网格调整策略以基于输入特征分布优化样条节点,计算过程如公式(16):

    其中,表示均匀网格,表示基于特征分位数计算的自适应网格,是混合系数。

    结合动态网格更新机制,残差连接结构确保有效的梯度反向传播,缓解深度网络训练中的梯度消失问题。与传统MLP的参数复杂度相比,KAN通过局部化B样条基函数将参数复杂度降低至

    与标准Swin Transformer中MLP块使用的4倍维度扩展策略以增强线性可分性不同,本研究中的KAN模块采用(800→64→800)的瓶颈架构。该设计的基本原理是,KAN的非线性表达能力主要源于其边上可学习的B样条激活函数,而非高维投影。每个B样条函数本身是一个强大的非线性逼近器。因此,瓶颈结构在显著降低参数数量的同时,迫使网络学习更紧凑且信息丰富的中间表示,从而在不牺牲性能的情况下提高参数效率。

    此外,为解决训练过程中激活分布的动态性问题,采用动态网格调整策略。B样条函数定义在有界域上,固定网格可能无法覆盖激活的演化范围。如公式(16)所示,该策略基于输入特征的分位数自适应更新网格节点,确保B样条在数据最密集区域进行细粒度建模。混合系数α 用于平滑此更新过程,增强训练稳定性。

    3.2 基于KAN-Swin Transformer的双分支网络

    所提出模型的整体架构如图7所示,包括GADF预处理模块和KAN-Swin Transformer与CNN-GAM的双分支网络。GADF通过格拉姆角差场将一维振动信号转换为二维时频图像,以捕获信号的周期性和瞬态冲击特性。KAN-Swin Transformer与GAM模型采用双分支并行架构,其中KAN-Swin Transformer分支通过分层窗口注意力提取局部纹理特征,而CNN-GAM分支通过多尺度卷积和全局注意力机制增强空间表示能力。因此,两个分支的特征经过跨模态融合以实现高精度的故障分类。完整模型结构如图7所示,各层的详细参数配置见表1

     

    图7 带有KAN-Swin Transformer的双分支网络结构

    所提模型各层参数

    a) 时频特征编码

    GADF模块通过格拉姆角差场将一维振动信号转换为二维时频图像。对于采样信号,GADF通过极坐标映射构建格拉姆矩阵,生成224×224尺寸的RGB图像。该过程将信号的时间依赖性计算转换为空间纹理特征,其中图像对角线表征时间序列的自相关,非对角元素用于表示跨时间步的相位关系,有效保留了信号的联合时频特性。

    b) 双分支特征提取

    模型采用双分支并行架构进行多尺度特征提取:

    (1) KAN-Swin Transformer作为主干网络:KAN-Swin Transformer的窗口注意力机制通过7×7局部窗口内的4头注意力计算空间相关性。同时,采用三阶B样条基函数,节点位置根据特征分布动态调整以实现动态KAN层。核心创新在于用KAN模块替代传统MLP层,通过自适应网格调整增强非线性拟合能力。

    (2) CNN-GAM分支:构建深度卷积网络,每层集成GAM模块。该模块采用双注意力机制:通道注意力通过全连接层学习通道权重,空间注意力通过7×7卷积核(空间金字塔池化)生成空间掩码,最终实现双重特征增强。

    c) 多模态特征融合

    来自KAN-Swin Transformer的局部特征和来自CNN-GAM的全局特征通过通道拼接融合为联合特征。自适应平均池化压缩空间维度同时保留最具判别性的通道响应。最终故障状态分类通过全连接层实现,采用交叉熵损失作为损失函数。该设计集成了KAN-Swin Transformer的长程依赖建模能力与CNN的局部特征提取优势,通过注意力驱动的特征增强提高复杂工况下的分类鲁棒性。

    3.3 航空轴承故障诊断流程图

    在上述部分,详细介绍了所提模型的理论。本节将所提方法应用于航空轴承故障诊断。基于所提模型的诊断流程图如图8所示,主要步骤如下:

    步骤1:信号采集与GADF图像生成

    通过通道传感器采集不同健康状态下轴承的振动信号。将原始时间序列数据分窗构建训练集和测试集。每个信号窗口通过GADF方法转换为二维图像,通过极坐标变换保留时间相关性特征。生成的GADF图像(尺寸224×224)进行归一化并以RGB格式存储为数据集,随后按7:2:1的比例划分为训练集、验证集和测试集。

    8 航空轴承故障诊断流程图

    步骤2:混合特征提取与所提模型训练

    将训练样本的GADF图像输入KAN-Swin Transformer和GAM架构进行拼接特征学习。模型通过双分支并行路径处理样本:

    KAN-Swin Transformer分支:在此过程中,通过移位窗口自注意力机制捕获局部空间依赖性,4×4不重叠图像块由分层结构处理,传统MLP被替换为KAN进行分类,使用动态B样条网格优化非线性特征映射,共同生成多尺度特征。

    CNN-GAM分支:通过堆叠Conv2D、ReLU和GAM注意力层的CNN主干网络提取全局纹理特征,其中GAM机制通过拼接通道注意力和空间注意力增强可区分特征。

    来自KAN-Swin Transformer分支的分层特征和来自CNN-GAM分支的高维全局特征通过通道拼接和自适应平均池化进行跨模态融合。

    步骤3:故障诊断与验证

    将测试样本的GADF图像输入训练好的模型进行健康状态识别。结合KAN-Swin Transformer的结构感知能力和CNN-GAM分支的纹理敏感性,KAN-Swin Transformer与GAM框架通过多级特征融合机制实现故障特征的协同提取。

    4 实验验证与对比分析

    在本节中,使用两个数据集验证所提方法的有效性。后续小节简要介绍每个数据集。所有实验在单台设备上进行,详细硬件规格列于表2。训练集、验证集和测试集按7:2:1划分。使用AdamW优化器,固定学习率3×10−4 ,交叉熵损失,批量大小32,训练100个epoch。所有实验在固定随机种子下运行以保证确定性和可重复性。

    表2 实验设备参数信息

    4.1 数据集描述

    1) 数据集A:哈尔滨工业大学航空轴承数据集

    哈尔滨工业大学航空轴承试验台如图9所示。该试验台主要由三部分组成:电机驱动系统、改装航空发动机和润滑系统。轴间轴承测试装置如图9(A)所示。在改装航空发动机中,拆除了原航空发动机原型机的转子叶片、燃烧室和部分辅助机匣,保留其核心部件——双转子结构,如图9(B)所示,包括低压(LP)压气机、高压(HP)压气机、低压涡轮和高压涡轮。双转子结构的关键部件包括机匣、轴间轴承和五个支承轴承。轴间轴承如图9(C)所示。如图9(B)所示,在轴间轴承中引入了三种人工故障。传感器1和2采集位移数据,传感器3、4、5和6采集加速度数据,如图9(A)所示。所有传感器以25,000Hz的采样频率工作。加速度计安装在航空发动机机匣上,因此故障特征在传递过程中发生畸变,连接结构的碰撞噪声也混入信号中。与传统轴承试验台数据相比,采集的振动信号更为复杂,对有效提取和识别故障特征构成挑战。此外,低压压气机(1000–5000r/min)和高压压气机(1200–6000r/min)的不同运行转速进一步增加了轴间轴承故障诊断的难度。

     

    航空发动机轴承试验台

    该轴承数据集包含三种故障状态和一种健康状态。轴承状态分别为:(A1)正常;(A2)外圈故障,尺寸0.5mm×0.5mm;(A3)轻微内圈故障,尺寸0.5mm×0.5mm;(A4)严重内圈故障,尺寸0.5mm×0.1mm。对于每种运行状态,从加速度计数据中选取2,500个不重叠样本构成数据集。每个样本以2,048个采样点进行分段。每个状态的样本按7:2:1划分为训练集、验证集和测试集。详情汇总于表3

    表3 哈尔滨工业大学数据集故障类型和数据划分

    2) 数据集B:都灵理工大学航空发动机轴承数据集

    都灵理工大学轴承试验台概览如图10所示。该试验台主要由高速主轴和由主轴驱动的副轴组成,如图10(A)所示。主轴轴承固定在高刚性单支撑上,安装在大型钢底板上。实验数据通过位于图10(B)中A1和A2点的三轴加速度计采集,测量轴承支承和主轴三个空间方向的加速度。具体而言,从故障轴承B1的支承和轴承B2的支承采集加速度数据。加速度计为三轴IEPE型,频率范围1–12,000Hz(幅度±5%,相位±10°),标称谐振频率55kHz,标称灵敏度1mV/ms⁻²。实验中使用的滚子轴承如图10(C)所示。B1和B3位置滚子轴承的外圈由相同的轴承座支承,内圈连接到设计转速高达35,000rpm的短空心轴上。

    本研究实验在51.2kHz采样频率和100Hz轴速(6,000rpm)无载荷条件下采集数据。数据集包含三种健康状态:内圈故障、滚子故障和正常。内圈故障和滚子故障各进一步细分为三个严重等级,共七种状态。每种故障类型包含六个通道的加速度数据,每通道512,000个数据点。对于每种运行工况,选取250个样本构成数据集。数据集B的划分方法与数据集A一致,详见表4

    图10试验台(A)总体视图 (B)两个加速度计的地方 (C)带有三个滚珠轴承的轴

    表4 都灵理工大学数据集故障类型和数据划分

    4.2 所提方法的实验结果

    所提方法在两个数据集上取得了不错的结果。本部分将详细阐述该方法的诊断结果分析和T-SNE可视化分析。

    1) 基于所提方法框架的诊断结果

    为严格评估所提模型的泛化能力和统计可靠性,采用10折分层交叉验证协议替代基于单次运行的评估。该协议确保每个样本恰好被用于测试一次,从而提供全面且无偏的性能评估。

    模型在两个数据集上表现出卓越的诊断性能。在数据集A上,达到99.80%±0.14%的平均精度。在更具挑战性的数据集B上,其特征为类别更多且每类样本更少,模型达到了98.06%±1.02%的高平均精度。这些结果及其他综合指标详见表5。高平均精度验证了模型的有效性,而低标准差突显了其在不同数据划分下的稳定性和鲁棒性。

    为进一步剖析模型的类别特定性能,通过累积所有10个测试折的预测生成聚合混淆矩阵(图11)。对于数据集A(图11a),模型展现出近乎完美的分类。极小的非对角元素显示,仅在极少数情况下模型将轻微内圈故障(A3)与严重内圈故障(A4)混淆。这证明了模型对故障严重度细微变化的高敏感性,这是预后能力的关键。对于数据集B(图11b),模型同样表现出色,成功区分了细粒度的故障类型和尺寸,如内圈故障(B1、B2、B3)和滚子故障(B4、B5、B6)。

    表5 所提模型在数据集A和B上的综合性能指标(10折交叉验证)

    图11所提模型在10折交叉验证下的聚合混淆矩阵。(a)数据集A的结果。(b)数据集B的结果。2) T-SNE可视化结果分析

    为进一步研究所提双分支网络在不同数据集上的内在特征学习机制,采用t-SNE可视化在三个关键阶段提取的特征:局部分支、全局分支和最终输出层。结果如图12所示。

    可视化揭示了清晰、渐进的特征学习过程。如图12(a)和(d)所示,KAN-Swin Transformer分支提取的局部特征表现出显著的类别重叠。这一结果与我们的设计预期一致,因为该分支旨在捕获GADF图像内的基本细粒度模式。这些特征原语类似于字母表中的字母;它们在孤立状态下缺乏完整的语义含义,可在多种故障类型间共享,因此本身不具备高度的类别判别性。

    相比之下,CNN-GAM分支提取的全局特征(如图12(b)和(e)所示)展现出显著改善的类别可分离性。这是因为CNN分支具有更大的感受野,并通过GAM模块增强,擅长识别宏观模式和周期性。例如,外圈故障的特征谐波簇表现为明显的重复纹理,这提供了与特定故障条件强相关的上下文线索,导致初始聚类的形成。

    最令人信服的结果如图12(c)和(f)所示,展示了特征融合后最终输出logits的分布。对于两个数据集,所有样本形成异常紧凑的类内簇,类间间隔大。从部分重叠到完全分离的戏剧性进展为双分支架构的协同效应提供了强有力的证据。模型学会在全局特征提供的上下文中解释局部原语。例如,反复出现在全局周期模式(全局特征)中的瞬态冲击(局部特征)共同形成指向特定故障类型和严重度的高度判别性"证据链"。最终,这种局部细节和全局视角的智能集成构建了高度鲁棒且可分离的最终特征表示,直观解释了模型出色的分类性能。

    图12 T-SNE视觉化显示与所提模型相对应的提取特征,分别对应于数据集A和B。(a)数据集A的局部特征,(b)数据集A的全局特征,(c)数据集A的输出层,(d)数据集B的局部特征,(e)数据集B的全局特征,(f)数据集B的输出层

    4.3 模型性能评估指标

    F1分数、G-mean和精度是用于评估所提模型性能的指标。F1分数是精确率和召回率的调和平均值,用于量化分类器的精确率和召回率能力。G-mean试图在保持各类别精度平衡的同时最大化每个类别的精度。对于多分类任务,它定义为召回率和特异性的乘积的平方根。F1分数、G-mean和精度的计算过程如公式所示:

    其中,表示类别i 的真阳性样本数;表示类别i 中正确分类的阴性样本数;表示类别i 中误分类的阳性样本数;表示类别i 中误分类的阴性样本数。当灵敏度和特异性越高时,G-mean越大。F1分数用于分析阳性样本的分类率。这些评估指标的值越大,对应分类性能越好。

    4.4 消融实验

    为进一步检验KAN、Swin Transformer和CNN-GAM模块在所提模型框架中的贡献,本小节进行消融实验。具体消融配置如下:

    1、 CNN-Transformer:无额外模块的基线Transformer模型,作为对比基准。

    2、 CNN-Swin Transformer:仅 incorporated Swin Transformer模块,评估其多尺度特征提取能力。

    3、 KAN-Swin Transformer:组合KAN和Swin Transformer模块,移除CNN-GAM模块,评估将KAN集成到Swin Transformer中的性能提升。

    4、 CNN-GAM:仅保留CNN-GAM模块,移除KAN和Swin Transformer,观察其对特征提取和模型性能的贡献。

    5、 Swin Transformer-GAM:组合Swin Transformer和CNN-GAM模块,排除KAN,评估其交互影响。

    6、 所提方法:通过GADF将一维信号转换为二维时频图像,集成KAN、Swin Transformer和CNN-GAM模块,测试其协同效应。

    两个数据集上的消融结果如表6所示,列出了两个数据集上的各种指标。首先,所提方法在所有指标上持续优于所有其他方法,证明了其优越性。其次,与Swin Transformer-GAM相比,由于KAN结构在分类决策过程中引入的推理能力,所提方法实现了识别率的显著提升。

    表6 两个数据集下的不同指标

     

    两个数据集上的消融结果如图13所示。通过消融实验观察到,KAN-Swin Transformer模块和CNN-GAM双分支架构的联合设计显著增强了模型性能。在KAN-Swin Transformer模块中,标准Swin Transformer的MLP层被基于B样条的KAN替代,通过动态激活函数调整和自适应网格机制增强对高频瞬态冲击特征的非线性建模能力。与传统Swin Transformer达到97.5%的精度相比,KAN-Swin Transformer在数据集A上达到98.10%的精度并减少了参数数量,验证了其效率和参数有效性。

    性能突破通过建立全局和局部特征互补性的双分支架构实现。在KAN-Swin Transformer分支中,通过移位窗口注意力机制捕获GADF图像中的长程依赖(如与格拉姆矩阵对角元素相关的周期性外圈故障模式)。同时,CNN-GAM分支旨在通过卷积空间注意力放大瞬态局部纹理(如数据集B中的滚子故障冲击),并通过通道注意力抑制噪声主导频段。这些互补特征通过通道拼接进行融合,使全局结构感知和局部判别模式能够协同集成。因此,所提框架在两个数据集上均达到100%的诊断精度,显著优于单模块配置。

    图13在数据集A和B下,六种不同诊断模型的准确率精确率和F1分数比较

    4.5 KAN模块超参数敏感性分析

    为确保所提模型的鲁棒性和可重复性,并为超参数选择提供明确依据,对Kolmogorov-Arnold网络(KAN)模块的关键参数进行敏感性分析。该分析涉及其实际应用的两个关键方面:有限B样条函数引入的逼近误差和动态网格调整策略的经验依据。

    1) B样条网格尺寸敏感性

    KAN的理论基础假设无限精细的函数分解,而实现采用有限数量的B样条基函数。该逼近的精细度由网格尺寸超参数控制,直接影响模型捕获复杂故障特征和避免逼近误差的能力。

    为量化此效应,通过系统改变网格尺寸同时保持所有其他训练参数不变进行消融研究。模型在网格尺寸为[3,5,8,10]下训练和评估。结果汇总于表7

    表7 网格尺寸超参数的敏感性分析

    分析表明,随着网格尺寸从3增加到5,模型性能显著提升,总体精度从0.9743上升至

    0.9992。这表明更精细的网格使KAN层能够更准确地逼近与故障数据相关的底层非线性函数,从而降低逼近误差。然而,进一步将网格尺寸增加到8和10导致性能显著下降。这种退化归因于模型复杂度的增加,在给定有限训练数据集的情况下,可能导致过拟合。因此,选择网格尺寸为5,以达到该故障诊断任务中逼近精度与模型泛化的最优平衡。

    2) 混合系数依据

    动态网格调整策略如公式(16)所述,采用混合系数α 平衡数据自适应网格和均匀网格的影响。为验证α 的选择并评估其对该故障诊断应用的影响,进行了第二项消融研究。

    基于最优网格尺寸5,评估模型在α 值为[0.0, 0.02, 0.05, 0.1, 0.2]下的性能。α 值0.0对应纯数据自适应网格。表8呈现的结果表明,虽然纯自适应网格(0.0)表现良好,但引入小的均匀分量(0.02)进一步提升性能至峰值。这表明均匀分量充当正则化器,改善模型对测试集中未见数据分布的泛化能力。随着α 超过此最优点,性能逐渐下降,表明过于均匀的网格在捕获故障数据的特定非均匀分布方面效果较差。

    表8 混合系数α 的敏感性分析

    该经验分析为选择0.02提供了坚实依据,该值也与原始KAN实现中的建议一致。这些发现证实所选超参数针对该任务进行了良好调优,确保高性能和方法论严谨性。

    4.6 双分支特征互补性的定量分析

    为验证双分支架构的核心假设——即KAN-Swin Transformer和CNN-GAM分支学习互补而非冗余的特征——采用中心核对齐(CKA)定量评估其特征表示的相似性。CKA通过计算两个特征空间Gram矩阵的归一化Hilbert-Schmidt独立性准则(HSIC)来衡量特征空间之间的相似性。其分数范围为0(完全不相似)到1(相同表示),较低值表示较强的互补性。

    在数据集A和数据集B的测试集上进行此分析。过程如下:对于每个输入样本,在拼接层之前提取KAN-Swin Transformer分支(FKAN−SwinTransformer  )和CNN-GAM分支(FCNN−GAM  )的输出特征张量。然后计算这两个展平特征矩阵之间的线性CKA相似性分数。分析得出数据集A的线性CKA相似性分数为0.304,数据集B为0.275。这些低分数显著接近0而非1,表明两个分支学习的特征表示相似度很低。该结果定量证实了假设:KAN-Swin Transformer分支和CNN-GAM分支确实捕获了不同且互补的信息。因此,简单的拼接特征融合方法被证明是集成这两组不同特征的有效方法,它们协同贡献了模型鲁棒且高精度的诊断能力。

    4.7 与其他先进方法的对比分析

    数据集B上的综合对比分析(详细结果见表9)证明了所提GADF驱动双分支网络的优越性能,达到98.06%的平均精度,以及高精确率、召回率和F1分数——超越所有其他评估模型。虽然基于CNN的架构如ResNet-50、EfficientNet和ConvNet,以及无卷积的MLP-Mixer展现出强大的诊断能力,精度范围为96.52%至97.15%,但其性能表明在捕获GADF图像中保留的长程依赖方面存在潜在局限性。类似地,Vision Transformer与CNN相比展现出竞争性但略低的结果,可能是由于其在建模细粒度局部模式方面的样本效率有限。CNN-Transformer混合模型改进了标准ViT,证实了结合局部和全局特征的价值。

    表9 不同模型在数据集B上的性能对比

    4.8 计算效率分析

    为阐明设计选择的实际意义,特别是在双分支架构背景下参数减少的说法,对模型的计算效率进行了定量分析。将所提模型与标准Swin-Tiny基线进行对比,后者作为典型高性能Transformer架构的参考。对比聚焦于三个关键指标:可训练参数总数(Parameters)、以Giga浮点运算衡量的计算复杂度(GFLOPs)和单样本推理延迟。所有测试在NVIDIA RTX 4090 GPU上进行以确保评估环境一致。

    表10 模型计算效率对比

    表10揭示的关键设计权衡表明,虽然所提模型实现了显著的40.8%参数减少,总参数仅16.27M(相比Swin-Tiny基线的27.50M),但这种效率以计算需求增加为代价。参数减少是直接用更高效的KAN模块替代标准MLP块的结果,使模型在存储方面更轻量化。然而,同时通过两个网络处理图像的双分支并行架构固有地增加了计算工作量。因此,所提模型的计算负载(8.39 GFLOPs)和推理延迟(18.75ms)约为单分支Swin-Tiny的两倍。

    所提模型的优势源于其集成的双分支设计,利用互补优势:首先,KAN-Swin Transformer分支通过窗口注意力和参数高效非线性建模有效捕获多尺度局部特征和瞬态特性;同时,CNN-GAM分支通过强调显著谐波结构同时抑制噪声,专门感知全局纹理和周期模式。最后,这两个路径的协同融合将局部细节与全局上下文信息集成,形成判别性特征表示,显著增强诊断精度,特别是在区分细微故障类型和严重度方面。

    总之,所提架构故意以更高计算成本换取更低参数数量。这使模型在存储或内存容量为主要约束的边缘设备部署方面具有特殊优势。然而,更高延迟对需要在计算受限硬件上进行实时推理的应用构成挑战。因此,边缘部署的可行性取决于目标应用的具体约束。

    4.9 噪声条件下的鲁棒性分析

    为严格验证模型在复杂噪声环境中的恢复能力,使用相同的10折交叉验证协议进行全面鲁棒性分析。对于每折,模型在干净训练数据上训练。随后,将相应测试集的一维振动信号叠加加性高斯白噪声,创建信噪比(SNR)为4dB、2dB、0dB、-2dB和-4dB的测试集。然后在这些噪声测试集上评估训练好的模型性能。

    表11 不同信噪比下的模型精度

    以均值±标准差形式报告的聚合结果汇总于表11。所提模型展现出显著的鲁棒性。随着噪声水平增加,性能优雅地退化。对于数据集A,即使在4dB的SNR下,平均精度仍高达99.20%±0.35%。在最严重的-4dB噪声条件下,模型仍保持97.10%±0.85%的可观精度。这一趋势证实了模型在显著噪声干扰下保持高性能的能力。

    这种优越的抗噪性源于双分支架构的协同作用。GADF变换有效保留核心信号模式,同时将噪声扩散为结构性较弱的图像纹理。KAN-Swin Transformer分支鲁棒地捕获局部结构依赖,而CNN-GAM分支利用注意力抑制噪声并放大显著全局模式。这种协作机制确保模型能够可靠地区分故障特征与背景噪声,验证了其适用于实际航空应用。

    4.10 不平衡数据集性能评估

    为评估所提框架对类别不平衡的鲁棒性——实际故障诊断中的常见挑战——从数据集B构建了一个不平衡子集。虽然原始数据集是平衡的,通过欠采样若干故障类别模拟更真实的场景。具体而言,类别B0、B1和B4保留100%样本量(多数类),类别B2和B5减少至50%(少数类),类别B3和B6减少至20%(稀有类)。

    然后使用10折分层交叉验证协议在该不平衡数据集上评估模型。为确保在倾斜分布下的公平评估,报告宏平均指标,无论样本量大小给予每个类别同等权重。聚合结果汇总于表12

    表12 数据集B不平衡子集上的性能

    表12的结果明确证明了模型对类别不平衡的卓越恢复能力。尽管若干类别的样本量显著减少,模型仍达到96.91%的平均精度。更重要的是,宏平均召回率和F1分数均超过95%,表明模型不仅在多数类上表现出色,在稀有类上同样表现优异。这种鲁棒性归因于双分支架构的协同特征学习。KAN-Swin Transformer和CNN-GAM分支擅长提取高度判别性和泛化性特征,使模型即使从有限数量的训练样本中也能识别独特的故障模式。这证实了所提模型适用于实际工业应用中平衡数据罕见的情况。

    4.11 跨域泛化分析

    为严格评估模型在变工况下的泛化能力——这对航空等实际部署领域至关重要——使用凯斯西储大学(CWRU)轴承数据集进行了一系列跨域实验。实验旨在模拟预训练模型部署在具有不同运行参数环境时遇到的"域偏移"现象。

    利用CWRU数据集中的四种不同载荷条件(HP)构建四种具有挑战性的跨域诊断任务(表13)。每项任务涉及10类分类问题(正常,加上3种故障类型各3种严重等级)。与先前实验一致,原始1D时间序列信号被分段并使用格拉姆角差场(GADF)技术转换为224×224图像作为模型输入。

    表13 CWRU跨域诊断任务定义

    所提模型在四项跨域任务上的诊断性能汇总于表14。结果报告为五次独立运行的均值和标准差,以确保统计可靠性。

    表14 CWRU数据集上的跨域诊断性能

    结果明确表明,如预期,当面临域偏移时模型精度相比单域场景下的近乎完美分数有所下降。然而,模型展现出显著的恢复能力。即使在最具挑战性的任务T2(1HP→3HP)和T4(0HP→3HP)中,代表载荷和组合载荷/转速的显著变化,模型仍保持远高于90%的精度。随着源域和目标域之间差异的增加,性能优雅地退化,而非灾难性失效,这突显了模型固有的鲁棒性。

    模型强大的跨域泛化性能可直接归因于其独特的双分支架构:KAN-Swin Transformer分支提取局部域不变特征,而CNN-GAM分支自适应地建模全局上下文。它们的融合使模型在域偏移下仍能保持鲁棒性能,确认了其在变化运行条件下的实际潜力。

    五 结论

    针对航空轴承诊断中微弱故障特征和复杂工况的挑战,本文提出了GADF驱动的KAN-Swin Transformer诊断框架,集成多模态特征增强和注意力机制,提高了航空轴承故障数据集的故障识别率。

    a) KAN-Swin Transformer模块的创新:用可学习的B样条基函数的KAN替代传统MLP,将KAN集成到Swin Transformer中。结合动态网格调整策略,增强非线性表示能力同时减少参数数量。双残差级联结构有效建模局部空间依赖和全局频域特征,实现轻微与严重内圈故障的准确区分。

    b) GADF时频特征编码的优势:通过GADF极坐标变换将瞬态冲击和周期特性编码为判别性纹理模式。结合KAN-Swin Transformer双分支网络,在变速条件下实现多样故障的100%识别率。

    c) KAN-Swin Transformer双分支网络的协同效应:通过跨模态特征拼接和自适应池化,结合KAN-Swin Transformer的局部结构感知与CNN-GAM的全局纹理敏感性。在两个航空轴承数据集上达到100%的分类精度,显著优于基线方法。

    虽然所提方法在两个航空轴承数据集上取得了优异性能,但仍存在若干局限值得未来工作进一步研究

    计算复杂度和边缘部署可行性:设计的关键方面涉及参数数量和计算负载之间的权衡。虽然用KAN模块替代标准MLP显著减少了Swin Transformer分支的参数,使总模型大小降至16.27M参数(相比标准Swin-Tiny的27.50M),但双分支并行架构固有地增加了计算需求。分析显示模型需要8.39 GFLOPs,推理延迟为18.75ms,高于Swin-Tiny基线的4.37 GFLOPs和8.54ms延迟。这对航空应用中常见的资源受限嵌入式系统或边缘设备的实时部署构成挑战。未来工作将专注于模型轻量化技术——如知识蒸馏、结构化网络剪枝和量化——以开发在保持高精度的同时满足机载计算严格预算的高效模型版本。

    数据多样性和真实世界条件泛化:本研究的验证基于两个实验室数据集。尽管我们在CWRU数据集上的跨域实验证明了模型对可变负载的鲁棒性,但真实的航空环境具有更复杂的多因素同时变化(如转速、负载和温度),这些因素会导致显著的域偏移。此外,现有数据集缺乏执行“留一轴承验证”协议所需的元数据,而该协议是评估模型对全新部件泛化能力的一种可靠方法。未来的研究应优先在更多样化、真实的现场数据以及按单个部件明确标注的数据集上验证模型性能,以便严格评估其在部件层面的泛化能力。同时,探索先进的迁移学习和域适应方法对于缩小实验室训练模型与实际现场应用之间的差距也至关重要。

    扩展到多源数据融合:本研究仅利用振动信号进行故障诊断。在实际的航空健康监测中,融合多源信息(例如温度、声发射和油液分析数据)可以通过提供更全面的设备健康状态视图,显著提升诊断的准确性和可靠性。未来一个很有前景的研究方向是将我们的双分支框架扩展为多模态架构,使其能够有效整合这些异构数据流,从而构建一个更鲁棒、更全面的诊断系统。

    编辑:李正平
    校核:陈凯歌、赵栓栓、曹希铭、赵学功、白亮、任超、陈宇航、Tina、王金、Kira、赵诚、肖鑫鑫、张优
    该文资料搜集自网络,仅用作学术分享,不做商业用途,若侵权,后台联系小编进行删除
    来源:故障诊断与python学习
    ACT振动碰撞非线性燃烧化学通用航空航天ANSA理论电机传动机器人数字孪生
    著作权归作者所有,欢迎分享,未经许可,不得转载
    首次发布时间:2026-05-07
    最近编辑:3月前
    故障诊断与python学习
    硕士 签名征集中
    获赞 87粉丝 152文章 328课程 0
    点赞
    收藏
    作者推荐

    故障诊断大模型 | BearLLM :基于统一振动信号表示的先验知识增强轴承健康管理框架

    现有的健康管理方法多局限于有限的工况条件,并且通常只能执行单一的健康管理任务,难以满足复杂工业场景的需求。本期推荐论文:BearLLM: A Prior Knowledge-Enhanced Bearing Health Management Framework with Unified Vibration Signal Representation,由中国科学院沈阳自动化研究所智能检测与装备研究室的科研团队发表在人工智能领域国际会议AAAI 2025,该项工作构建了首个多模态轴承健康管理数据集(MBHM)。该数据集融合机械振动信号与健康语料,覆盖数百种工况,显著提升了数据的复杂性与现实代表性。在此基础上,提出 BearLLM 框架:基于工业大模型,通过频域差异分析提升诊断精度,并将振动信号与语义对齐,实现了多种任务的统一自然语言响应。实验结果表明,这一框架在数百种复杂工况条件下表现出了领先的性能。论文基本信息论文题目:BearLLM: A Prior Knowledge-Enhanced Bearing Health Management Framework with Unified Vibration Signal Representation论文日期:2025论文链接:https://arxiv.org/abs/2408.11281数据集:https://hf-mirror.com/datasets/SIA-IDE/MBHM作者:Haotian Peng(1, 2, 3, 4*), Jiawei Liu(1, 2, 3*), Jinsong Du(1, 2 ,3), Jie Gao(1, 2, 3†), Wei Wang(1, 2, 3†)机构:1 Shenyang Institute of Automation, Chinese Academy of Sciences2 Liaoning Liaohe Laboratory 3 Key Laboratory on Intelligent Detection and Equipment Technology of Liaoning Province4 University of Chinese Academy of Sciences作者邮箱:{penghaotian, liujiawei, jsdu, gaojie, wangwei2}@sia.cn作者简介:高洁,中国科学院沈阳自动化研究所副研究员,主要从事信号检测,雷达信号处理的研究与开发工作。目录摘要1 引言2 相关工作3 多模态轴承健康管理数据集4 方法 4.1 基于先验知识的振动信号统一表示方法 4.2 特征抽取 4.3 特征对齐5 实验 5.1 实验设置 5.2 与故障诊断方法的比较 5.3 消融实验与泛化 5.4 用户研究6 结论摘要我们提出了一种基于大型语言模型(BearLLM)的轴承健康管理框架。BearLLM是一种新型多模态模型,通过处理用户提示和振动信号,将多个轴承相关任务统一整合。具体而言,我们引入了先验知识增强的统一振动信号表示方法, 以应对多数据集中的不同工况。该方法包含三个关键步骤:根据传感器采样率自适应采样振动信号、通过频域统一输入维度、 以及使用无故障参考信号作为辅助输入。为从振动信号中提取特征,我们首先训练故障分类网络,将提取的特征转换并对齐为词嵌入,最终将这些特征与文本嵌入拼接后输入语言模型。为评估该方法的性能,我们构建了首个大规模多模态轴承健康管理(MBHM)数据集,包含配对的振动信号和文本描述。通过统一的振动信号表示方法,BearLLM仅需一组预训练权重,便在九个公开可用的故障诊断基准测试中取得顶尖表现,超越了专为单一数据集设计的特定方法。我们提供数据集、模型及代码, 旨在激励未来研究开发更强大的工业多模态模型。1 引言轴承是机械旋转设备的核心部件,但由于复杂的运行和环境条件,其故障率较高[40] 。轴承健康管理(如异常检测、故障诊断和维护建议)在工业安全生产中具有重大实际意义 ,可减少经济损失和维护成本[32,44,35]。当前轴承健康管理框架依赖于为不同工况和任务设计专门方法,如图1(a)所示。为将特定方法应用于复杂的真实工业场景,领域适应与泛化技术已引发广泛关注。领域适应技术通过降低领域偏移或差异,使在一个源领域训练的模型能够在不同但相关的目标领域中表现良好[43,46] ,但当源域和目标域类别不一致时(例如从具有四种故障类型的工况C1 过渡到具有五种类型的C 2 ),其准确性会降低。领域泛化旨在提取领域不变特征以提升未见领域上的性能[19,47,4] ,但通常受限于差异较小的有限工况数量,例如[5,22]中少于十个工况。这些纯数据驱动的方法往往难以在高准确性和强泛化能力之间取得最佳平衡,从而影响故障诊断效果。本文提出了一种增强先验知识的轴承大语言模型(BearLLM),如图1(b)所示,该模型能够整合来自多个数据集的数百种不同工况下的轴承健康管理任务。为应对多样化工况,我们创新性地引入了增强先验知识的统一振动信号表示方法。与多数采用固定长度输入片段的故障诊断方法不同,我们采用可变长度但固定时长的振动信号采样片段。这些时长一致的片段经频域转换后进行对齐处理。我们进一步利用无故障参考信号作为先验输入,从而省去了针对不同轴承类型进行复杂机构分析的步骤[47]。 图1:现有轴承健康管理框架[3,28]与我们提出方法的对比。我们的BearLLM替代了针对不同条件和任务设计定制化方法的复杂操作。具体而言 , 我们首先设计一个故障分类网络(FCN),基于差异特征提取故障特征。通过分析查询信号段与无故障参考信号段之间的频率成分差异,这种基于频率的新型特征提取范式在轴承故障诊断中展现出更优的性能(即更快的收敛速度和更高的准确率) ,并实现了更强的泛化能力,相较以往直接从振动信号中提取故障特征的方法更具优势。提取的特征经过转换和对齐后生成词嵌入,随后与用户文本嵌入结合作为大语言模型(LLM) 的输入。为评估该方法的性能,我们构建了首个大规模多模态轴承健康管理(MBHM)数据集,包含配对的振动信号和文本描述。尽管九个公开数据集的振动信号分布存在显著差异,但采用预训练权重的BearLLM通过统一的振动信号表征,取得了与当前最先进方法相当的性能,甚至超越了针对单一数据集设计的专用方法。本文的主要贡献总结如下:• 我们提出一种新型轴承多模态大语言模型,通过比对振动信号与文本提示,实现多项轴承健康管理任务的统一。• 我们提出一种基于先验知识增强的统一振动信号表示方法,以处理来自多个数据集的多种工况。• 我们构建了首个面向轴承健康管理(MBHM) 的大型多模态数据集,包含振动信号及其对应的文本描述。• 实验结果表明,我们的BearLLM在九个公开基准测试中均优于当前最先进的故障诊断方法。2 相关工作多工况: 由于测试设备、传感器和环境的差异导致采集信号的异质性,使得从多个数据集在不同工况下进行故障诊断具有挑战性,难以获得统一特征[41] 。现有领域适应方法[6,38,25,14] 通常在已知工况(源域) 下训练模型 , 随后将知识迁移至未知工况( 目标域) 。然而这些方法在实践中仍需针对每个工况进行单独迁移微调,限制了其跨场景泛化能力。领域泛化方法通过多工况训练, 旨在通过网络架构和损失函数的设计使不同域的特征分布对齐[15,48,12] 。但这些方法往往依赖复杂的数据预处理和增强技术来帮助模型从振动信号中学习故障特征。多任务: 数据驱动的机械健康管理已获得显著发展[37] 。健康管理的概念通常涉及多项任务[29,49] ,包括异常检测 、故障诊断 、性能退化预测 、维护决策等。LLMs如ChatGPT-4[30] 在广泛任务中展现出卓越能力 。 LLaMA 3[27]和Qwen 2[1]等开源基础模型的出现,进一步赋能了各学科研究人员将这些模型整合到自身应用中。在航空领域,Liu等人[23] 应用广义线性模型实现多项任务,包括航空发动机装配指导与装配误差识别。在石油工业中,Eckroth等人[9] 设计了一种基于大语言模型(LLM)和知识图谱的问答系统,能够检索地层数据和地质年代测定等功能 。然而,利用LLMs整合多项任务进行轴承健康管理的研究仍较为有限[20]。3 多模态轴承健康管理数据集尽管表1中包含多个轴承相关数据集,但这些数据集通常仅采集单一测试装置的振动信号,工况条件有限,且缺乏用于训练语言模型(LLM) 的对应文本描述。为此,我们构建了一个大规模的公开多模态轴承健康管理数据集(MBHM)。 表1:不同数据集的对比。我们的 MBHM 数据集包含最多的工况、最完整的故障类型以及最长的文本提示/响应配对时间。该 MBHM 包含135,516对振动信号片段与故障类型,以及542,064对文本提示与响应,每个样本如图3所示,包含振动信号、故障标签、运行状态ID 、用户提示及文本响应 , 即 。我们的数据集包含从九个公开数据集收集的262种工作状态 , 即 CWRU [2] 、 DIRG [7] 、HIT[11] 、IMS[33] 、 JNU [16] 、JUST[34] 、 MFPT [10] 、PU[18] 、 XJTU [39] 。针对每个振动信号,我们设计了四项任务:通过ChatGPT[30]生成文本响应进行异常检测、故障诊断、维护建议及潜在风险分析。数据集构建的详细方法见附录A.3 。我们的 MBHM 数据集包含以下特征:• 多模态 : 每个振动信号均配有四个文本提示与响应,支持多模态多任务模型的训练与开发。 图2:我们提出的BearLLM架构。给定查询振动信号片段 和用户指令 作为输入,模型从数据库中检索出工况相似的无故障振动信号片段 作为参考。通过 DCN 将两个振动信号转换为统一表示。特征编码器识别两个信号之间的故障相关残差。对齐层将这些特征转换为词嵌入 。最后,利用LLM结合用户文本嵌入 生成多任务自然语言响应,其中 表示编码文本嵌入的长度。 图3:本 MBHM 数据集的示例案例 ,包含振动信号 、故障标签 、工作状态 、具体任务提示文本 以及响应文本 。• 多工况: 我们的数据集覆盖更广泛的工作场景,能更精准地模拟真实工业生产环境。4 方法本节提出BearLLM——一种整合多种轴承相关任务的新型多模态模型。为应对不同数据集中的多样化工况,我们在第4. 1节引入了基于先验知识的统一振动信号表征方法。该统一振动信号被输入故障分类网络进行特征提取(第4.2节) ,随后将提取的特征转换为词嵌入并进行对齐,最终与文本嵌入拼接后作为输入送入大语言模型(LLM)(第4.3节)。4.1 基于先验知识的振动信号统一表示方法BearLLM旨在管理数百种工况下的多种轴承相关任务。其核心在于构建统一的振动信号表示方法,包括根据传感器采样率自适应采样振动信号片段、通过频域整合统一输入维度, 以及利用无故障参考信号计算残余量作为辅助输入以提高数据利用效率。自适应采样 为监测不同工况和工业场景下的各类机械设备 ,振动传感器被部署为不同名称和采样率 。然而,大多数故障诊断方法[48,8]使用时域中固定长度的信号段作为输入,其中输入的故障频率分量偏离其原始固有值并随采样率变化 , 阻碍了准确的故障诊断。我们不采用固定长度信号段采样,而是利用传感器采样率的先验知识,对振动信号进行自适应采样,生成可变长度但固定时长的信号段。我们通过公式1从原始信号 中提取第 个查询信号段 ,并控制 的长度。 其中 表示传感器的采样率。频域输入对齐 自适应采样后,每个查询段( )具有相等的持续时间,且 X_v 的频率被对齐。然而, 由于采样率不同导致 长度变化,会产生不同数量的频率分量,使其不适合输入网络。我们设计了一种离散余弦归一化(DCN),该方法通过离散余弦变换(DCT)将振动信号转换至频域,使用填充或裁剪统一 个频率分量,并通过归一化 对振幅进行标准化。归一化频率表示 通过以下方式获得 采样率低于 的信号会被零填充,而超过 的信号则会被截断。为平衡计算资源与故障分类精度,我们通过经验设定 (更多细节见表3)。为增强训练稳定性,将频率序列的幅度归一化至[−1,1]范围内, 其中 为缩放因子,通过统计分析 MBHM 数据集确定为0.01。无故障参考信号为消除不同输入在各种运行条件下的分布差异,我们引入无故障信号作为参考信号。1) 在实际使用中,当设备正常运行时(例如工厂验收或维护后),可采集并保存参考信号段 ;2) 在 MBHM数据集上进行训练时, 的获得通过 这表明当我们的 MBHM 数据集中的信号( )无故障(即 )且与 具有相同工况(即 )时,会选择 。我们将查询频率信号( )、无故障频率信号( )和残余频率信号( )作为统一的振动信号表示进行组合, 4.2 特征抽取为提取振动信号的特征,我们提出一个故障诊断网络(FCN),该网络包含由 参数化的特征编码器和由 参数化的线性分类层,如图4所示。我们通过三个独立的卷积层(采用大核[45]且无权重共享)从统一振动信号表示( )中提取特征。随后通过三个多尺度通道注意力模块(MSCAB)对特征进行变换,其中多尺度特征通过通道注意力模块(CAM)[42]进行融合。最后使用两个线性层进行故障分类。我们的 FCN 以统一表示( )作为输入,并输出故障类型( )。 的形状为 , 表示故障类型数量。我们使用交叉熵损失进行训练,以故障标签 作为真实标签。训练过程如算法1所述。随后将 FCN 训练良好的特征编码器权重 ( )用于Bear- LLM并冻结(见图2),同时使用 FCN 分类器权重 ( )初始化对齐层。 图4:我们提出的 FCN 结构。在特征编码器中,首先使用三个宽卷积层提取主特征,随后通过三个 MSCAB块对多尺度特征进行转换和融合, 以实现故障分类。预训练 FCN 用于初始化BearLLM的特征提取器和对齐层。4.3 特征对齐我们提出一个特征对齐层,将振动特征嵌入词嵌入中,该 MLP 由三个线性层(即 , , )组成。对齐层的权重为 ,其中 是 & (即 FCN 中的两个线性分类层)的权重, 是 的权重。我们使用 将 的输出 转换为词嵌入 ,即, 其中 表示转换后的标记长度, 是LLM的隐藏层大小。 的权重 通过所有故障类别的文本描述 进行初始化 其中T代表文本域。E和T分别表示预训练LLM的嵌入层和分词器。通过使用分词器T和嵌入层E ,我们从 生成词嵌入,随后将其重塑为权重矩阵 。关于权重初始化的更多细节,请参见附录C.3。我们使用预训练的Qwen2-1.5B[1]作为由 参数化的LLM,实现了基本的人机交互。然而,其对特定领域的知识掌握和生成质量仍有待提升。我们采用现有的LoRA技术[13]和通用 PEFT[26] ,对LLM和我们提出的对齐层进行同步微调,具体细节详见算法1。 5 实验5.1 实验设置我们使用PyTorch[31]实现了所提出的方法。预训练和微调均在单个Nvidia RTX 4090 GPU上完成。在预训练、对比试验和消融实验中,我们采用AdamW[24]作为优化器,批量大小设为1024,训练最多50个epoch。微调使用现有PEFT[26]库完成。为评估本方法的有效性,我们提供了故障诊断、关键部件消融及语言响应质量评估的定量对比结果。为解决标签泄露问题,我们将9个公开数据集按7:2:1比例进行分割。MBHM 数据集的训练集由各子数据集的训练集拼接而成,确保与对应测试集无重叠。其他任务(包括异常检测、维护建议及潜在风险分析)详见附录D。5.2 与故障诊断方法的比较我们将BearLLM与以下故障诊断方法进行了比较。BearFM[17]和MagNet[36]旨在诊断交叉作业条件下的故障,而 WDCNN [45] 、 TCNN [6]和 QCNN [21]则针对特定作业条件设计。这些方法的详细描述可参见附录B 。为确保公平比较,我们在第5. 1节中重新实现了这些方法并在相同设置下进行测试。结果展示于表2。 表2:与现有方法的准确率对比。“DCN”表示在原有方法基础上添加 DCN ,“FCN” 则表示用 FCN 替换原有方法的网络结构,“(+108%)”代表从48.01%提升至100%的相对改进。我们的方法不仅在 MBHM 数据集上超越了SOTA 的准确率,其结果还优于专为单一数据集训练的模型。 DCN 和 FCN 组件在多种场景中均展现出广泛适用性。与BearingFM[17]相比,我们的 DCN 在相同 FCN 下实现了更高的精度(见图5(a))。这种提升的原因可能是BearingFM在包络谱 FFT 后使用绝对值。该方法仅捕捉振幅而忽略关键相位信息。相比之下,DCN 利用实数计算,有助于减少潜在信息损失,且运行时间不到比较方法的20%。将 DCN 与MagNet[36]结合,并利用对齐数据进行融合增强,显著提升了在分布差异显著数据集上的性能。如表2所示 ,三种缺乏数据增强或对齐技术的方法(WDCNN 、 TCNN 、 QCNN)在某些特定数据集上表现出较高准确率。然而,当在 MBHM 数据集上训练时,它们处理大规模分布差异的能力受到限制。引入DCN 技术可缓解 QCNN [21]中明显的过拟合现象,从而显著提升验证准确率(见图5(b))。类似地, 同时对WDCNN [45]和 TCNN [6]添加 DCN 也提高了准确率。在所有测试方法中,我们提出的方法不仅达到最高准确率,收敛速度也最快(如图5(c))所示,在 MBHM 数据集上仅需20个epoch即可收敛)。 图5:不同模型训练过程中的准确率与学习率变化趋势。(a)用 FCN 替换BearingFM网络后,准确率提升且收敛速度加快。(b)将 DCN 纳入 QCNN 显著缓解了过拟合问题。(c)我们提出的方法展现出最快的收敛速度和最高的准确率。5.3 消融实验与泛化测试在 DCN 中使用了四种不同的 设置(参见等式2),如表3所示。 由于振动信息主要存在于低频范围内,截断不太可能显著影响准确性。通过增加频率分量的数量,可以最小化截断引起的失真,从而提高MBHM数据集的精度;然而,这也增加了 FCN 中的参数和计算量。为了在准确性和性能之间取得平衡,我们选择24,000作为 。 表3:不同nf 设置下 FCN 的参数数量、浮点运算次数(FLOP)及在 MBHM 数据集上的准确率对比。为验证所提方法中各组件的有效性,我们开展了消融实验。通过直接使用原始时域振动信号(固定长度片段)作为输入,并分别及联合移除无故障通道与残余通道,对性能进行了评估。 表4的实验结果表明,仅使用时域信号时会出现显著的准确率和泛化能力下降,这进一步凸显了DCN 方法的有效性。通过应用t-SNE算法,我们对比了包含故障通道与无故障通道的输出可视化效果。图6(b)中的蓝色方框显示, 同一数据集的信号片段在特征空间中呈现高度聚类,这表明模型首先识别数据集类型,再进行故障分类细化。与之相反,如图6(a)所示,我们提出的方法有效缩小了数据集间的差异。该模型通过捕捉查询信号片段与无故障信号片段之间,创建在不同工况下实现统一的特征表示,并提升泛化能力。 表4:展示了不同消融设置的准确性和泛化能力比较。 图6:t-SNE可视化输出特征。(a)我们的方法显示出明显的类间可分离性。(b)去除无故障通道和残余通道后,同一数据集中的信号呈现相似特征。我们通过零样本场景评估所提方法的泛化能力。在公开数据集中,JUST[34]和IMS[33]是规模最大的数据集。我们使用仅占 MBHM 训练数据35%的 MBHM(不含JUST 和IMS)数据集进行训练 ,并分别在JUST 和IMS数据集上进行零样本测试。在JUST数据集上,我们的方法无需任何微调即可达到90.22%的准确率。相比之下,未使用无故障通道和残差通道的方法准确率仅为87.54%。图7(a,b)展示了IMS数据集[33]在零样本测试中,配置故障通道与保留残余通道时的混淆矩阵对比。由于IMS 数据集存在不平衡性(多数样本为无故障通道),整体准确率从98.52%略微下降至97.81%。但未配置两个辅助通道的方法存在严重低估故障严重程度的倾向:例如,61%的严重外环故障被误判为中度故障,23%的中度外环故障被误判为轻微故障。CWRU [2]和 XJTU [39]数据集是唯一包含全部十种断层类型的数据集。为验证构建统一表征的潜力,我们分别在 MBHM(无 CWRU)和 MBHM(无CWRU & XJTU)数据集上训练模型。 随后在常用 CWRU 数据集上进行零样本测试,混淆矩阵结果如图7(c,d)所示。我们的方法在未训练的 CWRU 数据集上分别达到90.26%和89. 14%的显著准确率,该结果甚至优于部分基于 CWRU 训练的方法,这表明了我们统一表示方法的普适性,且不依赖于任何特定的完整数据集进行训练。 图7:不同场景下零样本性能的混淆矩阵对比。(a)在 MBHM(无IMS&JUST)数据集训练并在IMS上测试的方法,展现出相对可靠的准确率。(b)在 MBHM(无IMS&JUST)数据集训练并在IMS上测试的无故障通道与残差通道方法,准确率较低且存在低估严重性的倾向。(c)在 MBHM(无 CWRU)数据集训练并在 CWRU 上测试的方法,验证了泛化能力。(d)在 MBHM(无 CWRU & XJTU)数据集训练并在 CWRU 上测试的方法,进一步证实了统一表征的泛化效果与有效性。5.4 用户研究表5汇总了四项不同任务的测试结果,用户在盲测中从 FCN 、未调优的BearLLM和微调后的BearLLM中选择最佳输出。值得注意的是,在简单任务中,选择故障代码输出的用户较少,而多数用户更倾向于自然语言输出。 图8展示了微调前后的输出示例。附录D提供了各任务的进一步对比数据。微调对简单异常检测任务的输出影响不显著。在故障诊断任务中,未进行微调的模型有时会遗漏故障严重程度信息,这一问题通过微调得到解决。对于两项更复杂的任务,微调模型生成了更准确、更详细的响应。我们的方法解决了非专家因系统复杂性而难以有效利用维护系统的挑战,降低了所需的专业知识门槛。 表5:用户研究投票结果 。任务A-D分别对应异常检测、故障诊断、维护建议及潜在风险分析。经过微调的BearLLM在所有任务中均获得最高支持率。 图8:BearLLM的输入与输出示例。振动信号和任务要求作为用户输入,生成相应的自然语言文本输出。经过微调的BearLLM表现出响应质量的提升。6 结论我们提出BearLLM ,这是一个创新的多模态轴承健康管理框架,首次尝试利用大语言模型(LLMs)整合异常检测、故障诊断、维护建议及潜在风险分析等多重轴承相关任务。为构建该统一框架,我们开发了适用于数百种工况的先验知识增强型振动信号表征方法,并构建了首个大规模多模态轴承健康管理(MBHM)数据集。在九个公开故障诊断数据集上的实验结果表明,Bear-LLM的性能超越了当前最先进的方法,甚至超过了专门针对单个数据集训练的模型。此外,我们设计的频域输入对齐和特征提取模块采用即插即用模式,显著提升了其他故障诊断模型的性能。我们希望这项工作能为未来构建更强大的工业多模态模型研究提供灵感。编辑:Kira校核:李正平、陈凯歌、赵栓栓、曹希铭、赵学功、白亮、任超、海洋、陈宇航、Tina、王金、赵诚、肖鑫鑫、张优该文资料搜集自网络,仅用作学术分享,不做商业用途,若侵权,后台联系小编进行删除来源:故障诊断与python学习

    未登录
    还没有评论
    课程
    培训
    服务
    行家
    VIP会员 学习计划 福利任务
    下载APP
    联系我们
    帮助与反馈