近日,北京交通大学史红梅教授研究团队与香港理工大学和兰州理工大学团队在中科院计算机科学一区期刊《Journal of Industrial Information Integration》(IF=11.6)上发表题为《Prior knowledge-embedded first-layer interpretable paradigm for rail transit vehicle human-computer collaboration fault monitoring》的论文,提出一种基于可解释学习与多视图学习的故障诊断新范式——首层可解释范式。该研究通过嵌入信号处理先验知识,构建轻量化且可解释的胶囊网络PIFCapsule,并通过信号处理正则化损失优化整个网络结构,显著提升轨道交通车辆(高速列车、重载货车轮对、地铁列车)行走部轴箱(轴端)轴承的故障识别能力。
论文题目:Prior knowledge-embedded first-layer interpretable paradigm for rail transit vehicle human–computer collaboration fault monitoring
论文期刊:Journal of Industrial Information Integration
论文日期:2026
论文链接:https://doi.org/10.1016/j.jii.2026.101068
作者:Chao He[a,b], Hongmei Shi [a,b ,∗], Jing-Xiao Liao [c], Bin Liu [d], Qiuhai Liu [a,b], Jianbo Li [a,b],Zujun Yu [a,b]
机构:
a State Key Laboratory of Advanced Rail Autonomous Operation, Beijing Jiaotong University, Beijing 100044, China
b School of Mechanical, Electronic and Control Engineering, Beijing Jiaotong University, Beijing 100044, China
c Department of Industrial and Systems Engineering, The Hong Kong Polytechnic University, Hung Hom 999077, Hong Kong Special Administrative Region
d School of Mechanical and Electronical Engineering, Lanzhou University of Technology, Lanzhou 730050, China
作者简介:
何超,1995年出生于淄博市。目前正在北京交通大学攻读载运工具与运用工程博士学位。主要研究方向为迁移学习和工业大数据。目前已撰写并发表SCI和EI论文8篇,其中ESI高被引论文4篇。TIM/MST杰出审稿人,个人主页:https://liguge.github.io/
摘要
1 引言
2 相关工作
2.1 基于物理的多视图信息的定义
2.2 故障诊断中的人机协同智能范式
2.3 由定制化制造引导的首层可解释瓶颈
2.4 故障诊断中的胶囊网络
2.5 基于物理的损失函数
2.6 基于物理的特征融合
3 提出的方法:PIFCapsule
3.1 PIFCapsule概述
3.2 具有信号处理先验知识的多重基于物理的可解释层
3.3 注意力融合路由机制
3.4 噪声阈值幅度比
3.5 损失函数
4 在轨道交通车辆轴承中的应用
4.1 数据集和任务描述
4.2 案例分析
轨道交通车辆承受着大载荷、高速度和恶劣环境的影响,易导致部件故障。首层可解释范式(FLIP)将人类先验知识嵌入智能设备,是受定制化制造和具身智能指导的智能范式之一。它由首层可解释模块、骨干网络和损失度量组成。然而,现有研究存在依赖单一来源信息、缺乏可解释骨干网络、无法进行特征融合等问题,因此难以处理多激励、耦合信号。为填补这一空白,本文提出了一种基于FLIP的单阶段多视图胶囊融合网络(PIFCapsule)。首先,设计了一个具有信号处理先验的第一层可解释模块,以实现参数自动优化,并突出不同信号处理算法产生的多视图特征之间的互补性。其次,采用可解释胶囊网络作为骨干网络。为解决信息融合效率低下和不足的问题,本文提出了一种高效的注意力融合路由(AFR),与传统的基于胶囊的网络相比,该路由将参数减少了约5.72倍,复杂度降低了约2.93倍。针对训练过程中缺乏基于物理的约束这一问题,本文提出了噪声阈值振幅比(NTAR)作为正则化项,通过抑制学习到的噪声来增强微弱的周期性瞬态脉冲。通过三个真实的轨道交通车辆数据集验证了该方法的有效性和可靠性:在仅使用10个样本的情况下,PIFCapsule的准确率比最先进的方法高出6.77%。鉴于其轻量化特性,该网络在智能边缘设备上的部署具有巨大潜力。代码可在https://github.com/liguge/PIFCapsule获取。
关键词:具身智能,多视图学习,首层可解释范式,注意力融合路由,噪声阈值幅度比,轨道交通车辆
铁路运输安全与日常工作和生产活动密切相关。本研究关注高速、重载货运和地铁列车的监测与维护技术。车辆的走行部是一个至关重要的子系统。轴承作为走行部的关键部件,直接影响安全和可靠性。然而,它们面临高载荷、高速度、强噪声和复杂运行条件等挑战,导致点蚀、剥落和断裂等失效模式。
具身智能(EI) 是实现轨道交通车辆智能运维的指导原则。EI将感知、认知和行动集成到制造系统中,实现设备上的"感知-认知-执行-反馈"闭环[1]。预测与健康管理(PHM) 平台也成为当前轨道交通车辆维护的标准设备。在PHM系统中,关键部件的故障预测和诊断是至关重要的环节。
在故障预测和诊断算法中,一些适用于普通旋转机械的算法未能达到令人满意的性能。尽管面临这些挑战,智能故障诊断(IFD) 利用先进的信号处理和数据驱动算法,能够实现精确的故障识别和定位,从而提高铁路运输的安全性和可靠性[2-5]。然而,现有算法缺乏明确的可解释性,未能融入人类先验知识。这对实现定制化制造和具身智能(CMEI)[1]提出了重大挑战。
具有人类先验知识的可解释IFD引起了广泛关注[13]。虽然计算机可以学习数据中的统计模式,但这是不可控的,可能无法与人类期望保持一致。内在可解释性旨在设计基于领域特定先验的透明且可理解的映射。因此,将人类先验知识嵌入系统,并通过可解释理论和物理定律约束优化过程[14]。
首层可解释范式(FLIP) 代表了智能设备的典型智能范式。它将信号处理先验知识嵌入深度模型,以解决复杂的工业问题。如图1所示,FLIP是一种简单而有效的方法。FLIP被定义为使用先验知识修改或替换首层权重,或在骨干网络前部添加可微分信号处理层以模拟信号处理操作的框架。
图1 首层可解释范式示意图
然而,根据时频不确定性原理(Gabor限制),时频分辨率难以充分表达弱故障特征。这是因为这些算法仅依赖于单一视图,这反映了信号的局部状态,容易受到信号失真和模糊性的影响。受多视图学习[18]启发,振动信号的特征可以从多种不同的信号处理技术进行描述,这些技术构成了原始信号的多个视图。显然,基于物理的多视图融合可以捕捉不同的特征,并为后续故障决策提供更可靠的依据[19,20]。
本文的主要贡献包括:
将多种散见于可解释故障诊断的多种方法(如基于小波、STFT、盲解卷积等的先验嵌入技术)系统性地总结并升华为一个统一的理论框架——首层可解释范式(First-Layer Interpretable Paradigm, FLIP)。该范式不仅清晰地刻画了以往研究的共同内核,更通过定义核心组件、设计原则和优化路径,为未来研究提供了可扩展的指导蓝图。
在人机协同指导下,提出了一种单阶段基于物理的多视图融合胶囊网络(PIFCapsule),涵盖三个信号处理赋能的首层设计、一个注意力融合路由机制、基于物理的正则化项。
将注意力路由融合机制引入CapsNet,显著减少了原始动态路由的参数数量,同时提高了泛化能力。
引入噪声阈值幅度比作为基于物理的正则化项,可以使用可微分软阈值模块抑制噪声,而不依赖于故障先验周期。
通过高速列车、重载货运列车和地铁列车走行部数据集的综合结果证明了其卓越性能。
2.1 基于物理的多视图信息的定义
多视图特征融合是一种通过利用来自多个视图或特征的互补信息来提高性能的方法[18,32]。对于基于物理的多视图信息的定义,不同的研究者可能有不同的看法。这些视图可以是同一数据集的不同特征。在本文中,不同的信号处理技术被视为不同的视图。
尽管这三种信号处理方法都针对振动信号,但它们强调不同的物理特性:小波层使用小波权重和时域卷积从时域视角获取时频谱;STFT层使用窗权重和频域乘法获取频域表示;BD层不需要预设滤波器参数,仅使用NTRA优化的权重获取时域表示。
尽管由先验知识引导的自适应滤波权重可以实现时间和频率分辨率之间的相对平衡,但仍无法解决Gabor限制。为进一步缓解这一限制,不同的信号处理方法关注不同的物理方面,然后通过胶囊融合网络实现全局和局部特征融合。融合的特征是三个不同的物理视图,超出了原始振动信号单独所能提供的内容。
2.2 故障诊断中的人机协同智能范式
在工业诊断领域,人机协作正在兴起,值得在循环具身智能制造的总体框架内重新审视。其中,智能设备的智能范式——包括预测与健康管理和人机协作等关键能力——作为定制化制造和具身智能的核心组成部分,为故障诊断提供系统支持。文献[33,34]主要在决策过程中添加人为干预。如果算法给出的故障置信度较低,人类需要基于其他指标和经验做出最终决策。Wen等人[35]引入了故障因果知识图谱,并使用大型语言模型实现人机协同决策。Li等人[36]也借鉴了这一思路,将可疑结果发送给人类进行二次判断。
上述方案仅在决策阶段引入人类知识以做出最终决策[19],而忽视了人类知识对计算机决策的指导作用。正如Kim所说[37],人类擅长从经验中发展先验知识,而机器擅长计算数据。因此,本文从不同角度解释人机协同诊断,将嵌入信号处理先验知识的可解释首层范式归类为典型的人机协作范式之一,并解决了FLIP的局限性。
2.3 由定制化制造引导的首层可解释瓶颈
提出的首层可解释范式属于更广泛的信号处理赋能技术类别。它使用信号处理修改和优化深度模型,从而增强可解释性。受此启发,WaveletKernelNet[15]将连续小波变换集成到卷积中。此后,关于小波核的研究引起了广泛关注[7,38,39]。SincNet[40]强调了首层模块对提取特征的重要性。基于物理的卷积神经网络(PCNN)[41]基于轴承速度和故障特征频率生成卷积核。然而,PCNN只能识别单一故障。M-PINet[42]结合多个PCNN分支进行多故障识别,但计算复杂度高。M-IPISincNet[43]利用带通滤波器和逆傅里叶变换设计卷积以提取多尺度信息,但仅依赖于单一的基于物理的信息源。PICNN[44]基于不同特征频率对应不同故障设计物理特征加权层。它为某个故障的特征频率分配更高的权重,并减少其他频率的权重以抵抗干扰。Liu等人[45]将有限脉冲响应滤波器视为核,将中心频率和带宽视为频率的多项式,开发了首层可解释模型[46]。乘法卷积网络(MCN)[47]由一系列乘法滤波核组成,从频谱样本中提取差分模式。时频网络[48]利用STFT、Chirplet和Morlet小波模拟时频变换,获取丰富的特征[49]。尽管随机卷积层[50]不强调可解释性,但它随机改变核大小以生成新数据并保留全局信息,同时提高样本多样性和模型泛化能力。包络谱神经网络[51]根据集成经验模态分解指导首层模块设计,提取物理特征。尽管上述方法取得了有希望的结果,但它们本质上受到不可靠的单信息源的限制,容易受到不确定性的影响。这种限制导致分析不完整,进而降低了模型的鲁棒性。
2.4 故障诊断中的胶囊网络
CapsNet在IFD中有广泛应用[52]。一些报告[53]使用谱图作为输入,并从事后解释中描绘热图。然而,这种方法计算成本高且参数量大。相比之下,一维信号具有某些优势。CapsNet还具有处理小样本诊断的能力。例如,CapsFormer[54]将CapsNet与自注意力机制集成。CapsNet用于特征提取,而自注意力机制关注谱图的空间和顺序方面。Wang等人[55]通过知识通知的卷积初始化胶囊,并提出谱模板方法建立胶囊与故障类型之间的映射。总体而言,大多数研究仍关注CapsNet在特征提取中的关键作用,例如使用CapsNet输出的特征进行视图自适应以计算源域和目标域之间的相似性度量[56-58],或将其与其他神经网络结合[59-62]。然而,高参数动态路由机制缺乏多源特征融合能力。此外,忽视基于物理的信息不仅降低了可解释性,还增加了对数据质量和数量的依赖。依赖单一数据模态或视图通常会产生模糊或不可靠的诊断决策,最终削弱泛化性能。
2.5 基于物理的损失函数
基于物理的损失是基于物理的机器学习中的关键组成部分[63-65]。pyDSN[9]引入了平衡谱质量度量来评估STFT谱图质量。Qin等人[66]使用边界损失约束动态模型参数,从而最小化真实世界和模拟数据之间的频率差异。ClassBD[67]利用峰度和l2/l4范数优化盲解卷积滤波器。PGNN[68]将转子的不平衡振幅和相位角视为损失函数。Jia等人[69]提取状态特征频率和信号谱能量以推导物理伪标签并制定基于物理的损失。总之,基于物理的度量通常针对特定的信号处理流程或设备动力学进行定制。因此,基于物理的损失应针对不同的系统和算法进行定制。
2.6 基于物理的特征融合
多源特征融合在IFD中得到了广泛研究[31,70]。然而,多源基于物理的特征融合仍然是一个新兴领域,值得注意的工作对此进行了研究。MPINet[42]结合多个基于物理的块(PIBs),并通过多分支特征连接实现融合。然而,这种方法需要训练多个PIBs。类似地,M-IPISincNet[43]集成电流和振动信号,使用逆傅里叶变换和带通滤波器设计基于物理的卷积层,并通过多尺度卷积提取多尺度特征。然而,MPINet和M-IPISincNet中的融合方法相对简单,缺乏互补信息视图之间的充分交互,仅考虑单一的基于物理的信息。Sun等人[71]引入了一种基于物理的多模态特征融合网络(PMFN),结合声学或振动信号与红外图像。PMFN集成了两种注意力机制:频域注意力,强调特定故障下的调制关系;区域注意力,突出谱图中更显著的特征,这些特征通过自注意力融合。然而,二维编码依赖于信号处理,其有效性严重依赖于手动参数选择。此外,通过两个自注意力分支的融合过程计算复杂度高,PMFN也忽视了基于物理的损失。Ying等人[72]提出了一种基于Dirichlet分布的可信融合模块,以确保动态融合的可靠性。然而,TMFEFN缺乏物理信息,需要大量训练数据。PFCG-Transformer[73]提出了一种集成声学和振动信号的物理框架,通过比较物理模型的数据分布与实际运行信号构建一致性和不确定性量化损失。然而,声振融合需要大量手动经验并涉及复杂计算,收集声学信号具有挑战性,图像信号处理高度复杂。
在实际轴承诊断中,振动信号对故障最敏感,并能充分反映故障特征[27,74]。PIFCapsule将信号处理赋能的权重视为可训练的,并通过数据驱动算法找到它们,而不是依赖于手动参数。此外,PIFCapsule通过注意力融合路由机制实现基于物理的多视图特征融合,使用范数激活操作关注信息最丰富的特征,并使用基于物理的正则化约束优化方向。
3.1 PIFcapsule概述

图2 PIFCapsule的总体情况
先前的首层可解释范式仅限于单视图信息,导致信息交互效率低下,并忽视了基于物理正则化的好处。因此,本文重点研究在首层可解释范式框架内基于CapsNet的基于物理的多视图特征融合。如图2所示,我们提出了一种注意力融合路由机制,增强了跨视图信息交互效率并保留了判别性特征。同时,我们实现胶囊路由,AFR促进了从初级胶囊到数字胶囊的高效信息流。此外,将基于物理的正则化纳入优化过程,以增强融合表示的物理保真度,产生更具泛化性的故障特征嵌入。
图3 系统诊断流程
具体框架如图3所示。诊断工作流程包括以下步骤:
● 收集三种类型的轨道交通车辆损伤数据集:高速列车牵引电机轴承数据集、重载货运列车轮对轴承数据集和铁路列车转向架数据集。收集的数据集分为训练集、验证集和测试集,每个类别的训练集大小不超过50个样本,符合小样本问题的定义。
● 收集的训练集数据输入PIFCapsule,计算所有基于物理的损失以指导模型训练。训练后保存最优模型权重。
● 在测试阶段,加载最优权重并评估性能。
3.2 具有信号处理先验知识的多重基于物理的可解释层
单源信息可靠性差且决策模糊,而多源特征融合可以捕捉具有抗干扰能力和鲁棒性的特征。因此,多源特征融合是一个优秀的解决方案。然而,多源特征融合仍然受到可解释性差的限制。因此,我们提出了一种基于物理的多视图特征融合框架。该方案集成了STFT、WT和BD信息视图:BD有效提取轴承故障的瞬态脉冲,而STFT和WT在这方面的能力较弱。STFT由于固定窗口而适应性和分辨率有限。WT提供更高分辨率并支持多尺度分析,但可能引入混叠和失真。
3.2.1. 双阻尼拉普拉斯小波权重初始化
在小波源信息背景下,采用双阻尼拉普拉斯小波,这在小波权重初始化领域尚未被探索。实际振动信号中观察到的故障脉冲响应经常表现为双边不对称衰减波形,这一特性与双阻尼拉普拉斯小波的内在属性完全吻合[75]。
其中 , 是采样频率, 是时间, 是双阻尼拉普拉斯小波的系数, 是时间常数, 和 是阻尼比。 因此,最终的小波视图层可以表示为:
其中 是尺度因子, 是平移因子。 表示卷积操作。
3.2.2. 窗权重初始化
先前的研究表明,权重初始化方法在性能上优于信号处理层的设计[7]。信号处理层侧重于将关键参数转换为可微分形式。然而,这种方法存在大量计算开销,因为滑动窗口操作未被卷积替代。受权重初始化的启发,我们将权重的通道视为时域轴,最后一个维度视为频域轴。STFT核用作CNN的初始化权重,以有效模拟STFT。引入窗权重初始化:
假设输入信号为 ,采样频率为 ,滤波器的输出通道数为 ,滤波器长度为 。定义的带宽 为 。对于每个通道 ,在范围 内设置滤波器 ,每个滤波器 使用窗函数(如Blackman窗)设计。通过归一化截止频率并考虑滤波器长度,计算理想脉冲响应 ,FIR滤波器响应可以表示为 与窗函数 的乘积。为确保初始权重更接近随机初始化,采用标准化来限制滤波器的范围。
该操作的原理是每个滤波器捕捉原始信号的频率分量,将通道视为沿时间轴的滑动窗口捕捉这些频率分量的时间变化以模拟STFT:
在STFT中,对加窗时间段执行傅里叶变换。为模拟此过程,我们使用傅里叶卷积而不是普通卷积:
3.2.3. 盲卷积模块
在BD领域,时域分量通过二次卷积神经网络(QCNN) 执行,而频域分量通过FFT处理。此过程通过集成峰度损失和 范数进一步增强。相比之下,我们设计噪声阈值幅度比,用于量化BD中的基本信息。 相比之下,QCNN产生大量参数且难以优化[67]。因此,我们选择标准CNN。类似地,我们通过减少时域中的周期性噪声并消除多余的频率分量来识别共振带。
特别地, 的滤波器也在峰度损失和 范数度量的约束下学习。
3.3 注意力融合路由机制
图4 注意力融合路由机制
如图4所示,第 层的胶囊由第 层的所有胶囊 预测,这是通过权重矩阵 和路由系数 实现的。 鉴于三个信息源具有不同的物理特性,使用单一的权重矩阵 不足以提取高度互补的特征。因此,利用三个线性层完成此变换。在这三个信息源中,通道表示时间轴,最后一个维度表示频率轴,它们共同映射到新空间:
其中FC指全连接层。 随后,通过范数线性注意力机制实现特征融合。 自注意力机制通常使用Softmax激活函数,复杂度为
其中
基于矩阵结合性质的性质,计算顺序可以从
Softmax注意力机制提供非线性加权机制,从而容易关注最重要的特征。然而,线性注意力机制的输出更接近平均值,难以聚焦。因此,采用范数激活函数作为核函数来缓解这一缺点,即:
其中
其中,
AFR有两个优点。首先,它在CapsNet中实现了路由机制,实现了非迭代、高速并行路由操作,减少了模型参数并提高了算法效率。其次,与传统注意力不同,AFR支持跨视图交互,并在模态内建立局部和全局依赖关系(长距离依赖),具有高效的信息适应性。它根据任务动态分配特征并关注关键信息,提高融合效率。
算法1 注意力融合路由机制
3.4 噪声阈值幅度比
盲卷积通过最大化信号的统计度量搜索滤波器来放大重复冲击。Fang等人提出了周期性噪声幅度比(PNAR) ,定义为噪声点的平均幅度与均方根的比值。如公式(14)所示:
其中
NTAR主要通过噪声系数获取噪声,促进训练过程中噪声逐渐减少趋近于零。受小波系数启发,软阈值处理[76]也可用于减少噪声系数,其中阈值 至关重要。如图5所示,我们采用基于注意力的架构自动搜索
其中
图5 抗噪软阈值模块
3.5 损失函数
类别
其次,原始CapsNet包含重构损失以衡量生成信号与原始信号之间的相似性。然而,我们的目标是提高信噪比(SNR),而不是重构低SNR的原始信号。因此,采用
其中
其中
确定
4.1 数据集和任务描述

图6 设备: (a)高速列车牵引电机; (b)超重货物列车轮对; (c)地铁车辆转向架齿轮箱
本研究涵盖三个轨道交通车辆数据集,即高速列车牵引电机数据集、重载货运列车轮对轴承数据集和地铁列车转向架齿轮箱数据集。这些数据集的简要概述(表1)如下:
表1 轨道交通车辆的数据描述
BJTU1[9]:数据集来自NTN牵引电机轴承试验台,这是一种具有国际先进标准的专用设备,用于进行高速列车牵引电机轴承实验,如图6(a)所示。该设备涵盖列车驱动系统的动态数据和信息收集与分析、地面平台实验验证以及全生命周期。它是实现高速列车牵引电机轴承预测与健康管理的特定实验平台。测试平台由电气控制柜、加速度计、多个测试轴承和信号传输设备组成。通过传感器和信号传输系统收集轴承的振动信号。为与实际应用场景保持一致,实验使用的轴承型号为HRB NU214 EM 32214H,其尺寸与实际应用中使用的轴承相同。包括四种机械状态:内圈故障(IF)、外圈故障(OF)、滚动体故障(BF)和正常(NC),采样频率为100 kHz,速度分别为200、250、300和350 km/h。
BJTU2[77]:数据集来自中车青岛四方开发的重载货运列车轮对轴承平台,如图6(b)所示。该试验台设计用于各种轴承型号的故障模拟、性能测试和剩余使用寿命评估。它可以模拟车辆轴承在实际运行期间的载荷、速度和相应的环境条件,从而最大限度地与真实铁路场景保持一致。具体而言,垂直载荷用于模拟轴重;横向载荷用于模拟不同的轨道条件,例如转弯、通过道岔和上下坡行驶时轨道上的侧向力;风扇用于模拟运行期间的横风,风速设置为8 m/s至10 m/s。实验样本是通过拆卸检查确认的故障轴承——这些轴承最初要么由在役铁路货车在线监测系统的警报识别为异常,要么通过人工检查识别。具体而言,标准轴承安装在轮对的一侧,实验轴承安装在另一侧。在轴箱外安装振动加速度传感器,采样频率为16 kHz。测试轴承为352226X2-2RZ。数据集包含七种故障类型:内圈剥落(IRP)、外圈剥落(ORP)、滚动体剥落(REP)、滚动体裂纹(REC)、保持架断裂(CF)、保持架半裂纹(CHC)和复合故障(外圈剥落+滚动体剥落)(CFs)。此外,还包括健康轴承(H)的数据。轴承转速设置在60 km/h至180 km/h范围内。
4.1.2 地铁列车场景的公共数据描述
BJTU3[78]:如图6(c)所示,实验平台基于地铁列车的转向架设计,与实际转向架的比例为1:2。此外,实验台上的传感器部署高度再现了实际测量点。采集的信号包含21个通道,采样频率为64 kHz,考虑了六种工况,转速设置为20 Hz、40 Hz和60 Hz,横向载荷为0 kN和10 kN。不同的速度用于模拟各种列车速度,而不同的横向载荷用于模拟直线行驶和转弯条件。评估列车传动系统的齿轮箱在九种不同健康状态下的表现:正常、齿轮裂纹齿(GCT)、齿轮磨损齿(GWT)、齿轮缺失齿(GMT)、齿轮崩齿(GCPT)、轴承内圈故障(BIR)、轴承外圈故障(BOR)、轴承保持架故障(BC)、轴承滚动体故障(BFE)。
4.1.3 任务描述
轨道交通车辆中的旋转机械设备面临几个挑战,包括重载荷、高速度、强噪声和复杂运行条件,再加上小样本。这种稀缺性通常阻碍训练出足够泛化的模型。为解决此问题,利用多源基于物理的特征融合CapsNet,特别是在有限样本下。本研究一方面涵盖三种不同类型的轨道交通车辆;另一方面,处理各种故障类型和设备,包括单点故障、复合故障以及齿轮箱和轴箱。
使用滑动窗口将信号分割成2048个样本的片段。滑动窗口之间没有重叠,以确保不会发生数据泄漏。根据先前的定义,如果每个类别的样本少于50个,则该问题被归类为小样本问题[6,79]。在小样本下,所提出的方法足以训练出泛化模型,从而在测试集上实现有效的故障识别。相比之下,其他主流方法在这方面表现相对较弱。训练样本大小为5、10、20、30、40和50。不同数据集和实验的训练样本设置各不相同,但都符合小样本的定义。测试集统一设置为每个故障1000个样本。
实验程序在PyTorch 2.5上执行,利用两个GTX 4090 24 GB GPU。每个实验重复五次以获得均值和标准差。参数配置详见表2。
表2 配置参数
4.2.1 在不同工况下不同数据集的PIFCapsule性能
图7 在不同工作条件下使用小样本的性能能力
如图7所示,评估了PIFCapsule模型在不同数据集和运行条件下的鲁棒性。具体而言,Data H的每个类别样本数设置为5,Data F和G设置为10。对于车辆,转速越慢,准确率越低。与其他条件相比,在低速和高载荷场景下,信噪比较低,噪声干扰在小样本下的影响更显著。(后续评估以这种最具挑战性的条件为基准。)即使在这样条件下,借助基于物理的信息和注意力融合路由机制等模块,PIFCapsule实现了超过90%的准确率,表现出鲁棒的性能.
4.2.2 不同样本大小下PIFCapsule的性能评估
图8 PIFCapsule在小样本下的性能能力
因此,我们评估了PIFCapsule在解决小样本挑战方面的能力。如图8所示,性能随着样本大小的增加而稳步提高。具体而言,对于高速列车牵引电机的数据集,当样本大小达到10时,PIFCapsule达到100%。这种卓越性能可能归因于高SNR。相比之下,对于货运列车轮对轴承或地铁转向架,SNR相对较低,导致信号质量较差。由于性能取决于数据的质量和数量,因此必须设计在小样本下增强数据/特征质量的方法。为此,PIFCapsule从多个视图提取故障特征频率,从而进一步减少原始信号中的噪声并识别主要频带。单一信息视图可能无法完全捕捉特征频率。因此,小波视图、盲解卷积视图和STFT视图相互补充和加强,分别提取多尺度高分辨率特征、周期性脉冲分量以及不易混叠且保真度高的特征。随后,这些特征通过注意力路由特征融合和基于物理的损失函数充分整合,使模型能够学习更具判别性和高质量的特征。因此,即使只有10个样本,PIFCapsule也分别达到91.54%和95.62%。
4.2.3 不同路由机制的性能
图9 三个模型的性能
表3 三种模型的性能、参数和计算复杂度对比
PIFCapsule是一种基于胶囊的架构,其性能与原始CapsNet和EfficientCapsule进行了比较。EfficientCapsule使用自注意力机制替代原始动态路由进行视觉处理。如表3和图9所示,PIFCapsule提高了27.35%和24.21%。值得注意的是,对于数据集F,这两个模型低于50%。然而,通过利用基于物理的多源信息和注意力融合路由机制,PIFCapsule有效减轻了噪声并提取了有价值的信息,性能超过90%。此外,PIFCapsule显著减少了参数数量和计算复杂度。它将参数减少了82%,FLOPs减少了66%,分别实现了0.4824 MB的参数大小和22.73 MFLOPs的计算成本。
注意力融合路由用于计算路由系数,从而减少迭代过程中的重复参数更新。此外,使用范数激活函数优化注意力权重,减轻了Softmax的高参数数量和复杂度。多视图全局特征融合直接在注意力融合路由模块中实现,无需复杂的多分支卷积融合结构。在注意力融合路由框架内实现深度可分离卷积以实现局部特征融合,降低了传统卷积操作固有的计算复杂度。
图10 混淆矩阵和t-sne
此外,通过混淆矩阵和T-SNE(如图10所示),我们分析了三个模型之间的性能差异。EfficientCapsule对于断齿仅达到68%,与轴承保持架故障混淆。原始CapsNet未能完全识别正常和异常,对于齿面磨损和轴承保持架故障的准确率低于62%。相反,PIFCapsule整合了基于物理的多视图信息,并通过AFR成功融合了这些特征。为精确提取鲁棒的物理特征,采用基于物理的损失来约束优化方向。
4.2.4 与其他最先进(SOTA)模型的比较
表4 与其他方法的性能对比(%)
如表4所示,我们进行了与SOTA模型的性能比较的全面评估。模型涵盖三类:
① 基础模型:ResNet、WDCNN、RCL和MSResNet。
② 首层可解释范式模型:EWSNet、WaveletKernelNet、SincNet、FCC、MCNWFK、TFN、ClassBD、DFAWNet[81]、GTFENet[82]、wave_convNext[83]和RaVEL[84]。
③ 小样本下表现良好的模型:MCSwinT[85]、Convformer_NSE[86]、CLFormer[87]、Liconvformer[88]。
ResNet、WDCNN、RCL和MSResNet是数据驱动的。它们受样本大小的显著影响。在小样本下,不可能获得足够泛化的模型。因此,它们的平均值都低于82%。尽管ResNet表现出相对较好的性能,但它有大约380万个参数和较高的计算复杂度。另一方面,RCL对输入原始数据进行随机卷积数据增强。与WDCNN相比,虽然增加了计算复杂度,但提高了7.62%。总体而言,这些模型受到有限样本的限制,未能提取判别性特征,导致准确率较差。
此外,首层可解释模型基于信号处理赋能的算法,如小波、STFT、BD和时频变换,以减少对数据质量和数量的依赖。与数据驱动模型相比,这些算法取得了改进。其中,EWSNet和RaVEL表现最佳,分别为86.51%和86.79%。然而,与PIFCapsule相比,它们的性能落后7.05%和6.77%。EWSNet主要采用小波但忽视了其他基于物理的信息,并且采用多尺度结构,提取多尺度小波特征。RaVEL可视为将小波注入RCL。它在数据预处理阶段提高了SNR,增强了数据集的质量。因此,RaVEL对数据的要求较低,计算复杂度极低,为0.70 MB。与上述两个模型相比,
PIFCapsule包含三种基于物理的信息,并使用AFR成功融合它们,达到93.56%。
测试了几种用于小样本诊断的轻量级Transformer模型。尽管MCSwinT达到了83.46%的最高准确率,但其参数数量和计算复杂度分别是PIFCapsule的4倍和17倍。CLFormer足够轻量,但平均准确率低于50%。PIFCapsule相比MCSwinT提高了10.1%。这表明即使面对最流行的Transformer架构,所提出的基于CapsNet的模型也具有竞争力。
4.2.5 与其他最先进多源融合方法的比较
表5 在十个样本下与先进多源特征融合算法的对比
如表5所示,我们对几种SOTA多源特征融合模型进行了比较分析,以评估AFR的优势。CSST_Net和MSIFT与PIFCapsule有相似之处,因为它们都采用自注意力结构。CSST_Net主要通过连接实现数据融合,而MSIFT利用交叉注意力机制实现特征融合。
表6 在数据集G下PIFCapsule中每个模块的功能对比
在本文中,CSST_Net通过连接小波、STFT和BD视图的三个特征进行数据融合。MSIFT输入小波和BD视图。如表6的消融实验所示,这两个视图的影响最显著。
结果表明,PIFCapsule在不同数据集上分别提高了0.98%和7.58%。尽管MSIFT具有竞争力,但其参数数量是PIFCapsule的2.46倍,计算复杂度是PIFCapsule的45.11倍。因此,其效率远低于PIFCapsule。此外,CSST_Net和MSIFT都使用相对复杂的Transformer架构,没有轻量化。
4.2.6 消融实验
为评估不同模块的影响,如表6所示,STFT视图、小波视图和BD视图带来的改进分别为1.28%、43.03%和6.25%。显然,小波视图影响最显著,表明多尺度和高分辨率时频特征可以捕捉绝大多数故障特征,从而显著提高性能。STFT视图和BD视图起补充作用,BD视图特别提取周期性特征。
此外,我们研究了不同度量的影响。BSQ的主要目的是增强时频表示的能量集中度,而NTRA主要用于减少噪声并提取周期性脉冲特征。采用BSQ时,性能提高了1.94%。BSQ增强了提取的时频表示的能量集中度,并突出了特征频带。使用NTRA时,性能提高了3.68%。NTRA主要通过可微分软阈值模块学习周期性信号中的噪声,从而放大周期性脉冲并突出故障特征频率。总之,本研究中的两个主要损失函数相互补充,提高了原始信号的质量。
5.1 多视图首层瓶颈的可解释性
为验证首层瓶颈的可解释性,我们以货运轮对轴承为例,其故障频率主要低于1000 Hz。基于表6的消融实验,小波视图信息是最关键的因素。因此,将重点分析小波权重视图。首先,计算小波权重的幅频响应h(f):
其中
图11 小波权重的频率响应
图12 8种状态FFT分析
如图11所示,小波权重的幅频响应在351.56 Hz处出现最高峰值,而原始卷积的幅频响应近似一条直线,无法反映信号的物理特性。此外,我们使用快速傅里叶变换(FFT)对八种不同状态的原始信号进行了分析,如图12所示。对应于小波权重,各种状态在300 Hz附近的分布相对密集。这一观察表明,小波权重可以在300 Hz附近区分不同状态,并有效提取故障频率特征。
图13 BD视图输出结果的包络频谱分析
此外,如图13所示,对BD层滤波信号的包络谱幅度分析证实了这一发现。显然,幅度在300 Hz附近达到最大值,从而进一步证实小波核的平均频率响应主要集中在300 Hz附近。同时,观察到一个有趣的现象:如图(a)、(e)、(d)、(h)所示,最大或第二幅度点位于相同的频率304.96 Hz(289.06 Hz)和664.06 Hz,这可能导致混淆和误分类。因此,需要额外的视图信息——如小波或STFT视图——来进一步区分故障类型。
图14 不同通道中窗口权重的频率分布
最后,如图14所示,我们分析了不同通道上窗权重的频率分布。训练后,初始索引通道的频率主要分布在300 Hz附近,而这些通道在训练前分布在0 Hz附近,其他通道未观察到显著变化。这揭示了三个关键现象:
① 窗权重证实频率分布集中在300 Hz附近,可以提取判别性特征。
② 窗权重初始化近似最优窗权重,无需大量调整。
③ 在初始索引通道中,滤波器以300 Hz为中心,不同通道在不同频率提取原始信号的主要特征,主要位于低频范围内。
5.2 路由系数Z的可解释性
通过使用数据集F的案例研究,在PIFCapsule中,低级胶囊由从三个信息视图(小波、STFT和BD)提取的特征构建而成。使用了16组低级胶囊,这些胶囊随后通过AFR机制聚合成高级胶囊,产生8组。为了量化低级胶囊对高级胶囊的贡献,进行了以下分析。 如图4所示,低级胶囊的表示可以表示为 m:
对于任何给定的低级胶囊
而实际贡献可以表示为:
其中
其中
图15 热力图:从低级胶囊映射到高级胶囊
如图15所示,热图直观地表示了低级胶囊对高级胶囊的贡献程度。尽管不同低级胶囊的贡献各不相同,但它们都是正的,表明整合了三个基于物理信息源的低级胶囊对故障定位做出了积极贡献。
轨道交通车辆诊断面临高转速、重载荷和有限样本的挑战。FLIP——一个植根于定制化制造和具身智能的智能框架——系统地将人类先验知识嵌入智能诊断设备。基于此范式,提出了一种多视图信号处理先验嵌入的PIFCapsule。首先,提出了一种基于物理启发的多视图方法,结合小波变换、短时傅里叶变换和盲解卷积,提取不同的物理特性,并最大限度地利用跨时间、频率和时频的互补信息。其次,提出了一种新的非迭代且计算高效的注意力融合路由机制。AFR不仅能应对减少的胶囊数量,提高知识的内在转换能力,还能增强泛化能力。关键的是,在路由过程中,AFR充分整合了互补信息的变化,拓宽了信息空间维度,并成功捕捉了隐式的视图间关联。最后,提出了噪声阈值幅度比度量作为基于物理的正则化项,通过削弱学习到的噪声来放大与冲击相关的故障特征。
然而,有几个方向值得进一步研究。首先,与一些单源基于物理的信息模型相比,PIFCapsule的参数数量和复杂度仍然相对较高。需要进一步研究在保持性能的同时实现更轻量级的模型。其次,PIFCapsule的特征具有更多的物理可解释性和泛化能力,这在不同机器间的迁移学习中具有潜力。第三,首层范式可以涵盖更多类型的信号处理,并开发更多信号处理赋能的卷积或基于Transformer的特征融合模块。最后,通过大型语言模型(LLMs)[92]增强现有算法的性能是一个有趣的研究方向。通过利用LLM代理或助手,研究人员旨在进一步优化现有算法的
轻量级特性和性能。未来,可以探索将具身智能的感知-行动循环与LLMs的推理能力深度融合,从而构建能够主动交互、持续学习和自主决策的智能代理。这将实现对复杂工业系统中故障的动态理解、因果解释和自适应诊断。