首页/文章/ 详情

中科院一区Top | 基于低功耗模拟电路物理神经网络的电机故障诊断研究

5月前浏览1296

目前,运行深度神经网络的CPU、GPU、FPGA、DSP等数字器件通常需要较高的计算功耗。近年来,依靠模拟电路结构实现的物理神经网络引起了研究人员的极大关注。物理神经网络的实现方式与人脑更接近,能够极大降低信号频繁传输和转换的能耗,神经推理的效率能够提升若干个数量级,是突破冯诺依曼瓶颈的有效途径,在分布式、多并行、低延迟、低功耗的智能计算领域展现出显著的应用前景。本文研究了一种基于低功耗模拟电路的物理神经网络方法并应用于电机故障诊断,供大家交流讨论。

论文基本信息

论文题目:Low-Power Analog Circuit-Based Physical Neural Networks for Motor Fault Diagnosis

论文期刊:Energy

论文日期:2025

论文链接:

https://doi.org/10.1016/j.energy.2025.139186

作者:Xianhong Wu [a], Xiaoxian Wang [b], Juncai Song [c], Zhiyong Hu [a], Jiawei Xu [a], Siliang Lu [a]

机构: 

a College of Electrical Engineering and Automation, Anhui University, Hefei, Anhui 230601, PR China

b College of Electronic and Information Engineering, Anhui University, Hefei 230601, PR China

c College of Internet, Anhui University and Control Technology, Anhui University, Hefei 230601, PR China

作者简介:

吴先红,安徽大学电气工程与自动化学院电气工程专业在读博士生,在IEEE Transactions on Transportation Electrification、Energy (Elsevier)、Measurement、仪器仪表学报上发表第一作者期刊论文4篇。

王骁贤,安徽大学光电信息获取与防护技术全国重点实验室副教授、硕士生导师,于2024年获得中国科学技术大学工学博士学位。研究方向包括信息处理、在线检测、智能运维等。主持国家自然科学基金青年项目1项,以第一作者/通信作者发表SCI期刊论文20余篇。

目录

摘要

1 引言

2 ACPNN基本电路原理

    2.1 ACPNN 的基本电子电路原理

    2.2 电路元件参数分析

3 ACPNN训练方法

    3.1 反向传播算法

    3.2 物理感知训练

    3.3 数据驱动的可微模型

4 ACPNN用于电机故障诊断

    4.1 电机故障信号采集与信号处理

    4.2 ACPNN

    4.3 ACPNN分类模型

5 实验设置和数据集描述

    5.1 SRM实验设置

    5.2 BLDCM实验设置

    5.3 数据预处理

6 实验结果分析

    6.1 ACPNN训练

    6.2 SRM的高阻接触与轴承混合故障诊断结果

    6.3 BLDCM混合故障诊断结果

    6.4 少样本条件下ACPNN鲁棒性的实验分析

    6.5 与现有方法的比较

7 讨论

    7.1 ACPNN能耗分析

    7.2 ACPNN在物联网中的潜在应用

8 结论

摘要

深度学习方法被广泛应用于电机状态监测与智能故障诊断中。目前,绝大部分的深度学习模型都运行在CPU、GPU、FPGA、DSP等数字器件上,这些器件通常需要较高的计算功耗。近年来,通过模拟电路结构实现的物理神经网络引起了研究人员的极大关注。物理神经网络的实现方式与人脑更接近,能够极大降低信号频繁传输和转换造成的能耗,神经推理的效率能够提升若干个数量级,是突破冯诺依曼瓶颈的有效途径,在分布式、多并行、低延迟、低功耗的智能计算领域展现出显著的应用前景。本文研究了一种基于低功耗模拟电路的物理神经网络(Analog Circuit-based Physical Neural Network, ACPNN)方法并应用于电机故障诊断。首先设计了ACPNN的基本电子电路和分类模型,然后使用基于物理感知的训练方法来优化网络性能。在两种具有不同电气和机械故障的电机实验台上验证了这种方法的有效性。同时,对模拟电路模型与传统数字处理器的能耗进行了对比分析。结果表明对于相同的运算量,ACPNN的能效较高。该研究为物理神经网络在节能型智能系统的应用提供了新的解决方案,特别适用于采用电池供电、供能受限的低功耗物联网监测诊断系统。

关键词:低功耗模拟电路的物理神经网络;物理感知训练;低功耗;电机故障诊断;

1 引言

作为电力系统的核心,电机广泛应用于现代工业领域,例如新能源汽车和风力发电机组等。然而,电机在运行过程中一旦发生故障,可能引发事故,造成巨大的经济损失,甚至人员伤亡。因此,电机故障诊断具有至关重要的意义。随着信息技术和人工智能的快速发展,深度学习在电机故障诊断领域的应用日益增多。深度学习模型具有多方面优势,包括强大的学习能力、广泛的适用范围、较强的适应性、较高的性能潜力以及良好的可移植性。因此,深度学习已成为特征提取、故障模式识别以及工业部署中的重要研究方向。

近年来的研究表明,人工智能和深度学习技术在电机故障诊断与电力系统监测中的应用已取得显著成效。Pietrzak等人提出了一种利用卷积神经网络(Convolutional Neural Networks,CNN)提取定子相电流双谱分析特征的方法,用于智能故障诊断。该方法能够实现永磁同步电机定子绕组故障的检测。Liu等人提出了一种基于多尺度卷积核的残差卷积神经网络。该网络通过多尺度卷积核对原始故障信号进行多尺度特征提取,从而在非平稳工况下实现有效的电机故障诊断。Wen等人提出了一种多源特征融合网络,通过训练多状态孪生神经网络实现轴承故障特征的融合与提取。该方法能够在小样本数据条件下实现高精度的电机轴承故障诊断。Benavides等人则通过将双旋转森林算法、极限学习机及其他人工智能方法相结合,在光伏能源系统中实现了有效的故障检测。然而,传统的深度学习模型和人工智能算法往往依赖较强的计算能力,从而带来较高的硬件要求和成本。随着能耗和计算需求的不断增加,这些模型的可扩展性也受到限制。因此,研究轻量化人工智能模型对于降低能耗、推动能源可持续发展具有重要意义。

作为一种分布式计算架构,边缘计算并不是在网络中心节点处理应用、数据和服务,而是在网络的逻辑边缘节点完成这些任务。由于其处理速度快、时延低,这种方法展现出巨大的应用潜力。Zhang等人采用迁移学习策略,将在云端训练并部署到边缘端的堆叠自编码器深度神经网络模型应用于电机传感器监测数据的实时故障诊断。Jiang等人提出了一种基于诊断知识的联邦学习框架,用于分布式边缘协同故障诊断,从而实现了高精度故障检测。Chen 等人开发了一种噪声增强卷积神经网络模型,以解决训练样本有限的问题,并将其部署在边缘设备上以实现高精度故障诊断。Yao等人则采用了一种轻量化的边缘二维(Two-Dimensional,2D)卷积神经网络,用于永磁同步电机驱动器开路故障的精确在线诊断。然而,由于云计算和大模型具有较高的计算需求,这类系统通常需要配备高性能处理器和大容量存储器,从而导致能源需求增加。此外,基于云边协同的边缘计算方法在多节点部署、信号采集和传输过程中也会产生额外能耗,进而带来能量损失。尽管这些方法提高了计算效率,但仍伴随着较高的能量消耗。若将故障诊断方法直接部署在嵌入式设备上,则必须考虑硬件资源受限的问题,并选择合适的轻量化模型,这无疑增加了诊断过程的复杂性。同时,基于边缘计算的传感设备还需要定期充电或更换电池,而在故障诊断传感器中,这种频繁更换的需求尤为繁琐。因此,如何解决边缘计算中的能耗问题,已被公认为一项关键且具有挑战性的任务。

物理神经网络(Physical Neural Networks,PNN)作为一类新型神经网络,通过利用物理系统的内在特性来实现计算,具有很高的计算效率,并能够显著降低能耗和时延。此外,这类网络能够更充分地利用硬件本身固有的物理属性,因此在现代人工智能领域展现出巨大潜力。例如,Stenning等人设计并采用了一种互连纳米磁阵列作为物理储层,构建了多层物理神经网络架构,并在预测和频率分解等任务中取得了良好效果。Ashtiani等人设计了一种集成式端到端光子深度神经网络,其中非线性激活函数通过光电方式实现。该网络可直接处理光子神经芯片上的片上光波,从而实现对手写数字的高精度分类。Lim等人构建了一种相变忆阻器阵列,并利用电阻漂移特性提升忆阻器网络的训练效果,从而实现对手写数字的准确分类。然而,物理神经网络目前仍处于实验室规模的早期探索阶段,主要应用于手写数字识别等二维图像实验分类任务。由于光学神经网络、忆阻器神经网络等技术本身较为复杂,PNN在故障诊断等实际工程场景中的应用仍不成熟,相关研究也相对有限。

本研究针对电机故障分类问题,研究了一种基于低功耗模拟电路的物理神经网络(Analog Circuit-based PNN,ACPNN)。首先,建立了ACPNN的基础电子电路,并对其电路特性进行了分析。其次,考察了反向传播(Back Propagation,BP)算法的优缺点及其在物理神经网络中的局限性,进而引出对物理感知训练(Physics-Aware Training,PAT)方法的研究。PAT方法在前向传播过程中利用物理系统,在反向传播过程中采用可微的数字模型来更新系统参数梯度,从而实现对深层物理神经网络的训练。在此基础上,本文进一步构建了ACPNN分类模型。随后,搭建了两个实验平台:其一用于开关磁阻电机(Switched Reluctance Motor,SRM)高阻连接(High-Resistance Connection,HRC)与轴承复合故障的诊断,其二用于无刷直流电机(Brushless Direct Current Motor,BLDCM)复合故障的诊断。通过采集三相电流信号和振动信号,构建了故障样本数据集,并将这些数据输入ACPNN进行训练,同时对故障诊断过程进行了逐层分析。研究结果验证了ACPNN在故障诊断中的可行性与先进性,并通过初步功耗计算进一步证明了物理神经网络的优势。

本研究的主要贡献如下:

(1)研究了一种基于深层物理神经网络分类模型的方法,对网络的基础电路单元进行了分析,并构建了模拟电路物理神经网络。

(2)研究了一种专门用于训练物理神经网络的物理感知训练方法

(3)将ACPNN应用于电机故障诊断,验证了其在电机故障诊断领域中的有效性与先进性。此外,本文还突出了低功耗ACPNN的特点,强调了其在物联网(Internet of Things,IoT)中的应用潜力。该工作为传统深度学习模型提供了一种高能效替代方案,从而有助于推动面向物联网系统的可扩展、低功耗实时监测与故障诊断解决方案的发展,而在这类系统中,能量约束是一个关键问题。

本文其余部分结构安排如下:第二节介绍ACPNN的电路原理;第三节和第四节分别介绍 ACPNN的训练方法以及所采用的故障诊断模型;第五节给出了两个实验平台,用于诊断开关磁阻电机的高阻接触与轴承复合故障,以及无刷直流电机的复合故障,并构建了相应的故障诊断数据集;第六节展示了ACPNN在这两类故障诊断中的实验结果;第七节讨论了ACPNN的性能及其潜在应用;最后,第八节对全文进行了总结。

2 ACPNN基本电路原理

本节介绍本研究所采用 ACPNN 的电路组成及其分析。

2.1 ACPNN 的基本电子电路原理

本研究所使用的ACPNN基本电子电路由标准电子元件(电阻、电容和电感)、面包板、导线以及高速数据采集卡(DAQ,USB-1208-HS-4AO,Digilent公司)构成。所用元器件的具体型号和参数列于表1中。

表1 模型元件和参数

ACPNN的基本电子电路是一种带有J111结型场效应晶体管(Junction Field-Effect Transistor,JFET)的电阻—电感—电容(Resistor–Inductor–Capacitor,RLC)电路,如图1所示。

图1 ACPNN的基本电子电路原理图和物理实现


JFET作为一种电压控制器件,其漏极电流  与栅源电压  之间满足平方律关系:  

其中,    表示当    时的饱和漏极电流。对于J111结型场效应晶体管,在        条件下,    =20mA;而在        条件下,其栅源截止电压    的范围为−3V到−10V。    表示夹断电压,即使    时对应的临界    值(对于N沟道JFET,该值为负)。电阻    用于将    转换为电压降,即    。电感    基于电流不能瞬时变化的原理产生反电动势,其表达式为    ,该项会影响输出的动态特性。电容    则作为耦合电容使用,在隔离直流分量的同时允许交流信号通过,从而将输入信号耦合到JFET的栅极。

2.2 电路元件参数分析

该电路旨在实现一种功能,即用基于电路的模型替代传统神经网络中的激活函数。通过在简单的RLC电路中引入晶体管,使电路具有非线性特性,从而增强网络实现复杂动态响应的能力。该模拟电路对具有可变恒定截面的复杂波形的响应如图2所示。

图2 模拟晶体管电路对具有可变恒定截面复杂波形的非线性响应。(a)给出了输入波形,不同颜色表示不同的输入信号;其中中间一段在不同固定取值下保持恒定电压。(b)展示了输出波形,其颜色与(a)中不同输入轨迹相对应。(c)描绘了输出波形切片随输入信号幅值变化的关系,表明该电路对输入具有较强的非线性变换能力。

ACPNN基本电路的输出特性由硬件元件的物理属性共同决定,包括 JFET(非线性半导体器件)、电感(储能元件)和电阻(分压元件)。这些特性反映了模拟电路的动态响应,其表现取决于实际器件参数以及实时信号变化。为了评估该电路,研究中对电压、电容和电感取不同数值,并通过DAQ输出脉冲信号进行测试,同时记录电路输出结果,如图3所示。对于输入为−10V的脉冲信号,采用控制变量法改变电路参数,所得输出结果如图3(c)所示。研究发现,电容的变化会引起电路输出在纵向上的偏移;当电容过小时,电路无法 正 常工作,而电容过大则会超出采集卡的测量范围。电感的变化会导致输出峰值变平,而电阻的变化则会降低峰值幅度。这些因素都会对电路输出产生不利影响。本研究最终将电路参数设置为:    、    、    ,与其他参数设置相比,这组参数在满足输出阈值要求的同时能够提供最佳峰值性能,因此被选定为本文的电路参数。

图3 不同电路参数对不同幅值脉冲响应的影响。(a)输入脉冲波形。(b)为增强可视性,对曲线进行了人为错位处理。(c)在输入脉冲为−10 V时,改变电路的电阻、电容和电感参数后测得的输出响应。

3 ACPNN训练方法

本节介绍ACPNN所采用的训练方法,包括物理感知训练方法,以及在物理神经网络反向传播过程中所使用的等效可微数值模型。

3.1 反向传播算法

训练神经网络模型并对参数进行迭代更新的传统方法是BP算法。该算法通过计算损失函数相对于网络中各个参数的梯度来更新参数,从而最小化损失函数。BP的核心思想是利用链式法则,从输出层开始逐层向输入层反向计算误差梯度。

该算法最终通过不断迭代更新网络参数来优化网络性能。这种方法解决了如何有效训练含有大量可训练参数的数学运算序列、以实现目标数学功能这一难题。其关键在于对数学运算进行解析求导,从而能够高效计算梯度,并确定最优参数更新方向以提升模型性能。

BP算法的主要步骤包括两个过程:前向传播和反向传播。在前向传播过程中,输入数据通过神经网络的层次结构逐层传递,最终得到预测结果。在反向传播过程中,则根据预测结果与真实结果之间的误差,从输出层开始逐层计算误差梯度。随后,利用这些梯度信息更新网络中的权重和偏置参数,从而减小预测误差。支撑该算法的数学基础是反向自动微分。在前向传播和反向传播过程中,使用的是相同的函数,如图4所示。

图4 BP算法

 正向传播的计算如下:

 

其中,     表示输入,     和      表示参数,     表示映射后的输出。函数      表示激活函数及某些通用计算,这些运算会在整个神经网络中被应用。

BP的计算如下:

 
 
 

其中,    ,    ,    ,    ,分别表示输出、输入以及参数对应的损失梯度。

BP算法非常适用于在数字计算机上进行深度学习,但它无法直接应用于物理神经网络。这是由于PNN具有其固有的硬件特性,BP无法对物理系统所执行的输入—输出变换直接计算解析梯度。因此,有必要探索适用于物理系统的训练方法。目前,基于BP改进的PNN训练方法主要包括:模拟仿真反向传播(in-silico BP)、直接反馈对齐(Direct Feedback Alignment,DFA)训练、物理局部学习(Physical Local Learning,PLL)以及物理感知训练(Physics-Aware Training,PAT)。这些训练方法的比较见表2,其中M表示神经元数量,T0表示反向传播的收敛时间。如表2所示,与in-silico BP相比,PAT训练方法对模型保真度的约束更低;与DFA训练和物理局部学习相比,PAT具有更快的收敛速度;并且该方法目前主要应用于光学和忆阻器计算阵列等领域。因此,本文选择PAT作为ACPNN的训练方法。

表2 PNN训练方法的比较

3.2 物理感知训练

PAT是一种融合物理域与数字域计算的混合算法,应用于物理系统网络的训练过程中。PAT方法在前向传播阶段利用物理系统对输入进行变换,而在反向传播阶段则采用可微分的数字模型,以处理训练循环中物理系统无法执行的部分。

这种方法实现了反向自动微分,并适用于任何真实物理系统的输入—输出变换。在前向传播和反向传播过程中,所使用的函数并不相同:前向传播采用物理系统的不可微变换(    ),而反向传播采用物理变换的可微数字模型(    )。图5展示了单层PAT的结构。

图5 单层PAT

考虑一个一维时间序列    。模拟电子电路的输入和输出均受限为一维时间序列。本文采用逐元素添加权重和偏置的方法,将系统输入分解为可训练参数和输入数据,从而控制电路对输入数据的变换。可训练参数与输入数据的叠加方式如下:

 

其中,    为可训练参数,  表示输入数据向量,  表示加入权重和偏置后的电压时间序列向量,随后该向量被送入模拟电路中,其中  。对于第一层而言,  是输入的故障信号数据;对于隐藏层而言,  则是前一层输出的电压时间序列向量。因此,前向传播的计算可表示为如下形式:

 

反向传播中所使用的函数与前向传播中所使用的函数不同,因此,反向自动微分函数无法再将梯度从输出层精确地反向传播到输入层,而是在反向传播过程中对精确梯度进行近似。因此,反向传播可表示为如下形式:

     

其中,       和    分别表示        以及    的梯度估计量。可微数值模型利用反向传播来估计损失梯度,并通过反复执行物理系统的前向传播,计算输出与目标值之间的误差,从而对参数进行调整。通过这一迭代过程,模型得以训练,预测误差逐步减小,并最终获得最优结果。

PAT方法在多层物理神经网络中的整体训练流程如图6所示。其训练循环的计算过程如下:

前向传播

 

计算误差向量

 

反向传播

 
 
 

参数迭代

 
 

图6 多层PAT

在这里,    ,    ,和      分别表示物理系统第      层中精确梯度     ,    ,和      的估计值。这些梯度是通过模型的反向自动微分获得的。     表示损失,     表示损失函数;     表示期望输出(目标输出);     表示批量大小;     表示学习率。     表示第      层的输入向量。在前馈网络结构中,隐藏层的输入等于前一层的输出向量。

对于第一层,输入数据向量      表示待处理的数据。在 PAT 中,当物理系统执行前向传播时,误差向量会被精确估计。随后,误差向量进行反向传播,其中需要在每一层的正确输入处(即实际物理输入处)对微分数值模型矩阵:

 

进行求值,这里的      表示转置操作。因此,在利用物理计算完成前向传播时,除了使用 PNN 的输出      之外,还需要使用中间输出      以支持 PAT 中精确梯度的计算。PAT 的关键优势在于,前向传播是由真实物理硬件直接执行的,而不是通过仿真完成的。

3.3 数据驱动的可微模型

PAT方法需要一个可微的数值模型,以便在反向传播过程中执行自动微分,从而实现对物理系统梯度的近似。原则上,任何可微模型都可以被采用,例如基于微分方程的传统物理模型、其他解析模型、数据驱动模型(如深度神经网络)以及物理信息神经网络等。因此,本研究采用神经架构搜索方法,寻找最优的深度神经网络结构,以获得对物理系统最精确的数值模型。具体步骤如下:

 (1)随机生成一个样本数据集,该数据集由70个输入/参数向量及其对应的70个输出向量组成。输入向量通过均匀随机分布生成,而输出向量则是将输入向量输入到电路系统中并记录其输出所得。 

(2)将数据集划分为训练集和测试集。采用神经架构搜索方法,寻找其输出结果与电路系统输出最接近的神经网络超参数组合。搜索空间定义如下:网络层数范围为1到5层,每层宽度在20到1500之间,初始学习率设定在10−5到10−2的范围内。经过五次训练迭代后,当数据被归一化到−1到1的范围内时,最优数值模型的验证损失仅为0.05。该模型是一个四层神经网络,采用wish激活函数,隐藏层单元数分别为311、340、1007和1224。优化器采用Adam,学习率为0.001。因此,在电子电路仿真的反向传播过程中,最优的可微数值模型结构的每层维度分别为[70,311,340,1007,1224,70]的深度神经网络。该模型的输出与电路输出高度一致,如图7所示。

图7 电子电路的典型电路输出(蓝色)和数字模型预测(红色)

4 ACPNN用于电机故障诊断

本节介绍用于电机故障诊断的ACPNN模型结构、输入输出以及参数计算方法。用于故障诊断的ACPNN分类模型完整物理神经网络结构如图8所示。该模型主要由以下几个部分组成。

图8 ACPNN框架

4.1 电机故障信号采集与信号处理

在数据准备阶段,利用传感器采集故障电机的三相电流信号(电机U、V、W三相电流)以及一路振动信号。每一路信号截取长度为196,并进行归一化处理,以确保故障信号能够充分表征故障特征。归一化后的各路信号再进行拼接,形成一个故障样本,其样本点数为196×4=784个。随后,对故障信号进行缩放变换,缩放因子为4,最终得到一个用于输入模型的196维向量。

4.2 ACPNN

本研究选取70个输入样本和70个输出样本作为RLC晶体管电子电路的输入—输出维度。为在电路噪声存在以及数值模型精度相对较低的情况下实现稳定性能,本文采用7个单通道三层物理神经网络组合构建模拟电路分类模型。

在最终阶段,各分支输出通过加权平均的方式生成最终结果。此外,模型还引入了残差网络的跳跃连接,以实现信息的直接传递,防止特征在层间传播过程中逐渐消失,从而提升网络性能。

4.3 ACPNN分类模型

完整建模步骤如下:

(1) 对196维故障信号采用逐元素添加权重和偏置的方法。为每一个元素分配可训练参数,从而在输入数据上引入权重和偏置。具体而言,    。其中,    和    为可训练参数,    表示输入数据向量,    表示加入权重和偏置后的电压时间序列向量。所得向量随后被传输到模拟电路中。

(2) 将196维向量划分为若干个14维区域,以保证用于故障诊断的信号数据与电子电路70维输入—输出变换的兼容性。每个区域通过求和池化进行处理,从而将其降维为一个 14维向量。随后,将该14维向量按顺序重复拼接5次,生成一个70维数据集,作为第一次物理电路变换的输入向量    

(3) 输入数据随后通过一个三层物理神经网络PNN进行处理,具体如下:

PNN的第一层:将70维参数化数据向量    分成两条路径。在第一条路径中,    经过第一层 PNN电路处理,得到一个70维输出向量    。在第二条路径中,引入一个带有可训练参数𝑎的跳跃连接。随后,将该路径的结果与第一条路径的输出相加,表示为    

PNN的第二层:将第一层输出的70维向量通过逐元素添加权重和偏置的方式进行处理,该变换生成第二层物理电路的输入,表示为  。随后,重复执行跳跃连接和物理变换操作,得到  

PNN的第三层:重复第二层的操作,最终生成70维输出数据。

(4) 将70维输出数据裁剪为50维。所得50维向量    被划分为10段,并分别求和,从而生成一个10维向量。

(5) 对另外6个子PNN重复上述过程,每个子PNN都对应一组独立的可训练参数。因此,每个子PNN都会生成一个独特的10维输出向量。

(6) 对这7个10维向量进行加权求和,计算方式为    。 因此,ACPNN的参数总数为:7×196+7×2×70+7=4711个参数。

5  实验设置和数据集描述

本节介绍了SRM和BLDCM两种类型电机的测试平台,包括实验设置、故障预设和数据集处理。

5.1 SRM实验设置

SRM的测试平台如图9所示。该实验平台主要由三个部分组成:电动汽车后桥、电机控制系统以及信号采集系统。电动汽车后桥包括变速箱、差速器、车轮和开关磁阻电机。本平台采用的是三相双凸极开关磁阻电机,其具体参数列于表3中。

图9 SRM实验设置

电机控制系统采用可调恒压电源来调节电机驱动器的输出,由驱动器对SRM进行控制。信号采集系统则由三通道电流探头(80i-110s,Fluke公司)、单通道加速度传感器(CA-YD-1182)以及NI-USB 4431数据采集卡组成。

表3 SRM的电气参数

为电机预设了故障工况。具体的故障类型及其标签见表4。在表中,    表示轴承内圈故障,其中    表示故障宽度,单位为毫米;类似地,    表示轴承外圈故障,其中    同样表示故障宽度,单位为毫米。    表示电机    相的高阻连接(High-Resistance Connection,HRC)故障,其中    表示电阻值,单位为欧姆;    和    也遵循相同的命名规则。

表4 SRM故障和标签设置

表4共包含10类故障。故障类型0表示电机处于健康状态,即不存在任何故障。故障类型1–3对应于高阻连接与轴承内圈缺陷的复合故障。在这些情况下,将轴承内圈故障与 ABC三相中某一相的0.5Ω电阻故障相结合,以模拟不同的HRC故障。故障类型4–6表示电机的高阻连接故障,而故障类型7–9则对应于高阻连接与轴承外圈缺陷的复合故障。这些故障通过在ABC三相中某一相设置HRC故障,并同时引入轴承外圈故障来构造。这种故障分类方式有助于实现对开关磁阻电机多种故障类型的诊断,从而保证故障识别的全面性和准确性。

5.2 BLDCM实验设置

该平台包含10台无刷直流电机,其中包括1台健康电机和9台故障电机。电机的详细参数列于表5中。该平台还配备了三通道电流探头(80i-110s,Fluke公司)、单通道加速度传感器(ADXL1001,ADI公司)以及一套基于微控制器单元的数据采集装置,用于信号采集。

表5 BLDCM的电气参数

对每台被测无刷直流电机均预先设置了故障工况。故障设置及其对应标签见表6。在表中,故障类型0表示高阻接触故障,其设置方式是在电机某一相绕组中串联电阻;故障类型1表示相断路故障(Phase Disconnection Fault,PDF),通过断开电机某一相实现;故障类型2表示霍尔传感器故障(Hall Sensor Faults,HSF),通过断开电机霍尔传感器电缆来构造。故障类型3和4表示轴承内圈故障(Bearing Inner Race Faults,BIRF),其设置方式是采用线切割工艺在轴承内圈上分别加工1mm或2mm的损伤;故障类型5表示转子不平衡故障(Rotor Unbalance Faults,RUF),通过在电机转子上附加不对称额外质量来实现;故障类型6到8表示轴承外圈故障(Bearing Outer Race Faults,BORF),其设置方式是采用线切割工艺在轴承外圈上分别加工直径为0.3mm、1mm或2mm的损伤。故障类型9表示正常工况,即无任何故障的健康BLDCM。

表6 BLDCM故障和标签的设置

5.3 数据预处理

根据表3和表5中列出的10类故障,采用SRM和BLDCM的振动信号及三相电流信号对ACPNN模型进行训练。原始实验数据首先进行归一化处理,并按照时间步长(样本长度)为 196、重叠率为0.4的方式进行分段,每一类故障提取8000个样本。随后,对样本点进行随机打乱。每个样本表示为一个4×196的矩阵,其中包含3路电流信号通道和1路振动信号通道,每个通道均含有196个采样点。最终,将数据集按照8:1:1的比例划分为训练集、测试集和验证集。

6 实验结果分析

本节将ACPNN应用于开关磁阻电机的高阻接触及轴承复合故障诊断,以及无刷直流电机的复合故障诊断中,以验证所提出方法在电机故障诊断中的有效性和性能。

6.1 ACPNN训练

数据集构建完成后,将所提出的模拟电路分类模型应用于10类故障的分类实验中。研究在 Python 编程环境下,采用PyTorch 1.6.0和PyTorch-Lightning 0.9.0作为深度学习框架。训练参数设置如下:batch size设为100,epoch设为35,优化器采用Adadelta算法[41]。初始学习率设为0.75,并在训练进行到30轮后下降至0.375。

6.2 SRM的高阻接触与轴承混合故障诊断结果

采用SRM高阻接触与轴承复合故障数据集对模拟电路分类模型进行训练与验证。将预处理后的数据输入ACPNN中,所得结果如图10所示。

图10 ACPNN模型的信号输出。标记为(a)–(p)的信号与图8中的对应信号一致。它们以SRM的第5类故障为例,表示网络各层中信号的状态。在子图(o)中,不同颜色的曲线对应于7个不同三层PNN的输出。

基于模拟电路分类模型的10类高阻接触故障输入信号及输出结果如图11所示。研究采用二维编码方法对其进行可视化,从而展示出清晰可分的故障特征以及一致的分类结果。所得混淆矩阵如图12(a)所示,而模型的训练精度和损失曲线如图12(b)所示。对于该数据集,模拟电路分类模型在测试集上的故障分类准确率达到96.7%。当将前向传播中的电路计算替换为等效可微数值模型(EDNM)时,模型的分类性能为95.9%。进一步采用ACPNN后,分类性能提升了0.8%。

图11 SRM的十类输入信号、二维特征图和输出结果

图12 SRM的混淆矩阵和训练精度曲线

6.3 BLDCM混合故障诊断结果

采用BLDCM故障数据集对模拟电路分类模型进行训练与验证。基于模拟电路分类模型的10类BLDCM故障输入信号及输出结果如图13所示。

图13 BLDCM的十类输入信号、二维特征图和输出结果

这些结果通过二维编码方法进行可视化,进一步突出了不同故障的显著特征以及一致的分类结果。所得混淆矩阵如图14(a)所示,训练精度和损失曲线如图14(b)所示。对于该数据集,模拟电路分类模型在测试集上的故障分类准确率达到97.8%。同样地,当将前向传播中的电路计算替换为等效可微数值模型(EDNM)时,模型准确率为88.3%。对于BLDCM数据集,采用所设计的ACPNN后,分类准确率提高了9.5%。

图14 BLDCM的混淆矩阵和训练精度曲线

6.4 少样本条件下ACPNN鲁棒性的实验分析

考虑到电机在实际运行中常常处于恶劣工况下,且故障样本较难获取,因此本文评估了ACPNN在小样本和高噪声条件下的有效性。将BLDCM数据集中每类样本数量由8000个减少至800个,并向故障样本中注入20 dB、15 dB和10 dB的噪声。该数据集由3路电流信号通道和 1 路振动信号通道组成,每个通道均包含196个采样点,并按照8:1:1的比例划分为训练集、测试集和验证集。为了进一步评估ACPNN在单通道信号上的有效性,本文还仅使用BLDCM的振动信号进行训练与验证。结果见表7,其中,BPNN表示传统神经网络。两层BPNN的每层的维度是[196,60,10],三层BPNN的每层的维度是[196,128,64,10],四层BP网络的每层的维度是[196,256,64,64,10]。

表7 实验结果

如表7所示,ACPNN仅需42 KB的参数存储空间。在各种噪声条件下(包括无噪声情况),其平均准确率可达到94.11%。与采用等效可微数值模型进行前向传播相比,ACPNN的分类性能提升了25.3%,这表明其大部分功能来源于受控的物理变换过程。对采用不同层数的传统反向传播神经网络进行分类任务比较后发现,任务难度与准确率之间呈现出非线性关系。通常,为了提升神经网络性能,往往需要将参数数量提高约一个数量级,这会显著增加计算成本,并进一步导致计算时间和功耗上升。而ACPNN在一定程度上缓解了这一问题。此外,在仅使用单通道振动信号的情况下,ACPNN 仍然能够取得较为理想的分类性能,进一步说明了其良好的鲁棒性和适用性。

6.5 与现有方法的比较

在本小节中,将所提出的方法与主流物理神经网络方法进行比较,以突出其技术差异及各自适用的应用场景。比较结果见表8。当前关于PNN的研究主要集中在光学芯片、忆阻器芯片等平台上,其任务大多面向二维图像处理。相比之下,本文所研究的方法将PNN应用于电机故障诊断:通过将一路振动信号与三路电流信号进行拼接,形成一维输入并送入ACPNN模型。借助ACPNN物理变换系统低功耗、低成本的特点,实现了高精度的电机故障诊断。

表8 PNN方法对比

7 讨论

本研究针对电机故障分类问题,研究了一种低功耗ACPNN。为了进一步提升所提方法在实际场景中的应用可行性,下面将从两个关键方面展开讨论。

7.1 ACPNN能耗分析

在上述实验中,ACPNN在故障诊断中取得了较高的准确率。与传统前馈神经网络相比,ACPNN在能耗和时间消耗方面表现出显著优势。然而,当前关于基于电路的物理神经网络(PNN)的研究主要集中在忆阻器阵列、光电子芯片等技术上,而对于采用纯模拟电路实现PNN的研究仍然相对有限。在这类电路中,功耗往往难以通过简单的计算和测量直接获得,因此很难进行标准化的能耗比较。为此,本文通过对晶体管网络求解非线性微分方程时所涉及的功耗与速度成本进行近似计算,来说明该电路分类网络的优越性。

考虑一个具有N个自由度的耦合非线性微分方程模型。

 

其中,    表示系统变量,    表示    对时间的导数。第一项表示线性项,说明    的变化率受到其他变量    线性组合的影响,其比例系数为    。 第二项表示二次非线性项,表明     的变化率还会受到所有变量两两乘积的影响。其中,系数    描述了系统中的复杂相互作用。第三项表示三次非线性项,而更高阶项则描述了多个变量乘积所构成的更复杂的非线性耦合作用。最后,    为非齐次项,用于表示作用于系统的外部输入或驱动力。

积分非线性微分方程并对晶体管网络进行仿真所需的名义运算次数可表示为:

 

其中,ΔT表示仿真时间,Δf表示仿真带宽,Nd表示描述每个晶体管所需的自由度数。参数n指定了表征系统运行状态所需的非线性耦合最高多项式阶数,而    表示每一非线性阶对应的晶体管间耦合范围(即每个晶体管与多少其他晶体管存在显著耦合)。对于每个晶体管而言,非线性项是局域的,这意味着当𝑖 >1时,      =1。在这些条件下,

 

晶体管的内部复杂性被抽象为一种局部非线性响应σ。该物理系统由某一方程所支配,其中每一个数值积分步都类似于通过一个残差层进行推进。

 

现代CPU/GPU的功耗大约为每十亿个晶体管10W,对应于每个晶体管的平均能耗约为100nW。本文考虑一种由典型现代晶体管构成的ACPNN,其可在数GHz的数字时钟频率下运行,并能够使非线性模拟动力学达到最高20GHz的频率。对于输入信号,假设采用数模转换(Digital-to-Analog Conversion,DAC)。该电路需要NT个时变输入和输出,因此需要配置NT个数模转换器和模数转换器(Analog-to-Digital Converter,ADC)。在采用等效电路描述的条件下,晶体管本身的能耗可表示如下:其中每个晶体管取Nd=10个自由度,晶体管总数NT=100,演化时间为10ns,输入带宽为5GHz(对应仿真中的最大频率为20GHz),耦合范围为M=100个相邻晶体管:

 

DAC和ADC的能量消耗可表示为:

 

其中,  表示输入和输出的采样频率。由于EADC/DAC ≫   ,因此可认为晶体管本身的功耗可以忽略不计。上式中的非线性计算通过设定  来近似等效为二次非线性项。根据上式,求解所需的运算次数可表示为:

 

JEDI超级计算机的能耗为13.7pJ/次运算,处理速度为5.13×1015次运算/秒。Nvidia RTX 3090 Ti GPU的半精度浮点运算速度为3.99×1013次运算/秒,能耗为11.25 pJ/次运算。因此,数字仿真在JEDI上需要的能量为2.2 × 107 × 13.7 pJ/operation = 0.3014 mJ,所需时间为1/(5.13 × 1015) × 2.2 × 107 = 4.268 ns。而在RTX GPU上,数字仿真需要的能量为2.2 × 107 × 11.25 pJ/operation = 0.2475 mJ,所需时间为1/(3.99 × 1013) × 2.2 × 107 = 551.364 ns。最终计算结果见表9。小规模物理神经网络在显著降低功耗的同时,也在计算时间方面表现出一定优势。

表9 相同操作次数下的时间和能耗比较

7.2 ACPNN在物联网中的潜在应用

随着物联网应用的不断发展,边缘设备所承担的工作负载和计算需求持续增加。然而,由于边缘设备具有异构性且资源受限,因此对其性能进行优化至关重要。所提出的方法可以与嵌入式设备集成,其中分布式边缘检测单元用于信号采集,而主设备上则设计集成化的 ACPNN 电路。借助ACPNN结构简单、鲁棒性强和低功耗的特点,可将部分计算任务从成本高昂的数字处理器转移到快速且节能的物理协处理器上,从而实现高精度、快速的故障检测与诊断,如图15所示。

图15 ACPNN在物联网数据传输和分布式处理中的潜在应用实例

8 结论

本研究探讨并应用了一种基于ACPNN的电机故障诊断方法。利用ACPNN结构简单、鲁棒性强以及低功耗的特点,分别对两类电机故障场景进行了诊断:一类是开关磁阻电机SRM的高阻接触与轴承故障,另一类是无刷直流电机的复合故障。所提出方法的贡献主要体现在三个方面:(1)构建了一种低功耗ACPNN模型,并对其电路结构进行了分析;(2)研究了一种适用于ACPNN的物理感知训练方法;(3)将ACPNN应用于电机故障诊断,并取得了较高的分类精度。通过对比实验与分析,ACPNN表现出较强的鲁棒性,同时具有计算量和计算时间更少、能耗和成本更低、响应速度更快等优势。此外,本文还讨论了ACPNN与嵌入式系统结合后在物联网环境中的潜在应用。本研究验证了ACPNN在电机故障诊断中的有效性,并突出了其在物联网低功耗应用中的潜力。鉴于物联网设备通常受到能量约束,ACPNN为实时监测和故障检测提供了一种高效且可扩展的解决方案。未来的研究将进一步探索该方法与物联网数字芯片的集成,并将其应用拓展到其他类型电机及旋转机械的故障诊断中。


编辑:曹希铭

校核:李正平、陈凯歌、赵栓栓、赵学功、白亮、任超、Tina、陈宇航、海洋、Kira、王金、赵诚、肖鑫鑫、张优

该文资料搜集自网络,仅用作学术分享,不做商业用途,若侵权,后台联系小编进行删除



来源:故障诊断与python学习
ACTACP振动非线性化学旋转机械电源通用汽车电力电子ANSApython新能源云计算电机Electric人工智能
著作权归作者所有,欢迎分享,未经许可,不得转载
首次发布时间:2026-03-25
最近编辑:5月前
故障诊断与python学习
硕士 签名征集中
获赞 87粉丝 152文章 327课程 0
点赞
收藏
作者推荐

故障诊断大模型 | BearLLM :基于统一振动信号表示的先验知识增强轴承健康管理框架

现有的健康管理方法多局限于有限的工况条件,并且通常只能执行单一的健康管理任务,难以满足复杂工业场景的需求。本期推荐论文:BearLLM: A Prior Knowledge-Enhanced Bearing Health Management Framework with Unified Vibration Signal Representation,由中国科学院沈阳自动化研究所智能检测与装备研究室的科研团队发表在人工智能领域国际会议AAAI 2025,该项工作构建了首个多模态轴承健康管理数据集(MBHM)。该数据集融合机械振动信号与健康语料,覆盖数百种工况,显著提升了数据的复杂性与现实代表性。在此基础上,提出 BearLLM 框架:基于工业大模型,通过频域差异分析提升诊断精度,并将振动信号与语义对齐,实现了多种任务的统一自然语言响应。实验结果表明,这一框架在数百种复杂工况条件下表现出了领先的性能。论文基本信息论文题目:BearLLM: A Prior Knowledge-Enhanced Bearing Health Management Framework with Unified Vibration Signal Representation论文日期:2025论文链接:https://arxiv.org/abs/2408.11281数据集:https://hf-mirror.com/datasets/SIA-IDE/MBHM作者:Haotian Peng(1, 2, 3, 4*), Jiawei Liu(1, 2, 3*), Jinsong Du(1, 2 ,3), Jie Gao(1, 2, 3†), Wei Wang(1, 2, 3†)机构:1 Shenyang Institute of Automation, Chinese Academy of Sciences2 Liaoning Liaohe Laboratory 3 Key Laboratory on Intelligent Detection and Equipment Technology of Liaoning Province4 University of Chinese Academy of Sciences作者邮箱:{penghaotian, liujiawei, jsdu, gaojie, wangwei2}@sia.cn作者简介:高洁,中国科学院沈阳自动化研究所副研究员,主要从事信号检测,雷达信号处理的研究与开发工作。目录摘要1 引言2 相关工作3 多模态轴承健康管理数据集4 方法 4.1 基于先验知识的振动信号统一表示方法 4.2 特征抽取 4.3 特征对齐5 实验 5.1 实验设置 5.2 与故障诊断方法的比较 5.3 消融实验与泛化 5.4 用户研究6 结论摘要我们提出了一种基于大型语言模型(BearLLM)的轴承健康管理框架。BearLLM是一种新型多模态模型,通过处理用户提示和振动信号,将多个轴承相关任务统一整合。具体而言,我们引入了先验知识增强的统一振动信号表示方法, 以应对多数据集中的不同工况。该方法包含三个关键步骤:根据传感器采样率自适应采样振动信号、通过频域统一输入维度、 以及使用无故障参考信号作为辅助输入。为从振动信号中提取特征,我们首先训练故障分类网络,将提取的特征转换并对齐为词嵌入,最终将这些特征与文本嵌入拼接后输入语言模型。为评估该方法的性能,我们构建了首个大规模多模态轴承健康管理(MBHM)数据集,包含配对的振动信号和文本描述。通过统一的振动信号表示方法,BearLLM仅需一组预训练权重,便在九个公开可用的故障诊断基准测试中取得顶尖表现,超越了专为单一数据集设计的特定方法。我们提供数据集、模型及代码, 旨在激励未来研究开发更强大的工业多模态模型。1 引言轴承是机械旋转设备的核心部件,但由于复杂的运行和环境条件,其故障率较高[40] 。轴承健康管理(如异常检测、故障诊断和维护建议)在工业安全生产中具有重大实际意义 ,可减少经济损失和维护成本[32,44,35]。当前轴承健康管理框架依赖于为不同工况和任务设计专门方法,如图1(a)所示。为将特定方法应用于复杂的真实工业场景,领域适应与泛化技术已引发广泛关注。领域适应技术通过降低领域偏移或差异,使在一个源领域训练的模型能够在不同但相关的目标领域中表现良好[43,46] ,但当源域和目标域类别不一致时(例如从具有四种故障类型的工况C1 过渡到具有五种类型的C 2 ),其准确性会降低。领域泛化旨在提取领域不变特征以提升未见领域上的性能[19,47,4] ,但通常受限于差异较小的有限工况数量,例如[5,22]中少于十个工况。这些纯数据驱动的方法往往难以在高准确性和强泛化能力之间取得最佳平衡,从而影响故障诊断效果。本文提出了一种增强先验知识的轴承大语言模型(BearLLM),如图1(b)所示,该模型能够整合来自多个数据集的数百种不同工况下的轴承健康管理任务。为应对多样化工况,我们创新性地引入了增强先验知识的统一振动信号表示方法。与多数采用固定长度输入片段的故障诊断方法不同,我们采用可变长度但固定时长的振动信号采样片段。这些时长一致的片段经频域转换后进行对齐处理。我们进一步利用无故障参考信号作为先验输入,从而省去了针对不同轴承类型进行复杂机构分析的步骤[47]。 图1:现有轴承健康管理框架[3,28]与我们提出方法的对比。我们的BearLLM替代了针对不同条件和任务设计定制化方法的复杂操作。具体而言 , 我们首先设计一个故障分类网络(FCN),基于差异特征提取故障特征。通过分析查询信号段与无故障参考信号段之间的频率成分差异,这种基于频率的新型特征提取范式在轴承故障诊断中展现出更优的性能(即更快的收敛速度和更高的准确率) ,并实现了更强的泛化能力,相较以往直接从振动信号中提取故障特征的方法更具优势。提取的特征经过转换和对齐后生成词嵌入,随后与用户文本嵌入结合作为大语言模型(LLM) 的输入。为评估该方法的性能,我们构建了首个大规模多模态轴承健康管理(MBHM)数据集,包含配对的振动信号和文本描述。尽管九个公开数据集的振动信号分布存在显著差异,但采用预训练权重的BearLLM通过统一的振动信号表征,取得了与当前最先进方法相当的性能,甚至超越了针对单一数据集设计的专用方法。本文的主要贡献总结如下:• 我们提出一种新型轴承多模态大语言模型,通过比对振动信号与文本提示,实现多项轴承健康管理任务的统一。• 我们提出一种基于先验知识增强的统一振动信号表示方法,以处理来自多个数据集的多种工况。• 我们构建了首个面向轴承健康管理(MBHM) 的大型多模态数据集,包含振动信号及其对应的文本描述。• 实验结果表明,我们的BearLLM在九个公开基准测试中均优于当前最先进的故障诊断方法。2 相关工作多工况: 由于测试设备、传感器和环境的差异导致采集信号的异质性,使得从多个数据集在不同工况下进行故障诊断具有挑战性,难以获得统一特征[41] 。现有领域适应方法[6,38,25,14] 通常在已知工况(源域) 下训练模型 , 随后将知识迁移至未知工况( 目标域) 。然而这些方法在实践中仍需针对每个工况进行单独迁移微调,限制了其跨场景泛化能力。领域泛化方法通过多工况训练, 旨在通过网络架构和损失函数的设计使不同域的特征分布对齐[15,48,12] 。但这些方法往往依赖复杂的数据预处理和增强技术来帮助模型从振动信号中学习故障特征。多任务: 数据驱动的机械健康管理已获得显著发展[37] 。健康管理的概念通常涉及多项任务[29,49] ,包括异常检测 、故障诊断 、性能退化预测 、维护决策等。LLMs如ChatGPT-4[30] 在广泛任务中展现出卓越能力 。 LLaMA 3[27]和Qwen 2[1]等开源基础模型的出现,进一步赋能了各学科研究人员将这些模型整合到自身应用中。在航空领域,Liu等人[23] 应用广义线性模型实现多项任务,包括航空发动机装配指导与装配误差识别。在石油工业中,Eckroth等人[9] 设计了一种基于大语言模型(LLM)和知识图谱的问答系统,能够检索地层数据和地质年代测定等功能 。然而,利用LLMs整合多项任务进行轴承健康管理的研究仍较为有限[20]。3 多模态轴承健康管理数据集尽管表1中包含多个轴承相关数据集,但这些数据集通常仅采集单一测试装置的振动信号,工况条件有限,且缺乏用于训练语言模型(LLM) 的对应文本描述。为此,我们构建了一个大规模的公开多模态轴承健康管理数据集(MBHM)。 表1:不同数据集的对比。我们的 MBHM 数据集包含最多的工况、最完整的故障类型以及最长的文本提示/响应配对时间。该 MBHM 包含135,516对振动信号片段与故障类型,以及542,064对文本提示与响应,每个样本如图3所示,包含振动信号、故障标签、运行状态ID 、用户提示及文本响应 , 即 。我们的数据集包含从九个公开数据集收集的262种工作状态 , 即 CWRU [2] 、 DIRG [7] 、HIT[11] 、IMS[33] 、 JNU [16] 、JUST[34] 、 MFPT [10] 、PU[18] 、 XJTU [39] 。针对每个振动信号,我们设计了四项任务:通过ChatGPT[30]生成文本响应进行异常检测、故障诊断、维护建议及潜在风险分析。数据集构建的详细方法见附录A.3 。我们的 MBHM 数据集包含以下特征:• 多模态 : 每个振动信号均配有四个文本提示与响应,支持多模态多任务模型的训练与开发。 图2:我们提出的BearLLM架构。给定查询振动信号片段 和用户指令 作为输入,模型从数据库中检索出工况相似的无故障振动信号片段 作为参考。通过 DCN 将两个振动信号转换为统一表示。特征编码器识别两个信号之间的故障相关残差。对齐层将这些特征转换为词嵌入 。最后,利用LLM结合用户文本嵌入 生成多任务自然语言响应,其中 表示编码文本嵌入的长度。 图3:本 MBHM 数据集的示例案例 ,包含振动信号 、故障标签 、工作状态 、具体任务提示文本 以及响应文本 。• 多工况: 我们的数据集覆盖更广泛的工作场景,能更精准地模拟真实工业生产环境。4 方法本节提出BearLLM——一种整合多种轴承相关任务的新型多模态模型。为应对不同数据集中的多样化工况,我们在第4. 1节引入了基于先验知识的统一振动信号表征方法。该统一振动信号被输入故障分类网络进行特征提取(第4.2节) ,随后将提取的特征转换为词嵌入并进行对齐,最终与文本嵌入拼接后作为输入送入大语言模型(LLM)(第4.3节)。4.1 基于先验知识的振动信号统一表示方法BearLLM旨在管理数百种工况下的多种轴承相关任务。其核心在于构建统一的振动信号表示方法,包括根据传感器采样率自适应采样振动信号片段、通过频域整合统一输入维度, 以及利用无故障参考信号计算残余量作为辅助输入以提高数据利用效率。自适应采样 为监测不同工况和工业场景下的各类机械设备 ,振动传感器被部署为不同名称和采样率 。然而,大多数故障诊断方法[48,8]使用时域中固定长度的信号段作为输入,其中输入的故障频率分量偏离其原始固有值并随采样率变化 , 阻碍了准确的故障诊断。我们不采用固定长度信号段采样,而是利用传感器采样率的先验知识,对振动信号进行自适应采样,生成可变长度但固定时长的信号段。我们通过公式1从原始信号 中提取第 个查询信号段 ,并控制 的长度。 其中 表示传感器的采样率。频域输入对齐 自适应采样后,每个查询段( )具有相等的持续时间,且 X_v 的频率被对齐。然而, 由于采样率不同导致 长度变化,会产生不同数量的频率分量,使其不适合输入网络。我们设计了一种离散余弦归一化(DCN),该方法通过离散余弦变换(DCT)将振动信号转换至频域,使用填充或裁剪统一 个频率分量,并通过归一化 对振幅进行标准化。归一化频率表示 通过以下方式获得 采样率低于 的信号会被零填充,而超过 的信号则会被截断。为平衡计算资源与故障分类精度,我们通过经验设定 (更多细节见表3)。为增强训练稳定性,将频率序列的幅度归一化至[−1,1]范围内, 其中 为缩放因子,通过统计分析 MBHM 数据集确定为0.01。无故障参考信号为消除不同输入在各种运行条件下的分布差异,我们引入无故障信号作为参考信号。1) 在实际使用中,当设备正常运行时(例如工厂验收或维护后),可采集并保存参考信号段 ;2) 在 MBHM数据集上进行训练时, 的获得通过 这表明当我们的 MBHM 数据集中的信号( )无故障(即 )且与 具有相同工况(即 )时,会选择 。我们将查询频率信号( )、无故障频率信号( )和残余频率信号( )作为统一的振动信号表示进行组合, 4.2 特征抽取为提取振动信号的特征,我们提出一个故障诊断网络(FCN),该网络包含由 参数化的特征编码器和由 参数化的线性分类层,如图4所示。我们通过三个独立的卷积层(采用大核[45]且无权重共享)从统一振动信号表示( )中提取特征。随后通过三个多尺度通道注意力模块(MSCAB)对特征进行变换,其中多尺度特征通过通道注意力模块(CAM)[42]进行融合。最后使用两个线性层进行故障分类。我们的 FCN 以统一表示( )作为输入,并输出故障类型( )。 的形状为 , 表示故障类型数量。我们使用交叉熵损失进行训练,以故障标签 作为真实标签。训练过程如算法1所述。随后将 FCN 训练良好的特征编码器权重 ( )用于Bear- LLM并冻结(见图2),同时使用 FCN 分类器权重 ( )初始化对齐层。 图4:我们提出的 FCN 结构。在特征编码器中,首先使用三个宽卷积层提取主特征,随后通过三个 MSCAB块对多尺度特征进行转换和融合, 以实现故障分类。预训练 FCN 用于初始化BearLLM的特征提取器和对齐层。4.3 特征对齐我们提出一个特征对齐层,将振动特征嵌入词嵌入中,该 MLP 由三个线性层(即 , , )组成。对齐层的权重为 ,其中 是 & (即 FCN 中的两个线性分类层)的权重, 是 的权重。我们使用 将 的输出 转换为词嵌入 ,即, 其中 表示转换后的标记长度, 是LLM的隐藏层大小。 的权重 通过所有故障类别的文本描述 进行初始化 其中T代表文本域。E和T分别表示预训练LLM的嵌入层和分词器。通过使用分词器T和嵌入层E ,我们从 生成词嵌入,随后将其重塑为权重矩阵 。关于权重初始化的更多细节,请参见附录C.3。我们使用预训练的Qwen2-1.5B[1]作为由 参数化的LLM,实现了基本的人机交互。然而,其对特定领域的知识掌握和生成质量仍有待提升。我们采用现有的LoRA技术[13]和通用 PEFT[26] ,对LLM和我们提出的对齐层进行同步微调,具体细节详见算法1。 5 实验5.1 实验设置我们使用PyTorch[31]实现了所提出的方法。预训练和微调均在单个Nvidia RTX 4090 GPU上完成。在预训练、对比试验和消融实验中,我们采用AdamW[24]作为优化器,批量大小设为1024,训练最多50个epoch。微调使用现有PEFT[26]库完成。为评估本方法的有效性,我们提供了故障诊断、关键部件消融及语言响应质量评估的定量对比结果。为解决标签泄露问题,我们将9个公开数据集按7:2:1比例进行分割。MBHM 数据集的训练集由各子数据集的训练集拼接而成,确保与对应测试集无重叠。其他任务(包括异常检测、维护建议及潜在风险分析)详见附录D。5.2 与故障诊断方法的比较我们将BearLLM与以下故障诊断方法进行了比较。BearFM[17]和MagNet[36]旨在诊断交叉作业条件下的故障,而 WDCNN [45] 、 TCNN [6]和 QCNN [21]则针对特定作业条件设计。这些方法的详细描述可参见附录B 。为确保公平比较,我们在第5. 1节中重新实现了这些方法并在相同设置下进行测试。结果展示于表2。 表2:与现有方法的准确率对比。“DCN”表示在原有方法基础上添加 DCN ,“FCN” 则表示用 FCN 替换原有方法的网络结构,“(+108%)”代表从48.01%提升至100%的相对改进。我们的方法不仅在 MBHM 数据集上超越了SOTA 的准确率,其结果还优于专为单一数据集训练的模型。 DCN 和 FCN 组件在多种场景中均展现出广泛适用性。与BearingFM[17]相比,我们的 DCN 在相同 FCN 下实现了更高的精度(见图5(a))。这种提升的原因可能是BearingFM在包络谱 FFT 后使用绝对值。该方法仅捕捉振幅而忽略关键相位信息。相比之下,DCN 利用实数计算,有助于减少潜在信息损失,且运行时间不到比较方法的20%。将 DCN 与MagNet[36]结合,并利用对齐数据进行融合增强,显著提升了在分布差异显著数据集上的性能。如表2所示 ,三种缺乏数据增强或对齐技术的方法(WDCNN 、 TCNN 、 QCNN)在某些特定数据集上表现出较高准确率。然而,当在 MBHM 数据集上训练时,它们处理大规模分布差异的能力受到限制。引入DCN 技术可缓解 QCNN [21]中明显的过拟合现象,从而显著提升验证准确率(见图5(b))。类似地, 同时对WDCNN [45]和 TCNN [6]添加 DCN 也提高了准确率。在所有测试方法中,我们提出的方法不仅达到最高准确率,收敛速度也最快(如图5(c))所示,在 MBHM 数据集上仅需20个epoch即可收敛)。 图5:不同模型训练过程中的准确率与学习率变化趋势。(a)用 FCN 替换BearingFM网络后,准确率提升且收敛速度加快。(b)将 DCN 纳入 QCNN 显著缓解了过拟合问题。(c)我们提出的方法展现出最快的收敛速度和最高的准确率。5.3 消融实验与泛化测试在 DCN 中使用了四种不同的 设置(参见等式2),如表3所示。 由于振动信息主要存在于低频范围内,截断不太可能显著影响准确性。通过增加频率分量的数量,可以最小化截断引起的失真,从而提高MBHM数据集的精度;然而,这也增加了 FCN 中的参数和计算量。为了在准确性和性能之间取得平衡,我们选择24,000作为 。 表3:不同nf 设置下 FCN 的参数数量、浮点运算次数(FLOP)及在 MBHM 数据集上的准确率对比。为验证所提方法中各组件的有效性,我们开展了消融实验。通过直接使用原始时域振动信号(固定长度片段)作为输入,并分别及联合移除无故障通道与残余通道,对性能进行了评估。 表4的实验结果表明,仅使用时域信号时会出现显著的准确率和泛化能力下降,这进一步凸显了DCN 方法的有效性。通过应用t-SNE算法,我们对比了包含故障通道与无故障通道的输出可视化效果。图6(b)中的蓝色方框显示, 同一数据集的信号片段在特征空间中呈现高度聚类,这表明模型首先识别数据集类型,再进行故障分类细化。与之相反,如图6(a)所示,我们提出的方法有效缩小了数据集间的差异。该模型通过捕捉查询信号片段与无故障信号片段之间,创建在不同工况下实现统一的特征表示,并提升泛化能力。 表4:展示了不同消融设置的准确性和泛化能力比较。 图6:t-SNE可视化输出特征。(a)我们的方法显示出明显的类间可分离性。(b)去除无故障通道和残余通道后,同一数据集中的信号呈现相似特征。我们通过零样本场景评估所提方法的泛化能力。在公开数据集中,JUST[34]和IMS[33]是规模最大的数据集。我们使用仅占 MBHM 训练数据35%的 MBHM(不含JUST 和IMS)数据集进行训练 ,并分别在JUST 和IMS数据集上进行零样本测试。在JUST数据集上,我们的方法无需任何微调即可达到90.22%的准确率。相比之下,未使用无故障通道和残差通道的方法准确率仅为87.54%。图7(a,b)展示了IMS数据集[33]在零样本测试中,配置故障通道与保留残余通道时的混淆矩阵对比。由于IMS 数据集存在不平衡性(多数样本为无故障通道),整体准确率从98.52%略微下降至97.81%。但未配置两个辅助通道的方法存在严重低估故障严重程度的倾向:例如,61%的严重外环故障被误判为中度故障,23%的中度外环故障被误判为轻微故障。CWRU [2]和 XJTU [39]数据集是唯一包含全部十种断层类型的数据集。为验证构建统一表征的潜力,我们分别在 MBHM(无 CWRU)和 MBHM(无CWRU & XJTU)数据集上训练模型。 随后在常用 CWRU 数据集上进行零样本测试,混淆矩阵结果如图7(c,d)所示。我们的方法在未训练的 CWRU 数据集上分别达到90.26%和89. 14%的显著准确率,该结果甚至优于部分基于 CWRU 训练的方法,这表明了我们统一表示方法的普适性,且不依赖于任何特定的完整数据集进行训练。 图7:不同场景下零样本性能的混淆矩阵对比。(a)在 MBHM(无IMS&JUST)数据集训练并在IMS上测试的方法,展现出相对可靠的准确率。(b)在 MBHM(无IMS&JUST)数据集训练并在IMS上测试的无故障通道与残差通道方法,准确率较低且存在低估严重性的倾向。(c)在 MBHM(无 CWRU)数据集训练并在 CWRU 上测试的方法,验证了泛化能力。(d)在 MBHM(无 CWRU & XJTU)数据集训练并在 CWRU 上测试的方法,进一步证实了统一表征的泛化效果与有效性。5.4 用户研究表5汇总了四项不同任务的测试结果,用户在盲测中从 FCN 、未调优的BearLLM和微调后的BearLLM中选择最佳输出。值得注意的是,在简单任务中,选择故障代码输出的用户较少,而多数用户更倾向于自然语言输出。 图8展示了微调前后的输出示例。附录D提供了各任务的进一步对比数据。微调对简单异常检测任务的输出影响不显著。在故障诊断任务中,未进行微调的模型有时会遗漏故障严重程度信息,这一问题通过微调得到解决。对于两项更复杂的任务,微调模型生成了更准确、更详细的响应。我们的方法解决了非专家因系统复杂性而难以有效利用维护系统的挑战,降低了所需的专业知识门槛。 表5:用户研究投票结果 。任务A-D分别对应异常检测、故障诊断、维护建议及潜在风险分析。经过微调的BearLLM在所有任务中均获得最高支持率。 图8:BearLLM的输入与输出示例。振动信号和任务要求作为用户输入,生成相应的自然语言文本输出。经过微调的BearLLM表现出响应质量的提升。6 结论我们提出BearLLM ,这是一个创新的多模态轴承健康管理框架,首次尝试利用大语言模型(LLMs)整合异常检测、故障诊断、维护建议及潜在风险分析等多重轴承相关任务。为构建该统一框架,我们开发了适用于数百种工况的先验知识增强型振动信号表征方法,并构建了首个大规模多模态轴承健康管理(MBHM)数据集。在九个公开故障诊断数据集上的实验结果表明,Bear-LLM的性能超越了当前最先进的方法,甚至超过了专门针对单个数据集训练的模型。此外,我们设计的频域输入对齐和特征提取模块采用即插即用模式,显著提升了其他故障诊断模型的性能。我们希望这项工作能为未来构建更强大的工业多模态模型研究提供灵感。编辑:Kira校核:李正平、陈凯歌、赵栓栓、曹希铭、赵学功、白亮、任超、海洋、陈宇航、Tina、王金、赵诚、肖鑫鑫、张优该文资料搜集自网络,仅用作学术分享,不做商业用途,若侵权,后台联系小编进行删除来源:故障诊断与python学习

未登录
还没有评论
课程
培训
服务
行家
VIP会员 学习计划 福利任务
下载APP
联系我们
帮助与反馈