首页/文章/ 详情

初学者入门教程|| 手把手带你入门各种深度学习网络(上)

1天前浏览12
在上一篇推文中【点击即达】,我们介绍了多个常用故障诊断数据集的文件结构、信号读取方式、样本切割方法以及训练集、验证集和测试集的划分流程,并以LSTM为例,展示了处理后的振动数据如何输入神经网络。完成数据处理后,接下来的关键问题就是:面对同一组故障数据,应该选择什么网络模型?
论文和代码中,我们经常看到MLP、CNN、VGG、ResNet、RNN、LSTM、GRU、GNN、Transformer、自编码器和GAN等名称。对于初学者而言,真正困难的往往不是记住这些缩写,而是弄清楚它们之间的关系。例如,VGG和ResNet本质上属于CNN,LSTM和GRU属于RNN的改进结构,而注意力机制既可以嵌入CNN和RNN,也可以作为Transformer的核心模块。
因此,本期将从故障诊断应用角度,对常见深度学习网络进行系统梳理,重点介绍每类网络的基本概念、组成结构、数据处理流程、适用数据以及优点与局限。由于涉及的网络类型较多,全文将分为上下两篇:本篇为上篇,主要介绍全连接神经网络MLP、卷积神经网络CNN、循环神经网络RNN和图神经网络GNN;下篇将继续介绍注意力网络、编码与重构网络以及生成模型。
本期内容不仅罗列各模型定义,而且结合具体故障分类任务,说明不同网络在模型中究竟承担什么作用。文章内容较为基础且完整,适合刚接触深度学习故障诊断、对不同网络关系还不清楚,或者在阅读论文和代码时经常分不清特征提取器、时序模块和分类头的初学者。每节最后附上参考博文链接,可供读者进一步学习。

目录

0 引言

1 全连接神经网络MLP

   1.1 MLP是什么?

   1.2 MLP由哪些部分组成?

   1.3 数据在MLP中是怎样处理的?

   1.4 MLP在故障诊断中怎么使用?

   1.5 MLP有什么优点和局限?

   1.6 总结

2 卷积神经网络CNN

   2.1 CNN是什么?

   2.2 CNN由哪些部分组成?

   2.3 数据在CNN中是怎样处理的?

   2.4 CNN在故障诊断中怎么使用?

   2.5 CNN有什么优点和局限?

   2.6 总结

3 循环神经网络RNN

   3.1 RNN是什么?

   3.2 RNN由哪些部分组成?

   3.3 数据在RNN中是怎样处理的?

   3.4 RNN在故障诊断中怎么使用?

   3.5 RNN有什么优点和局限?

   3.6 总结

4 图神经网络GNN

   4.1 GNN是什么?

   4.2 GNN由哪些部分组成?

   4.3 数据在GNN中是怎样处理的?

   4.4 GNN在故障诊断中怎么使用?

   4.5 GNN有什么优点和局限?

   4.6 总结

5 注意力网络Transformer

6 编码与重构网络

7 生成模型

注:小编能力有限,如有不恰之处,请多多指正~

0.引言

随着传感器技术、工业互联网和计算能力的发展,机械设备运行过程中产生了大量振动、电流、声音、温度和压力等监测数据。如何从这些数据中准确提取设备状态特征,并及时识别潜在故障,已经成为智能故障诊断领域的重要研究内容。

传统故障诊断方法通常依赖人工提取时域、频域或时频域特征,再结合支持向量机、决策树等机器学习方法进行分类。这类方法具有较好的可解释性,但诊断效果往往依赖研究人员的经验和特征设计能力。当数据规模增大、运行工况复杂或故障特征不明显时,人工设计特征可能难以充分描述设备状态。

深度学习通过构建多层神经网络,可以直接从原始数据或低层特征中学习更加复杂的特征表示,实现从数据输入、特征提取到故障分类的端到端建模。目前,深度学习已经广泛应用于轴承、齿轮箱、电机、风力发电机和船舶综合电力系统等设备的故障诊断。

需要注意的是,深度学习并不是某一种固定网络,而是包含多种网络结构和学习方式。不同网络具有不同的信息处理特点:

  • MLP通过全连接层学习特征之间的非线性关系;
  • CNN通过卷积提取局部特征;
  • RNN通过隐藏状态建模时间依赖;
  • GNN通过节点与边描述设备或传感器之间的关系;
  • 注意力机制能够突出重要特征并建立不同位置之间的联系;
  • 编码与重构网络通过压缩和恢复数据学习潜在特征;
  • 生成模型通过学习数据分布生成新的样本。

本系列将按照“基本概念—网络结构—数据处理流程—故障诊断应用—优点与局限”的逻辑,依次介绍全连接神经网络MLP、卷积神经网络CNN、循环神经网络RNN、图神经网络GNN、注意力网络、编码与重构网络以及生成模型。

需要特别说明的是,这些网络并不是相互独立或彼此替代的。在实际故障诊断中,CNN、RNN、注意力机制和GNN等经常组合使用。例如,CNN可以提取局部振动特征,LSTM可以进一步建模时序关系,注意力机制可以突出关键时间步,MLP则负责完成最终分类。

因此,理解不同网络的关键,不只是记住网络名称,而是弄清楚三个问题:输入数据是什么形式?网络通过什么方式提取信息?这种结构适合解决什么故障诊断问题?掌握这些基本逻辑后,面对CNN-LSTM、CNN-BiLSTM-Attention、时空图神经网络等复杂模型时,就能够看清各个模块在网络中的实际作用。

1 全连接神经网络MLP

1.1 MLP是什么?

这一部分主要解决:MLP到底是什么?它在深度学习中处于什么位置?MLP的英文名称是Multi-Layer Perceptron,中文名称是多层感知机。它是一种由多个全连接层组成的前馈神经网络。所谓前馈,是指数据按照固定方向,从输入端逐层传递到输出端:

输入数据
→ 输入层
→ 隐藏层
→ 输出层
→ 预测结果

MLP不会像RNN一样保存前一时刻的信息,也不会像CNN一样使用卷积核提取局部特征。它主要通过多个全连接层,对输入特征进行逐层变换和组合,最终完成分类或回归任务。可以用一句话概括: MLP通过多层全连接运算,学习输入特征之间的非线性关系,并完成分类或预测。

虽然MLP结构相对简单,但它是理解其他深度学习网络的重要基础。CNN、RNN和Transformer等网络中,也经常使用全连接层或MLP作为最终的分类模块。

1.2 MLP由哪些部分组成?

这一部分主要解决:MLP内部的网络结构是什么样的?如图1所示,一个典型的MLP通常包含三个部分:

  1. 输入层;
  2. 一个或多个隐藏层;
  3. 输出层。
     

图1 MLP结构示意图

其基本结构为:

输入层
→ 隐藏层1
→ 隐藏层2
→ 输出层

例如,在一个四分类故障诊断任务中,输入样本包含10个特征,可以设计如下网络:

10维输入特征
→ 64个隐藏神经元
→ 32个隐藏神经元
→ 4个输出神经元

可以简写为:

 

其中:

  • 10表示输入特征的数量;
  • 64和32表示隐藏层的神经元数量;
  • 4表示需要识别的故障类别数量。

例如四种状态分别为:

  • 正常状态;
  • 内圈故障;
  • 外圈故障;
  • 滚动体故障。

那么输出层就可以设置为4个神经元。

1.2.1 输入层

输入层负责接收数据。

MLP的输入通常是固定长度的特征向量,例如:

 

在故障诊断中,输入可以是:

  • 均值;
  • 标准差;
  • 均方根;
  • 峭度;
  • 偏度;
  • 峰值因子;
  • 频谱能量。

1.2.2 隐藏层

隐藏层位于输入层和输出层之间。它的主要作用是:对输入特征进行组合、变换和提取,形成更适合分类的中间特征。需要注意的是,隐藏层描述的是网络中的位置,并不是一种固定的运算。

在MLP中,隐藏层通常是全连接层。

在CNN中,卷积层也可以是隐藏层。

在RNN中,LSTM层也可以是隐藏层。

1.2.3 输出层

输出层负责给出最终预测结果。如果是四分类任务,输出层通常包含4个神经元,每个神经元对应一个类别。

1.3 数据在MLP中是怎样处理的?

这一部分主要解决:输入数据进入MLP以后,具体发生了什么? MLP中的数据处理可以分为以下几个步骤。

1.3.1 加权求和

假设一个神经元接收到多个输入:

 

每个输入都有对应的权重:

 

神经元首先进行加权求和:

 

其中,    表示偏置。也可以写成矩阵形式:

 

1.3.2 激活函数

加权求和后的结果会送入激活函数:

 

常见的激活函数包括:

  • ReLU;
  • Sigmoid;
  • Tanh;
  • Leaky ReLU;
  • GELU。

MLP隐藏层中最常用的是ReLU:

 

激活函数的主要作用是引入非线性。如果MLP中的每一层都只进行线性变换,那么无论堆叠多少层,最终仍然可以等价为一次线性变换。因此,激活函数使MLP具备学习复杂非线性关系的能力。

1.3.3 逐层传播

假设MLP结构为:

 

第一层隐藏特征可以表示为:

 

第二层隐藏特征可以表示为:

 

输出层为:

 

输出结果:

 

这些输出值通常称为Logits,也就是网络对不同类别给出的原始分数。

1.3.4  输出类别概率

通过Softmax,可以将Logits转换为类别概率:

 

例如:

正常状态:0.03
内圈故障:0.85
外圈故障:0.08
滚动体故障:0.04

概率最大的类别就是模型的预测结果。

1.3.5 训练网络

MLP的训练过程可以表示为:

输入训练样本
→ 前向传播
→ 得到预测结果
→ 计算损失
→ 反向传播
→ 更新网络参数

在分类任务中,输入数据首先经过MLP进行前向传播,得到每个类别对应的原始分数,也就是Logits;随后,Softmax可以将这些分数转换为各类别的预测概率;接着,交叉熵损失函数会将预测结果与真实标签进行比较,计算模型当前的分类误差;最后,Adam或SGD等优化器根据反向传播得到的梯度更新MLP中的权重和偏置,使模型在不断训练后逐渐减小分类误差并提高识别准确率。

1.4 MLP在故障诊断中怎么使用?

这一部分主要解决:MLP在实际故障诊断任务中,输入什么数据?输出什么结果?MLP在故障诊断中的使用方式主要有两种。

1.4.1 直接对人工特征进行分类

首先从原始振动信号中提取特征,例如:

  • 均值;
  • 标准差;
  • 均方根;
  • 峭度;
  • 偏度;
  • 峰值因子;
  • 波形因子;
  • 频带能量。

然后将这些特征组成一个固定长度的向量:

 

再输入MLP进行分类:

原始振动信号
→ 提取时域和频域特征
→ MLP
→ 故障类别

例如:

10个故障特征
→ Linear(10, 64)
→ ReLU
→ Linear(64, 32)
→ ReLU
→ Linear(32, 4)
→ 四类故障结果

1.4.2 作为其他网络的分类头

MLP不仅可以独立使用,也经常作为CNN、RNN和Transformer最后的分类器。

例如:

原始振动信号
→ CNN提取局部特征
→ MLP分类头
→ 故障类别

或者:

时间序列
→ LSTM提取时序特征
→ MLP分类头
→ 故障类别

还可以是:

振动信号
→ Transformer提取全局特征
→ MLP分类头
→ 故障类别

因此,MLP在故障诊断中具有两种常见身份:一种是独立的故障分类网络,另一种是复杂网络最后的分类头。

1.5 MLP有什么优点和局限?

这一部分主要解决:什么情况下适合使用MLP?什么情况下不适合?

1.5.1 MLP的优点

MLP的主要优点包括:

  • 网络结构简单;
  • 容易理解和实现;
  • 训练过程相对直接;
  • 能够学习特征之间的非线性关系;
  • 适合固定长度的特征向量;
  • 适合人工提取特征和表格数据;
  • 经常作为其他深度学习网络的分类头。

对于已经提取好时域、频域或统计特征的数据,MLP通常是一种简单有效的分类方法。

1.5.2 MLP的局限

MLP的主要局限包括:

  • 不会主动利用输入数据的局部结构;
  • 不擅长建模时间顺序;
  • 输入维度较大时,参数量会迅速增加;
  • 样本较少时容易过拟合;
  • 直接处理长振动信号时,效果不一定理想。

例如,将长度为2048的振动信号直接输入一个包含512个神经元的全连接层,其参数量为:

 

仅一个全连接层就包含超过100万个参数。这是因为全连接层中的每个输入,都需要与下一层的每个神经元连接。相比之下,CNN通过局部连接和权重共享,可以使用更少的参数提取局部特征。

因此:MLP更适合处理已经提取好的低维特征(人工提取特征),而原始长振动信号通常更适合使用CNN、RNN或Transformer。

1.6 总结

MLP是一种由多个全连接层组成的前馈神经网络。其基本流程为:

输入特征
→ 全连接层
→ 激活函数
→ 隐藏特征
→ 输出层
→ 分类结果

MLP的核心特点包括:

  • 通过全连接层处理输入特征;
  • 通过隐藏层逐步进行特征变换;
  • 通过激活函数学习非线性关系;
  • 可以单独用于故障分类;
  • 也可以作为CNN、RNN和Transformer的分类头。

MLP将输入看作普通的特征向量,不能主动利用振动信号中的局部关系。 为了解决这一问题,CNN引入了局部连接和权重共享机制,这也是下一节将要介绍的内容。

MLP学习参考链接:

https://blog.csdn.net/m0_73798143/article/details/136636647

https://zhuanlan.zhihu.com/p/1988204416914985913

2. 卷积神经网络CNN

在上一节中,我们介绍了多层感知机MLP。MLP通过全连接层处理输入特征,但它会将输入数据看成一个普通向量,无法主动利用相邻数据点之间的局部关系。对于图像、振动信号、声音信号等数据,相邻位置往往具有较强联系。为了更有效地提取这些局部特征,卷积神经网络应运而生。卷积神经网络的英文名称是Convolutional Neural Network,通常简称为CNN。

2.1 CNN是什么?

CNN是一种以卷积运算为核心的深度神经网络。它通过卷积核在输入数据上滑动,自动提取局部特征,并将简单特征逐层组合为更加复杂的高级特征。CNN的基本流程可以表示为:

输入数据
→ 卷积层
→ 激活函数
→ 池化层
→ 多层特征提取
→ 分类器
→ 输出结果
 

可以用一句话概括:CNN通过局部连接和权重共享,从原始数据中自动提取局部特征,并完成分类或预测任务。CNN最早广泛应用于图像识别,但现在也常用于:

  • 一维振动信号;
  • 声音信号;
  • 时间序列;
  • 频谱;
  • 时频图;
  • 医学图像;
  • 工业故障诊断。

在故障诊断中,CNN可以直接从原始振动信号或时频图中学习故障特征,减少对人工特征提取的依赖。

2.1.1 CNN与MLP有什么不同?

MLP中的全连接层会让上一层的每个神经元都连接到下一层的所有神经元。CNN则主要采用局部连接。例如,对于长度为1024的振动信号,卷积核可能每次只观察其中连续的5个、7个或15个采样点。CNN不会一次处理整个信号,而是通过卷积核在信号上滑动,提取不同位置的局部模式。

两者的核心区别可以概括为:

对比项      
MLP      
CNN      
主要结构      
全连接层      
卷积层      
连接方式      
全连接      
局部连接      
参数共享      
通常没有      
有      
擅长处理      
特征向量      
图像、信号、局部结构      
特征提取      
常依赖人工特征      
可以自动提取特征      

2.2 CNN由哪些部分组成?

如图2所示,一个典型的CNN通常包含以下几个部分:

  1. 输入层;
  2. 卷积层;
  3. 激活函数;
  4. 池化层;
  5. 分类头。
       
    图2 CNN网络结构与计算示意图    

其基本结构可以表示为:

输入
→ 卷积层
→ 激活函数
→ 池化层
→ 卷积层
→ 激活函数
→ 池化层
→ 全连接分类器
→ 输出类别
 

2.2.1 输入层

CNN可以处理不同形式的数据。对于一维振动信号,输入可以表示为:

 
 

其中:

  •      表示输入通道数;
  •      表示信号长度。

例如,单个振动传感器采集长度为2048的信号:

 
 

对于二维时频图,输入可以表示为:

 
 

其中:

  •      表示图像通道数;
  •      表示图像高度;
  •      表示图像宽度。

2.2.2 卷积层

卷积层是CNN最核心的部分。卷积核会在输入数据上滑动,并与局部区域进行加权计算,卷积计算过程和原理如图3所示。

 

图3 卷积计算过程和原理

对于一维信号,卷积运算可以表示为:

 
 

其中:

  •      表示输入信号;
  •      表示卷积核参数;
  •      表示卷积核大小;
  •      表示偏置;
  •      表示卷积输出。

例如,一个长度为3的卷积核:

 
 

会依次处理:

 
 
 
 

同一个卷积核会在整个信号上重复使用。 这就是CNN中的权重共享。

2.2.3 激活函数

卷积层后通常会加入激活函数,例如ReLU:

 
 

激活函数可以为网络引入非线性,使CNN能够学习复杂的故障特征。

常见结构为:

卷积层
→ 批归一化
→ ReLU
 

也就是:

Conv
→ BatchNorm
→ ReLU
 

2.2.4 池化层

池化层用于压缩特征图,减少数据尺寸和计算量。

常见的池化方式包括:

  • 最大池化;
  • 平均池化;
  • 全局平均池化。

最大池化会保留局部区域中的最大值。

例如:

 
 

使用大小为2的最大池化后,可以得到:

 
 

池化层的主要作用包括:

  • 减少特征尺寸;
  • 降低计算量;
  • 扩大感受野;
  • 保留重要特征;
  • 缓解过拟合。

不过,现代CNN并不一定都使用传统池化,也可以通过步长卷积完成降采样。

2.2.5 分类头

经过多层卷积提取特征后,CNN通常需要通过分类头输出类别。

常见分类头为:

卷积特征
→ 全局平均池化
→ 全连接层
→ 输出类别
 

其中,全连接层或MLP负责将CNN提取的高级特征映射为不同故障类别的Logits。因此,一个完整CNN通常由两部分组成:

CNN特征提取器
+
MLP分类头
 

2.3 数据在CNN中是怎样处理的?

这一部分主要回答:原始数据进入CNN后,是怎样逐层变成分类结果的?

假设输入是一段长度为2048的一维振动信号:

 
 

一个简单的CNN可以设计为:

输入信号
→ Conv1D
→ ReLU
→ MaxPool
→ Conv1D
→ ReLU
→ MaxPool
→ 全局平均池化
→ 全连接层
→ 故障类别
 

2.3.1 卷积核提取局部特征

第一层卷积核通常提取比较基础的特征,例如:

  • 局部波动;
  • 幅值变化;
  • 边缘;
  • 短时冲击;
  • 高频变化。

对于轴承振动信号,第一层卷积核可能对局部冲击信号产生较强响应。不同卷积核会学习不同的特征模式。

例如:

卷积核1:关注尖峰冲击
卷积核2:关注周期波动
卷积核3:关注高频振动
卷积核4:关注低频趋势
 

因此,卷积层的输出通常包含多个通道。假设输入通道数为1,卷积层输出通道数为16,则输出可以表示为:

 
 

这16个通道分别表示16种不同的卷积特征。

2.3.2 深层卷积组合高级特征

浅层卷积主要提取简单局部特征。随着网络层数增加,深层卷积会将简单特征逐渐组合成更复杂的模式。

例如:

浅层特征
→ 局部冲击、幅值变化、频率成分

中层特征
→ 周期冲击、调制现象、频带能量

深层特征
→ 内圈故障、外圈故障、滚动体故障的类别特征
 

因此,CNN中的特征通常具有层次性:浅层学习基础特征,深层学习与具体任务相关的高级特征。

2.3.3 池化和降采样压缩特征

经过卷积后,特征长度通常仍然较大。池化或步长卷积可以逐渐缩短特征长度。

例如:

2048
→ 1024
→ 512
→ 256
→ 128
 

随着特征长度减小,卷积通道数通常会增加:

1通道
→ 16通道
→ 32通道
→ 64通道
→ 128通道
 

CNN逐渐压缩空间或时间长度,同时增加特征通道数量。

2.3.4 分类头输出结果

经过多层卷积后,可以使用全局平均池化,将每个通道压缩为一个数。例如:

 
 

经过全局平均池化后:

 
 

然后输入全连接层:

 
 

如果需要识别4种状态,则输出为:

 
 

这些数是不同类别的Logits。再通过交叉熵损失训练网络。完整流程可以表示为:

原始输入
→ 局部卷积特征
→ 多通道特征
→ 深层高级特征
→ 全局特征向量
→ MLP分类头
→ 故障类别
 

2.4 CNN在故障诊断中怎么使用?

CNN在故障诊断中主要有两种常见使用方式:

  1. 直接处理一维原始信号;
  2. 处理二维图像或时频图。

2.4.1 一维CNN处理原始振动信号

一维CNN通常用于:

  • 振动信号;
  • 电流信号;
  • 声音信号;
  • 压力信号;
  • 转速时间序列。

输入形式为:

 
 

例如:

2048点振动信号
→ 1D-CNN
→ 全局平均池化
→ MLP分类器
→ 故障类别
 

具体结构可以是:

Input(1, 2048)
→ Conv1D(1, 16, kernel_size=7)
→ ReLU
→ MaxPool1D
→ Conv1D(16, 32, kernel_size=5)
→ ReLU
→ MaxPool1D
→ Conv1D(32, 64, kernel_size=3)
→ ReLU
→ Global Average Pooling
→ Linear(64, 4)
 

其中:

  • 输入通道数为1;
  • 经过三层卷积后得到64通道特征;
  • 最后输出4种故障类别。

一维CNN的优势是可以直接处理原始信号,不需要先转换为图像。

2.4.2 二维CNN处理时频图

振动信号也可以先经过信号处理方法转换为二维图像,例如:

  • 短时傅里叶变换;
  • 连续小波变换;
  • 小波包变换;
  • 希尔伯特频谱;
  • Gramian角场;
  • 递归图。

基本流程为:

原始振动信号
→ 时频变换
→ 二维时频图
→ 2D-CNN
→ 故障类别
 

二维CNN输入通常表示为:

 
 

二维卷积核会在图像的高度和宽度方向滑动,提取:

  • 局部纹理;
  • 能量分布;
  • 时间变化;
  • 频率变化;
  • 时频联合特征。

2.4.3 1D-CNN和2D-CNN有什么区别?

对比项      
1D-CNN      
2D-CNN      
输入      
一维信号      
二维图像或时频图      
卷积方向      
沿一个方向滑动      
沿两个方向滑动      
常见数据      
振动、声音、电流      
图像、频谱图、时频图      
数据预处理      
相对简单      
通常需要时频转换      
计算量      
通常较小      
通常较大      
特征特点      
保留原始时间结构      
便于提取二维纹理      

不能简单说1D-CNN和2D-CNN谁一定更好。

选择取决于:

  • 输入数据形式;
  • 数据规模;
  • 计算资源;
  • 故障特征表现形式;
  • 是否需要时频分析。

2.4.4 CNN与其他网络组合

CNN还经常与其他网络组合使用。

例如:

原始振动信号
→ CNN提取局部特征
→ LSTM提取时序特征
→ MLP分类头
→ 故障类别
 

也可以加入注意力机制:

原始振动信号
→ CNN
→ SE或CBAM注意力
→ MLP分类头
→ 故障类别
 

还可以用于迁移学习:

源域数据和目标域数据
→ CNN特征提取器
→ 特征分布对齐
→ 故障分类
 

因此,CNN既可以独立完成故障诊断,也可以作为复杂模型中的特征提取器。

2.4.5 常见CNN网络

CNN不是某一个固定网络,而是一大类以卷积为核心的网络。

常见CNN架构包括:

  • LeNet;
  • AlexNet;
  • VGG;
  • GoogLeNet;
  • ResNet;
  • DenseNet;
  • MobileNet;
  • EfficientNet。

(1)VGG

如图4所示,给出常见VGG的模型结构。VGG的核心思想是使用多个小尺寸卷积核不断堆叠,加深网络层数。VGG中常用3×3的小卷积核。

其结构比较规则:

多个3×3卷积
→ 池化
→ 多个3×3卷积
→ 池化
→ 全连接分类器
 
 

图4 常见VGG模型与结构

常见版本包括:

  • VGG16;
  • VGG19。

VGG结构简单,但参数量较大,特别是传统VGG末端的全连接层包含大量参数(如图5以VGG16为例)。

 

图5 VGG16网络结构

(2)ResNet

随着网络变深,普通CNN可能出现梯度消失、梯度传播困难和性能退化问题。ResNet引入了残差连接:

 
 

其中:

  •      是输入;
  •      是卷积层学习的残差特征;
  •      是输出。

残差结构可以表示为:

输入x
├──────────────┐
↓              │
卷积层          │
→ 卷积层        │
↓              │
F(x)            │
├──── 相加 ←────┘
↓
输出F(x)+x
 
 
图6 ResNet18 残差结构  

残差连接让信息和梯度可以更直接地在网络中传播,因此可以训练更深的CNN。

常见版本包括:

  • ResNet18(如图7所示);
  • ResNet34;
  • ResNet50;
  • ResNet101。

图7 ResNet18网络结构

在故障诊断中,一维ResNet通常将二维卷积替换为一维卷积,用于处理原始振动信号。

2.5 CNN有什么优点和局限?

这一部分主要回答: CNN适合解决什么问题?又有哪些不足?

2.5.1 CNN的优点

(1)自动提取特征

CNN可以直接从原始信号或图像中学习特征,减少对人工特征设计的依赖。

(2)擅长提取局部特征

卷积核能够捕捉:

  • 局部冲击;
  • 波形变化;
  • 边缘;
  • 纹理;
  • 局部频率模式。

这与机械故障信号中常见的局部冲击特征较为契合。

(3)权重共享

同一个卷积核会在整个输入上重复使用,因此参数量通常比同规模全连接网络更少。

假设一维卷积层:

  • 输入通道为1;
  • 输出通道为64;
  • 卷积核大小为7。

参数量为:

 
 

而将长度为2048的信号连接到64个神经元,参数量为:

 
 

因此,卷积层通常比全连接层更加节省参数。

(4)具有一定平移适应能力

相同故障冲击即使出现在信号中的不同位置,卷积核仍然可以检测到相似模式。

(5)容易构建深层网络

通过多层卷积,可以逐步学习从低级到高级的层次化特征。

2.5.2 CNN的局限

(1)更擅长局部关系

普通CNN主要通过局部卷积提取特征。如果需要直接建模序列中相距很远的位置关系,往往需要:

  • 堆叠更多卷积层;
  • 使用更大的卷积核;
  • 使用空洞卷积;
  • 与LSTM或Transformer结合。

(2)对网络结构比较敏感

卷积核大小、步长、通道数、层数和池化方式都会影响模型性能。

(3)可能丢失细节

池化和步长卷积会压缩特征尺寸。 如果降采样过快,可能丢失弱故障或瞬态故障信息。

(4)需要足够的训练数据

CNN虽然可以自动提取特征,但当数据量过少时,仍然可能过拟合。

(5)二维时频方法依赖预处理

如果使用2D-CNN处理时频图,结果还会受到以下因素影响:

  • 时频变换方法;
  • 窗口大小;
  • 图像分辨率;
  • 颜色映射;
  • 信号预处理方式。

因此,二维图像并不一定天然优于一维原始信号。

2.6总结

CNN是一种以卷积运算为核心的深度神经网络。其基本流程为:

输入数据
→ 卷积层提取局部特征
→ 激活函数引入非线性
→ 池化或步长卷积压缩特征
→ 多层卷积提取高级特征
→ MLP分类头
→ 输出类别
 

CNN的核心特点包括:

  • 局部连接;
  • 权重共享;
  • 自动特征提取;
  • 层次化特征学习;
  • 适合处理图像、信号和具有局部结构的数据。

在故障诊断中:

  • 1D-CNN可以直接处理原始振动信号;
  • 2D-CNN可以处理频谱图和时频图;
  • VGG通过堆叠小卷积核加深网络;
  • ResNet通过残差连接解决深层网络训练困难;
  • CNN还可以与LSTM、注意力机制和迁移学习方法结合。

可以用一句话概括:CNN通过卷积核在输入数据上滑动,利用局部连接和权重共享自动提取故障特征,是目前故障诊断中最常用的深度学习网络之一。

不过,CNN主要擅长提取局部特征,对于时间序列中的长期依赖关系并不具备天然优势。为了进一步建模数据在不同时间步之间的关系,下一节将介绍循环神经网络RNN,以及LSTM和GRU。

CNN学习参考链接:

https://zhuanlan.zhihu.com/p/561991816

https://zhuanlan.zhihu.com/p/27715976701

https://blog.csdn.net/ai_aijiang/article/details/149255318

https://blog.csdn.net/m0_64799972/article/details/132753608

https://blog.csdn.net/m0_54487331/article/details/112758795

3.循环神经网络RNN

在上一节中,我们介绍了卷积神经网络CNN。CNN通过卷积核提取输入数据中的局部特征,特别适合识别振动信号中的局部冲击、波形变化和频率模式。但是,许多故障信号不仅具有局部特征,还具有明显的时间顺序。例如,当前时刻的振动状态可能与前一时刻有关,设备的退化过程也会随着时间逐渐发展。为了处理这种具有前后顺序的数据,可以使用循环神经网络。循环神经网络的英文名称是Recurrent Neural Network,通常简称为RNN。

3.1 RNN是什么?

RNN是一种专门用于处理序列数据的神经网络。 它与MLP和CNN最大的不同是:RNN在处理当前时刻的数据时,还会利用前面时刻保留下来的信息。

图8 RNN与CNN网络结构对比

3.1.1 RNN的核心思想

RNN引入了循环结构。每一个时间步,如图10所示,RNN不仅接收当前输入,还会接收上一时刻的隐藏状态:

当前时刻输入
+
上一时刻隐藏状态
→ RNN单元
→ 当前时刻隐藏状态
 
 

图10 RNN网络结构和计算过程

假设输入序列为:

 
 

RNN会按照时间顺序依次处理:

x₁ → RNN → h₁
             ↓
x₂ → RNN → h₂
             ↓
x₃ → RNN → h₃
             ↓
            ……
             ↓
xₜ → RNN → hₜ
 

其中:

  •      表示第      个时间步的输入;
  •      表示第      个时间步的隐藏状态;
  • 隐藏状态用于传递前面时间步的信息。

因此,可以用一句话概括: RNN通过循环传递隐藏状态,学习序列中不同时间步之间的依赖关系。

3.1.2 RNN适合处理什么数据?

RNN主要适合具有先后顺序的数据,例如:

  • 振动时间序列;
  • 电流信号;
  • 声学信号;
  • 设备运行状态序列;
  • 设备退化过程;
  • 自然语言;
  • 语音信号。

在故障诊断中,RNN不仅可以用于故障分类,还可以用于设备状态预测、退化阶段识别和剩余寿命预测。

3.2 RNN由哪些部分组成?

一个用于故障分类的RNN通常包含输入序列、循环层、隐藏状态、特征汇总模块和分类头。

其基本结构为:

输入序列
→ RNN循环层
→ 时序隐藏特征
→ 特征汇总
→ MLP分类头
→ 故障类别
 

3.2.1 输入序列

RNN的输入通常由多个时间步组成。单个样本可以表示为:

 
 

其中:

  •      表示序列长度;
  •      表示第      个时间步的输入特征。

如果每个时间步只有一个振动采样值,则:

 
 

一段长度为2048的单通道振动信号可以表示为:

 
 

也可以将2048个采样点划分为64个时间片,每个时间片包含32个采样点:

 
 

此时:

  • 序列长度为64;
  • 每个时间步的输入维度为32。

3.2.2 RNN循环层

在第    个时间步,RNN同时接收当前输入    和上一时刻隐藏状态    :

 
 

其中:

  •      表示输入到隐藏状态的权重;
  •      表示隐藏状态之间的循环权重;
  •      表示偏置;
  •      表示激活函数。

该公式说明:当前隐藏状态既包含当前输入的信息,也包含前面时间步传递过来的信息。

3.2.3 隐藏状态

隐藏状态是RNN最核心的组成部分之一。它可以理解为网络对当前时刻之前信息的压缩表示。

h₁:主要包含第1个时间步的信息

h₂:包含第1和第2个时间步的信息

h₃:包含前3个时间步的综合信息

……

hₜ:包含当前时刻之前的序列信息
 

假设隐藏维度为128,则每个时间步的隐藏状态为:

 
 

隐藏维度越大,网络能够保存的信息通常越丰富,但模型参数量和计算量也会增加。

3.2.4 特征汇总

RNN处理完整个序列后,会得到所有时间步的隐藏状态:

 
 

为了进行分类,需要将这些时序特征汇总成一个固定长度的向量。

(1)使用最后一个时间步

 
 

这种方法直接将最后时刻的隐藏状态作为整个序列的特征。

(2)平均池化

 
 

这种方法对所有时间步的隐藏状态取平均。

(3)最大池化

 
 

这种方法保留不同特征维度上的最大响应。

(4)注意力加权

 
 

其中,    表示第    个时间步的注意力权重。

3.2.5 分类头

汇总后的时序特征通常输入全连接层或MLP分类头:

RNN时序特征
→ 全连接层
→ 输出Logits
→ 故障类别
 

如果需要识别4种设备状态,则输出层包含4个神经元:

 
 

训练时,通常使用交叉熵损失计算预测结果与真实标签之间的差异。

3.3 数据在RNN中是怎样处理的?

假设输入序列为:

 
 

RNN会按照时间顺序依次处理每一个输入。

3.3.1 初始化隐藏状态

在处理第一个时间步前,需要初始化隐藏状态。通常将其设置为全零向量:

 
 

3.3.2 按照时间步循环计算

(1)处理第一个时间步

 
 

由于    通常为0,因此    主要包含第一个时间步的信息。

(2)处理第二个时间步

 
 

此时,    不仅包含    的信息,还间接包含    的信息。

(3)继续处理后续时间步

 
 
 
 

RNN在所有时间步中使用同一组参数,因此它能够处理不同长度的序列。

3.3.3 提取序列特征

处理完所有时间步后,可以使用最后一个隐藏状态,也可以对所有隐藏状态进行平均池化、最大池化或注意力加权。

3.3.4 输出分类结果

最终时序特征输入全连接分类器:

 
 

如果是四分类任务,则输出:

 
 

完整数据处理流程为:

输入时间序列
→ 按时间步依次读取
→ 隐藏状态循环传递
→ 得到时序特征
→ 汇总序列信息
→ MLP分类头
→ 输出故障类别
 

3.4 RNN在故障诊断中怎么使用?

RNN适合处理具有明显时间顺序和状态变化的数据。

3.4.1 直接处理原始振动信号

可以将每个振动采样点作为一个时间步:

原始振动信号
→ RNN
→ 时序特征
→ MLP分类头
→ 故障类别
 

例如,一段长度为2048的单通道振动信号可以表示为:

 
 

这种方式能够保留完整的时间顺序,但序列较长时,训练速度可能较慢。

3.4.2 分段后输入RNN

可以将连续信号划分成多个小片段。

例如,将2048点信号划分为64段,每段包含32个采样点:

 
 

处理流程为:

2048点振动信号
→ 划分为64个时间片
→ 每个时间片包含32个采样点
→ RNN提取时间片之间的关系
→ 故障分类
 

3.4.3 输入时序统计特征

也可以先对连续信号分窗,再从每个窗口中提取统计特征:

连续监测信号
→ 滑动窗口
→ 提取均方根、峭度等特征
→ 构成时间序列
→ RNN
→ 状态识别或趋势预测
 

例如,每个时间步包含5个特征:

 
 

整个样本可以表示为:

 
 

这种方法常用于设备状态监测、退化阶段识别和剩余寿命预测。

3.4.4 CNN与RNN组合

CNN和RNN经常组合使用:

原始振动信号
→ CNN提取局部特征
→ RNN提取时序关系
→ MLP分类头
→ 故障类别
 

其中:

  • CNN负责提取局部冲击和波形特征;
  • RNN负责建模特征随时间的变化;
  • MLP负责完成最终分类。

常见组合包括:

  • CNN-RNN;
  • CNN-LSTM;
  • CNN-GRU;
  • CNN-BiLSTM。

需要注意的是:如果样本之间相互独立,不存在真实的连续时间关系,那么增加RNN不一定能够提高诊断效果。

3.4.5 LSTM和GRU

普通RNN、LSTM和GRU之间的关系为:

循环神经网络
├── 普通RNN
├── LSTM
└── GRU
 

LSTM和GRU都属于RNN的改进结构,主要用于缓解普通RNN难以学习长期依赖的问题。

(1)LSTM

LSTM的英文名称是Long Short-Term Memory,中文名称是长短期记忆网络。

 

图11 RNN和LSTM网络结构对比

它在普通RNN基础上增加了记忆单元和门控结构,主要包括:

  • 遗忘门:遗忘门决定以前的信息哪些不再重要;
  • 输入门:输入门决定当前的新信息哪些值得记住;
  • 输出门:输出门决定当前要从记忆中拿出哪些信息用于判断;
  • 细胞状态:细胞状态相当于长期记忆本。

其基本过程为:

当前输入
+
上一时刻隐藏状态
+
上一时刻细胞状态
→ 遗忘旧信息
→ 写入新信息
→ 更新细胞状态
→ 输出当前隐藏状态
 

LSTM通过门控结构控制信息的保留、遗忘和输出,因此比普通RNN更适合处理较长序列。

(2)GRU

GRU的英文名称是Gated Recurrent Unit,中文名称是门控循环单元。

GRU主要包含:

  • 更新门:决定最终状态中,旧信息和新信息各占多少;
  • 重置门:决定计算当前新状态时,要参考过去多少信息。

图13 GRU结构

与LSTM相比,GRU没有单独的细胞状态,结构更加简单,参数通常更少,训练速度也可能更快。

3.4.6 LSTM和GRU的区别

对比项      
LSTM      
GRU      
门控结构      
遗忘门、输入门、输出门      
更新门、重置门      
状态数量      
隐藏状态和细胞状态      
主要使用隐藏状态      
参数量      
通常较多      
通常较少      
结构复杂度      
较高      
较低      
训练速度      
通常较慢      
通常较快      
长期依赖能力      
较强      
较强      

不能简单认为LSTM一定优于GRU,实际效果需要结合数据规模、序列长度和任务类型进行实验比较。

3.4.7 双向RNN与BiLSTM

普通RNN只按照一个方向处理序列:

x₁ → x₂ → x₃ → …… → xₜ
 

双向RNN会同时从两个方向处理序列:

正向:x₁ → x₂ → x₃ → …… → xₜ

反向:xₜ → …… → x₃ → x₂ → x₁
 

两个方向的特征通常进行拼接:

 
 

如果双向结构使用LSTM单元,就称为BiLSTM;如果使用GRU单元,就称为BiGRU。

双向结构适合完整序列分类,但在实时在线诊断中,由于未来数据尚未产生,通常不能直接使用反向信息。

3.4.8 RNN和残差连接有什么相似与不同?

RNN和残差连接在“将前面的信息继续向后传递”这一点上有些相似,但二者并不是同一种结构。

RNN主要沿时间方向传递隐藏状态:

 
 

残差连接主要沿网络深度方向传递输入特征:

 
 

二者的核心区别是:

  • RNN用于建模不同时间步之间的依赖关系;
  • 残差连接用于改善深层网络中的信息与梯度传播;
  • RNN不同时间步通常共享参数;
  • 不同残差块通常具有各自的网络参数;
  • 普通RNN会对上一隐藏状态进行变换,而残差连接通常将输入直接与变换结果相加。

可以简单理解为:RNN是在时间维度上传递记忆,残差连接是在网络深度维度上传递特征。

LSTM的细胞状态更新在形式上与残差连接更相似:

 
 

它同样包含“保留旧信息并加入新信息”的过程,但LSTM通过门控机制控制信息保留比例,而普通残差连接通常直接保留原输入。

3.5 RNN有什么优点和局限?

3.5.1 RNN的优点

(1)能够处理序列数据

RNN可以按照时间顺序读取输入,适合分析信号随时间的变化。

(2)能够建模时间依赖

隐藏状态能够传递历史信息,因此RNN可以学习前后时刻的联系、周期性变化和状态演化过程。

(3)可以处理不同长度的序列

由于不同时间步共享同一组参数,RNN能够在一定程度上处理长度不同的输入序列。

(4)适合动态故障诊断

RNN可以用于:

  • 故障分类;
  • 状态预测;
  • 退化阶段识别;
  • 故障趋势分析;
  • 剩余寿命预测。

(5)容易与其他网络结合

例如:

CNN
→ LSTM
→ Attention
→ MLP分类器
 

3.5.2 RNN的局限

(1)容易出现梯度消失

当序列较长时,梯度需要沿多个时间步传播,可能逐渐变小,导致网络难以学习早期时间步的信息。

LSTM和GRU通过门控结构缓解了这一问题。

(2)可能出现梯度爆炸

梯度在时间方向传播时也可能变得非常大,导致训练不稳定。

常见解决方法包括:

  • 梯度裁剪;
  • 调整学习率;
  • 合理初始化参数;
  • 使用LSTM或GRU。

(3)难以完全并行计算

RNN必须按照时间顺序计算:

 
 

只有得到    后,才能计算    ,因此长序列训练速度通常较慢。

(4)长序列计算成本较高

如果将每一个振动采样点作为一个时间步,一段长度为4096的信号就需要循环计算4096次。

(5)并不适合所有故障分类任务

如果故障特征主要表现为局部冲击或频率模式,而且样本之间没有真实的连续时间关系,那么CNN可能更加直接有效。

3.6 总结

RNN是一种专门处理序列数据的循环神经网络。

其基本流程为:

输入时间序列
→ 按时间步依次处理
→ 隐藏状态循环传递
→ 提取时序特征
→ MLP分类头
→ 输出故障类别
 

RNN的核心特点包括:

  • 按照时间顺序处理数据;
  • 使用隐藏状态传递历史信息;
  • 能够建模不同时间步之间的依赖关系;
  • 适合时间序列分类、预测和设备状态监测;
  • LSTM和GRU是普通RNN的改进结构;
  • BiLSTM和BiGRU可以同时利用前后方向的信息。
RNN通过循环传递隐藏状态,使网络在处理当前数据时能够参考之前的信息,从而学习时间序列中的动态变化和前后依赖关系。不过,RNN主要关注数据在时间维度上的顺序关系。当故障诊断对象由多个设备、机械部件或传感器组成时,除了时间变化之外,不同对象之间往往还存在物理连接、空间邻接、功能依赖或信号关联。统的MLP、CNN和RNN通常难以直接表示这种不规则的连接关系。为了同时描述对象本身的特征及其相互关系,下一节将介绍专门处理图结构数据的图神经网络GNN。  
RNN学习参考链接:  

https://zhuanlan.zhihu.com/p/652712909

https://blog.csdn.net/2401_85327249/article/details/142249393

https://blog.csdn.net/bestrivern/article/details/90723524

https://blog.csdn.net/mary19831/article/details/129570030

https://blog.csdn.net/Michale_L/article/details/122778270

https://blog.csdn.net/weixin_42111770/article/details/80900575

4.图神经网络GNN

前面介绍的MLP、CNN和RNN,通常将输入数据表示为向量、规则网格或时间序列。例如:

  • MLP处理固定长度的特征向量;
  • CNN处理一维信号或二维图像;
  • RNN处理具有前后顺序的时间序列。

但是,现实中的很多工业系统并不是简单的向量、图像或序列,而是由多个相互连接的设备、部件或传感器组成。为了处理这种具有连接关系的数据,可以使用图神经网络。 图神经网络的英文名称是Graph Neural Network,通常简称为GNN。

4.1 GNN是什么?

GNN是一类专门处理图结构数据的神经网络。

图结构数据不仅包含每个对象自身的信息,还包含对象之间的连接关系。一个图通常表示为:

   
 

其中:

  •        表示节点集 合(下图A到E);
  •        表示边集  合。s
    图示展示了图形的顶点以及它们如何通过边连接。    
    图14 图结构示意图    

例如,在设备系统中:

  • 节点可以表示传感器、零部件或设备;
  • 边可以表示物理连接、空间邻近、能量传递或功能关系。

4.1.1 什么是图结构数据?

传统数据通常具有规则结构。

例如,一维振动信号可以表示为:

   
 

二维图像可以表示为规则像素矩阵:

   
 

但是,图结构数据中的每个节点连接数量可能不同,节点之间也不一定按照规则顺序排列。

例如:

传感器1 ─── 传感器2
   │           │
   │           ├── 传感器4
   │           │
传感器3 ─── 传感器5
 

这里的每个传感器可以作为一个节点,传感器之间的连接可以作为边。

因此,图结构数据主要包含三类信息:

  • 节点;
  • 边;
  • 节点和边的特征。

4.1.2 GNN的核心思想

GNN的核心思想是: 每个节点通过聚合邻居节点的信息,更新自己的特征表示。例如,节点      不仅使用自身特征,还会接收邻居节点的信息:

节点自身特征
+
邻居节点特征
→ 信息聚合
→ 节点新特征
 

可以写成:

   
 

其中:

  •        表示第        层中节点        的特征;
  •        表示节点        的邻居集 合;
  •        表示邻居信息聚合;
  •        表示节点特征更新。

GNN通过在图中传播和聚合信息,学习节点及其连接关系所包含的特征。

4.2 GNN由哪些部分组成?

一个典型的图神经网络通常包含:

  1. 图结构;
  2. 节点特征;
  3. 边或邻接关系;
  4. 图消息传递层;
  5. 特征汇总模块;
  6. 分类器。
       
    图15  图级分类任务GNN网络结构    

其基本结构可以表示为:

图结构与节点特征
→ 图神经网络层
→ 节点信息传播与聚合
→ 节点或全图特征
→ MLP分类头
→ 预测结果
 

4.2.1 节点

节点用于表示图中的基本对象。在故障诊断中,节点可以表示:

  • 不同传感器;
  • 不同机械部件;
  • 不同电气设备;
  • 不同测点;
  • 不同时间片;
  • 不同频率成分。

每个节点可以包含一个特征向量:

   
 

其中,      表示节点特征维度。

例如,一个传感器节点的特征可以包括:

   
 

如果一共有      个节点,则节点特征矩阵可以表示为:

   
 

其中:

  •        表示节点数量;
  •        表示每个节点的特征维度。

4.2.2 边

边用于描述节点之间的关系。在工业系统中,边可以根据以下关系构建:

  • 物理连接关系;
  • 空间距离;
  • 机械传动关系;
  • 电气拓扑关系;
  • 信号相关性;
  • 功能耦合关系;
  • 因果或知识关系。

例如:

电动机
→ 联轴器
→ 齿轮箱
→ 轴承
 

可以将相邻部件之间建立边。

边也可以带有特征,例如:

  • 节点之间的距离;
  • 信号相关系数;
  • 连接阻抗;
  • 能量传递强度;
  • 相似度。

4.2.3 邻接矩阵

图的连接关系通常可以使用邻接矩阵表示。

假设图中有      个节点,则邻接矩阵为:

   
 

如果节点      和节点      之间存在连接,则:

   
 

如果不存在连接,则:

   
 

对于加权图,      也可以是连续数值,例如两个传感器信号之间的相关系数。

4.2.4 图消息传递层

图消息传递层是GNN的核心部分。每个节点会接收邻居发送的信息:

   
 

然后结合自身特征更新节点状态:

   
 

经过一层GNN后,每个节点可以获得一阶邻居的信息。经过两层GNN后,每个节点可以间接获得二阶邻居的信息。

例如:

第1层GNN:聚合直接相邻节点的信息

第2层GNN:聚合邻居及邻居的邻居信息

第3层GNN:获得更大范围的图结构信息
 

因此,增加GNN层数可以扩大节点在图中的感受范围。

4.2.5 特征汇总模块

GNN经过多层消息传递后,会得到每个节点的新特征:

   
 

如果任务是节点分类,可以直接使用每个节点的特征进行预测。

如果任务是整个图的分类,则需要将所有节点特征汇总为一个图级特征。

常见方法包括:

(1)平均池化

   
 

(2)求和池化

   
 

(3)最大池化

   
 

(4)注意力池化

   
 

其中,      表示不同节点的重要程度。

4.2.6 分类头

汇总后的节点或图特征通常输入MLP分类头:

图特征
→ 全连接层
→ 激活函数
→ 输出层
→ 故障类别
 

如果需要识别4种故障状态,则输出为:

   
 

训练时,可以使用交叉熵损失完成分类。

4.3 数据在GNN中是怎样处理的?

GNN的数据处理过程通常包括图构建、节点特征初始化、邻居信息聚合、节点特征更新和分类输出。

4.3.1 构建图结构

使用GNN之前,首先需要确定:

  • 什么对象作为节点;
  • 节点之间如何建立边;
  • 节点包含哪些特征;
  • 边是否需要权重。

例如,一个多传感器故障诊断系统可以构建为:

每个传感器
→ 一个节点

传感器之间的物理距离或相关性
→ 节点之间的边

传感器采集的时域和频域特征
→ 节点特征
 

图的构建方式会直接影响GNN学习到的信息。

因此:GNN的关键不仅是选择网络,还包括如何合理地构建图。

4.3.2 初始化节点特征

假设图中有      个传感器,每个传感器提取      个特征,则输入节点特征矩阵为:

   
 

例如,图中有8个传感器,每个传感器提取16个特征:

   
 

节点特征既可以是人工特征,也可以由CNN、RNN等网络提取。

例如:

各传感器原始振动信号
→ 1D-CNN提取局部特征
→ 得到节点特征
→ GNN进行多传感器信息融合
 

4.3.3 聚合邻居信息

对于节点      ,GNN首先收集邻居节点的信息:

   
 

也可以使用平均聚合:

   
 

然后将邻居信息与节点自身信息结合:

   
 

其中:

  •        表示节点自身特征;
  •        表示邻居聚合特征;
  •        和        表示可学习参数;
  •        表示激活函数。

4.3.4 更新节点特征

经过一层GNN后,每个节点的新特征不仅包含自身信息,还包含周围节点的信息。

例如:

轴承节点原始特征
+
相邻齿轮箱节点特征
+
相邻电动机节点特征
→ 更新后的轴承节点特征
 

经过多层传播后,可以进一步获得整个设备系统中的关联信息。

4.3.5 输出预测结果

根据任务不同,GNN可以输出不同结果。

(1)节点分类

判断每个节点的状态,例如:

传感器节点
→ 正常或异常

设备节点
→ 故障类型
 

(2)图分类

判断整个系统或整个样本的状态,例如:

整个设备图
→ 正常
→ 内圈故障
→ 外圈故障
→ 滚动体故障
 

(3)边预测

预测两个节点之间是否存在关系,或者关系是否发生异常。

(4)图级回归

预测整个设备系统的健康指数、退化程度或剩余寿命。

完整流程可以表示为:

原始多源数据
→ 构建节点和边
→ 提取节点特征
→ GNN消息传递
→ 获得节点或图特征
→ MLP分类器
→ 输出故障结果
 

4.4 常见GNN网络及其在故障诊断中的应用

GNN不是某一个固定网络,而是一类图神经网络的统称。

常见模型包括:

  • GCN;
  • GAT;
  • GraphSAGE;
  • 图池化网络;
  • 时空图神经网络。

4.4.1 GCN

GCN的英文名称是Graph Convolutional Network,中文名称是图卷积网络。

如图16所示,GCN可以理解为将卷积思想扩展到图结构数据中。

 

图16 GCN结构

经典GCN的一层传播可以写成:

   
 

其中:

  •        表示加入自连接后的邻接矩阵;
  •        表示单位矩阵;
  •        表示节点度矩阵;
  •        表示第        层节点特征;
  •        表示可学习参数;
  •        表示激活函数。

加入自连接是为了让节点在聚合邻居信息的同时,也保留自身信息。

GCN的基本过程为:

节点自身特征
+
相邻节点特征
→ 归一化聚合
→ 线性变换
→ 激活函数
→ 新节点特征
 

GCN通常默认相邻节点的信息都参与聚合,但不同邻居的重要程度主要由图结构和归一化系数决定。

4.4.2 GAT

GAT的英文名称是Graph Attention Network,中文名称是图注意力网络。GAT在GNN中引入注意力机制,让网络自动学习不同邻居节点的重要程度。

 
图17 GAT原理示意图  

节点      和节点      之间的注意力分数可以表示为:

   
 

经过Softmax归一化后:

   
 

然后对邻居特征进行加权聚合:

   
 

其中:

  •        表示邻居节点        对节点        的重要程度;
  •        表示特征拼接;
  •        和        表示可学习参数。

例如,在多传感器故障诊断中:

传感器1对当前故障最敏感
→ 较高注意力权重

传感器2受到噪声干扰
→ 较低注意力权重
 

因此,GAT可以自适应地选择重要邻居。需要注意的是:图注意力是一种注意力机制,而GAT是使用图注意力机制构建的图神经网络。。

4.4.3 GraphSAGE

GraphSAGE是一种基于邻居采样和信息聚合的图神经网络。它不会在每次训练时使用节点的全部邻居,而是从邻居中进行采样。

 

图18 GraphSAGE样本和增强方法示意图

基本过程为:

采样部分邻居节点
→ 聚合邻居特征
→ 与节点自身特征拼接
→ 得到新节点表示
 

常见聚合方式包括:

  • 平均聚合;
  • 最大池化聚合;
  • LSTM聚合。

GraphSAGE适合处理节点数量较多的大规模图。

4.4.4 时空图神经网络

时空图神经网络同时建模:

  • 节点之间的空间关系;
  • 数据随时间变化的动态关系。

其基本结构可以表示为:

多传感器时间序列
→ 时间特征提取
→ 图结构空间聚合
→ 时空特征融合
→ 故障分类或预测
 

常见组合包括:

  • GCN-RNN;
  • GCN-LSTM;
  • GCN-GRU;
  • GAT-LSTM;
  • 时空图卷积网络。

例如,在多传感器设备中:

  • GNN负责建模不同传感器之间的关系;
  • LSTM负责建模各传感器特征随时间的变化。

4.4.5 GNN在故障诊断中的常见使用方式

(1)多传感器融合

多个传感器信号
→ 每个传感器作为节点
→ 传感器关系作为边
→ GNN融合多节点信息
→ 故障类别
 

(2)设备拓扑故障诊断

发电机、母线、变压器、负载
→ 构建设备拓扑图
→ GNN传播设备状态
→ 定位故障设备
 

(3)机械部件关系建模

电机
→ 轴
→ 齿轮箱
→ 轴承

各部件作为节点
→ 机械连接作为边
→ GNN分析故障传播关系
 

(4)时频图转图结构

可以将不同频带、时频区域或特征分量作为节点,再根据相似性建立边。

(5)知识图谱故障诊断

将设备、故障、现象、原因和维修措施表示为不同节点,构建设备故障知识图谱。

然后使用GNN进行:

  • 故障原因推理;
  • 故障定位;
  • 维修决策;
  • 知识补全。

4.5 GNN有什么优点和局限?

4.5.1 GNN的优点

(1)能够利用节点之间的关系

传统神经网络通常只关注样本自身特征,而GNN可以同时使用节点特征和连接关系。

(2)适合处理不规则数据

图中的节点数量和连接方式不需要像图像像素一样规则排列。

(3)能够融合多传感器信息

GNN可以通过图消息传递,将多个传感器的信息进行关联和融合。

(4)可以建模故障传播关系

在复杂工业系统中,某个设备故障可能沿着机械连接、电气连接或功能关系传播。

GNN可以通过图结构描述这种传播过程。

(5)适用于多种任务

GNN可以用于:

  • 节点故障分类;
  • 故障设备定位;
  • 整体系统状态识别;
  • 故障关系预测;
  • 剩余寿命预测;
  • 知识图谱推理。

(6)容易与其他网络结合

例如:

CNN
→ 提取每个传感器的局部特征
→ GNN融合传感器关系
→ MLP分类器
 

也可以是:

GNN
→ 建模空间关系
→ LSTM建模时间变化
→ 故障预测
 

4.5.2 GNN的局限

(1)图构建比较困难

GNN通常需要提前确定节点和边。

如果图结构不合理,模型可能学习到错误或无意义的关系。

例如,需要考虑:

  • 节点应该表示传感器还是部件;
  • 边应该根据物理连接还是信号相关性建立;
  • 是否保留弱连接;
  • 是否设置边权重。

因此,图构建是GNN应用中的关键问题。

(2)并不是所有数据都适合使用GNN

如果输入只是单个传感器的一维振动信号,而且不存在明确的节点关系,那么直接使用CNN或RNN可能更加自然。

不能仅仅为了使用GNN,就人为构造缺乏物理意义的图。

(3)可能出现过平滑问题

随着GNN层数增加,节点不断聚合邻居信息,不同节点的特征可能变得越来越相似。

这种现象称为过平滑。

最终可能导致不同节点难以区分。

(4)深层GNN训练困难

GNN层数过多时,可能出现:

  • 节点特征过平滑;
  • 信息过度压缩;
  • 梯度传播困难;
  • 计算量增加。

因此,很多GNN并不会堆叠得特别深。

(5)计算成本可能较高

对于节点和边数量较多的大规模图,消息传递需要较大的存储和计算开销。

(6)图结构可能随工况变化

工业系统中的传感器相关性和设备状态可能随运行工况改变。如果使用固定图结构,可能无法准确描述动态关系。

这时可以考虑:

  • 动态图神经网络;
  • 自适应邻接矩阵;
  • 图注意力网络;
  • 时空图神经网络。

4.5.3 GCN和GAT如何选择?

对比项        
GCN        
GAT        
邻居聚合        
基于邻接关系和归一化        
基于可学习注意力权重        
邻居重要性        
主要由图结构决定        
网络自动学习        
结构复杂度        
相对简单        
相对复杂        
参数和计算量        
通常较少        
通常较多        
可解释性        
一般        
可分析注意力权重        
适用场景        
图结构较可靠        
不同邻居重要性差异明显        

如果节点关系比较明确,并且邻居作用较为接近,可以优先考虑GCN。如果不同传感器或不同部件对故障诊断的贡献差异较大,可以考虑GAT。但最终仍需要通过实验比较。

4.6 总结

GNN是一类专门用于处理图结构数据的神经网络。

其基本流程为:

构建图结构
→ 设置节点和边
→ 初始化节点特征
→ 聚合邻居信息
→ 更新节点特征
→ 获得节点或图级表示
→ MLP分类头
→ 输出故障结果
 

GNN的核心特点包括:

  • 同时利用节点特征和连接关系;
  • 通过消息传递聚合邻居信息;
  • 适合处理多传感器、设备拓扑和部件关联数据;
  • GCN通过图卷积聚合邻居信息;
  • GAT通过注意力机制学习不同邻居的重要程度;
  • 时空图神经网络可以同时建模空间关系和时间变化。

在故障诊断中,GNN特别适合以下场景:

  • 多传感器信息融合;
  • 复杂设备系统故障定位;
  • 机械部件关系建模;
  • 电力系统拓扑诊断;
  • 故障传播分析;
  • 设备知识图谱推理。

GNN通过在节点之间传递和聚合信息,使模型不仅能够分析单个设备或传感器的特征,还能够学习整个系统中的连接关系和故障传播规律。

需要注意的是,GNN并不是CNN和RNN的简单替代。CNN擅长提取局部信号特征,RNN擅长学习时间依赖,而GNN擅长建模多个对象之间的连接关系。

在实际故障诊断中,它们经常组合使用:

CNN提取局部特征
+
RNN提取时间特征
+
GNN建模节点关系
→ 完成复杂系统故障诊断
 

GNN主要负责学习数据之间的关联关系,而另一类网络则主要通过压缩和重构输入数据学习特征。

为了让网络更加灵活地选择重要信息,并直接建立不同位置之间的联系,下一节将介绍注意力机制与Transformer网络。

GNN学习参考链接:

https://blog.csdn.net/qq_43787862/article/details/113830925

https://zhuanlan.zhihu.com/p/660987867

https://zhuanlan.zhihu.com/p/75307407

https://blog.csdn.net/weixin_47332746/article/details/144554395

https://cloud.tencent.com/developer/article/2284994

注:本期下篇将介绍注意力网络、编码与重构网络以及生成模型的在故障诊断中的相关概念和知识点。

编辑:Leo

校核:李正平、陈凯歌、曹希铭、赵学功、白亮、王金、陈莹洁、陈宇航、任超、海洋、Tina、赵诚

该文资料搜集自网络,仅用作学术分享,不做商业用途,若侵权,后台联系小编进行删除


来源:故障诊断与python学习
振动非线性航空船舶核能电力python海洋声学电机爆炸数字孪生控制
著作权归作者所有,欢迎分享,未经许可,不得转载
首次发布时间:2026-09-30
最近编辑:1天前
故障诊断与python学习
硕士 签名征集中
获赞 87粉丝 153文章 334课程 0
点赞
收藏
作者推荐

新锐期刊一区TOP论文推荐|结合可解释性与不确定性的刀具剩余使用寿命自适应预测方法

本期给大家推荐结合可解释性与不确定性的刀具剩余使用寿命自适应预测方法。在高端制造领域,刀具剩余使用寿命(Remaining Useful Life, RUL)的精准预测直接关乎加工质量与生产能效,是实现智能化切削工艺的核心环节。然而,实际工况中有限的无标签样本、退化过程固有的强不确定性,以及传统模型对大量历史标注数据的依赖,长期制约着RUL预测方法的工程适用性。针对这一瓶颈,本文提出一种融合多源传感信息与贝叶斯自适应推理的全新预测框架:该模型无需离线训练,仅依托在线观测即可动态更新退化参数,并内嵌延迟拒绝与自适应Metropolis-Hastings策略以显式量化不确定性。经刀具磨损实验验证,新方法在无需大规模标注数据的前提下,显著提升预测鲁棒性与可解释性,为工业场景下的小样本RUL预测提供了兼具实用价值与理论深度的技术路径。论文基本信息论文题目:An adaptive RUL prediction approach for cutting tools incorporated with interpretability and uncertainty 论文期刊:Reliability Engineering and System SafetyDoi:10.1016/j.ress.2024.110705作者:Zenghui Wang (a), Guanghui Zhou (a,b,*), Chao Zhang (a,b), Jiancong Liu (a), Fengtian Chang (c), Yaguang Zhou (a), Chong Han (a), Dan Zhao (a,b) 论文时间:2025年 机构:(a) School of Mechanical Engineering, Xi’an Jiaotong University, Xi’an 710049, PR China (b) State Key Laboratory for Manufacturing Systems Engineering, Xi’an Jiaotong University, Xi’an 710049, PR China (c) School of Construction Machinery, Chang’an University, Xi’an 710064, PR China作者简介:周光辉,工学博士,教授,博士生导师。1996年、1999年与2003年分别获西安交通大学工学学士、硕士与博士学位。2000年、2004年分别在香港大学作Research Assistant和访问学者,2004年9月到西安交通大学任教,2010年-2011年在美国佛罗里达州立大学作访问学者,入选教育部新世纪优秀人才支持计划,获陕西省“三秦人才”津贴。近年来围绕智能制造与产品服务系统技术、复杂机电产品协同优化设计与低碳设计、离散车间制造执行系统高效低碳运行理论与方法三个研究方向,先后承担包括国家973、863、国家自然科学基金、科技部创新方法专项、科技部科技支撑计划、工信部智能制造专项、工信部数控重大专项、广东省教育部产学研项目等国家省部及企业级纵横向项目40余项,发表学术论文200余篇,出版学术专著2本,主编/参编教材及教学参考书12部;申报国家发明专利58项,授权43项;登记计算机著作版权28项;获教育部自然科学一等奖1项,陕西省科学技术二等、三等奖各1项,陕西省高等学校自然科学一等奖2项,二等奖1项,行业协会奖2项,陕西省学位与研究生教育学会研究生教学成果一等奖、二等奖各1项,西安交通大学教学成果(研究生)一等奖1项、二等奖2项;获陕西省优秀博士学位论文。(摘自西安交通大学教师主页) 通讯作者邮箱:ghzhou@mail.xjtu.edu.cn 摘要刀具剩余使用寿命(Remaining Useful Life, RUL)的可靠预测对于保障加工质量、推动可持续发展至关重要,是高性能加工的核心组成部分。传统方法在加工过程中应对不确定性、保证可解释性方面面临重大挑战。为在小样本、无标签数据集场景下预测刀具RUL,并量化退化模型中的不确定性,本文提出一种基于多源数据融合与贝叶斯推理的自适应RUL预测方法。具体而言,本文提出一种基于刀具退化过程的自适应贝叶斯迭代更新模型。该模型无需大量有标签样本或离线训练,同时兼顾可解释性与不确定性。此外,将贝叶斯推理结合延迟拒绝与自适应Metropolis-Hastings策略,用于更新退化模型中的不确定性参数。这使得退化模型能够通过持续观测,实时自适应逼近实际磨损趋势。所提方法通过刀具磨损实验数据验证,与其他方法相比,平均均方根误差(Root Mean Square Error, RMSE)分别降低27.00%和11.60%。值得注意的是,该方法不依赖大规模有标签历史数据集,能有效缓解不确定性的影响,为实际工业应用中的RUL预测提供了一种新思路。关键词:刀具;剩余寿命预测;贝叶斯理论;DRAM算法;可解释性;不确定性 目录1 引言1.1 研究背景1.2 相关研究1.3 研究不足与动机2 方法2.1 所提自适应RUL预测框架2.2 所提RUL预测方案细节3 关键支撑技术3.1 特征提取与观测量概述3.2 基于贝叶斯的不确定性量化4 实验案例4.1 实验装置与数据描述4.2 评估指标4.3 实验案例4.4 讨论5 结论5.1 贡献5.2 未来研究方向1 引言1.1 研究背景随着现代信息技术的发展,其与传统制造业的深度融合给全球制造业格局带来重大变革,开启了智能制造新浪潮[1-3]。为应对新一轮工业革命带来的机遇与挑战,美国、德国、日本等发达国家相继推出“工业 4.0”“先进制造伙伴计划”等战略举措,以保持国际市场竞争优势。中国同样启动“中国制造2025”战略与“新质生产力”倡议,加速高端装备制造业的智能化转型升级[4, 5]。面对制造业日益激烈的竞争与产品多样化需求,金属切削加工承担了90%以上关键零部件生产任务。刀具作为加工过程中最活跃的元件,极易发生磨损,直接影响切削效率与加工质量。刀具磨损是刀具与工件间的摩擦、剪切力、冲击共同引发机械摩擦、切削热与化学交互作用导致的退化现象。刀具磨损是金属切削的关键影响因素,决定零件质量、切屑形成与整体加工经济性[4, 6, 7]。若未及时更换严重磨损的刀具,会破坏工件表面完整性、降低机床系统刚度,甚至引发严重生产事故[8, 9]。反之,过早更换刀具会中断生产连续性,增加加工现场停机时间。刀具使用不当的负面影响如图1所示。统计数据显示,超过30%的刀具寿命因过于保守的更换策略被浪费;40%的加工质量问题源于刀具失效;50%的刀具碰撞事故由机床无法监测刀具崩损导致;超过70% 的金属切削过程缺乏刀具状态预测性维护[10]。因此,精准可靠的刀具RUL预测对提升刀具可持续性、改善加工性能至关重要[6-8]。 图1 不合理使用刀具的危害当前,新兴智能技术与工业大数据的快速发展引发了刀具RUL预测技术革命。各类预测方法不断涌现,借助先进传感设备[11,12]、信号处理算法[13,14] 与深度学习模型[15-17]实现 RUL 预测,推动RUL预测向智能化方向发展。但实际加工长期处于断续切削、高速、重载等恶劣环境,获取全生命周期数据并不现实。同时,切削过程必然存在噪声、测试误差、退化非线性等不确定性,未考虑不确定性的RUL预测结果不可靠[18,19]。此外,许多传统数据驱动方法往往忽略刀具磨损背后与摩擦、磨粒、热等因素相关的物理机制 —— 具体包括黏着磨损、磨粒磨损、热疲劳磨损及切削力引发的磨损。这导致此类方法物理可解释性低,在变工况下泛化性能差。1.2 相关研究本节综述刀具 RUL 预测相关研究,分析现有不足与研究动机。近年来,学者围绕刀具RUL预测开展大量研究,取得诸多代表性成果,可归纳为两类:数据驱动方法与物理驱动方法。数据驱动方法又可细分为基于数据统计与随机模型的方法、基于深度学习的方法[7]。Aramesh 等[20]构建基于威布尔分布基线的比例风险模型,预测变工况下刀具磨损演化。Yu[21]采用逻辑回归模型,利用以逻辑概率表示的健康指标在线预测刀具RUL。此外,Zhang等[22]采用马尔可夫链蒙特卡洛(Markov Chain Monte Carlo, MCMC)方法更新威布尔比例风险模型参数,提出刀具可靠性与平均寿命概率估计方法。这类基于统计模型的方法结构与参数相对简单,易于部署实现,能考虑退化过程中的不确定性,提供刀具磨损状态概率估计、置信区间与不确定性量化结果。但此类模型往往依赖特定分布假设,难以基于连续观测实时动态估计RUL。而基于深度学习的方法借助先进人工智能技术捕捉刀具退化趋势,通过误差反馈更新模型参数或权重[23,24]。Lei 等(201 [25]、2020 [26]、2021 [27])提出多种改进卷积神经网络(Convolutional Neural Network, CNN)与循环神经网络(Recurrent Neural Network, RNN)模型,在旋转机械 RUL 预测中表现优异。Guo等[28]与Liu等[29]将注意力机制融入深度学习,在复杂RUL预测任务中表现出色。Chen等[30]提出基于多模态融合与集成迁移学习的航空发动机 RUL 预测方法,实现变工况下有效预测。此外,Yang等[31]提出基于深度流核网络的元学习模型,解决无标签小样本数据问题。Javed等[32]建立融合增量学习与小波-极限学习机的预测框架,可在线更新退化模型。基于上述研究,Xu等[33]采用卷积自编码器网络提取特征,结合状态退化模型实现滚动轴承 RUL 在线预测。Mao等[17]融合历史全寿命数据先验信息,构建递归时间序列预测模型,通过深度对抗回归网络实现滚动轴承RUL在线预测。这些代表性方法借助统计模型与机器学习技术,凭借强大的特征提取与回归能力受到关注。诸多方法已通过实时监测数据成功实现 RUL 在线预测。但它们往往需要大量高质量数据[1,18],且通常依赖数据分布相似的假设。此外,这些方法因“黑箱”特性饱受诟病[34,35],无法严谨、物理地解释数据与 RUL 间的内在关联。同时,离线训练的预测模型能否适配新预测任务,仍需进一步探索。相比之下,物理驱动方法以系统内在物理原理与机制为基础,建立参数具备明确物理意义的物理方程或数学模型,模型可解释性强。这类模型结构通常简洁,可通过监测数据在线更新,逐步收敛至实际退化趋势[36–38]。此外,它们可通过严谨物理推导实现各时刻 RUL 迭代估计。Jaydeep等[39]提出基于贝叶斯理论与泰勒退化方程的刀具 RUL 预测框架。在此基础上,Jaydeep等[40]进一步拓展泰勒刀具寿命方程,通过模型参数量化刀具寿命与切削速度、进给量的关系,并采用Metropolis-Hastings算法更新不确定性参数。Yang等[41]将健康指标作为观测量引入交互式多模型(Interactive Multi-Model, IMM)估计框架,通过扩展卡尔曼滤波(Extended Kalman Filter, EKF)估计刀具磨损与RUL。Downey等[42]提出基于多并行退化机制的锂离子电池物理预测方法,成功将机理退化分析结果融入非线性模型实现RUL预测。此外,Wang等[36]对比分析粒子滤波(Particle Filter, PF)、卡尔曼滤波(Kalman Filter, KF)与贝叶斯推理更新退化模型的性能,结果表明多数情况下贝叶斯推理性能优于其他方法。这类方法通过严谨数学推导描述磨损过程,不严重依赖大量历史数据,在长期退化预测中具备不可替代的优势。但需注意,切削速度、切削深度、刀具材料等因素间的交互作用往往高度复杂,简单物理模型难以完整刻画。这一局限可能导致预测不准确甚至失效。基于上述代表性研究,数据驱动与物理驱动模型的核心区别在于底层思路不同。数据驱动模型采用统计方法或机器学习技术构建,物理驱动模型以系统内在机制与成熟理论为基础。两类模型均能实现精准预测与在线更新。物理驱动模型的优势在于可解释性——能基于系统物理原理解释退化过程,结构相对简洁,可通过参数校准实时更新以适配新监测工况。而数据驱动方法虽同样能实现精准预测,但在揭示系统退化关键诱因、适配陌生工况方面存在局限。此外,数据驱动模型结构通常更复杂,实现实时更新往往需要更高算力。综上,方法选择取决于监测数据特性与系统物理特性的认知程度。1.3 研究不足与动机多数数据驱动预测方法依赖大量带RUL标签的监测数据进行离线模型训练,且预测精度往往依赖在线数据分布与离线训练数据分布的相似性。但实际加工过程中,获取大量退化数据仍面临巨大挑战。受相关研究启发,研究不足可总结如下:● 依赖高质量标签数据:传统数据驱动方法往往依赖高质量有标签样本,且通常假设数据分布相似。在此背景下,无标签小样本场景下的RUL预测成为重大挑战[7,19]。● 忽略不确定性:多数传统方法忽略加工过程中噪声、切削液、电磁干扰、测试误差等不确定性,这必然降低预测结果的可信度。● 物理可解释性有限:现有数据驱动方法无需理解刀具磨损机制,但物理可解释性有限。结合刀具磨损机制开展自适应RUL预测值得深入探索。这些挑战推动本文设计一种兼具可解释性与不确定性的新型刀具RUL自适应预测方法。本研究核心贡献可归纳为三方面:● 小样本场景性能:所提方法在无标签小样本场景下表现优异,无需高成本离线训练。与传统数据驱动方法相比,平均RMSE分别降低27.00%与11.60%。● 自适应不确定性量化:采用延迟拒绝自适应Metropolis算法(Delayed Rejection Adaptive Metropolis, DRAM)实现贝叶斯推理,自适应量化退化模型未知参数的不确定性,自适应迭代提供可靠RUL预测。● 可解释性提升:将贝叶斯理论与更新后退化模型结合,为方法提供坚实理论基础与更强可解释性,优于传统数据驱动方法。本文后续结构如下:第2节介绍所提方法框架,详述预测方案;第3节阐述相关理论与技术;第4节给出案例研究;第5节总结全文。2 方法2.1 所提自适应RUL预测框架本节聚焦所提自适应刀具RUL预测方法,概述框架与具体流程。该方法包含以下关键步骤:首先,从多通道信号中提取多域特征,对筛选后的特征降维以提升预测效率;其次,构建健康指标作为观测量,指导迭代推理过程;随后,采用DRAM算法量化指数退化模型(Exponential Degradation Model, EDM)中未知参数的不确定性,使模型通过迭代自适应收敛至实际退化趋势;最后,通过铣削实验验证所提方法的可靠性。图2展示所提方法的整体架构。本研究核心贡献在于将退化模型、主成分分析(Principal Component Analysis, PCA)、贝叶斯推理等多种理论与技术融入统一框架,应用于刀具 RUL 预测。在高质量有标签监测数据不足的场景下,该方法充分考虑磨损不确定性与物理可解释性,实现自适应、无监督RUL预测。 图2 所提出的RUL预测方案框架2.2 所提 RUL 预测方案细节本节详细阐述结合可解释性与不确定性的自适应刀具RUL预测方法,所提方法具体流程如图3所示。具体步骤可总结如下:步骤1:采集加工过程中海量多通道监测数据s;步骤2:通过信息处理技术提取监测数据多域特征,采用斯皮尔曼相关系数初步筛选特征;步骤3:利用PCA技术对筛选后的多域特征降维融合,构建健康指标作为观测量x;步骤4:确定不确定性参数θ的先验分布 π(θ),设置采样次数T与非自适应阶段T₀,通过2.2节DRAM算法自适应更新指数退化模型(Exponential Degradation Model, EDM)不确定性参数,逼近实际退化趋势;步骤5:通过更新后退化模型M(θ)得到当前时刻刀具RUL的后验概率分布p(θ|x)。需注意,先验分布通常基于专家知识与历史经验。若无此类信息,可依据贝叶斯原理采用均匀先验,以降低主观不确定性的影响。此外,多数数据驱动方法直接将原始传感器数据映射至目标RUL标签,获取精准标签的成本往往较高。相比之下,所提方法通过从原始传感器信号提取多域特征、构建健康指标,解决标签依赖问题。随后将该指标与更新后退化模型结合,预测刀具健康状态。当预测值超过预设阈值时,可递归推断刀具RUL。 图3 所提预测方法的整体结构3 关键支撑技术本节主要讨论相关研究理论与技术,详细介绍特征提取与不确定性量化的理论及方法。3.1 特征提取与观测量概述3.1.1 多域特征提取信号特征提取是从监测数据中获取能反映系统状态信息的过程,以应对监测数据的高维度特性,是故障诊断、军事目标识别等多个领域的基础与关键。刀具磨损监测中,原始信号通常包含异常值、噪声等,且数据量庞大,往往无法直接捕捉磨损退化趋势。通过特征提取对信号预处理,可揭示磨损相关关键信息、降低噪声、减少数据冗余,进而提升RUL预测精度。假设信号s=[s₁, s₂, ⋯, sₙ]长度为n,即每个采集通道的数据点数量。每个通道共提取24项特征,除最大值、最小值、中位数外,其余21项特征的具体表达式列于表1。通过提取时域特征,可获取刀具磨损过程中信号的整体变化。本文提取均值、方差、峰值等13项时域特征,反映信号的平均水平、离散程度与极值位置,为刀具磨损状态提供基础信息。同时,刀具磨损过程中的信号通常包含不同频率分量,可通过傅里叶变换等频域分析方法提取。本文提取频率质心、均方频率等9项频域特征,获取不同频率分量对刀具磨损的贡献程度信息。时频域方面,采用小波分解对信号进行3层分解,选用“db3”小波基函数,提取对局部微小变化敏感的小波总能量。表1 所提取特征的计算公式 3.1.2 PCA 技术与健康指标构建多源信号提取特征后,数据量显著降低,但剩余数据仍可能包含无关或冗余特征,降低预测效率与精度,甚至引发维度爆炸问题。因此,需进一步特征融合以实现降维。本文采用PCA技术融合提取的多域特征,缓解噪声对RUL预测的负面影响。该降维过程类似信息融合,可充分利用多源数据的互补性[43]。PCA在状态估计、目标识别、军事控制等领域具备广阔发展与应用前景。PCA核心思路是通过计算样本协方差矩阵的特征向量,将特征从输入空间线性映射至低维特征空间。提取主成分前,需对原始特征数据标准化以消除量纲影响。PCA具体步骤如下:(1)计算信号协方差矩阵,表达式为 (2)求取 的特征值 与单位正交特征向量 : 前 个较大特征值 代表前 个主成分的方差, 对应的特征向量 为主成分 在原始变量上的系数。主成分方差贡献率δᵢ表示信息含量: 若 个主成分累计贡献率大于85%,提取的主成分特征即可反映原始高维特征信息。 (3)计算信号样本的主成分得分: 其中 , 为特征主成分矩阵,即压缩后的特征数据,相同工况下得到的低维特征与磨损程度高度相关。3.2 基于贝叶斯的不确定性量化3.2.1 贝叶斯模型更新原理受材料性能、加工误差、测试噪声等因素影响,系统监测往往存在各类不确定性。当前,贝叶斯推理凭借扎实的概率推理数学基础,在不确定性量化与分析中展现巨大潜力。与传统方法仅通过添加误差项处理退化不确定性不同,贝叶斯方法可在获取新观测时动态更新不确定性估计。这种持续优化预测的特性对精准RUL预测至关重要[44]。贝叶斯方法最突出的优势在于,结合先验信息与观测数据可推断不确定性参数的后验概率密度函数(Probability Density Function, PDF)[45,46],表达式为 其中 为观测样本; 为待更新不确定性参数向量; 为不确定性参数先验分布向量,通常取广义无偏均匀分布, ; 为常数; 为给定条件下的条件分布,通常称为似然函数,描述给定不确定性参数 时观测样本 出现的概率;假设独立测试次数为 ,贝叶斯方程中似然函数表达式为 其中 表示实际观测,即本文构建的实际健康指标; 表示模型预测结果,即本文退化模型的健康指标预测值; 为观测协方差矩阵。将式 (6) 代入式 (5),PDF 可进一步写为 其中 为与 无关的常数。工业应用中,响应表达式通常为隐式,导致积分运算难以实现,因此通常采用随机采样方法估计PDF,以解决复杂积分运算问题。3.2.2 DRAM算法当前,Metropolis-Hastings(MH)算法是贝叶斯推理中广泛应用的随机采样方法,通过生成后验样本简化贝叶斯方程中的积分运算。但该算法主要适用于单参数不确定性场景,参数维度升高时采样效率显著下降,马尔可夫链难以捕捉统计特性[47]。为克服高维不确定性参数带来的挑战,本文引入DRAM算法实现贝叶斯推理。DRAM结合延迟拒绝策略与自适应采样,生成更高质量的后验样本,保障 RUL 预测中不确定性量化的稳定性。采样过程具体步骤如下[48, 49]:(1)设置DRAM参数:非自适应采样长度 、采样迭代次数 ,在先验分布范围内获取初始样本 ; (2)选取初始方差为 的建议分布 ,基于当前样本 通过建议分布生成候选样本 ; (3)计算 的接受概率,基于建议分布的对称性 ,表达式为 (4)选取服从 分布的变量 ,若 则接受 ,即 ;否则通过更新后建议分布 生成候选样本 ,重复步骤(3)、(4)判断是否接受候选样本;(5)采样迭代至 时,根据生成的后验样本更新建议分布协方差矩阵 : 其中 为缩放因子,为保障接受概率处于合理范围,Gelman教授建议 取值为 , 为参数维度[50]; 通常取 ; 为协方差矩阵; 为 维单位矩阵[51];(6) 迭代至 次时终止采样,得到收敛的后验样本序列,即马尔可夫链。剔除马尔可夫链非收敛燃烧期样本,即可获取不确定性参数的统计特性。4 实验案例4.1 实验装置与数据描述4.1.1 C-MAPSS数据集为评估所提刀具RUL预测方法性能,采用PHM 2010提供的刀具磨损数据集。实验环境框架与具体设置如图4所示。实验在高速数控(Computer Numerical Control, CNC)铣床上开展,工件材料为不锈钢,采用3刃铣刀铣削。每次切削中,刀具X向切削长度108mm,径向切深0.125mm,轴向切深0.2mm,主轴转速10400r/min,X向进给速度1555mm/min。选取后刀面磨损量(VB)评估刀具磨损,判定磨损标准为 VB≥0.15mm。同步开展在线信号采集与离线磨损测量。本文采集铣削过程中7路信号,具体为X、Y、Z向铣削力信号,X、Y、Z向振动信号与声发射(Acoustic Emission, AE)信号。 图4 切削实验的设置如图4所示,实验平台由四部分组成:CNC铣床、离线刀具磨损测量模块、在线信号采集模块、信号处理与存储模块。工作台与工件间安装三向Kistler测力仪,获取X、Y、Z向实时铣削力;工件上安装 Kistler 压电加速度计,采集三向振动信号;此外,工件上安装 Kistler 声发射传感器,捕捉高频应力波。采集信号经NI数据采集卡(NI DAQ)放大,采样频率50kHz。同时,采用LEICA MZ12显微镜测量每次切削后的刀具磨损量。详细设置列于表2。表2 实验平台的详细信息 铣削过程中,以50kHz采样频率采集7路信号(X/Y/Z向铣削力、X/Y/Z向振动、声发射),单把刀具共完成315次切削。为获取可靠刀具磨损监测数据,采用6把刀具开展6次切削试验,分别记为C₁–C₆。本文采用C₁–C₄监测数据评估所提方法性能。需强调,所提融合多域特征提取与基于贝叶斯不确定性量化框架的方法,适用于多种数据集。但数据集必须同时包含加工信号数据与对应刀具磨损数据,才能保障方法有效性。4.2 评估指标本文采用平均绝对误差(Mean Absolute Error, MAE)、均方根误差(Root Mean Square Error, RMSE)与决定系数 [18, 52]评估RUL预测结果。各指标介绍如下: (1)MAE。MAE 表达式为 其中 为 时刻实际RUL(i=1,2,⋯,N); 为 时刻预测RUL。MAE 越小表示预测精度越高。 (2)RMSE。RMSE表达式为 RMSE是另一常用指标,对误差大小更敏感。RMSE越小表示预测越准确。 (3) 。 表达式为 是评估拟合程度的指标,表示预测模型解释实际变化的比例,取值范围0-1,越接近1拟合效果越好。4.3 实验案例为验证特征提取对揭示刀具磨损退化趋势的重要性,以 为例,图5展示铣削力与振动全寿命信号,随切削时间波动显著,表明刀具磨损随切削次数增加而加剧。但从多通道信号中难以直接获取磨损退化趋势,需对海量信号进一步分析处理。本文提取多域24项特征(公式列于表 2),提升海量信号的信息密度。 图5 刀具在整个切削过程中的多通道信号由于刀具早期磨损退化相对缓慢,该阶段RUL预测意义有限。研究重点应放在磨损后期RUL预测,及时预测对刀具更换、降低生产风险至关重要。此外,为评估所提方法解决小样本问题的能力,仅采用磨损数据集前200次切削时刻作为训练数据更新退化模型,随后通过更新后模型实现RUL预测。从前200个数据点提取多域特征,构建健康指标作为观测量,指导DRAM随机采样过程。需注意,训练集大小影响预测精度与效率,需根据实际情况与计算机性能合理选择。同时需剔除训练集中冗余特征,保障RUL预测精度。以 为例,前200次切削时刻形成特征矩阵 。X向振动信号中提取的24项特征如图6所示。 图6 X向振动信号的24项特征 为提升预测精度与效率,需筛选特征矩阵中不敏感、冗余特征。由于退化过程通常随时间单调变化,选取与时间呈单调关系的特征最适合表征该趋势。斯皮尔曼相关系数为非参数统计量,常用于衡量两个变量间的单调关系。本文计算每项特征与对应时间向量的斯皮尔曼相关系数,表达式为 其中 为斯皮尔曼相关系数,取值范围[−1,1], 与 分别表示完全负相关与完全正相关, 表示无相关性; 为两次观测的排序差值; 为观测次数。图7展示7路信号提取特征的 计算结果,设置阈值0.9,剔除斯皮尔曼相关系数低于阈值的特征。最终, 筛选后得到特征矩阵 。需注意,不同刀具需保留的特征略有差异。 图7 不同通道信号特征的斯皮尔曼相关系数随后,如2.2节所述,多通道信号经特征提取与初步筛选后,数据量显著降低,但仍包含部分无关或冗余特征。因此,本文采用PCA技术进一步对筛选后特征降维。需注意,各通道信号特征的量纲与数量级差异较大,筛选后特征矩阵 融合前采用Z-score方法标准化。降维结果如图8所示,一阶主成分贡献率高达92%,表明一阶主成分包含原始信号92%的信息。这说明原始信号冗余度高,或主要变化集中在少数方向。因此,可保留一阶主成分替代原始信号,并采用三次指数平滑法[53]获取健康指标。 图8 前两个主成分及其累积贡献率 工程应用中,EDM通常用于描述系统与设备的退化趋势,在多种工业场景RUL预测中表现优异。EDM描述随时间呈指数速率退化的系统,其指数退化特性与电子设备老化、材料疲劳、机械部件磨损等诸多实际系统退化趋势一致。此外,EDM构建简便,模型参数具备明确物理意义。因此,本文采用EDM表征刀具退化趋势[54,55],表达式为 其中 为健康指标值; 为常数,表示刀具初始状态或初始退化程度; 为衰减幅度参数,表示刀具初始状态与寿命终点间的退化幅度; 为衰减速率参数,用于控制EDM下降速率,反映退化速度。 与 决定退化趋势,且包含多种不确定性,直接影响RUL预测精度。因此,本案例将两个未知参数作为不确定性参数 ,采用3.2.2节DRAM算法开展贝叶斯推理,再通过持续采集的实时健康指标迭代更新EDM不确定性参数。 假设不确定性参数均值服从二维独立高斯分布矩阵,标准差设为0.1,参数均值范围设为[−10,10]。依据贝叶斯理论,DRAM算法中建议分布设为对称高斯分布,初始方差设为0.8,可随推理自适应更新。为充分考虑不确定性,初始采样点在采样范围内随机生成,采样迭代20000次,非自适应阶段 设为1000。 为降低数据随机性的负面影响,按照图2所示框架,采用所提方法预测4把刀具 的RUL。图9展示4把刀具预测RUL与实际RUL的实验结果。需注意,底部绿色 区域表示预测RUL的相对误差,两条深绿色虚线表示置信度 的置信区间边界,二者包围的浅绿色 区域为置信区间,代表20%预测偏差的容忍范围。可见,受不确定性干扰,4把刀具早期预测RUL存在不同幅度波动,但随迭代估计,预测RUL逐渐逼近实际RUL。同时,预测RUL基本落在对应置信区间内,表明所提方法可缓解不确定性对预测的负面影响,通过自适应迭代推理实现各时刻更优的RUL预测。 图9 4把刀的RUL预测结果 为验证所提方法的优越性,本文实现多种常用刀具RUL预测数据驱动方法,具体为支持向量机(Support Vector Machine, SVM)[56]、长短期记忆网络(Long Short-Term Memory, LSTM)[57]与混合模型(CNN-BLSTM)[58]。同时纳入两种经典物理模型驱动方法(参考文献 [59,60])与所提方法对比。需注意,所有6种预测模型均采用 数据集前200次切削时刻数据作为训练集。随后将预测结果与图9中红色实线表示的实际RUL对比,计算3.2节所述评估指标。 具体模型参数设置如下:SVM模型包含两个超参数:惩罚参数 与径向基(Radial Basis Function, RBF)核参数 。这些参数构成二维网格空间,采用网格搜索算法与三重交叉验证策略确定最优超参数( , )。LSTM 模型中,隐藏单元数量设为特征向量维度的两倍,隐藏层与输出层分别采用双曲正切S型与对数S型激活函数。训练过程中,采用共轭梯度法更新权重与偏置,最大迭代次数设为200,丢弃率(Dropout)设为0.2以防止过拟合,性能目标设为 。混合模型及另外两种物理驱动方法的参数设置见参考文献[58,59,60]。 5种模型预测结果汇总于表3。SVM与LSTM的平均RMSE分别为7.93与6.55。相比之下,所提方法平均RMSE为5.79,降幅分别为27.00%与11.60%。SVM与LSTM的平均MAE分别为7.31与6.00。而所提方法平均MAE为5.20,降幅分别为28.86%与13.33%。结果表明,与传统方法相比,所提方法预测性能更优、更可靠,取得满意结果且具备强可行性。表3 不同现有方法实验预测结果的比较 与方法#1相比,所提方法预测结果更优,RMSE 与 MAE 平均降幅分别为 23.92% 与 23.42%。该提升源于方法#1采用标准 MH 采样算法,通常仅适用于单维参数空间。而 DRAM 算法的延迟拒绝与自适应采样策略,可在高维参数空间实现高效随机采样,进而提升退化模型参数更新效果。 如表3所示,所提模型预测精度与方法#2、混合模型相当,但后两种方法在部分数据集上精度更高。需注意,方法#2与混合模型参数更复杂,参数化成本更高,直接影响最终RUL预测精度。例如,方法#2采用贝叶斯更新与期望最大化(Expectation-Maximization, EM)算法估计退化模型参数,再通过粒子滤波算法实现状态估计。粒子滤波的大量超参数会显著影响RUL估计结果。因此,所提方法在计算成本与操作便捷性方面具备优势,是更高效的RUL预测选择。4.4 讨论对图9与表3所示实验结果综合分析表明,所提方案实现高精度RUL预测,优于常用预测方法。需强调,传统数据驱动方法通常需要大量标签数据进行离线训练,训练成本高昂。相比之下,所提方法无需标签样本,通过自适应迭代估计即可取得满意结果。这一特性表明该方法在解决无标签预测挑战方面具备巨大潜力。此外,DRAM算法的应用实现退化模型中不确定性参数的自适应更新,提升预测的不确定性表征能力与方法整体可解释性。如图9所示,RUL预测值始终落在置信区间内,凸显所提方法的可解释性与可靠性。5 结论5.1 贡献本文提出一种自适应方法,用于无标签样本数据、退化模型存在参数不确定性场景下的刀具RUL预测。所提方法主要贡献归纳为三方面:(1)无需大量带RUL标签的历史数据开展高成本离线训练,展现自适应、无监督预测潜力;(2)采用DRAM算法定量评估退化模型未知参数的不确定性,实现考虑不确定性的RUL预测迭代更新;(3)贝叶斯理论与更新后退化模型的结合,为方法提供坚实理论基础,提升可解释性。为验证所提方法可行性,采用PHM 2010刀具磨损实验数据,结果表明方法性能优于多种代表性方法。具体而言,与SVM、LSTM相比,所提方法平均RMSE分别降低27.00%与11.60%。此外,与其他代表性预测方法相比,所提方法整体预测性能更稳定。综上,所提方法在精度与可解释性方面取得显著进步,为工业系统RUL预测提供有价值思路,推动刀具可持续利用。5.2 未来研究方向未来研究初步思路如下:首先,鉴于加工场景的复杂性与非线性,将采集更多加工数据进一步验证所提方法;其次,研究退化模型快速重构与集成机制,提升方法在复杂应用场景下的适用性。编辑:陈宇航校核:李正平、陈凯歌、曹希铭、赵学功、白亮、任超、海洋、Leo、Kira、Tina、王金、赵诚、肖鑫鑫、张优该文资料搜集自网络,仅用作学术分享,不做商业用途,若侵权,后台联系小编进行删除来源:故障诊断与python学习

未登录
还没有评论
课程
培训
服务
行家
VIP会员 学习计划 福利任务
下载APP
联系我们
帮助与反馈