工业设备"看病难"?故障数据稀缺让AI诊断频频"误诊"!天津工业大学团队最新研究将数字孪生与物理神经网络深度融合,让AI不仅"看懂"振动信号,更"理解"轴承背后的力学规律,在故障样本极少的情况下仍能达到99.86%的诊断准确率,为智能工厂的设备运维开辟了新路径。
本期推荐的这篇是天津工业大学机械工程学院教授尚志武的文章,本文系统综述了基于数字孪生的物理信息自编码器(PIAE-DT:Physics-Informed Auto-Encoder based on Digital Twin)在不平衡样本条件下滚动轴承故障诊断中的应用,针对工业场景中故障数据稀缺导致的类别不平衡难题,提出了一种融合物理机理与数据驱动的数据增强新范式;该方法通过将无量纲轴承动态特征嵌入自编码器隐空间,实现刚度、阻尼等关键物理参数的精确辨识与概率分布建模,并基于数字孪生空间的重采样机制生成高保真、多样化的合成故障样本;在凯斯西储大学(CWRU:Case Western Reserve University)公开数据集与高速轴承故障模拟实验平台(HFHP:High-speed Bearing Fault Simulation Experiment Platform)私有数据集上的对比实验表明,PIAE-DT在100:1至1:1的不平衡比例范围内均显著优于合成少数类过采样技术(SMOTE:Synthetic Minority Over-sampling Technique)、变分自编码器VAE(VAE:Variational Autoencoder)、带梯度惩罚的瓦瑟斯坦生成对抗网络(WGAN-GP:Wasserstein GAN with Gradient Penalty)等方法,最高诊断准确率达97.60%与99.86%,为智能制造背景下小样本故障诊断提供了兼具可解释性与鲁棒性的技术路径。
由于文章篇幅过长,小编将分两次为大家翻译介绍这篇论文。第一篇推文提出了基于数字孪生的物理信息自编码器框架,针对滚动轴承故障诊断中故障样本稀缺导致的数据不平衡问题,通过将无量纲物理信息模块嵌入自编码器,实现刚度、阻尼等动态模型参数的精确辨识,并将这些参数映射到概率分布空间进行重采样,从而生成兼具物理一致性与统计多样性的合成故障数据;该方法设计了包含重构损失、无量纲微分损失和数字孪生物理一致性损失的复合损失函数及两阶段训练策略,为后续数据增强与故障诊断奠定理论基础。
论文题目: Physics-informed auto-encoder based on digital twin for rolling bearing fault diagnosis under imbalanced sample conditions
论文期刊:Engineering Applications of Artificial Intelligence
Doi:https://doi.org/10.1016/j.engappai.2025.113017
作者: Ziyu Wang a,b , Cailu Pan a,b , Wanxiang Li c,d , Maosheng Gao e
论文时间: 2025年
机构:
a School of Mechanical Engineering, Tiangong University, Tianjin, 300387, China
b Tianjin Modern Electromechanical Equipment Technology Key Laboratory, Tianjin, 300387, China
c TBEA Beijing Tianjin Hebei Intelligent Technology Co., Ltd, Tianjin, 301701, China
d TBEA Tianjin Transformer Co., Ltd, Tianjin, 300300, China
e TBEA Electrical Equipment Group Co., Ltd, Tianjin, China
作者简介:尚志武,男,1977年2月生,天津工业大学机械工程学院教授、正高级工程师、博士生导师。2003年获天津大学机械制造及其自动化专业博士学位。任中国振动工程学会机械动力学专委会委员,兼任天津经济技术开发区正高级职称评委会委员、国家科技奖励评审专家、国际TRIZ协会(MATRIZ)认证专家、甘肃省产业竞争力战略咨询委员会委员 。研究方向涵盖智能诊断与动态测控、机电一体化技术、创新方法与创新设计等领域。(来源:ResearchGate)
在滚动轴承故障诊断中,故障样本稀缺导致故障数据远少于正常数据,引发样本不平衡问题,严重影响诊断准确率。生成式神经网络虽能补充故障数据,但无法确保生成数据充分捕捉轴承动力学特性,从而损害可靠性。本文提出了一种基于数字孪生的物理信息自编码器,用于不平衡条件下的可解释数据增强。通过将融入轴承动态特性的无量纲物理信息模块嵌入自编码器,实现了动态模型参数的辨识,并确保每个学习特征对应具有物理意义的参数,提升了可解释性。辨识后的参数被映射至概率分布,进而通过重采样在数字孪生空间中开发故障数据增强方法,以增加增强数据的多样性。此外,从这些参数重构振动信号进一步提升了增强数据的可靠性,实验结果验证了物理信息模块的有效性。最终,应用PIAE-DT辨识已知样本的动态参数,在数字孪生空间中实现故障数据增强,有效缓解了诊断中的不平衡问题。该方法在公开数据集和私有数据集上进行了评估,最高诊断准确率分别达到97.60%和99.86%,优于其他数据增强方法。
关键词:数据增强;动态模型;故障诊断;不平衡数据;数字孪生
1 引言
2 相关工作
2.1 自编码器
2.2 物理信息神经网络
2.3 数字孪生
3 所提方法
3.1 轴承数字孪生模型
3.2 轴承数字孪生空间
3.3 基于数字孪生的物理信息自编码器
3.4 不平衡样本故障诊断总体框架
4 实验
4.1 数据集描述
4.2 不平衡数据集构建
4.3 实验设置
4.4 训练结果分析
4.5 应用于故障诊断
5 结论
注:小编能力有限,如有翻译不恰之处,请多多指正~
若想进一步拜读完整版,请下载原论文进行细读。
滚动轴承是航空发动机、高速列车、精密机床等高精度机械中不可或缺的传动与支承部件,其运行状态对系统性能、稳定性和安全性具有决定性影响(Lei et al., 2020; Sun et al., 2025b)。在动态载荷波动等恶劣服役条件下,轴承易发生磨损、疲劳裂纹等缺陷,导致性能退化、安全事故及重大经济损失(Zhao et al., 2025)。这些后果不仅危及系统的稳定可靠运行,同时在维护成本、故障预测及安全保障方面带来严峻挑战。因此,发展先进的轴承健康监测与故障诊断技术已成为学术界和工业界的研究热点(Xin et al., 2025)。
在工业实践中,故障诊断系统的部署面临重大挑战,故障样本往往稀缺而正常样本丰富,导致数据集不平衡,阻碍模型学习与泛化(Lu et al., 2024; Zhang et al., 2022a)。过采样是一种广泛采用的策略,通过生成额外的少数类样本而不丢弃现有数据来解决滚动轴承故障诊断中的不平衡问题。然而,合成少数类过采样技术(SMOTE:Synthetic Minority Oversampling Technique)等传统技术可能引发过拟合,且对原始数据集中的噪声高度敏感,从而降低诊断模型的泛化能力(Yi et al., 2022; Zhu et al., 2017)。为克服这些局限性,Han等人提出了注意力特征选择过采样(AFS-O:Attention Feature Selection Oversampling)方法,在过采样前融入特征选择与加权机制,以生成高质量合成数据并提升分类性能(Han et al., 2024)。类似地,Li等人开发了自适应聚类加权过采样(ACWOS:Adaptive Clustering Weighted Oversampling)方法,该方法自适应地确定聚类结构,并基于样本密度与相对距离分配过采样权重,从而在不平衡及变速条件下增强少数类样本的多样性(Li et al., 2024)。这两种方法均旨在缓解传统过采样的噪声敏感性与过拟合问题,同时增强模型鲁棒性。
尽管上述改进的过采样技术能够有效缓解数据不平衡的不利影响,但其性能在很大程度上仍依赖于人工设计特征的质量(Zhang et al., 2025)。近年来,基于深度学习的智能诊断方法因其能够直接从原始振动信号中自动学习层次化特征表示、从而减少对人工设计特征的依赖而备受关注(Ni et al., 2025; Zhang et al., 2020)。其中,卷积神经网络(CNN:Convolutional Neural Networks)和深度神经网络(DNN:Deep Neural Networks)等架构因其强大的自适应特征提取能力,在滚动轴承故障诊断中得到广泛应用(Sun et al., 2025a; Yan et al., 2025)。Li等人提出了一种双阶段注意力循环神经网络(DA-RNN:Dual-stage Attention-based Recurrent Neural Network)结合嵌入卷积块注意力模块的卷积神经网络(CBAM-CNN:Convolutional Block Attention Module-embedded Convolutional Neural Network),以扩充不平衡数据集并提高诊断精度(Li et al., 2022)。Yang等人引入了一种集成外部注意力的CNN(EA-CNN:External Attention-integrated CNN)结合连续小波变换(CWT:Continuous Wavelet Transform),以降低模型复杂度并提升不平衡数据条件下的性能(Yang et al., 2025)。Chen等人将基于聚类和密度的重采样与多域特征提取(时域、频域和熵特征)以及基于注意力的时间卷积相结合,并辅以梯度加权类激活映射(Grad-CAM:Gradient-weighted Class Activation Mapping)可视化,以进一步提升诊断精度(Chen et al., 2025)。这些研究共同强调了在基于深度学习的故障诊断中解决数据不平衡问题对于提升准确性与鲁棒性的重要性。
尽管基于深度学习的分类模型在解决数据不平衡问题上取得了显著进展,但其性能仍受限于少数类样本的有限可用性。为克服这一局限性,生成模型作为一种有前景的替代方案应运而生,因其能够合成真实且多样的故障样本以直接平衡数据集(Liu et al., 2023)。随着深度学习的快速发展,生成对抗网络(GAN:Generative Adversarial Networks)和变分自编码器(VAE:Variational Autoencoders)等生成模型因其生成多样且具有代表性样本的强大能力,已成为不平衡数据条件下故障诊断的重要工具(Zhou et al., 2020)。Hou等人提出了一种集成数据选择模块的增强型生成对抗网络(EGAN-DSM:Enhanced Generative Adversarial Network with a Data Selection Module),该网络融合网络增强模块、基于希尔伯特空间距离的数据筛选以及宽首层核CNN,以提升不平衡条件下的诊断精度(Hou et al., 2023)。Liu等人开发了一种具有序列注意力的可解释对抗变分自编码器(AVAE-SQA:Adversarial Variational Autoencoder with Sequential Attention),结合可靠控制限、对抗训练与注意力机制,以增强诊断精度与可解释性(Liu et al., 2023)。Wang等人将工况信息与跨频注意力融入增强型GAN,以在变工况下生成更长的振动序列,从而提升不平衡场景下的鲁棒性(Wang et al., 2025)。Yin等人提出了一种变分辅助分类器Wasserstein GAN(VACWGAN:Variational Auxiliary-Classifier Wasserstein GAN),将变分自编码器与ACGAN风格的分类器相结合,丰富了稀缺的多故障样本,稳定了训练过程,并在严重不平衡条件下实现了更高的诊断精度(Yin et al., 2025)。同时,这些基于生成模型的方法能够生成高质量的少数类样本,有效缓解了传统方法在数据稀缺和变工况下的性能退化问题,为不平衡故障诊断提供了新的解决方案。
与纯粹数据驱动的生成模型相比——后者虽能丰富少数类样本,但往往缺乏物理可解释性且与现实系统动力学的一致性不足——数字孪生(DT:Digital Twin)技术提供了一种物理一致的数据增强方法(Cui et al., 2024)。相比之下,DT技术通过融合基于物理的仿真与真实传感器数据,实现了物理一致的数据增强,为解决上述局限性提供了有前景的途径(Yi et al., 2023; Zhang et al., 2023)。在滚动轴承故障诊断中,DT已展现出相当大的潜力(Qin et al., 2024a; Zhong et al., 2025)。然而,许多现有方法仍侧重于从虚拟系统到物理系统的单向映射,忽视了利用真实传感器数据进行反向校准以捕捉动态变化的过程。此外,经验参数设置与确定性优化限制了仿真-真实对齐与数据多样性。为应对这些挑战,近期研究探索了将DT技术与机器学习相结合,强调将轴承动力学与失效机理的物理知识融入数据驱动模型,或先验知识与学习表示的融合。这类物理信息驱动的可解释故障诊断方法已被证明能够提升复杂工业场景下的鲁棒性、可靠性与泛化能力(Ali et al., 2024a, 2024b, 2025a, 2025b)。例如,Qin等人提出了一种集成频域双向长短期记忆(Bi-LSTM:Bidirectional Long Short-Term Memory)循环一致生成对抗网络(CycleGAN:Cycle-Consistent Generative Adversarial Network)及频谱约束损失的多自由度DT,以提升映射性能,同时嵌入系统动力学的逆物理信息神经网络用于不平衡条件下的参数估计与数据生成(Qin et al., 2024b)。Shang等人开发了一种基于有限元的DT,结合多尺度注意力CycleGAN与感知损失,以实现域对齐并增强生成数据的真实性(Shang et al., 2025)。Zhu等人引入了一种数据-模型融合方法,将DT与条件深度卷积GAN相结合,用于物理一致的数据合成(Zhu et al., 2025)。这些研究共同表明,双向虚实映射、参数校准与概率建模对于提升基于DT的不平衡样本条件下的故障诊断性能至关重要。
总体而言,当前用于轴承故障诊断的数据增强策略常常面临平衡多样性与可解释性的挑战。侧重于多样性的方法往往产生具有有限或仅部分可解释性的数据,难以追溯其来源或底层机制。相反,优先考虑可解释性的方法通常导致多样性不足,从而限制了诊断模型的泛化能力。因此,在样本不平衡条件下实现多样性与可解释性之间的良好权衡,仍是开发可靠且鲁棒的轴承故障诊断系统所面临的关键挑战。
为解决这一挑战,本文提出了一种基于数字孪生的物理信息自编码器(PIAE-DT:Physics-Informed AutoEncoder based on Digital Twin)框架,该框架将数字孪生技术与深度学习相结合,旨在联合提升数据多样性与物理可解释性。将嵌入轴承动力学特性的无量纲物理信息模块融入自编码器,实现了动力学模型参数的精确估计。这些参数被映射到概率分布空间,通过重采样技术在数字孪生域内生成高质量的合成故障数据。通过从具有物理意义的动力学参数重构振动信号,所提方法在丰富数据变异性的同时,确保了生成数据的物理一致性与可靠性。
本研究的主要贡献如下:
(1) 基于数字孪生的物理信息自编码器架构——提出了一种新的PIAE-DT框架,将数字孪生技术与物理信息自编码器相结合,以解决轴承故障诊断中的数据不平衡问题。
(2) 兼具多样性与可解释性的数据生成——在PIAE-DT中开发了一种生成具有高多样性和强物理可解释性故障数据的机制,以扩充数据集并改善模型训练。
(3) 物理一致的参数建模——建立了一种推导目标轴承无量纲参数分布的方法,确保合成故障数据与底层物理机制保持一致。
(4) 综合性能评估——在多种数据不平衡场景下开展大量实验,验证了PIAE-DT生成数据能够显著提升诊断精度与鲁棒性。
本文其余部分组织如下。第2节回顾三个关键领域的相关研究工作:自编码器、物理信息神经网络以及数字孪生技术。第3节详细介绍所提方法,具体包括轴承数字孪生模型及其相应数字孪生空间的构建、PIAE-DT的设计与原理、损失函数、故障数据生成流程、训练策略以及不平衡样本条件下的整体诊断框架。第4节报告实验验证,包括数据集描述、实验设置、不平衡数据集构建、数字孪生空间分析、数据质量评估及其在故障诊断中的应用。最后,第5节总结全文并展望未来研究方向。
2.1 自编码器
在旋转机械领域,借助 DT 的动态建模正成为研究热点;优质的动态模型是 DT 建模的根基,可为后续虚实交互提供高保真虚拟信号。当前研究主要集中于轴承、齿轮与转子系统。对轴承系统,研究重心为轴承损伤(如内圈、外圈及滚动体损伤)的动态建模,主要关注轴承自身力学特性,而不考虑转子系统影响。对齿轮传动系统,研究重心为裂纹、剥落、磨损、断齿等故障状态下齿轮传动系统的动态建模。对转子系统,当前重心主要为不平衡、不对中、碰摩、机座松动等工况下的转子系统动态建模 [50]。这三类系统所采用的主要建模方法包括:基于物理的模型(如集中参数模型、有限元模型、刚−柔耦合模型)、唯象模型以及数据驱动模型。
自编码器是一种著名的无监督学习技术,旨在以最小的重构误差重构高维输入数据(Zhang et al., 2025)。从根本上讲,自编码器包含两个核心组件:编码器和解码器。编码器将高维输入数据压缩至低维潜在空间,生成一种称为潜在特征向量(或隐藏层特征)的压缩表示。编码过程可用数学公式表述为(Li et al., 2021):
其中, 表示输入样本, 为权重矩阵, 为偏置向量, 代表潜在特征向量。
解码器旨在从潜在特征重构原始高维数据。重构过程定义为:
其中, 为重构输出, W 和 分别为解码器的权重矩阵和偏置向量。
自编码器通过反向传播优化参数 ,以最小化输入 与重构输出 之间的差异。常用的重构损失为均方误差(MSE:Mean Squared Error),用于量化输入数据与重构数据之间的平均偏差。MSE损失定义为:
式中: 为损失值,m为训练样本总数。
2.2 物理信息神经网络
物理信息神经网络(PINNs:Physics-Informed Neural Networks)可将经验数据与偏微分方程(PDEs:Partial Differential Equations)等控制方程相结合,通过将物理定律嵌入神经网络架构实现(Wang et al., 2024)。通过在优化过程中将物理原理作为软约束引入,PINNs不仅增强了可解释性与泛化能力,还确保解严格遵循底层物理规律,使其在实际应用中更为可靠。PINN的总损失函数通常表述为多目标加权组合形式(Cuomo et al., 2022):
其中, 量化预测数据与观测数据之间的偏差,, 强制满足初始/边界条件, 对偏离控制PDE的行为进行惩罚。权重系数 用于平衡各项,可手动调节或在训练过程中自动学习。
PINN的参数通过Adam等基于梯度的方法进行优化,复合损失函数的梯度通过自动微分计算。尽管传统PINN框架在求解孤立偏微分方程方面表现出色,但在处理涉及多组件相互作用的复杂系统时往往力不从心。这一局限性凸显了将这些框架扩展至涵盖更广泛物理现象的必要性,从而增强其在各领域的适用性(Zhang et al., 2023; Zhong et al., 2025)。在本研究中,我们通过基于物理的约束将轴承的物理特性融入神经网络,从而扩展了物理信息范式。
2.3 数字孪生
数字孪生框架主要由物理空间、虚拟空间以及二者之间的数据流或映射关系构成(Cui et al., 2024; Qin et al., 2024a, 2024b)。物理空间包含被研究的实际系统或部件,包括其所有物理属性与运行工况。虚拟空间由复杂的分析模型组成,如集总参数动力学模型(LPDM:Lumped Parameter Dynamic Models),用于模拟物理系统在各种条件下的行为,并提供对潜在故障或性能问题的洞察(Hao et al., 2024; Yi et al., 2023)。数据流或映射作为物理空间与虚拟空间之间的关键纽带,确保物理系统的实时数据能够准确反映在虚拟模型中,从而实现连续监测与预测性维护能力。
为应对轴承故障诊断中的样本不平衡挑战,我们利用数字孪生技术创建合成故障样本。该方法不仅缓解了标注故障数据的稀缺性问题,还通过提供更全面的训练与验证数据集,增强了诊断算法的鲁棒性与可靠性。
3.1 轴承数字孪生模型
建立轴承故障动力学模型对于开发精确的轴承数字孪生至关重要。该模型能够在真实工况下模拟各种故障模式,从而增强预测性维护能力。通过将轴承故障简化为单自由度非线性模型,我们在保持对广泛轴承数据集适应性的同时,最小化了模型复杂度。
如图1所示,本研究开发的轴承数字孪生模型通过改变故障尺寸获取不同类别的缺陷位移数据,并将其嵌入动力学模型中。
图1 轴承数字孪生模型
该模型融合滚动体非线性接触、如图1左侧所示,该轴承模型由不旋转的外圈和旋转的内圈组成。轴承具有一个自由度,即外圈的垂向位移。
保持架的转速为:
其中, 为轴转速, 为滚动体直径, 为接触角, 为节圆直径。
第j个滚动体的转角位置为:
其中, 为滚动体个数。
滚动体的转动角速度为:
如图1右侧所示,该动力学模型模拟三种故障状态:外圈故障、内圈故障及滚动体故障。三种局部故障形式均表示为矩形剥落。
外圈故障、内圈故障及滚动体故障的圆周跨角分别定义为:其中
其中, 是外环缺陷的尺寸, 是外环的直径, 是内环缺陷的尺寸, 是内环的直径, 是滚动体缺陷的尺寸, 是滚动体的直径。
第 个滚动体进入外环缺陷、内环缺陷和滚动体缺陷的方位角分别定义为:
其中,
外环缺陷、内环缺陷和滚动体缺陷引起的径向位移分别定义为:
总之,第
其中,
赫兹接触力中的刚度取决于:
其中,
动力学的微分方程表达为(Ashtekar et al., 2010):
其中,
由此,本文建立了完整的单自由度数字孪生轴承动力学模型。
3.2 轴承孪生数字空间
刚度和阻尼系数是轴承故障动力学建模中的两个关键参数,因其直接决定模拟振动响应的精度。然而,这些参数通常凭经验确定,导致不同振动数据样本间的刚度和阻尼系数存在差异,且可能在受限范围内波动。尽管全局优化方法能够在宏观意义上识别理想参数值,但确保参数与样本的特异性仍具挑战性,从而限制了模型的精度与泛化能力。
为克服这些局限性,本研究提出了一种将概率建模与数字孪生技术相结合的新方法。首先,我们假设刚度和阻尼系数并非固定常数,而是在样本间遵循特定的概率分布。具体而言,我们假设:
其中,
这一范式将优化目标从确定性参数估计转变为概率分布学习,从而建立了一个能够以统计方式表征内在物理属性分布的数字孪生空间。
其次,推断已知样本的动力学参数并将其映射到参数化的概率分布。
其中,
最后,通过从推导出的分布中采样生成新的轴承故障数据,从而实现物理 一致的故障场景创建。
图2展示了轴承数字孪生空间的双向映射机制,该机制包含两个关键过程:(1)物理到虚拟映射,通过统计学习从真实振动信号中提取参数分布;(2)虚拟到物理映射,从采样得到的参数分布生成真实的振动信号。
图2 数字孪生空间中的双重映射
3.3 基于数字孪生的物理信息自编码器
3.3.1 基于数字孪生的物理信息自编码器原理
本研究重新定义了优化目标:并非为所有样本确定固定的最优动力学参数,而是通过轴承数字孪生空间学习最优的动力学参数分布。这确保了生成数据与现实世界轴承行为保持物理一致性。
为实现这一目标,需要一种神经网络架构,能够将原始振动数据压缩至数字孪生空间内的低维表示,同时实现物理信号的高保真重构。然而,传统的生成模型由于无法在生成过程中融入领域特定的物理约束,难以胜任这些任务。为弥补这一缺陷,本文提出了一种基于数字孪生的物理信息自编码器(PIAE-DT:Physics-Informed Auto-Encoder Based on Digital Twin),这是一种将数据驱动学习与基于物理的正则化相结合的新型架构。
如图3所示,PIAE-DT架构将自编码器的数据压缩能力与物理信息约束相结合,旨在通过两种关键机制提升轴承故障诊断精度:(1)通过将轴承动力学嵌入潜在表示以提高物理可解释性;(2)通过在数字孪生空间中进行概率采样以增强样本多样性。
图3 基于数字孪生的物理信息自动编码器
具体而言,自编码器负责样本扩充与多样性保持,而物理信息模块则用编码轴承特定动力学参数的数字孪生潜在空间替代传统隐藏层。
其中编码器作为提取动力学特征的网络,解码器从提取的动力学参数重构振动信号,物理信息模块(PIM:Physics-Informed Module)负责获取与当前加速度信号对应的位移信号。
在神经网络训练中,保持输出参数的量级一致性对于促进稳定的梯度传播和有效的模型收敛至关重要。然而,在轴承故障诊断应用中,物理参数往往表现出极大的量级差异——跨越多个数量级——这严重阻碍了模型训练的稳定性。例如,阻尼系数通常在 10 至
为应对这些与量级相关的挑战,本文提出了一种无量纲参数变换框架。具体而言,对神经网络输出施加物理缩放操作,将所有参数归一化至统一的无量纲尺度。这是通过将各物理参数除以根据轴承规格确定的相应基准值来实现的。例如,刚度和阻尼的缩放方式如下:
其中,
这种两阶段方法确保了:(1)归一化参数实现稳定的网络训练;(2)重缩放输出与物理测量尺度对齐,在保持数值稳定性的同时保留工程意义。
3.3.2 PIAE - DT损失函数的设计
该复合损失函数整合了三个核心组件,以平衡数据保真度、物理合理性与数字孪生一致性:
数据重构损失:该组件确保重构信号与原始振动信号在像素级精度上的一致性。
其中,
无量纲微分损失:该组件编码了两项无量纲物理原理。首先,通过建立归一化加速度、速度和位移之间的微分关系,强制实现无量纲运动学一致性;其次,通过最大均值差异(MMD:Maximum Mean Discrepancy)将生成信号与真实数据对齐,确保分布一致性。
其中,s 为无量纲位移,v 为无量纲速度。该损失函数旨在使物理信息模块实现部分积分功能,即输入加速度信号、输出位移和速度信号。因此,除了微分损失外,还需对输出的位移和速度信号进行数据分布约束,使其更符合真实振动信号的特征。
数字孪生物理一致性损失:该组件确保归一化后的刚度和阻尼参数遵循轴承动力学规律。
其中 Label 为标签信息(包含数据集的所有类别),
总损失函数定义为(Aguilar et al., 2019):
其中最后的对数正则化项用于缓解退化解(例如,过大或过小的权重),并促进三个损失分量的均衡贡献。
3.3.3 PIAE-DT的训练策略和故障数据生成
所提基于数字孪生的物理信息自编码器(PIAE-DT:Physics-Informed Autoencoder with Digital Twin)框架采用两阶段训练范式,旨在实现专用模块优化与整体参数协调。该策略使网络能够同时捕捉物理动力学特性与数据驱动表示,最终促进真实且多样的故障数据生成。
在第一阶段,编码器、解码器及物理信息子网络独立优化,各自由专门的损失函数引导以确保针对性学习。具体而言,重构损失强制生成振动信号与实测振动信号在时域波形上保持一致,从而保留数据的细粒度时序特征。数字孪生损失融合轴承动力学方程与潜在特征分布的约束,确保编码表示与具有物理意义的系统行为对齐。同时,微分一致性损失评估生成信号与原始信号的二阶位移导数和一阶速度导数之间的差异,促进在幅值域和相位域中保持动态响应特性。
每个模块的参数通过Adam优化器更新,学习速率为:
这种模块化优化方案允许各组件独立学习其各自的功能角色而互不干扰,这对于后续联合更新中实现稳定收敛至关重要。
在第二阶段,网络过渡到全局优化阶段,所有参数以及自适应损失权重系数 α 、β 和 γ 进行联合更新。联合参数更新规则如下:
训练过程在第一阶段与第二阶段之间交替进行,直至模型收敛或达到预定义的最大迭代次数。
收敛后,对习得的动力学参数进行统计分析,以推导基于频率的概率分布,从而定义数字孪生参数空间
其中,
这种两阶段训练范式具有多项优势。首先,第一阶段的独立模块优化确保编码器、解码器及物理信息组件各自学习任务特定特征而互不劣化。其次,第二阶段的全局优化通过自适应加权协调所有模块的目标,使网络能够在训练过程中动态调整不同物理约束与数据驱动约束的重要性。最后,通过利用数字孪生参数空间,该框架实现了可控且多样的故障数据生成。
3.4 不平衡样本故障诊断总体框架
为应对旋转机械智能故障诊断中普遍存在的类别不平衡挑战,本研究提出了一种基于数字孪生的合成少数类样本生成与训练数据集再平衡框架,如图4所示。总体目标是缓解主导性正常类别或主要故障类别引起的偏差,从而提高诊断模型对稀表示故障类型的识别能力。该框架包含四个主要阶段:不平衡数据集构建、数字孪生空间建模、样本生成与质量评估、以及诊断验证。
图4 不平衡样本故障诊断总体框架
在第一阶段(步骤1),采用滑动窗口方法处理从滚动轴承采集的原始振动信号,以在规定的类别比例下构建不平衡数据集。在步骤2中,利用多故障类别的真实振动数据训练物理信息自编码器数字孪生(PIAE-DT:Physics-Informed Auto-Encoder Based on Digital Twin)模型;所得的模型参数构建了一个数字孪生特征空间,用于捕捉各故障类型的潜在动力学分布。在步骤3中,通过在数字孪生空间内采样并将其解码回时域,生成少数类样本。这些生成信号的真实性与保真度通过时序波形相似度(均方根误差)和特征空间分布相似度(最大均值差异)进行评估。最后,在步骤4中,将生成样本按特定比例与原始数据集 合并,以获得平衡的训练数据集。随后训练并评估标准CNN诊断模型,其中不同不平衡比例下的分类准确率及t-SNE特征可视化作为验证指标,用于评估合成数据的有效性。
综上所述,所提框架形成了一个从真实数据驱动的数字孪生建模到高质量样本生成及诊断性能增强的闭环工作流。通过模型驱动的合成增强重构平衡数据集,该方法显著缓解了类别不平衡的不利影响,并为有限样本条件下数据驱动故障诊断的鲁棒性与泛化能力提升提供了一种实用且可扩展的范式。
编辑:赵栓栓
校核:李正平、陈凯歌、曹希铭、赵学功、白亮、任超、海洋、陈宇航、Kira、Tina、王金、赵诚、肖鑫鑫、张优
该文资料搜集自网络,仅用作学术分享,不做商业用途,若侵权,后台联系小编进行删除
来源:故障诊断与python学习