首页/文章/ 详情

中科院一区论文推荐 | 一种适用于时变工况下机械故障迁移诊断的新分布差异度量指标:集成离散流形距离

5月前浏览1097

    分布差异度量指标是实现域混淆的核心基础,因此它们在很大程度上决定了深度迁移诊断模型的性能。然而,这些指标的有效性依赖于数据局部分布的稳定性,使其不适用于连续时变工况下的跨域机械诊断任务。本文作者提出一种新的集成离散流形距离,以增强动态数据结构中的差异表征能力,供大家参考学习。


    论文基本信息

    论文题目:Integrated-Dispersion Manifold Distance: A New Distribution Discrepancy Metric for Machine Fault Transfer Diagnosis Under Time-Varying Conditions

    论文期刊:IEEE   TRANSACTION ON  CYBERNETICS

    论文日期:2026

    论文链接https://doi.org/10.1109/TCYB.2025.3630879  

    作者:Quan Qian[a,b],  Jiusi Zhang[a], Jun Luo[b], and Yi Qin[b]

    机构:

    a: the Schoolof Automation Engineering, University of Electronic Science and Technology  

    of China, Chengdu  

    b: the State Key Laboratory ofMechanical Trans mission, College of Mechanical and Vehicle Engineering, Chongqing University, Chongqing 

    作者简介:

    钱泉,1998年10月生,重庆巫山人,工学博士,首批中国科协青年人才托举工程博士生专项计划入选者,获宝钢优秀学生奖、国家奖学金、重庆大学在校生最高个人荣誉"学生年度人物"、重庆大学"十佳学术之星"。2016.09-2020.06期间于西南交通大学机械设计制造及其自动化专业学习,获工学学士学位;2020.09-2025.06期间于重庆大学机械电子工程专业学习,获工学博士学位;2025年7月于电子科技大学自动化工程学院任教。    研究兴趣主要包括工业大数据特征挖掘与人工智能、智能故障诊断与预测性维护、电磁微弱信号检测等领域 。主持国家自然科学基金博士生项目、重庆市研究生科研创新项目,参与国家自然科学基金重点项目/面上项目、JKW基础加强项目、华为企业委托横向项目等。以一作/通讯身份在IEEE TNNLS/TCYB/TII/TIE/TS MC/TMECH、MSSP、RESS、EAAI、KBS等领域权威期刊上发表SCI论文中科院一区Top15篇和中科院二区Top1篇,其中入选ESI高被引论文7篇和ESI热点论文3篇,谷歌学术引用1500余次,获IEEE可靠性重庆协会最佳论文奖和川渝科技学术大会优秀论文二等奖。担任IEEE Trans系列与爱思唯尔旗下等60余种期刊审稿人,获《Measurement Science and Technology》期刊杰出审稿人。以第一完成人身份获中国研究生创新实践系列大赛一等奖1项、二等奖3项和三等奖1项。(来源:电子科技大学教师主页)  

    目录

    摘要

    1 引言

    2 相关工作

    3 IDMD分布差异度量指标

        3.1 问题定义与动机分析

        3.2 MELD选择机制

        3.3 EGMG度量方法

        3.4 算法概述

    4 实验研究

        4.1 MELD选择机制分析

        4.2 案例1:实验室时变行星齿轮箱

        4.3 案例2:实时时变风力涡轮机轴承

        4.4 局限性与未来工作

    5 结论

    摘要

    分布差异度量指标是实现域混淆的核心基础,因此它们在很大程度上决定了深度迁移诊断模型的性能。然而,这些指标的有效性依赖于数据局部分布的稳定性,使其不适用于连续时变工况下的跨域机械诊断任务。为此,本文提出一种新的集成离散流形距离(Integrated-Dispersion Manifold Distance,IDMD),以增强动态数据结构中的差异表征能力。设计基于最大熵的局部分布(Maximum Entropy-based Local Distribution,MELD)选择机制,自适应地表征时变监测信号的全局分布信息;此外,构建集成格拉斯曼流形测地线(Ensemble Grass mann Manifold Geodesic, EGMG)度量方法,以表征高维数据复杂非线性结构所导致的内在分布差异信息。通过在时变工况下的两个故障迁移诊断实验(包括实验室行星齿轮箱和实际风力发电机轴承)对所提出的 IDMD 分布差异度量指标进行验证,实验结果表明其相较于现有先进方法具有有效性和优越性。  

    关键词分布差异;故障诊断;时变工况;迁移学习(TL)

    1 引言

    机械故障诊断技术在现代工程领域(如制造业、能源、电力和铁路运输等)中至关重要。该技术能够及时发现设备潜在故障,避免生产过程中出现意外停机;同时,还可提高设备可靠性和使用寿命,降低维护成本和能耗 [1-3]。随着新一代信息技术的发展,基于深度学习的故障诊断方法取得了显著成果,尤其在处理大规模、复杂的机械监测数据方面展现出强大潜力 [4-7]。然而,深度学习技术通常依赖大量带标签的故障样本进行训练。在工程实际中,机械设备的故障样本稀缺且标注成本高昂,这限制了基于深度学习的故障诊断方法的实际应用。此外,由于运行工况变化、环境改变、传感器精度不足等因素,历史训练数据与测试数据之间存在分布差异,使得模型难以在所有潜在故障工况下实现泛化 [8]。  

    幸运的是,基于迁移学习(Transfer Learning, TL)的诊断方法为减小训练数据(源域)和测试数据(目标域)之间的分布差距提供了可行方案 [9-11]。迁移学习大致可分为域自适应(Domain Adaptation, DA)和域泛化(Domain Generalization, DG)两类。域自适应通过利用源域和目标域数据调整模型,以确保模型对目标域特征具有更好的适应性。根据源域和目标域标签空间的关系,域自适应可进一步分为闭集域自适应 [12]、部分集域自适应 [13]、开集域自适应 [14] 和通用域自适应 [15] 等子领域。相比之下,域泛化仅通过源域数据训练模型,增强模型的跨域泛化能力,使其能够在未见过的目标域上表现良好,主要包括单源域泛化 [16] 和多源域泛化 [17-18]。由于域自适应在训练过程中可以访问目标域数据,其诊断精度通常高于域泛化,但诊断实时性较低。  

    基于域自适应和域泛化的诊断方法核心在于 “减小域间差异”,这通常通过边际分布对齐、联合分布对齐等技术实现。然而,这些方法忽略了 “发现差异” 这一基础环节,即核心层面的分布差异度量指标。分布差异度量指标可分为隐式距离基和显式距离基两类 [19]。隐式距离基指标中常用的有基于单分类器的 A 距离 [20] 和基于双分类器 “异或” 运算的 H∆H 距离 [21],它们通过神经网络基于对抗机制的自适应学习获得。显式距离基指标通过样本统计量测量分布差异,例如最大均值差异(Maximum Mean Discrepancy, MMD)[22]、相关性对齐(Correlation Alignment, CORAL)[23] 以及其他距离度量方法 [24-26]。由于 MMD 在希尔伯特空间中具有出色的差异表征能力,因此成为故障迁移诊断中应用最广泛的指标。  

    尽管上述分布差异度量指标在许多诊断场景中取得了成功,但它们仅适用于数据局部分布与整体分布近似一致的情况(即图 1 (a) 所示的恒定工况)。在实际应用中,部分机械设备(如风力发电机)运行在时变工况下,风速和风力随时间随机波动 [27]。在这种动态条件下,局部分布数据可能与整体分布产生显著偏差(如图 1 (b) 所示)。然而,传统分布差异度量指标通常以整体分布作为最终观测对象,导致时变工况下局部分布表征不准确,分布差异度量出现失真 [28]。因此,迫切需要一种考虑时变工况下局部分布不确定性的分布差异度量指标,以提高动态环境下故障迁移诊断的精度。  

    图 1 局部分布变化示意图(a)恒定工况 (b)时变工况  

    为解决上述问题,本文构建了一种新的分布差异度量指标 —— 集成离散流形距离(IDMD),用于时变工况下的故障迁移诊断。IDMD 指标主要由基于最大熵的局部分布(MELD)选择机制和集成格拉斯曼流形测地线(EGMG)度量方法组成。MELD 选择机制通过自适应分割多个局部分布,最大化表征时变整体分布的信息;随后,提出 EGMG 度量方法,以捕捉时变工况下流形空间中源域和目标域的内在分布差异。基于 IDMD 指标构建模型,实现了实验室行星齿轮箱和实际风力发电机轴承的时变故障迁移诊断。本文的主要贡献和创新点如下:  

    为避免动态环境下数据分布测量失真,提出新的 MELD 选择机制,通过多个局部分布自适应地表征整个时变监测信号的信息。  

    考虑到振动监测数据具有复杂的非线性数据结构,基于测地线投影构建新的 EGMG 度量方法,从非线性样本空间中挖掘源域和目标域之间的内在分布差异信息。  

    针对典型分布差异度量指标仅适用于稳定数据结构的问题,结合 MELD 选择机制和 EGMG 度量方法,提出适用于时变工况的新分布差异度量指标 IDMD,并通过两个故障迁移诊断实验验证了其相对于现有先进方法的优越性。

    2 相关工作

    本文主要关注分布差异度量指标,这类指标用于捕捉两个域的内在差异表征。将从隐式距离类和显式距离类两个角度进行文献综述。

    2.1 隐式距离类指标

    隐式距离类指标主要包括基于单分类器的    距离    [20]和基于双分类器的"异或"运算的    距离    [21],其数学形式如下:        

    其中,    表示数据样本,    表示对应的样本空间,     和    分别表示源域和目标域,    表示指示函数,     表示神经网络函数空间    中的分类函数,“⊕” 符号表示 “异或” 运算。在实际应用中,分类函数通常与对抗机制结合使用。例如,文献 [29] 提出了一种利用     距离的对抗性域自适应模型,通过训练域判别器来区分源域和目标域;焦等人 [30] 结合信息熵和 H∆H 距离,开发了一种自训练行星齿轮箱诊断网络;潘等人 [31] 构建了一种基于     距离和对比学习的开集域自适应诊断模型,并在多个轴承数据集上验证了其有效性。

    2.2 显式距离类指标

    与隐式距离类指标不同,显式距离类指标具有更清晰的数学表达式和更稳定的分布对齐效果,MMD [22] 和 CORAL [23] 是故障迁移诊断领域最常用的距离指标:

           

    其中,    和    分别为源域和目标域的数据样本,    为希尔伯特空间    中的核函数,    为样本维度,    和    分别为源域和目标域的协方差矩阵。这些距离指标常作为自适应层,通过转导训练实现域混淆:例如卢等人 [32] 基于自适应带宽诱导高斯核函数构建新的峰度 MMD,用于跨轴承诊断;文献 [33] 基于 MMD 的高维空间测量原理,结合机械监测信号的振动特性,开发新型分布差异度量指标以增强差异表征能力。 部分研究者将隐式距离类指标和显式距离类指标结合,开发混合分布差异度量指标,以获得更强的差异表征能力,提升域混淆程度 [34-35]。尽管这些指标在诸多场景中表现出优异的诊断性能,但仍不适用于时变工况下的分布差异测量。

    3 IDMD分布差异度量指标

    本节首先介绍研究的问题定义与动机分析,随后详细阐述 MELD 选择机制和 EGMG 度量方法,最后给出 IDMD 指标的算法伪代码。 

    3.1 问题定义与动机分析

    本研究在恒定↔连续时变工况的迁移诊断场景中验证所提 IDMD 分布差异度量指标。该场景下仅单个域(源域或目标域)的数据分布稳定,即局部分布与整体分布一致;分布对齐形式基于无监督迁移学习,仅源域样本带标签,目标域样本完全无标签,且源域与目标域的标签空间关系为闭集。 

     

    图2 提出的IDMD分布差异度量原理图

    以图 2 所示的 “恒定源域→时变目标域” 迁移诊断场景为例(第三节 B-D 小节均基于该设定):由于目标域持续时变,其局部分布与整体分布不一致且难以稳定观测(图 1 (b)),直接用整体分布表征整个时变监测信号会导致实际数据分布测量失真。因此,可将连续时变场景视为 “未见过的目标域”(目标域数据分布不可观测),假设实际最优目标域分布    位于由    个目标域局部分布    构成的凸包    内(即    ),凸包    定义如下:

       

    其中,    表示    维单纯形,    表示归一化权重。恒定源域分布    与凸包    之间的分布差异    可表示为:

       

    其中,    表示     距离。最优目标域分布    可通过理想归一化权重    近似表示:

       

    凸包    的直径    定义为:

       

    根据式 (5)-(8) 及迁移学习理论 [36],可推导出时变目标域的经验误差界:

       

    其中,        分别表示源域和目标域的经验风险;    表示目标域多个局部分布构成的凸包与恒定源域的分布差异;    为凸包的直径大小;    表示不可观测的最优分布差异。若令    ,可得    。基于上述分析,需通过以下两步减小目标域的诊断误差: 1.寻找多个局部分布表征整个时变监测信号的信息,满足    (对应所提 MELD 选择机制); 2.减小源域分布与每个目标域局部分布的差异(对应所提 EGMG 度量方法,可从非线性样本空间中提取内在分布差异信息)。 IDMD 分布差异度量指标的原理如图 2 所示,MELD 选择机制和 EGMG 度量方法将在第三节 B、C 中详细介绍。

    3.2 MELD 选择机制

     基于前述迁移诊断理论,确保 IDMD 指标有效性的前提是最大化表征连续时变监测信号的分布信息。因此,设计 MELD 选择机制自适应搜索多个最优局部分布:首先假设监测信号的分布服从高斯分布    (与图 1 所示实际数据特征一致),其概率密度函数定义为:

       

    其中,    表示第    个高斯分量下的样本分布概率,         分别为第    个样本集的均值和协方差,    为样本维度。整个连续时变监测信号的内在分布    可表示为:

       

    其中,    为参数集,    为第    个高斯分布的权重。分布参数    的求解可转化为高斯混合模型的求解问题 [37],给定样本数量    ,优化目标定义为:
       

       

    直接通过偏导数求解    难以实现,利用詹森不等式和 “懒惰统计学家法则”,将式 (12) 中的目标函数    重写为:

       

       

    采用期望最大化算法迭代计算式 (13),其数学表达式为:

           

    通过式 (10)-(15) 可得到最终的分布参数    

    接下来需确定表征时变监测信号全部信息所需的高斯局部分布数量:根据前述理论,选择多个局部分布需最大化包含所有分布信息(满足    ),即捕捉更多信息。熵表示信息的不确定性和丰富度,其大小反映系统中信息的多样性,因此选择局部分布数量的目标是实现更高的信息熵。考虑到    表示第    个高斯分布在所有高斯分布混合中的占比,最优数量    可通过下式求解:

           

    其中,    表示C个高斯分布下的信息熵;    为温度系数,用于控制    间的差异,    越小差异越大。根据式 (16),    ,无法通过穷举搜索求解,因此将其重写为:

    其中,    为指示函数,即若,反之则为 0;    为判别阈值。仅当当前    对应的信息熵高于    时,才选择    作为局部分布数量(满足。为确保高置信度,本研究设定阈值    ,通过式 (17) 选择最小的    作为最终局部分布数量    
    3.3 EGMG 度量方法 

    基于上述 MELD 选择机制和图 2 的设定,通过对应局部分布参数采样可得到时变目标域中的多个子域    

       

       

    其中,     表示给定样本维度    和显著性水平    下的卡方分布;    从分布    中以    置信水平采样得到,即数据样本    位于超球面内。

       

    在复杂时变工况下,测量两个域的内在分布差异信息面临巨大挑战:现有多数方法依赖欧氏度量,其本质假设数据样本空间为线性,但实际监测数据通常呈现复杂的非线性结构 [38],导致欧氏度量可能对分布差异做出不准确甚至误导性的评估。为克服这一局限,本文提出 EGMG 度量方法(图 3):与欧氏度量不同,测地线度量明确考虑数据空间的非线性几何特性,能够捕捉域间的内在结构变化,更准确地表征分布差异信息,从而提升迁移诊断任务中的域混淆效果。

     

    图3  欧几里得测量和测地线测量原理 

    由于直接在样本空间中测量测地线的计算复杂度极高,将源域和目标域的多个子域嵌入到格拉斯曼流形中,得到其子空间表示    ,可通过样本协方差矩阵的特征值分解求解:

       

    图 3 中源域和目标域第    个子域分别表示为        ,对应的测地线子空间流(图 3 中蓝线)可表示为:

     

    其中,         。若能构建    的表达式,即可得到测地线度量    。根据流形理论 [39]:

       

    其中,            为正交矩阵,满足:

       

    其中,        为与子空间        之间的主角度     [40] 相关的奇异对角矩阵:

       

    式 (22) 中        对应的元素分别为        。由于测地线度量    为无穷维向量,无法直接计算。样本向量        分别来自源域和目标域的第    个子域。因此最终的 IDMD 分布差异距离    是在     和     之间的内积基础上定义的:

       

       , 以积分项    为例,其详细数学推导如下:

       

    其中:

       

    IDMD 满足距离定义的证明见附录。 由 EGMG 的推导过程可知,式 (20) 中子空间的维度对最终分布差异有显著影响,因此确定该维度也是关键问题。首先根据迁移学习理论 [20],定义跨域的    范数自然度量    

       

    其中,            下的可测集。根据上述定义,分布差异度量指标应捕捉源域与目标域的最大差异,因此子空间维度    可通过以下规则选择:

       

    其中,    表示分布距离 [41],其数学表达式为:

       

       表示简单二元判别神经网络的分类误差。需注意的是,    计算效率高,且能通过神经网络自适应测量非线性数据结构下的差异,因此式 (29) 未采用 EGMG、MMD、CORAL 等度量方法。

    3.4 算法概述 

    所提 IDMD 分布差异度量指标的算法概述如表 1 所示。 

    表 1 IDMD 指标的算法概述

     

    为验证 MELD 选择机制能否选择多个局部分布表征全局信息,通过三个正态分布      模拟简单阶段时变信号,对应公式如下:

     

    模拟时变信号及 MELD 选择的局部分布如图 4 所示:MELD 选择的局部分布数量与式 (31) 一致    且通过 MELD 得到的分布参数与三个采样正态分布近似相等,验证了 MELD 选择机制的有效性。

     

    图4 模拟的时变信号和来自MELD机制的局部分布

     

    4 实验研究  

    本节首先在模拟信号上评估 MELD 选择机制的准确性,随后通过两类迁移诊断案例(实验室时变行星齿轮箱和实际时变风力涡轮机轴承),验证所提 IDMD 指标在时变动环境下的有效性。

    4.1 MELD 选择机制分析

    (注:对应原文第四节 A,主要验证 MELD 选择机制的有效性,前文已通过模拟信号验证,此处不再赘述)

    4.2 案例 1:实验室时变行星齿轮箱

    1) 实验台描述  

    时变行星齿轮箱数据集通过图 5 所示的实验台采集。该 HD-CL-012X 实验台由无锡厚德自动化仪表有限公司搭建,主要包括控制器、驱动电机、扭矩传感器、单级行星齿轮箱和磁粉制动器五个部分;模拟故障部件为行星齿轮箱中的行星轮,在齿轮箱壳体上安装振动加速度传感器进行健康监测。采集的振动监测信号包含六种健康状态:正常状态(NC)、表面剥落(SP)、齿根裂纹(RC)、齿面磨损(TW)、微点蚀(MP)和轮齿断裂(TF);加速度信号采样频率设为 16384 Hz,模拟三种时变转速工况(0-600 r/min(V1)、0-1200 r/min(V2)、0-2400 r/min(V3)),转速变化率分别为 100、200、400 r/min/s,同时模拟一个恒定转速工况(600 r/min(C))。每种转速工况下施加 5 N・m 的恒定负载,振动信号采样时长为 10 s;样本长度设为 3072(确保每个样本至少包含一个故障周期),通过滑动采样技术将每种健康状态下采集的信号分为 1000 个样本(相邻样本重叠 2911 个数据点)。为更严格地验证诊断性能,直接使用原始振动信号进行故障诊断,未进行预处理。

     

    图5  单级行星齿轮箱测试台

    2) 实验结果与分析  

    本研究选择一维卷积神经网络作为特征提取器,将所提 IDMD 指标     作为域混淆损失以提取域不变故障特征,采用分类交叉熵损失学习可分离特征,通过两种损失实现跨域诊断:

       

    其中,    为权衡参数,通过二分查找使上述两种损失保持同一数量级。 基于上述模拟的三种时变转速和一种恒定转速工况,构建六个迁移诊断任务(C→V1、C→V2、C→V3、V1→C、V2→C、V3→C),验证所提方法的有效性。选取三种显式距离基指标(MMD [22]、MMSD [33]、CORAL [23])和两种隐式距离基指标(A [20]、H∆H [21])作为对比方法,评估 IDMD 的优越性。所有方法的诊断精度如图 6 所示:IDMD 显著提升了诊断精度,在所有任务中较其他指标提升近 40%,平均精度超过 90%,表明其在连续时变工况下更有效;但在 “恒定→时变” 迁移任务(C→V1、C→V2、C→V3)中,IDMD 的精度低于反向任务(V1→C、V2→C、V3→C),这主要是因为所有时变工况(V1、V2、V3)均包含 600 r/min 恒定工况(C)的故障信息。

     

    图6 实验室时间变行星齿轮箱的实验结果

    3) 域混淆能力分析

    以 V3→C 迁移任务为例,通过各故障类型提取特征的概率密度图(图 7)直观展示所提 IDMD 指标的域混淆能力:源域和目标域中所有类别的特征分布完全重叠,表明 IDMD 能在时变动环境下实现分布对齐;此外,从每个子图中水平轴上特征分布的数值范围可以看出,IDMD 能学习到类内紧凑、类间分离的故障特征。综合实验结果进一步验证了 IDMD 具有强大的差异表征能力和迁移诊断能力。

     

    图7 在V3->C转移任务下不同故障特征的概率密度图。(a)NC,(b)SP,(c)RC, (d) TW, (e) MP和(f) TF

    4) 多种评估指标分析  

    与精度相比,混淆矩阵不仅能反映整体正确性,还能捕捉类间误分类分布,评估更全面。以 C→V3 迁移任务为例,六种不同分布差异度量指标的分类结果混淆矩阵如图 8 所示:图 8 (f) 中主对角线元素在对应行中最大,表明 IDMD 总体上学习到了域不变且具有判别性的故障特征;但 IDMD 在 SP(标签 0)和 MP(标签 4)故障类别的诊断性能相对较弱,这可能是由于剥落和点蚀故障尺寸较小,导致冲击信号不明显。从上述混淆矩阵中可轻松推导各类别的精确率、召回率和 F1 分数,其 “宏平均” 值如表 2 所示。综合图 8 和表 2 可知,IDMD 相较于其他方法取得了最优的诊断性能。

     

    图8 C到V3迁移任务的混淆矩阵。(a)MMD,(c)(b)MMSD,CORAL, (d) A, (e) HAH和 (f) IDMD. 

    表 2 多种典型评估指标的实验结果

     
    5) 计算效率分析  

    为进一步评估 IDMD 分布差异度量指标的计算效率,以 V1→C 迁移任务为例,测量所有方法每个 epoch 的训练时间和测试时间(图 9)。实验平台配置为 Intel Core i7-9700 CPU、16 GB RAM 和 GeForce GTX 3080 GPU:由于 MELD 选择机制中的穷举搜索操作和 EGMG 度量方法中的大量矩阵计算,IDMD 的训练时间达到 48.56 s,计算复杂度高于其他基线方法;但 IDMD 的测试时间仅为 0.16 s,表明其适用于实际工程中的实时故障诊断。

     

    图9 不同方法的训练时间和测试时间

    6) 消融实验  

    为进一步验证所提 IDMD 的有效性,进行消融实验:“w/o-MELD mechanis m” 表示域混淆训练过程中不考虑时变工况下的局部分布不确定性,直接应用所提流形距离进行对齐;“w/o-EGMG measurement” 表示使用传统 MMD 而非所提 EGMG 度量方法测量分布差异。以 C→V1 和 V1→C 迁移任务为例,结果如图 10 所示:C→V1 任务中 IDMD 的诊断精度为 85.43%,而移除 MELD 机制或替换 EGMG 度量方法后,精度分别降至 55.68% 和 69.23%;V1→C 任务中,“w/o-MELD mechanis m” 和 “w/o-EGMG measurement” 的精度分别为 77.36% 和 68.45%,显著低于 IDMD 的 94.75%。这些结果表明,忽略局部分布不确定性或采用典型分布度量会严重降低跨域泛化能力和诊断性能,而所提 MELD 机制和 EGMG 度量方法在增强分布对齐和提升模型鲁棒性方面发挥关键作用,验证了所设计模块的合理性和有效性。

     

    图10 在迁移任务C>V1和V1一C下的消融实验结果

    4.3 案例 2:实际时变风力涡轮机轴承

    1) 数据集描述

    工程实际中机械设备的历史故障监测数据稀缺,导致源域诊断知识获取困难。测试台采集的故障数据成本较低且获取迅速,因此受到广泛关注;但实际机械设备的故障监测信号复杂度高,可能导致源域与目标域之间存在较大分布差异,进而引发诊断知识的负迁移(尤其对于未知设备)。为解决这一挑战,本节利用实际风力涡轮机齿轮箱轴承(WTGB)监测数据和公开的东南大学(SEU)轴承测试台数据集,构建时变条件下的跨域诊断任务,评估所提 IDMD 诊断模型的工程应用潜力,以下详细介绍两类数据集: 

    ● WTGB 数据集:来自某风电场的多台 2-MW 风力涡轮机,其传动结构如图 11 所示,主要包括一级行星齿轮传动系统和两级平行轴齿轮传动系统;在低速轴轴承附近安装加速度传感器采集振动数据,采样频率为 25.6 kHz;为降低数据存储成本,每天仅保留 5.12 s 的数据。WTGB 数据集记录的故障类型包括正常状态(NC)、内圈故障(IF)、滚动体故障(BF)和外圈故障(OF),均发生在平行轴齿轮箱的低速轴轴承上,且在不同运行工况下采集。与测试台人工加工的规则轴承故障形状不同,实际风力涡轮机的轴承故障由于降解过程缓慢且运行工况复杂,形状不规则;此外,监测信号中包含故障信息的冲击分量常被背景噪声和其他分量淹没,这两点增加了诊断模型提取故障特征的难度。同时,风速变化导致转速持续非线性波动(图 12)。每个故障类别的样本大小和数量与前一小节一致,且对实际服役环境中传感器采集的数据进行了异常值去除处理。

     


    图11  实际2兆瓦风力涡轮机的传动结构

     

    图12 风力涡轮机的实际时变工作条件:(a)输出速度信息和(b)振动加速度波 

    ● SEU 数据集[42]:来自动态传动系统模拟器(图 13),该测试台由电机、电机控制器、行星齿轮箱、平行轴齿轮箱、制动器和制动控制器组成,通过调节制动控制器的电压改变负载。实验中施加两种电压(0 V 和 2 V),设置两种转速工况(1200 r/min 和 1800 r/min),故障类型与 WTGB 一致(NC、IF、BF、OF),采样频率为 5120 Hz。通过迁移能力判别分析方法 [43],选择 2 V&1800 r/min 的恒定工况作为本案例的源域,每个故障类型的样本大小和数量分别设为 3072 和 1000。

    2) 实验结果与分析

    利用 WTGB 和 SEU 轴承数据集构建两个跨设备迁移诊断任务(WTGB→SEU 和 SEU→WTGB):由于两类数据集的采样频率、机械结构和噪声环境完全不同,其迁移诊断任务比图 6 中的任务更具挑战性。本案例的实验设置与案例 1 一致,结果如图 14 所示:所提 IDMD 指标表现突出,在 WTGB→SEU 和 SEU→WTGB 任务中的精度分别达到 86.65% 和 81.13%,较其他知名指标提升近 30%,进一步证明了 IDMD 在实际工程场景中的优越迁移诊断性能。 

    3) 进一步实验研究

    为评估所提 IDMD 指标的抗噪声鲁棒性,以 WTGB→SEU 迁移任务为例,在原始监测信号中添加随机噪声,设置不同噪声水平(通过信噪比(SNR)评估),信噪比定义如下:

       

    其中,Psignal 和Pnoise 分别表示信号和噪声的功率。选取多种最先进的 MMD 变体(KMMD [32]、LMMD [44]、MKMMD [45])作为基线方法进行对比,进一步评估 IDMD 的优越性。结果如图 15 所示:IDMD 在所有噪声水平下均取得最高诊断精度,鲁棒性强于其他指标;尤其在噪声功率与信号功率相等的极端高噪声条件下(SNR=0 dB),IDMD 仍能达到 70.61% 的诊断精度,验证了其在严重噪声干扰下仍能保持可靠的诊断性能。与先进 MMD 变体相比,IDMD 在所有噪声水平下的平均精度提升约 36.5%,突出了其捕捉域不变特征的卓越能力,表明 IDMD 为实际场景中的故障诊断提供了稳健可靠的方法。 基于事后弗里德曼检验的临界差异(CD)图 [46],可清晰可视化多种算法在不同噪声水平下的统计显著性,通过展示平均排名,直观对比方法性能和显著性关系。为系统评估 IDMD 的鲁棒性,在所有 SNR 水平下将其与其他指标进行对比,采用威尔科克森 - 霍尔姆程序进行事后非参数弗里德曼检验,诊断精度的 CD 图如图 16 所示(CD 值越小,迁移诊断性能越好):图中粗水平线表示一组方法处于同一显著性水平,综合来看,CD 图明确证实了所提 IDMD 指标在连续时变条件下跨域故障诊断的优越能力和鲁棒性。

    4.4 局限性与未来工作

    尽管所提 IDMD 在跨域故障诊断中表现出强大性能,但仍存在以下局限性:

    • 1.IDMD 已在行星齿轮箱和风力涡轮机齿轮箱上验证,但在其他机械系统和超高维数据结构中,其稳定性和优越性可能下降;此外,由于实验装置的限制,未探索快速转速变化等极端运行工况;

    • 2.MELD 机制假设局部分布近似服从高斯分布,在处理高度非高斯数据集时有效性可能降低;

    • 3.该方法依赖源域与目标域故障类别相同的假设,限制了其在标签空间关系不同场景中的适用性。

    未来工作将探索超越高斯假设的更灵活分布建模方法、通用伪标签权重策略,拓展所提方法在更多机械系统中的应用,并评估其在更复杂严苛工作条件下的鲁棒性。

     

    五 结论

    本文提出一种新型 IDMD 分布差异度量指标,以提升连续时变工况下的差异表征和迁移诊断能力。首先深入分析和探索 IDMD 指标的迁移诊断理论,基于该理论开发 MELD 选择机制和 EGMG 度量方法,确保 IDMD 的有效性:MELD 选择机制自适应搜索多个局部分布,准确表征时变监测信号的全局分布;针对高维数据样本的复杂非线性结构,基于测地线度量和流形子空间构建 EGMG 度量方法,挖掘源域与目标域之间的内在分布差异信息。通过实验室时变行星齿轮箱和实际时变风力涡轮机轴承的故障迁移诊断实验,验证了所提 IDMD 指标优于其他最先进的分布差异度量指标,尤其在所有迁移任务中,IDMD 的平均诊断精度超过 88%,表明其在实际工程中具有巨大的应用潜力。

    编辑:李正平
    校核:陈凯歌、赵栓栓、曹希铭、赵学功、白亮、任超、海洋、陈宇航、Tina、王金、Kira、赵诚、肖鑫鑫、张优
    该文资料搜集自网络,仅用作学术分享,不做商业用途,若侵权,后台联系小编进行删除

    来源:故障诊断与python学习
    ACTMechanical振动断裂非线性旋转机械通用电力电子ANSA海洋UM裂纹电场理论电机传动数字孪生人工智能DAP
    著作权归作者所有,欢迎分享,未经许可,不得转载
    首次发布时间:2026-03-12
    最近编辑:5月前
    故障诊断与python学习
    硕士 签名征集中
    获赞 87粉丝 152文章 327课程 0
    点赞
    收藏
    作者推荐

    “数字孪生/故障诊断”专题||数字孪生+视觉语言大模型:用于多场景工业故障诊断(上)

    本期给大家分享一篇小编近期阅读的1区top文章。如果有故障诊断相关方向研究人员希望宣传自己研究成果,欢迎大家在公 众号后台与小编联系投稿,大家一起交流学习。 本期推荐的这篇是西安交通大学许权宁的文章,本文系统综述了工业故障诊断从“数据驱动深度模型”走向“大模型时代”的完整技术脉络:首先回顾了传统规则/模型/数据三类范式的演进瓶颈,继而梳理了大型语言模型、视觉模型与多模态视觉-语言模型(LVLMs:Large Vision-Language Models)在故障预测与健康管理(PHM:Prognostics and Health Management) 领域的最新进展,指出通用大模型因缺乏工业知识、难以应对跨工况分布漂移与高质量样本稀缺等痛点;在此基础上,重点剖析了数字孪生驱动的深度合成数据、参数高效微调(LoRA:Low-Rank Adaptation)、跨模态对齐与对比学习等关键技术如何协同解决样本不足、域泛化与可解释性三大核心问题,最终提出面向多场景、可对话、可迁移的下一代智能故障诊断大模型研究框架与未来挑战。 由于文章篇幅过长,小编将分两次为大家翻译介绍这篇论文。第一篇推文提出融合深度数字孪生与大型视觉-语言模型的故障诊断框架故障诊断通用语言模型(FDGLM:Fault Diagnosis General Language Model),利用虚拟实体生成高质量振动样本,经短时傅里叶变换(STFT:Short-Time Fourier Transform)转为时频图,再借助LoRA策略对视觉和语言模块进行两阶段微调,实现跨工况、跨设备智能诊断,并构建人机交互式维护决策,突破工业数据稀缺与泛化瓶颈。 希望对大家的学习有所帮助,文章质量很高同时希望大家可以多多引用。 论文基本信息论文题目: Deep digital twin-powered large vision-language model for multi-scenario industrial fault diagnosis论文期刊:Advanced Engineering InformaticsDoi:https://doi.org/10.1016/j.aei.2025.103997作者: Quanning Xu(a), Guangrui Wen(b), Zihao Lei(c),Shulong Gu(d),Yu Su(e),Zhifen Zhang(f),Xuefeng Chen(g) 论文时间: 2025年 机构: a National Key Lab of Aerospace Power System and Plas ma Technology, Xi’an Jiaotong University, Xi’an 710049, Chinab State Key Laboratory for Manufacturing System Engineering, Xi’an Jiaotong University, Xi’an 710049, Chinac School of Mechanical Engineering, Xi’an Jiaotong University, Xi’an, Shaanxi 710049, China作者简介:许权宁,西安交通大学机械工程学院博士研究生,国家航空航天动力系统与等离子体技术重点实验室、机械制造系统工程国家重点实验室核心成员。长期聚焦工业人工智能、数字孪生与多模态大模型融合研究,近三年在《Advanced Engineering Informatics》等顶刊以一作/通讯身份发表多篇论文,主导开发了面向多场景工业故障诊断的开源框架 FDGLM。(来源:ResearchGate) 摘要数据驱动的深度学习技术已被广泛采纳于工业健康监测与维护。然而,传统诊断方法常受场景特异性限制且智能能力不足。新近发展的大规模视觉-语言模型为智能故障诊断提供了先进的人机交互范式。本研究通过提出FDGLM框架,将LVLMs拓展至工业故障诊断,实现跨多种运行条件与数据集的智能化诊断。首先,依托先进数字孪生技术生成高质量振动样本以支撑模型训练;这些样本经STFT处理,生成增强的时频谱图,满足故障诊断通用语言模型(FDGLM:Fault Diagnosis General Language Model)训练对大规模数据的需求。随后,采用低秩自适应策略对预训练视觉模型进行微调,联合交叉熵损失与圆损失以同步提升对工业故障时频特征的判别能力与鲁棒性。接着,利用领域专用文本指令对语言模型进行微调,实现视觉与文本模态的深度对齐,使因果故障分析与维护决策成为可能。最后,在四个独立数据集上开展跨工况与跨数据集实验,结果显示:同工况诊断精度达0.995,变工况为0.890,跨数据集为0.947,同时呈现专业级对话诊断能力。实验结果证实,FDGLM以极小微调代价即可提供适用于工业场景的可靠诊断,性能优于现有框架,为下一代工业装备健康管理提供解决方案。 关键词:大语言模型;大规模视觉-语言模型;故障诊断;多模态大语言模型;数字孪生 目录1 引言2 相关研究 2.1 智能故障诊断 2.2 大规模模型3 深度数字孪生模型 3.1 滚动轴承的虚拟表示 3.2 虚拟-物理数据流融合4 所提出的大规模视觉-语言模型 4.1 模型架构 4.2 预训练视觉模型的微调 4.3 查询变换器 4.4 预训练语言模型的微调 4.5 实现流程5 实验验证 5.1 数据集配置与预处理 5.2 实验设计与实现细节 5.3 数字孪生模型验证 5.4 单工况验证 5.5 跨工况验证 5.6 跨数据集验证 5.7 超参数分析 5.8 消融实验6 结论注:小编能力有限,如有翻译不恰之处,请多多指正~ 若想进一步拜读完整版,请下载原论文进行细读。 1 引言作为工业界与学术界人工智能领域的首要研究焦点,大规模模型已在多学科掀起新一轮技术浪潮。在自然语言处理、计算机视觉与科学计算等领域,这些模型衍生出大语言模型[1,2]、视觉模型[3]及天气预报模型[4]等多元变体。通过跨学科融合,它们进一步演化为融合视觉与文本数据的多模态视觉-语言模型[5,6],以及面向工业视觉监测的多模态对话模型[7]。这些技术对装备健康管理与工业系统智能化升级展现出变革性潜力。故障诊断作为故障预测与健康管理的核心环节,依托传感器信号分析实现故障类型识别、故障部位定位及严重程度评估。近十年来,计算机科学的范式迁移推动了基于深度学习的诊断方法取得显著突破[8]。凭借端到端学习机制,此类方法在面向特定运行工况定制的数据集上展现出卓越诊断性能。然而,由于域间分布漂移,其性能在不同工况或不同设备间往往难以泛化[9]。将大规模模型技术融入PHM框架,尤其是通过面向故障诊断的专用时序建模架构,为保障机械设备运行稳定性提供了变革性视角[10]。在工业数据集上微调后,预训练视觉-语言模型能够以强泛化能力与上下文理解力完成故障诊断。此外,多模态数据的有效利用以实现缺陷全面表征仍是持续显著的研究挑战。在真实工业环境中,先进传感系统通常产生多源数据流,涵盖振动、声信号、文本描述及视觉图像。学者已针对各类信号模态展开广泛研究:例如,Löwenmark 等提出弱监督技术语言处理框架,借助自然语言标注提升模型性能[11];Lei 等提出变工况轴承振动信号域自适应诊断方法[12];Liu 等构建动态视觉数据神经形态故障诊断框架,利用脉冲神经网络实现高效特征提取,并通过迁移与元学习增强泛化[13]。大规模模型凭借异构模态对齐、互补特征融合及语义推理[14],在整合文本、图像、音频、视频数据方面展现强大能力,实现全面信息理解与生成。OpenAI 的对比语言-图像预训练(CLIP:Contrastive Language–Image Pre-Training)[15]通过对比学习将视觉与文本模态投影至共享语义空间,实现高效跨模态对齐与检索。将工业图像与文本信息融合后,视觉-语言模型在故障诊断中展现出变革性应用潜力。深度神经网络架构的演进呈现出参数规模持续扩大的显著趋势。以Transformer框架为代表的大规模预训练模型已相对传统神经网络实现显著性能跃升。依据Vapnik-Chervonenkis维度理论,模型容量、泛化能力与所需训练数据量存在根本关联——即模型越复杂,所需样本越多[16]。因此,构建大规模故障诊断模型亟需高质量数据集且须具备充足样本多样性。然而,工业环境中设备故障发生频率低且复现成本高昂,导致采集多样化多状态数据以构建全面数据集极为困难[17]。为突破该瓶颈,研究者已探索多种数据增强方法:Hei 等提出融合Wasserstein距离与工况标签嵌入生成对抗网络的方法,利用注意力驱动预自适应模块缓解分布漂移[18];Yu 等将信号标签嵌入去噪扩散概率模型,并优化网络架构以提升层内与层间特征表示,实现不平衡数据条件下的精准轴承故障诊断[19]。然而,生成模型固有地难以在合成数据质量与训练规模间取得平衡,因而无法彻底解决数据稀缺问题。数字孪生技术通过利用丰富虚拟资源于工业生态系统内模拟故障状态,为构建高质量训练数据集提供了变革性解决方案[20,21]。Yu 等提出数字孪生特征输入框架,建立虚拟映射关系,实现非接触故障诊断[22]。本文尝试通过孪生数据构建全面训练集,以支撑视觉-语言模型的训练。综上,为在多状态且高质量数据稀缺的条件下构建智能对话诊断模型,本文提出数字孪生驱动的大规模视觉-语言故障诊断框架。主要创新包括:(1) 研发实用化数字孪生驱动视觉-语言诊断框架;(2) 利用数字孪生构建大规模高质量数据集,满足大规模模型训练需求;(3) 提出故障诊断视觉-语言模型,采用两阶段训练策略对视觉模块与语言模块进行渐进式微调;(4) 开展全面验证,证明该框架在单工况、跨工况及跨数据集场景下均具备智能化多场景诊断性能。本文结构如下:第二节回顾智能故障诊断与大规模模型相关研究;第三节阐述数字孪生模型;第四节介绍所提视觉-语言框架;第五节给出实验结果;第六节总结关键发现并展望未来研究方向。2 相关研究2.1 智能故障诊断在旋转机械领域,借助 DT 的动态建模正成为研究热点;优质的动态模型是 DT 建模的根基,可为后续虚实交互提供高保真虚拟信号。当前研究主要集中于轴承、齿轮与转子系统。对轴承系统,研究重心为轴承损伤(如内圈、外圈及滚动体损伤)的动态建模,主要关注轴承自身力学特性,而不考虑转子系统影响。对齿轮传动系统,研究重心为裂纹、剥落、磨损、断齿等故障状态下齿轮传动系统的动态建模。对转子系统,当前重心主要为不平衡、不对中、碰摩、机座松动等工况下的转子系统动态建模 [50]。这三类系统所采用的主要建模方法包括:基于物理的模型(如集中参数模型、有限元模型、刚−柔耦合模型)、唯象模型以及数据驱动模型。从另一个角度来看,故障诊断经历了四个关键的开发阶段。如图1(a)所示,传统的诊断技术主要集中在一维振动信号分析上。这些模型通常使用工业数据从零开始进行训练,但往往受到泛化能力有限的影响,并且需要大量的训练样本。如图1(b)所示,预训练模型显著降低了对标记样本的依赖。通过将一维信号转换为图像,已经建立的视觉模型(如视觉Transformers(ViT:Vision Transformers)[28])成功应用于故障诊断。大型语言模型(LLMs:Large Language Models)利用其在序列信号处理方面的强大能力,为PHM引入了新的范式。这些模型通过智能人机交互在分类和预测任务中实现了高性能[3,4]。如图1(d)所示,视觉-语言模型超越了LLMs的局限性,通过动态融合视觉和文本特征来增强多模态推理能力[7,29]。具体而言,使用信号处理技术将一维信号转换为二维表示。这种转化不仅满足了基于视觉模型的输入要求,还增强了与故障相关的特征,同时减少了因采样频率差异和设备特定变异而引起的伪影。LVLMs利用领域特定的文本语料库实现准确的故障分类和因果推断。此外,通过利用视觉和语言特征之间的深度交互,该模型支持高精度的故障诊断和在工业应用中的知情决策。因此,本研究重点关注使用LVLMs进行精确的轴承故障诊断。 图1 不同阶段的故障诊断办法2.2 大规模模型大规模模型是计算机科学中的一个关键前沿,最初出现在自然语言处理(NLP:Natural Language Processing)领域[30]。为了处理图像和视频等视觉数据模态,这些模型已经演变为大规模视觉-语言架构。通过将视觉和文本数据映射到统一的语义空间,这些模型实现了跨模态的相关性和理解。Luo等人提出了一种对比跨模态去噪框架,通过结合跨模态匹配与模态内部去噪,利用被遮挡和未遮挡视频帧之间的对比来改善视觉-文本对齐[31]。然而,由于缺乏领域特定的知识,现有的大型语言模型在工业视觉数据上的表现不尽如人意。近期的研究努力专注于为PHM应用开发专用的LLMs。Wang等人开发了一种多模态晶圆缺陷数据集,并使用LVLMs实现了高精度的多类缺陷识别[32]。Zheng等人针对复杂系统的故障诊断进行了初步研究,使用预训练的大型模型进行数据集大小、数据预处理和可解释性等因素的定量和定性评估[33]。Tao等人推出了首个用于轴承故障诊断的大型语言模型,通过统计分析选择振动信号特征,并验证其在少样本和跨数据集场景下的性能[10]。Tang等人提出了一种针对少样本和零样本场景设计的大规模视觉-语言模型。通过联合优化交叉熵损失、焦点损失和Dice损失,该模型在样本有限的情况下也能实现准确的故障识别[29]。针对故障诊断的LLMs研究仍处于早期阶段,如何在故障数据稀缺的条件下有效操作仍是一个主要挑战。从头训练含数亿到万亿参数的大规模模型计算开销惊人,于是学界转向参数高效微调:仅更新极少额外参数即可把预训练模型“挪”到新任务。全参数微调虽更新全部权重,却丝毫未减算力负担;当前把通用大型视觉-语言模型拉进垂直场景,几乎全靠这类“轻量”微调,主流套路有 Adapter、Prefix-Tuning 和低秩适应。Adapter 在每个 Transformer 层塞入轻量前馈子模块 [34],训练时只动这些“小插头”,思路简单却额外加层,推慢推理,且参数效率与优化深度仍受限;Prefix-Tuning 把一串可训练的“前缀 token”贴到输入,靠冻结主干、只调前缀来引导输出 [35],但连续软提示直接学习极易震荡、收敛糟糕;相比之下,LoRA 用低秩矩阵逼近权重更新 [36],在算力与性能间切出最优权衡——Meta 的工作已证实,预训练模型本征维度极低,在此压缩子空间微调即可媲美全参更新;LoRA 仅对高维 权重矩阵做低秩分解、训练其中一小撮参数,便实现“四两拨千斤”。令预训练模型中 特定层的原始权重矩阵记为 ,微调更新为 ,得到更新后的参数矩阵 。根据LoRA假设,更新 可以用两个低秩矩阵的乘积近似: ,其中 , 和 。这里, 作为一个超参数控制着低秩近似的复杂度。与传统的微调更新整个矩阵 不同,LoRA只需要 个额外参数,显著降低了计算成本和内存占用。如图2所示,在前向过程中,给定一个输入 ,,层的输出h被计算为:矩阵 使用高斯分布初始化,而 初始化为零矩阵。值得注意的是,尽管只引入了少量的额外参数,LoRA实现了与完全微调相当的性能,同时大幅降低了计算和内存成本[38]。 图2 LoRA微调方法示意图3 深度数字孪生模型深度数字孪生(DDT:Deep Digital Twin)技术通过将深度学习算法嵌入数字孪生框架,并以生成模型为桥梁,实现虚拟-物理的高保真映射 [39]。概念上,DDT 由三大核心单元构成:物理实体、虚拟实体以及虚实映射网络 [40]。为构建覆盖全健康状态的大规模训练数据集,本文借助 DDT 生成多样化多健康状态数据。3.1 滚动轴承的虚拟表示在为精准复现轴承振动特征与失效机理,本文以六自由度动力学模型作为虚拟映射:如图 3 所示,该模型将六个自由度分配至内圈、外圈与壳体部件。该模型融合滚动体非线性接触、润滑油膜阻尼及缺陷效应等关键因素。运动方程基于 Hertz 接触理论建立,用以刻画滚动体与滚道间的弹性相互作用;针对不同故障类型,通过将几何缺陷参数与动态响应数据耦合,量化缺陷引发的位移扰动。非线性接触力由接触变形计算,速度相关阻尼则表征油膜效应。轴承系统微分方程见式 (2)。采用 Runge-Kutta 法数值求解,获得机匣振动位移,并通过二阶差分生成仿真加速度信号。详细建模流程与参数设置参见文献 [41]。该虚拟建模方式可大规模生成多故障数据集,服务于下游基础模型训练。 图3 滚动轴承的虚拟表示3.2 虚拟-物理数据流融合基于前期研究 [41,42,43],本文采用 CycleGAN架构建立虚拟域与物理域的双向数据转换,如图 4 所示。具体而言,该框架配置两对镜像对称的生成器-判别器,实现仿真振动信号与真实振动信号的循环映射。训练过程通过对抗损失与循环一致性损失的联合优化进行引导,其中对抗损失与循环一致性损失的比例设为 0.1 [41]。通过每对生成器-判别器之间的迭代对抗学习,仿真信号被转换为高保真的合成信号,即孪生信号。实验结果表明,这些孪生信号在波形特征上与实际测量数据高度一致,能够有效捕捉环境噪声及故障相关信息。因此,所生成的数据可直接用于故障诊断、剩余使用寿命预测等下游任务。更多实现细节参见文献 [41,42]。图4 基于CycleGAN框架的虚实数据流融合4 所提出的大规模视觉—语言模型为提升故障诊断的可及性与智能化水平,本文提出数字孪生驱动的大规模视觉-语言模型机械故障诊断框架。该框架实现 LVLM 在工业场景下的实用化部署,并缓解标注数据稀缺带来的训练瓶颈;通过将专家知识注入模型,进一步增强自动化能力,显著简化日常维护与巡检流程。4.1 模型架构DGLM 采用时–频谱图分析,以支持直观且高效的人机交互故障识别。如图 5 所示,整体框架由三大模块组成:数字孪生模块、信号预处理模块与 FDGLM。首先,通过虚拟–物理数据流集成构建深度数字孪生模型,生成大量孪生信号用于 FDGLM 训练。随后,信号预处理模块利用 STFT 将一维孪生信号转换为二维时–频谱图,使其格式与视觉模型输入要求对齐。为使视觉–语言模型适配机械系统的智能运维任务,采用两阶段微调策略,包括视觉与文本编码器适配;两阶段均使用 LoRA 技术实现高效参数调优。预训练 ViT 作为视觉编码器,经微调后增强从时频表示中提取故障相关模式的能力;同时,ChatGLM-6B 作为文本编码器。为使模型对齐领域特定知识(如诊断术语与推理逻辑),利用 LoRA 联合微调视觉与文本编码器,确保跨模态表征学习最优。QueryTransformer 模块通过可学习查询注意力机制,将提取的视觉特征转换为语义丰富的文本表示,从而桥接 ViT 与 ChatGLM-6B。两阶段训练流程逐次优化视觉与文本模态:基于 LoRA的轻量适配在冻结绝大部分预训练编码器参数的同时注入领域知识,有效抑制灾难性遗忘。LoRA 层被选择性嵌入视觉与语言编码器的关键组件,使模型在可训练参数大幅减少的情况下仍获得与全参数微调相当的性能。第一阶段聚焦时频谱图的视觉特征抽取,第二阶段转向基于文本的故障理解与决策生成,最终形成覆盖数据解读与动态决策的闭环智能维护体系。 图5 基于深度数字孪生驱动LVLMs的故障诊断框架4.2 预训练视觉模型的微调在 FDGLM 框架中,ViT充当视觉模型的骨干。ViT 已在大规模公开图像数据集上完成充分预训练,对自然图像的视觉表征提取能力强劲 [44]。然而,由于振动信号谱图与常规图像在视觉特性上存在本质差异,若冻结视觉编码器、仅训练语言模型,效果并不理想。受近期研究 [32] 启发,我们采用 LoRA策略对预训练 ViT 进行微调,使其能够有效捕捉由振动信号生成的时频表示的独特特征。通过增强 ViT 对工业谱图的建模能力,框架得以提取更具判别力的故障特征,微调流程示于图 6。 图6 基于LoRA的视觉模型微调ViT的操作方式是将输入图像划分为固定大小的块,这些块随后作为顺序输入格式中的元素进行处理,如图7所示。对于尺寸为 的输入图像,该图像被重塑为大小为 ,其中 和 分别表示图像的高度、宽度和通道数。 是输入序列的长度, 是向量的维度。图像被均匀地划分为不重叠的块,并展平成一个维度为 的序列。生成的序列包含 个块,每个块被表示为维度为 的向量。为了捕获块级表示,每个块通过一个可学习的线性投影矩阵 投影到 维的潜在空间中,从而得到形状为 的统一表示矩阵。 图7 图像块及位置嵌入示意图 一个可学习的类标记,记为 ,被添加到块序列的前面,以聚合全局上下文并实现整体图像理解。为了保持块之间的位置信息关系,一个可学习的位置信息编码矩阵 被添加到嵌入的块序列中。在本研究中,使用正弦/余弦函数生成位置信息编码,如公式(3)所定义:其中 和 分别表示位置编码向量中的偶数和奇数索引, 表示序列中每个标记的位置。正弦/余弦编码不仅捕获了相对位置的信息,还减少了序列表示中的冗余 [45]。经过上述变换后,最终的输入序列记为 。综上,为在多状态且高质量数据稀缺的条件下构建智能对话诊断模型,本文提出数字孪生驱动的大规模视觉-语言故障诊断框架。主要创新包括:(1) 研发实用化数字孪生驱动视觉-语言诊断框架;(2) 利用数字孪生构建大规模高质量数据集,满足大规模模型训练需求;(3) 提出故障诊断视觉-语言模型,采用两阶段训练策略对视觉模块与语言模块进行渐进式微调;(4) 开展全面验证,证明该框架在单工况、跨工况及跨数据集场景下均具备智能化多场景诊断性能。本文结构如下:第二节回顾智能故障诊断与大规模模型相关研究;第三节阐述数字孪生模型;第四节介绍所提视觉-语言框架;第五节给出实验结果;第六节总结关键发现并展望未来研究方向。其中 、 和 分别表示查询、键和值矩阵, 表示注意力头的维度。整合LoRA矩阵可以实现自注意力机制的自适应调节。如Eq.(1)式中,注意力矩阵的约束形式表示为:如图6所示,微调过程冻结了ViT模型的所有预训练参数,只更新插入的LoRA矩阵。为了确保跨多个健康状态的准确分类,交叉熵损失被用作主要分类目标:此外,为提升模型对振动信号时频表示中显著特征的敏感度,我们引入对比学习策略:构建正、负样本对,最大化正对相似度并最小化负对相似度;采用 Circle Loss 对该策略进行优化,从而增强模型在工况多变或设备差异下对同一故障类型的识别鲁棒性 [48]。其中, 与 分别表示类内相似度与类间相似度; 与 分别为类间与类内阈值; 与 为非负权重系数; 为缩放超参数。Circle Loss 旨在最大化类内相似度并最小化类间相似度。第一阶段的总体损失函数由上述两项损失加权求和得到:两项损失虽共同优化视觉特征表征,却各有侧重:交叉熵损失作为首要分类准则,为模型划定健康状态间的决策边界,实现故障精准归类;Circle 对比损失则提升模型对振动信号时频图中细微特征的敏感度,强化其捕获故障本质特性的能力,并促使所学特征更具判别力且工况不变,显著增强跨工况诊断的鲁棒性与泛化性。二者协同,既保证分类精度,又大幅提升模型的适应性与韧性。4.3 查询变换器由Salesforce Research开发的查询变换器(Q-Former:Query Transformer)是一种轻量级的变换器架构,有效地连接了预训练的视觉和语言编码器。它促进了强大的跨模态特征对齐和特定任务的适应。其主要目标是将视觉特征映射到大语言视觉模型的语义空间中,最小化参数更新,从而最大限度地重用冻结的预训练组件。如图 8 所示,Q-Former 从冻结的 ViT 编码器提取的特征中构建一组可学习的视觉查询向量;这些查询向量捕获特定语义属性,如故障类别与缺陷尺寸。Q-Former 架构包含三大关键模块:交叉注意力、自注意力与前馈神经网络。在交叉注意力层,查询向量与视觉 token 交互,提取与文本数据语义对齐的任务相关信息;自注意力机制随后促进查询间的内部交互,增强语义一致性;所得表征经前馈网络进行非线性变换并调整输入格式。通过多个 Q-Former 块后,输出的查询向量封装高级视觉语义,并被送入语言编码器进行联合训练。为优化 Q-Former 的表征能力,Salesforce Research 引入多目标优化策略,最小化文本对比损失、文本匹配损失及图像条件文本生成损失。更多实现细节参见文献 [49]。 图8 Q - Former的架构通过使用可学习的查询向量,Q-Former 有效地融合了视觉和语言表示。它无缝地融入了所提出的两阶段训练策略中,使视觉特征与文本语义对齐,并使大型语言模型能够基于视觉上下文生成连贯且特定领域的文本输出。4.4 预训练语言模型的微调在本小节中,预训练的 ChatGLM-6B 语言模型采用 LoRA 方法进行微调,以优化其在工业故障诊断任务中的性能。通过利用定制设计的图文配对数据集,微调后的模型能够从文本描述中提取与故障相关的特征,并将其与相应的故障模式关联。此外,该模型对特定任务要求的理解得到了提升,能够生成准确且具上下文感知的文本解释。在智能维护的全面知识基础支持下,该模型还提供简洁且可行的建议,以辅助操作决策。图文数据集构建的详细信息见第 5.1 节。如图9所示,诊断文本首先被切分为适合模型处理的离散单元;随后这些 token 被嵌入为连续向量,以捕获文本的语义内容。对于给定文本序列 ,嵌入过程生成向量表示 ,其中 为将序列映射至潜在语义空间的嵌入函数 [7]。通过 Q-Former 生成的时频视觉 token 与文本 token 拼接,形成多模态 token 流;该统一表征被送入预训练语言模型进行进一步微调。按照与视觉编码器相同的调参策略,在语言模型选定的自注意力层插入 LoRA 矩阵;优化目标采用自回归损失函数:其中 表示长度为 的输出序列中的第 t 个标记。自回归损失使模型能够生成在语法和语义上与诊断上下文一致的响应,从而产生富有洞察力的健康评估和可实施的维护建议。 图9 基于LoRA的语言模型微调4.5 实现流程总而言之,FDGLM 框架通过基于 LoRA 技术的两阶段微调流程,将通用视觉-语言模型转化为面向故障诊断的领域专用系统;该策略同时实施视觉与语言适配,以提升诊断任务性能。第一阶段(视觉模型微调)包含三个主要步骤:(1)利用 STFT 将合成孪生信号转为二维时频表示,形成大规模图像数据集;(2)预训练视觉编码器提取可捕获关键故障特征的判别特征;(3)构建正、负样本对,并通过联合最小化分类损失与 Circle 损失,使用 LoRA 微调视觉编码器,从而增强特征判别力与模型鲁棒性。第二阶段(语言模型微调)包括四个关键步骤:(1)构建配对的图像-文本数据集,涵盖视觉特征与故障语义描述;(2)使用已微调编码器提取视觉特征,确保跨模态一致性;(3)Query Transformer 将视觉特征投影至语言嵌入空间,并与文本 token 融合,生成统一的多模态表征;(4)采用自回归损失对经 LoRA 增强的语言模型进行微调,以产生连贯且任务特定的文本输出。通过该两阶段流程,FDGLM 在多种工业场景的智能故障诊断中展现强劲性能,提供可扩展且可泛化的解决方案。 编辑:赵栓栓校核:李正平、陈凯歌、曹希铭、赵学功、白亮、任超、海洋、陈宇航、Kira、Tina、王金、赵诚、肖鑫鑫、张优该文资料搜集自网络,仅用作学术分享,不做商业用途,若侵权,后台联系小编进行删除来源:故障诊断与python学习

    未登录
    还没有评论
    课程
    培训
    服务
    行家
    VIP会员 学习计划 福利任务
    下载APP
    联系我们
    帮助与反馈