首页/文章/ 详情

SCI论文学习 |混合驱动高周疲劳寿命预测:具有小样本学习的物理约束神经网络优化

5月前浏览491

本期分享一篇融合物理信息的神经网络模型的论文,混合驱动高周疲劳寿命预测:具有小样本学习的物理约束神经网络优化警。针对机器学习在疲劳寿命研究中存在的过拟合问题,文章提出一种融合物理信息神经网络的多组疲劳寿命试验数据集训练方法,通过引入物理信息损失约束并评估拟合效果的优越性,在保证拟合得到的全寿命S-N曲线具有高精度的同时,使结果符合材料的物理一致性规律


论文基本信息


论文题目:  Hybrid-driven high-cycle fatigue life prediction: Physically constrained neural network optimization with s mall sample learning

论文期刊:  International Journal of Fatigue

论文时间:2025年

作者:  Guoxi Jing (a,b,c) ,Shuai Tao (a,b) ,Teng Ma (a,b,* ) ,Yafei Fu (a,b), Zhige Zhou (a,b,*), Liqiang Zhang (d)

机构:

a: School of Mechanical Engineering, Hebei University of Technology, Tianjin 300401, China

b: Tianjin Key Laboratory of Power Trans mission and Safety Technology for New Energy Vehicles, Tianjin 300400, China

c: State Key Laboratory of Engines, Tianjin University, Tianjin, China

d: China North Engine Research Institute, Tianjin 300400, China

论文下载:https://doi.org/10.1016/j.ijfatigue.2025.109128

作者邮箱:  

mxc200523@sina.com (T. Ma), 

2000005@hebut.edu.cn (Z. Zhou)mxc200523@sina.com(T. Ma),2000005@hebut.edu.cn(Z. Zhou

摘要

机器学习在疲劳寿命研究领域的逐步应用,推动了基于数据驱动的人工神经网络疲劳试验数据拟合算法的发展。然而,这类算法的拟合结果与公认的疲劳性能物理规律相悖,存在明显的过拟合问题。本文提出一种融合物理信息神经网络的多组疲劳寿命试验数据集训练方法,通过引入物理信息损失约束并评估拟合效果的优越性,在保证拟合得到的全寿命S-N曲线具有高精度的同时,使结果符合材料的物理一致性规律。研究结果表明,基于S-N曲线的物理信息神经网络模型对平均寿命的预测结果明确且准确,精度优于三参数S-N曲线模型和双过渡S-N曲线模型;与人工神经网络模型相比,该物理信息神经网络模型能有效规避过拟合问题。通过引入惩罚因子调整物理信息约束的权重,可显著提升物理信息神经网络模型预测疲劳寿命时的物理一致性。

关键词: 物理信息神经网络;S-N 曲线;高周疲劳;疲劳寿命预测

目录


1 引言
研究方法
    2.1 传统 S-N 曲线模型

    2.2 S-N 曲线的物理信息研究
 3 物理信息神经网络模型训练结果的评价方法研究

 4 研究结果
    4.1 人工神经网络、物理信息神经网络与传统模型的拟合结果
    4.2 物理信息指标与约束结果
 
    4.3 概率物理信息神经网络框架的敏感性结果
 
讨论  
    5.1 人工神经网络与物理信息神经网络的拟合结果分析  
    5.2 物理一致性指标结果分析  
    5.3. 人工神经网络与物理信息神经网络对隐藏层单元数的敏感性分析
 
    5.4. 物理信息神经网络对惩罚因子的敏感性分析  

6 结论

 注:本文只选中原论文部分进行分享,若想进一步拜读,请下载原论文。
 小编能力有限,如有翻译不恰之处,请多多指正~

1 引言


疲劳失效是工程领域中一种普遍的失效形式,通常发生在长期承受循环载荷的机械构件上。高周疲劳寿命的预测依赖于S-N曲线的拟合,但高精度S-N 曲线的拟合需要大量的试验数据支撑。此外,传统疲劳试验还存在循环周期长、试验成本高、难以建立完备疲劳数据库等问题。因此,研究基于小样本的高周疲劳寿命预测方法,对工程实际应用具有重要意义。

当前的高周疲劳寿命预测模型大致可分为三类:物理失效模型、数据驱动模型和融合模型[1]。在早期的疲劳设计分析中,均值S-N曲线等物理失效模型通常将作用在构件上的工作应力和材料的疲劳性能参数视为确定值,该方法也被称为均值安全系数法。采用这种方法设计的结构,往往会出现过于保守或存在安全隐患的问题。目前更常用的方法是利用概率统计分析疲劳失效情况,但该方法同样需要大量的试验数据,才能保证分析结果的精度和可靠性[2,3]。

事实上,随着构件疲劳寿命预测向高精度、高效率方向发展,由于机器学习方法具备高预测精度,且疲劳相关的具体作用机制尚未明确,基于机器学习的疲劳寿命预测方法已成为当前的研究热点[4,5]。目前,神经网络、支持向量机、深度学习等方法已被应用于轴承[6]、齿轮[7]、弯管机棘轮[8]、复合管道热疲劳[9]等领域的寿命预测。其中,数据驱动模型无需做出强假设即可逼近潜在的疲劳损伤过程,因此逐渐被广泛应用于疲劳预测问题中[10]。例如,Liu 等人提出了基于支持向量机的S-N 曲线模型,并与其他四种主流机器学习算法进行了对比[11];Kalombo 等人考虑了平均应力对疲劳强度的影响,利用神经网络建立了适用于不同应力比的 S-N 曲线[12];Karolczuk 等人提出了基于高斯过程的失效概率模型,该模型无需预先定义 S-N 曲线和经验函数即可实现寿命预测[13]。此外,在各类用于构建 P-S-N 曲线的机器学习方法中,人工神经网络因具备优异的非线性建模能力,且能适应缺乏精确物理模型的场景,成为最受推荐的方法[14,15]。Barbosa 等人搭建了以平均应力和疲劳寿命为输入、应力幅为输出的多层感知器网络,用于计算 P-S-N 曲线和疲劳强度衰减因子[16];Bucar 等人在假设疲劳寿命服从对数正态分布或威布尔分布的前提下,利用多层神经网络模型绘制 P-S-N 曲线[17],后续又对该神经网络进行了改进,将缺口系数、温度等多种影响疲劳寿命的因素纳入考量,构建了新的网络框架[18]。 然而,目前大部分相关研究均基于数据驱动方法。这类方法虽能较好地拟合观测数据,但纯数据驱动模型可能违背物理规律,易发生过拟合,且与疲劳损伤的基本准则相矛盾。仅有少数研究关注将疲劳物理知识嵌入机器学习模型中, Chen 和 Liu提出了基于概率物理神经网络的寿命预测模型[19],该模型融入了两种形式的物理知识:以前馈神经网络表征应力-寿命关系,并通过解析导数约束权重或偏置,实现物理规律的融合;Chen、Li等人将物理知识以激活函数的形式嵌入神经元,构建了复合网络层,以适配不同比例的混合疲劳数据,结果表明该模型符合物理一致性规律,且具备一定的外推精度[20]。

嵌入物理信息的模型以疲劳领域的数学特征、物理定律、试验观测结果和经验认知等先验知识为指导,在保证预测精度的同时,能降低对样本量的需求,有效避免出现不合理的训练结果,还可提升模型训练的收敛性。根据 Karniadakis 等人的研究,物理信息神经网络可通过三种方式将先验知识嵌入网络:观测偏置、归纳偏置和学习偏置[21]。第一个因素是数据本身的特征。这是通过引入物理场数据或数据增强来实现的,例如自举自适应采样[22]。第二个是设计一个嵌入先验知识的神经网络架构。例如,Dourado和Viana等人提出了一种PINN,用于预测飞机机翼面板在腐蚀物理特性下的剩余寿命[23]。第三种方法是使用先验知识作为损失函数中的惩罚约束。例如,Zhang等人提出了一种用于蠕变疲劳寿命预测的PINN[24],其中 特征提取的物理定律作为惩罚约束嵌入到损失函数中。

本文提出一种基于学习偏置法的物理信息神经网络结构,并融入三类疲劳物理信息;采用自动微分的方式构建物理信息神经网络,将疲劳损伤特征、疲劳强度分布规律等作为损失函数项,以此约束神经网络的训练结果,避免因对数据本身进行操作引入无关特征,同时减少因调整物理信息神经网络框架带来的整体误差。本文从现有文献中收集了六种不同样本量的金属材料试验数据用于模型训练,并将预测结果与经典的三参数 S-N 曲线模型、考虑全寿命范围的双过渡 S-N 曲线模型以及常用的人工神经网络模型进行对比;通过分析物理信息神经网络框架中隐藏层单元数和物理约束惩罚因子的敏感性,验证所提物理信息神经网络在疲劳寿命预测中的可行性。

2 研究方法

2.1 传统 S-N 曲线模型

2.1.1 三参数 S-N 曲线模型

传统的疲劳寿命预测通常以S-N曲线为表征手段,该曲线本质上是利用不同的应力-寿命模型,对高周范围内的疲劳试验数据进行的拟合结果。最早的S-N曲线可追溯至韦勒提出的线性模型。为提升S-N曲线模型的适用范围和精度,后续研究者引入疲劳极限    ,对线性模型进行平滑过渡处理,得到了更适用于工程应用的复杂非线性S-N曲线模型。其中1914年提出的斯特罗迈尔方程[25](即三参数 S-N 曲线模型)是应用较为广泛的疲劳寿命预测模型,其表达式如公式(1)所示:

 
 

式中,    为应力水平,    为疲劳极限,    为循环寿命,    、    为与材料相关的未知参数,通常采用最小二乘法进行参数估计。

2.1.2 双过渡 S-N 曲线模型

在国家标准《金属材料疲劳试验数据统计方案与分析方法》中,最常用的 S-N 曲线为幂函数形式,该模型假定中寿命区的对数应力与对数寿命呈线性关系[26],如公式(2)所示:

 
 

式中,    为应力水平,    为循环次数,    、    为与材料相关的未知参数。对公式两侧取对数,即可得到ISO 12107等标准中常用的巴斯奎因方程[27]。相关研究表明,由巴斯奎因方程向低周域延伸可得到帕尔姆格伦方程[28],向高周域延伸则可得到斯特罗迈尔方程(公式 1)。因此,本文建立S-N模型时主要考虑以下三点因素:

第一,试件的寿命随应力降低而增加,在双对数坐标系下,二者的变化过程近似呈线性关系;第二,当应力达到某一水平时,试件的寿命理论上可达到无限长;第三,中寿命区与低寿命区、中寿命区与高寿命区的过渡段均存在曲线过渡区域。基于此,本文提出的 S-N 曲线方程如公式(3)所示:

 
 

式中,    为与疲劳极限对应的未知参数,;    为与低周过渡区相关的未知位置参数,;    为形状参数;    为未知常数。

为便于后续在 “疲劳强度分布假设” 下计算应力,在    、    的条件下对公式(3)求解,将应力改写为疲劳寿命的函数:

 
 

关于S-N曲线上应力的分布,存在两种假设:

(1)不同循环次数下的应力分布特征近似一致;

(2)应力分布服从正态分布、对数正态分布或威布尔分布。

假设循环次数为     ,则与之对应的应力    为随机变量,且服从正态分布。根据 “应力分布假设”,不同寿命的疲劳试验中,应力分布的分位数特征相似,因此可得到对应的概率密度函数:

 
 
 

为保证疲劳强度分布假设的合理性,需严格遵循国家标准《数据的统计处理和解释》中的规定:当数据集的样本量在8~50之间时,正态性检验推荐采用Shapiro-Wilk检验[29]。若疲劳强度服从对数正态分布,则其概率密度函数为:

 
 

2.2 S-N 曲线的物理信息研究

根据断裂力学和疲劳损伤累积原理[30],疲劳寿命可通过应力作用下裂纹从初始缺陷扩展至临界尺寸引发失效的过程推导得到。本文结合Zhou 等人的研究成果[31],总结出疲劳寿命分布的三点物理信息,如图1所示。

 

图 1 概率疲劳载荷 - 寿命曲线示意图

(1) 大量试验表明,疲劳寿命通常具有离散性,且其方差随应力幅的降低而增大[32]。这一现象可通过小裂纹效应解释:低载荷作用下,较长的疲劳寿命易消耗于小裂纹的扩展过程,且裂纹扩展阶段的疲劳损伤区域与晶粒尺寸大致相当[33]。因此,材料内部的裂纹对疲劳损伤影响显著,最终表现为疲劳寿命的离散性。这类疲劳寿命通常服从对数正态分布,对应的疲劳应力在一定程度上服从正态分布[34]。但在由应力和对数寿命构成的单对数坐标系中,上述两种分布规律往往无法同时满足,为此,本文提出在双对数坐标系中构建离散性约束的方法。考虑到试验寿命可按应力幅划分,且疲劳寿命的正态性检验比疲劳应力的正态性检验更简便、可靠,本文最终确定在双对数坐标系中构建离散性约束,规定对数寿命的标准差随应力幅的降低而增大,即     ,以此表征寿命离散性的扩大趋势;同时将对数应力的标准差保持不变作为边界条件,防止离散性出现极端变化,即    ,将二者结合,可综合表征离散性对疲劳 S-N 曲线预测结果的影响。

(2) 由于疲劳损伤具有不可逆性,应力幅越大,损伤范围越广,材料的服役寿命也相应缩短。因此,疲劳寿命与应力幅之间呈单调递减趋势。如图 1 所示,应力降低时,平均疲劳寿命增加,即

(3) 图 1 展示了五种应力水平下 S-N 曲线的斜率,反映了应力相对寿命的变化规律。在中高周寿命区,S-N 曲线的斜率随疲劳寿命的增加而增大,且与应力呈正相关,在疲劳极限处呈现渐近特征[35],即。在低中周寿命区,S-N 曲线的斜率随疲劳寿命的增加而减小,且与应力呈负相关,在抗拉强度处呈现渐近特征,即。     为中低周寿命区与中高周寿命区的理论临界点,通常取    次循环[19],用于区分低周区附近疲劳寿命离散性的变化特征和疲劳强度的渐近行为。

2.3 物理信息神经网络的结构研究

对于融合物理信息与数据驱动的混合模型,存在三类不确定性:物理不确定性、数据不确定性和学习模型不确定性。在物理信息约束的前提下构建预测模型,可通过将物理约束嵌入神经网络,加快模型训练速度,提升模型的泛化能力[36]。由于采用自动微分将物理信息嵌入损失项的方法,具有网络训练收敛性好、构建简便的特点,本文采用该方法搭建物理信息神经网络框架。

2.3.1 全连接神经网络的结构设计

考虑到单变量回归问题不宜采用过多的神经网络层,本文所使用的全连接神经网络仅包含两层神经元,通过与损失相关的指标1−Loss判断模型的回归性能,如公式(8)所示:

 
 

式中,    为第    个全连接神经网络的第i个预测值    ,Loss为归一化后的损失函数值。

2.3.2 物理信息神经网络的结构设计

基于物理的机器学习模型往往需要训练带有复杂损失函数的大型神经网络,训练过程中各损失项之间可能存在相互制约的问题。通过设计合理的模型结构和物理信息神经网络训练算法,可缓解这一问题。因此,本文搭建了结构参数一致的人工神经网络和物理信息神经网络,以逼近疲劳强度分布规律,嵌入应力 - 应变幅随循环次数变化的物理知识,并学习表征应力 - 寿命关系的潜在函数,如图 2 所示。

 

图 2 物理信息神经网络结构示意图

物理信息神经网络的输入为离散的疲劳试验数据(包括试验应力S和寿命N),与两个隐藏层相连,激活函数采用 ReLU 函数;后续的概率层生成定义疲劳强度分布的变量;网络的输出层包含两个输出端,为表征疲劳强度S和寿命N的连续型变量,分别对应经对数变换后的疲劳强度均值和标准差,假设其服从正态分布;输出层采用 tanh 激活函数,以约束输出尺度。在此基础上搭建物理信息神经网络框架,利用自动微分,通过由网络梯度推导得到的复合损失函数实现物理信息的嵌入。本文假设对疲劳性能和耐久性观测数据进行对数变换后,其统计特征由集中趋势和离散程度指标构成的双参数概率模型描述。为保证物理信息指标与物理知识的一致性,可通过计算疲劳强度导数的物理指标并结合损失函数,施加特定的物理约束,如表 1 所示。表中Y为疲劳应力的预测值,X为对应的疲劳寿命N,二者均经过对数变换。

表 1 约束神经网络训练的三类物理信息指标

 

3 物理信息神经网络模型训练结果的评价方法研究

通过概率物理信息神经网络模型的训练,可利用训练得到的最优参数网络,对任意疲劳寿命下的概率疲劳强度进行参数化表征。因此,如公式(9)所示,可得到某一置信水平下的概率疲劳强度    :给定存活率P时,试验样本中有    的样本会在指定循环次数前,于该概率疲劳强度下发生失效。已知疲劳强度分布的累积分布函数    为常用形式,可直接利用其逆累积分布函数    计算所需的疲劳强度值:

 
 

3.1 考虑物理信息约束的复合损失函数

物理信息神经网络的训练需同时符合疲劳试验数据的基本变化趋势和已确立的物理规律。因此,可将物理信息编码为物理损失项,结合惩罚因子λ和均方误差损失项    ,构建复合损失函数,如公式(10)所示:

 
 

数据拟合损失项应采用考虑失效数据和通过数据的负对数似然估计,如公式(11)所示:

 
 

式中,    取 0 或 1,    表示失效数据,    表示通过数据。

疲劳物理信息损失的计算方式为:对表 1 中的物理信息指标赋予等权重并量化,其数值大小取决于预测结果违背疲劳物理约束的程度,计算时将各指标的损失值累加,得到总疲劳物理信息损失:

 
 

对于任意物理损失项    ,可通过输出疲劳强度    判断其是否满足物理信息约束    。先通过计算输出疲劳强度    确定均值 S-N 曲线,再计算疲劳强度分布的均值和标准差,最后通过计算对应疲劳强度下的三类物理损失项    、    和    ,施加物理约束。

 
 
 
 

3.2 疲劳试验数据的标准化

本文所用试验数据均来自相关文献[37-44],根据数据特征将其分为 6 组样本,如图 3 所示。这 6 组数据集的不同特征,基本能满足验证疲劳试验数据构建模型适用性的需求。对试验数据中的应力和疲劳寿命进行对数变换,将变换后的应力数据标准化后用于模型拟合,原始数据详见附录 A。

 

图 3 标准化试验数据集分布图

4 研究结果

4.1 人工神经网络、物理信息神经网络与传统模型的拟合结果

利用训练完成的模型拟合 S-N 曲线,结合疲劳强度分布规律考虑概率不确定性的 P-S-N 曲线表征,并采用统计指标和物理一致性趋势图对拟合效果进行评价。为便于对比,人工神经网络与物理信息神经网络采用相同的结构配置,不同的是,人工神经网络的训练过程未融入疲劳物理知识。图 4 和图 5 分别为人工神经网络和物理信息神经网络的拟合结果。

 

图 4 人工神经网络对不同数据集的预测结果(a)Ti-6Al-4V (b)4130 (c)7475 (d)2A12 (e)2024T4 (f)C35

 

图 5 物理信息神经网络对不同数据集的预测结果(a)Ti-6Al-4V (b)4130 (c)7475 (d)2A12 (e)2024T4 (f)C35

基于表 1 中的物理信息指标和拟合优度指标,对六种材料的模型性能进行评价。分别采用人工神经网络、双过渡 S-N 曲线、物理信息神经网络和三参数 S-N 曲线对六组典型数据进行拟合,结果如表 2 所示。

优秀的 S-N 曲线拟合方法应具备高R2、低 MSE、低物理信息损失和低预测偏差的特征。决定系数R2反映 S-N 曲线与原始数据的拟合程度,均方误差 MSE 为 S-N 曲线预测值的实际偏差,物理信息损失衡量结果的物理一致性程度,预测偏差表示疲劳极限的预测误差。

由表 3 可知,四种方法的计算时间对样本量的变化均不敏感;物理信息神经网络的计算时间与人工神经网络相近,但显著高于另外两种传统模型。这是因为物理信息神经网络的训练过程需要多次迭代才能达到稳定状态,从而增加了求解时间。为使训练结果更接近最优解,本文所建立的物理信息神经网络和人工神经网络适当缩短了训练步长,这也进一步增加了训练时间。考虑到疲劳试验的时间和成本,工程实际中难以获取大量疲劳数据,因此本文所提物理信息神经网络的计算时间在工程应用中是可接受的。

表 2 四种疲劳预测模型的性能对比

 

表 3 四种疲劳预测模型的计算时间对比

 

4.2 物理信息指标与约束结果

本节重点研究对后续研究更具价值的异方差小样本数据,即 4130 结构钢的相关数据。图 6 为采用人工神经网络和物理信息神经网络拟合 4130 结构钢后得到的物理指标趋势曲线,其中物理损失 1 对应标准差损失,物理损失 2 对应均值损失,物理损失 3 对应斜率损失。结果表明,物理信息神经网络的物理损失显著低于人工神经网络,说明该结构能有效提升全寿命范围内预测结果的物理一致性。

 

图 6 纯数据驱动模型与物理信息神经网络的物理信息指标趋势对比(a)物理信息损失 1 (b)物理信息损失 2 (c)物理信息损失 3

4.3 概率物理信息神经网络框架的敏感性结果

本节提出一种敏感性评价方法,以考量不同网络配置的神经网络在 P-S-N 曲线表征中的局限性;通过对物理信息神经网络的结构和训练过程进行敏感性分析,验证其性能。通过改变神经网络的结构配置,对比模型的拟合优度,并衡量其物理一致性。

4.3.1 人工神经网络与物理信息神经网络对隐藏层单元数的敏感性

通过改变隐藏层单元数,对人工神经网络和物理信息神经网络进行敏感性分析,单元数设置为 {4, 8, 16, 32, 64, 128, 256, 512, 1024, 2048},训练参数设置与 2.3 节一致。图 7 和图 8 为不同模型对六种材料的物理信息损失随隐藏层单元数的变化趋势。

 

图 7 人工神经网络对隐藏层单元数的敏感性(a)拟合优度 (b)物理信息损失 1 (c)物理信息损失 2 (d)物理信息损失 3

 

图 8 物理信息神经网络对隐藏层单元数的敏感性(a)拟合优度 (b)物理信息损失 1 (c)物理信息损失 2 (d)物理信息损失 3

4.3.2 物理信息神经网络对惩罚因子的敏感性

通过改变惩罚因子对物理信息神经网络进行敏感性分析,验证所提模型的性能。神经网络的其他设置与 2.3 节一致,惩罚因子设置为 {10,300,1000,3000,6000,10000,30000,60000,100000,300000} 共 10 个取值,表征对违背物理约束行为的惩罚程度。图 9 为六种材料的拟合优度和物理损失随惩罚因子的变化趋势。

 

图 9 物理信息神经网络对惩罚因子的敏感性(a)拟合优度 (b)物理信息损失 1 (c)物理信息损失 2 (d)物理信息损失 3

5 讨论

5.1 人工神经网络与物理信息神经网络的拟合结果分析

由表 2 数据可知,从拟合优度来看,三参数 S-N 曲线模型的拟合优度最低,其余三种方法的拟合优度非常接近,误差在 0.05 以内,均保持较好的拟合效果;从细节上看,人工神经网络模型的拟合优度略高于物理信息神经网络模型。从物理信息损失来看,物理信息神经网络模型的损失值最小,其次为双过渡 S-N 曲线模型,人工神经网络模型和三参数 S-N 曲线模型的损失值较大。从疲劳极限预测偏差来看,受物理约束的影响,物理信息神经网络模型对疲劳极限的预测精度最高,人工神经网络模型与双过渡 S-N 曲线模型相近,三参数 S-N 曲线模型的预测精度最低。 通过各指标对四种方法进行综合评价:与其他三种模型相比,物理信息神经网络的物理信息损失和预测偏差均为最低,因此在物理一致性和疲劳极限预测精度上具有显著优势;人工神经网络模型的R2高于物理信息神经网络,但物理信息损失更大,这是因为人工神经网络过度追求拟合效果,丢失了原始数据的疲劳物理特征,图 4 中也能明显观察到过拟合现象;双过渡 S-N 曲线模型和三参数 S-N 曲线模型的R2低于物理信息神经网络,且物理信息损失更大,也并非最优的 S-N 曲线拟合方法。

5.2 物理一致性指标结果分析

预测结果与最优物理一致性指标的偏差,均源于网络训练过程中对物理约束的违背。本文中物理约束为软约束,因此物理损失项无法降至零。再次分析表 2 中的物理损失统计数据可知,人工神经网络模型无法保证预测结果的物理一致性,因此将物理信息神经网络所强调的物理约束融入模型训练至关重要。以 4130 结构钢的拟合结果为例,可得到以下结论:(1)物理信息神经网络模型的平均疲劳强度一阶导数为负,在高、低周寿命区,平均预测寿命均呈严格的单调递减趋势,而人工神经网络模型的拟合结果无法保证该单调性(见图 4、图 5);(2)物理信息神经网络模型的标准差一阶导数为负,且变化过程平滑,在低周寿命区呈下降趋势,在高周寿命区逐渐上升;与人工神经网络相比,物理信息神经网络的斜率变化更为平缓,且过渡点(物理信息损失 2 为 0)唯一,与本文提出的104次循环过渡寿命接近,实现了高、低周寿命过渡段趋势的合理变化(见图 6b);(3)物理信息神经网络模型的平均疲劳强度二阶导数在低周寿命区为负,在高周寿命区为正,保证了平均寿命预测一阶导数的单调递增趋势与疲劳极限的渐近行为一致;同时,物理信息神经网络的斜率变化过渡点(物理信息损失 3 为 0)唯一,且与104次循环过渡寿命接近;而人工神经网络的斜率变化波动较大,无唯一过渡点,存在明显的物理信息损失(见图 6c)。

5.3 人工神经网络与物理信息神经网络对隐藏层单元数的敏感性分析

由图 7、图 8 的结果分析可知,当隐藏层单元数较多时,人工神经网络拟合结果的标准差(物理信息损失 1)变化趋势与物理信息神经网络相近,但均值(物理信息损失 2)和斜率(物理信息损失 3)的损失值显著高于物理信息神经网络,说明物理信息神经网络在训练过程中更好地保留了原始疲劳数据的物理特征,体现了其在物理一致性衡量中的优势。此外,从图 7a 和图 8a 的结果可看出,单元数变化时,物理信息神经网络的拟合优度波动小于人工神经网络,反映了物理信息神经网络对隐藏层单元数的鲁棒性。

5.4 物理信息神经网络对惩罚因子的敏感性分析

由图 9 的结果可知,六种材料的拟合优度随惩罚因子的变化无明显波动,即所提物理信息神经网络模型对惩罚因子具有鲁棒性;同时,标准差和均值受惩罚因子的影响较小,变化较为稳定;斜率的波动较大,说明斜率变化受惩罚因子的影响更显著。由此可得出以下结论:对于中小样本数据,在合理的惩罚因子范围内,更大的惩罚因子会降低物理信息的违背程度。较大的惩罚因子能使预测结果的物理一致性更接近理想状态,但惩罚因子过大也易导致物理损失产生波动,不利于保持物理信息神经网络框架训练的稳定性。大样本数据因单元数的配置,对惩罚因子的敏感性较低,相比中小样本数据具有更好的抗干扰能力。

6 结论

本文提出一种基于疲劳寿命物理约束配置物理信息神经网络模型,对疲劳试验数据进行训练的方法;利用现有数据将该模型的预测结果与传统三参数 S-N 曲线模型、双过渡 S-N 曲线模型和人工神经网络模型进行对比,得出以下结论:

(1)对多种材料的样本数据进行 S-N 曲线拟合的结果表明,物理信息神经网络模型在表征疲劳物理特征方面表现优异,且对疲劳极限的预测精度最高;双过渡 S-N 曲线模型的整体性能优于三参数 S-N 曲线模型,拟合优度相对较高,但对疲劳极限的预测精度不及物理信息神经网络模型;人工神经网络模型对部分类型数据的预测精度高于双过渡 S-N 曲线模型和物理信息神经网络模型,但物理损失较大,存在过拟合问题。综合以上因素,物理信息神经网络模型的预测效果最优。

(2)小样本数据的拟合结果表明,物理信息神经网络模型能有效避免因数据量有限导致的过拟合问题;在人工神经网络模型的基础上融入疲劳寿命相关的物理信息约束,不仅保留了人工神经网络模型高精度拟合 S-N 曲线的能力,还保证了疲劳寿命预测结果的物理一致性。

(3)对物理信息神经网络框架的敏感性分析结果表明,与人工神经网络相比,物理信息神经网络的拟合结果更稳定,且具备一定的可扩展性;在模型调优过程中,物理信息神经网络对隐藏层单元数和惩罚因子在一定范围内具有鲁棒性。对于大样本数据集,目前尚无通用的物理信息神经网络参数设置方案,需通过敏感性分析进行合理配置;对于中小样本数据集,应避免设置过大的惩罚因子。 

编辑:Tina

校核:李正平、陈凯歌曹希铭、赵学功、白亮、任超、海洋、陈宇航、Kira、赵栓栓、王金、赵诚、肖鑫鑫、张优

该文资料搜集自网络,仅用作学术分享,不做商业用途,若侵权,后台联系小编进行删除



来源:故障诊断与python学习
Mechanical疲劳断裂非线性通用python海洋UM裂纹理论材料数字孪生试验管道
著作权归作者所有,欢迎分享,未经许可,不得转载
首次发布时间:2026-03-05
最近编辑:5月前
故障诊断与python学习
硕士 签名征集中
获赞 87粉丝 152文章 327课程 0
点赞
收藏
作者推荐

“数字孪生/故障诊断”专题||数字孪生+视觉语言大模型:用于多场景工业故障诊断(上)

本期给大家分享一篇小编近期阅读的1区top文章。如果有故障诊断相关方向研究人员希望宣传自己研究成果,欢迎大家在公 众号后台与小编联系投稿,大家一起交流学习。 本期推荐的这篇是西安交通大学许权宁的文章,本文系统综述了工业故障诊断从“数据驱动深度模型”走向“大模型时代”的完整技术脉络:首先回顾了传统规则/模型/数据三类范式的演进瓶颈,继而梳理了大型语言模型、视觉模型与多模态视觉-语言模型(LVLMs:Large Vision-Language Models)在故障预测与健康管理(PHM:Prognostics and Health Management) 领域的最新进展,指出通用大模型因缺乏工业知识、难以应对跨工况分布漂移与高质量样本稀缺等痛点;在此基础上,重点剖析了数字孪生驱动的深度合成数据、参数高效微调(LoRA:Low-Rank Adaptation)、跨模态对齐与对比学习等关键技术如何协同解决样本不足、域泛化与可解释性三大核心问题,最终提出面向多场景、可对话、可迁移的下一代智能故障诊断大模型研究框架与未来挑战。 由于文章篇幅过长,小编将分两次为大家翻译介绍这篇论文。第一篇推文提出融合深度数字孪生与大型视觉-语言模型的故障诊断框架故障诊断通用语言模型(FDGLM:Fault Diagnosis General Language Model),利用虚拟实体生成高质量振动样本,经短时傅里叶变换(STFT:Short-Time Fourier Transform)转为时频图,再借助LoRA策略对视觉和语言模块进行两阶段微调,实现跨工况、跨设备智能诊断,并构建人机交互式维护决策,突破工业数据稀缺与泛化瓶颈。 希望对大家的学习有所帮助,文章质量很高同时希望大家可以多多引用。 论文基本信息论文题目: Deep digital twin-powered large vision-language model for multi-scenario industrial fault diagnosis论文期刊:Advanced Engineering InformaticsDoi:https://doi.org/10.1016/j.aei.2025.103997作者: Quanning Xu(a), Guangrui Wen(b), Zihao Lei(c),Shulong Gu(d),Yu Su(e),Zhifen Zhang(f),Xuefeng Chen(g) 论文时间: 2025年 机构: a National Key Lab of Aerospace Power System and Plas ma Technology, Xi’an Jiaotong University, Xi’an 710049, Chinab State Key Laboratory for Manufacturing System Engineering, Xi’an Jiaotong University, Xi’an 710049, Chinac School of Mechanical Engineering, Xi’an Jiaotong University, Xi’an, Shaanxi 710049, China作者简介:许权宁,西安交通大学机械工程学院博士研究生,国家航空航天动力系统与等离子体技术重点实验室、机械制造系统工程国家重点实验室核心成员。长期聚焦工业人工智能、数字孪生与多模态大模型融合研究,近三年在《Advanced Engineering Informatics》等顶刊以一作/通讯身份发表多篇论文,主导开发了面向多场景工业故障诊断的开源框架 FDGLM。(来源:ResearchGate) 摘要数据驱动的深度学习技术已被广泛采纳于工业健康监测与维护。然而,传统诊断方法常受场景特异性限制且智能能力不足。新近发展的大规模视觉-语言模型为智能故障诊断提供了先进的人机交互范式。本研究通过提出FDGLM框架,将LVLMs拓展至工业故障诊断,实现跨多种运行条件与数据集的智能化诊断。首先,依托先进数字孪生技术生成高质量振动样本以支撑模型训练;这些样本经STFT处理,生成增强的时频谱图,满足故障诊断通用语言模型(FDGLM:Fault Diagnosis General Language Model)训练对大规模数据的需求。随后,采用低秩自适应策略对预训练视觉模型进行微调,联合交叉熵损失与圆损失以同步提升对工业故障时频特征的判别能力与鲁棒性。接着,利用领域专用文本指令对语言模型进行微调,实现视觉与文本模态的深度对齐,使因果故障分析与维护决策成为可能。最后,在四个独立数据集上开展跨工况与跨数据集实验,结果显示:同工况诊断精度达0.995,变工况为0.890,跨数据集为0.947,同时呈现专业级对话诊断能力。实验结果证实,FDGLM以极小微调代价即可提供适用于工业场景的可靠诊断,性能优于现有框架,为下一代工业装备健康管理提供解决方案。 关键词:大语言模型;大规模视觉-语言模型;故障诊断;多模态大语言模型;数字孪生 目录1 引言2 相关研究 2.1 智能故障诊断 2.2 大规模模型3 深度数字孪生模型 3.1 滚动轴承的虚拟表示 3.2 虚拟-物理数据流融合4 所提出的大规模视觉-语言模型 4.1 模型架构 4.2 预训练视觉模型的微调 4.3 查询变换器 4.4 预训练语言模型的微调 4.5 实现流程5 实验验证 5.1 数据集配置与预处理 5.2 实验设计与实现细节 5.3 数字孪生模型验证 5.4 单工况验证 5.5 跨工况验证 5.6 跨数据集验证 5.7 超参数分析 5.8 消融实验6 结论注:小编能力有限,如有翻译不恰之处,请多多指正~ 若想进一步拜读完整版,请下载原论文进行细读。 1 引言作为工业界与学术界人工智能领域的首要研究焦点,大规模模型已在多学科掀起新一轮技术浪潮。在自然语言处理、计算机视觉与科学计算等领域,这些模型衍生出大语言模型[1,2]、视觉模型[3]及天气预报模型[4]等多元变体。通过跨学科融合,它们进一步演化为融合视觉与文本数据的多模态视觉-语言模型[5,6],以及面向工业视觉监测的多模态对话模型[7]。这些技术对装备健康管理与工业系统智能化升级展现出变革性潜力。故障诊断作为故障预测与健康管理的核心环节,依托传感器信号分析实现故障类型识别、故障部位定位及严重程度评估。近十年来,计算机科学的范式迁移推动了基于深度学习的诊断方法取得显著突破[8]。凭借端到端学习机制,此类方法在面向特定运行工况定制的数据集上展现出卓越诊断性能。然而,由于域间分布漂移,其性能在不同工况或不同设备间往往难以泛化[9]。将大规模模型技术融入PHM框架,尤其是通过面向故障诊断的专用时序建模架构,为保障机械设备运行稳定性提供了变革性视角[10]。在工业数据集上微调后,预训练视觉-语言模型能够以强泛化能力与上下文理解力完成故障诊断。此外,多模态数据的有效利用以实现缺陷全面表征仍是持续显著的研究挑战。在真实工业环境中,先进传感系统通常产生多源数据流,涵盖振动、声信号、文本描述及视觉图像。学者已针对各类信号模态展开广泛研究:例如,Löwenmark 等提出弱监督技术语言处理框架,借助自然语言标注提升模型性能[11];Lei 等提出变工况轴承振动信号域自适应诊断方法[12];Liu 等构建动态视觉数据神经形态故障诊断框架,利用脉冲神经网络实现高效特征提取,并通过迁移与元学习增强泛化[13]。大规模模型凭借异构模态对齐、互补特征融合及语义推理[14],在整合文本、图像、音频、视频数据方面展现强大能力,实现全面信息理解与生成。OpenAI 的对比语言-图像预训练(CLIP:Contrastive Language–Image Pre-Training)[15]通过对比学习将视觉与文本模态投影至共享语义空间,实现高效跨模态对齐与检索。将工业图像与文本信息融合后,视觉-语言模型在故障诊断中展现出变革性应用潜力。深度神经网络架构的演进呈现出参数规模持续扩大的显著趋势。以Transformer框架为代表的大规模预训练模型已相对传统神经网络实现显著性能跃升。依据Vapnik-Chervonenkis维度理论,模型容量、泛化能力与所需训练数据量存在根本关联——即模型越复杂,所需样本越多[16]。因此,构建大规模故障诊断模型亟需高质量数据集且须具备充足样本多样性。然而,工业环境中设备故障发生频率低且复现成本高昂,导致采集多样化多状态数据以构建全面数据集极为困难[17]。为突破该瓶颈,研究者已探索多种数据增强方法:Hei 等提出融合Wasserstein距离与工况标签嵌入生成对抗网络的方法,利用注意力驱动预自适应模块缓解分布漂移[18];Yu 等将信号标签嵌入去噪扩散概率模型,并优化网络架构以提升层内与层间特征表示,实现不平衡数据条件下的精准轴承故障诊断[19]。然而,生成模型固有地难以在合成数据质量与训练规模间取得平衡,因而无法彻底解决数据稀缺问题。数字孪生技术通过利用丰富虚拟资源于工业生态系统内模拟故障状态,为构建高质量训练数据集提供了变革性解决方案[20,21]。Yu 等提出数字孪生特征输入框架,建立虚拟映射关系,实现非接触故障诊断[22]。本文尝试通过孪生数据构建全面训练集,以支撑视觉-语言模型的训练。综上,为在多状态且高质量数据稀缺的条件下构建智能对话诊断模型,本文提出数字孪生驱动的大规模视觉-语言故障诊断框架。主要创新包括:(1) 研发实用化数字孪生驱动视觉-语言诊断框架;(2) 利用数字孪生构建大规模高质量数据集,满足大规模模型训练需求;(3) 提出故障诊断视觉-语言模型,采用两阶段训练策略对视觉模块与语言模块进行渐进式微调;(4) 开展全面验证,证明该框架在单工况、跨工况及跨数据集场景下均具备智能化多场景诊断性能。本文结构如下:第二节回顾智能故障诊断与大规模模型相关研究;第三节阐述数字孪生模型;第四节介绍所提视觉-语言框架;第五节给出实验结果;第六节总结关键发现并展望未来研究方向。2 相关研究2.1 智能故障诊断在旋转机械领域,借助 DT 的动态建模正成为研究热点;优质的动态模型是 DT 建模的根基,可为后续虚实交互提供高保真虚拟信号。当前研究主要集中于轴承、齿轮与转子系统。对轴承系统,研究重心为轴承损伤(如内圈、外圈及滚动体损伤)的动态建模,主要关注轴承自身力学特性,而不考虑转子系统影响。对齿轮传动系统,研究重心为裂纹、剥落、磨损、断齿等故障状态下齿轮传动系统的动态建模。对转子系统,当前重心主要为不平衡、不对中、碰摩、机座松动等工况下的转子系统动态建模 [50]。这三类系统所采用的主要建模方法包括:基于物理的模型(如集中参数模型、有限元模型、刚−柔耦合模型)、唯象模型以及数据驱动模型。从另一个角度来看,故障诊断经历了四个关键的开发阶段。如图1(a)所示,传统的诊断技术主要集中在一维振动信号分析上。这些模型通常使用工业数据从零开始进行训练,但往往受到泛化能力有限的影响,并且需要大量的训练样本。如图1(b)所示,预训练模型显著降低了对标记样本的依赖。通过将一维信号转换为图像,已经建立的视觉模型(如视觉Transformers(ViT:Vision Transformers)[28])成功应用于故障诊断。大型语言模型(LLMs:Large Language Models)利用其在序列信号处理方面的强大能力,为PHM引入了新的范式。这些模型通过智能人机交互在分类和预测任务中实现了高性能[3,4]。如图1(d)所示,视觉-语言模型超越了LLMs的局限性,通过动态融合视觉和文本特征来增强多模态推理能力[7,29]。具体而言,使用信号处理技术将一维信号转换为二维表示。这种转化不仅满足了基于视觉模型的输入要求,还增强了与故障相关的特征,同时减少了因采样频率差异和设备特定变异而引起的伪影。LVLMs利用领域特定的文本语料库实现准确的故障分类和因果推断。此外,通过利用视觉和语言特征之间的深度交互,该模型支持高精度的故障诊断和在工业应用中的知情决策。因此,本研究重点关注使用LVLMs进行精确的轴承故障诊断。 图1 不同阶段的故障诊断办法2.2 大规模模型大规模模型是计算机科学中的一个关键前沿,最初出现在自然语言处理(NLP:Natural Language Processing)领域[30]。为了处理图像和视频等视觉数据模态,这些模型已经演变为大规模视觉-语言架构。通过将视觉和文本数据映射到统一的语义空间,这些模型实现了跨模态的相关性和理解。Luo等人提出了一种对比跨模态去噪框架,通过结合跨模态匹配与模态内部去噪,利用被遮挡和未遮挡视频帧之间的对比来改善视觉-文本对齐[31]。然而,由于缺乏领域特定的知识,现有的大型语言模型在工业视觉数据上的表现不尽如人意。近期的研究努力专注于为PHM应用开发专用的LLMs。Wang等人开发了一种多模态晶圆缺陷数据集,并使用LVLMs实现了高精度的多类缺陷识别[32]。Zheng等人针对复杂系统的故障诊断进行了初步研究,使用预训练的大型模型进行数据集大小、数据预处理和可解释性等因素的定量和定性评估[33]。Tao等人推出了首个用于轴承故障诊断的大型语言模型,通过统计分析选择振动信号特征,并验证其在少样本和跨数据集场景下的性能[10]。Tang等人提出了一种针对少样本和零样本场景设计的大规模视觉-语言模型。通过联合优化交叉熵损失、焦点损失和Dice损失,该模型在样本有限的情况下也能实现准确的故障识别[29]。针对故障诊断的LLMs研究仍处于早期阶段,如何在故障数据稀缺的条件下有效操作仍是一个主要挑战。从头训练含数亿到万亿参数的大规模模型计算开销惊人,于是学界转向参数高效微调:仅更新极少额外参数即可把预训练模型“挪”到新任务。全参数微调虽更新全部权重,却丝毫未减算力负担;当前把通用大型视觉-语言模型拉进垂直场景,几乎全靠这类“轻量”微调,主流套路有 Adapter、Prefix-Tuning 和低秩适应。Adapter 在每个 Transformer 层塞入轻量前馈子模块 [34],训练时只动这些“小插头”,思路简单却额外加层,推慢推理,且参数效率与优化深度仍受限;Prefix-Tuning 把一串可训练的“前缀 token”贴到输入,靠冻结主干、只调前缀来引导输出 [35],但连续软提示直接学习极易震荡、收敛糟糕;相比之下,LoRA 用低秩矩阵逼近权重更新 [36],在算力与性能间切出最优权衡——Meta 的工作已证实,预训练模型本征维度极低,在此压缩子空间微调即可媲美全参更新;LoRA 仅对高维 权重矩阵做低秩分解、训练其中一小撮参数,便实现“四两拨千斤”。令预训练模型中 特定层的原始权重矩阵记为 ,微调更新为 ,得到更新后的参数矩阵 。根据LoRA假设,更新 可以用两个低秩矩阵的乘积近似: ,其中 , 和 。这里, 作为一个超参数控制着低秩近似的复杂度。与传统的微调更新整个矩阵 不同,LoRA只需要 个额外参数,显著降低了计算成本和内存占用。如图2所示,在前向过程中,给定一个输入 ,,层的输出h被计算为:矩阵 使用高斯分布初始化,而 初始化为零矩阵。值得注意的是,尽管只引入了少量的额外参数,LoRA实现了与完全微调相当的性能,同时大幅降低了计算和内存成本[38]。 图2 LoRA微调方法示意图3 深度数字孪生模型深度数字孪生(DDT:Deep Digital Twin)技术通过将深度学习算法嵌入数字孪生框架,并以生成模型为桥梁,实现虚拟-物理的高保真映射 [39]。概念上,DDT 由三大核心单元构成:物理实体、虚拟实体以及虚实映射网络 [40]。为构建覆盖全健康状态的大规模训练数据集,本文借助 DDT 生成多样化多健康状态数据。3.1 滚动轴承的虚拟表示在为精准复现轴承振动特征与失效机理,本文以六自由度动力学模型作为虚拟映射:如图 3 所示,该模型将六个自由度分配至内圈、外圈与壳体部件。该模型融合滚动体非线性接触、润滑油膜阻尼及缺陷效应等关键因素。运动方程基于 Hertz 接触理论建立,用以刻画滚动体与滚道间的弹性相互作用;针对不同故障类型,通过将几何缺陷参数与动态响应数据耦合,量化缺陷引发的位移扰动。非线性接触力由接触变形计算,速度相关阻尼则表征油膜效应。轴承系统微分方程见式 (2)。采用 Runge-Kutta 法数值求解,获得机匣振动位移,并通过二阶差分生成仿真加速度信号。详细建模流程与参数设置参见文献 [41]。该虚拟建模方式可大规模生成多故障数据集,服务于下游基础模型训练。 图3 滚动轴承的虚拟表示3.2 虚拟-物理数据流融合基于前期研究 [41,42,43],本文采用 CycleGAN架构建立虚拟域与物理域的双向数据转换,如图 4 所示。具体而言,该框架配置两对镜像对称的生成器-判别器,实现仿真振动信号与真实振动信号的循环映射。训练过程通过对抗损失与循环一致性损失的联合优化进行引导,其中对抗损失与循环一致性损失的比例设为 0.1 [41]。通过每对生成器-判别器之间的迭代对抗学习,仿真信号被转换为高保真的合成信号,即孪生信号。实验结果表明,这些孪生信号在波形特征上与实际测量数据高度一致,能够有效捕捉环境噪声及故障相关信息。因此,所生成的数据可直接用于故障诊断、剩余使用寿命预测等下游任务。更多实现细节参见文献 [41,42]。图4 基于CycleGAN框架的虚实数据流融合4 所提出的大规模视觉—语言模型为提升故障诊断的可及性与智能化水平,本文提出数字孪生驱动的大规模视觉-语言模型机械故障诊断框架。该框架实现 LVLM 在工业场景下的实用化部署,并缓解标注数据稀缺带来的训练瓶颈;通过将专家知识注入模型,进一步增强自动化能力,显著简化日常维护与巡检流程。4.1 模型架构DGLM 采用时–频谱图分析,以支持直观且高效的人机交互故障识别。如图 5 所示,整体框架由三大模块组成:数字孪生模块、信号预处理模块与 FDGLM。首先,通过虚拟–物理数据流集成构建深度数字孪生模型,生成大量孪生信号用于 FDGLM 训练。随后,信号预处理模块利用 STFT 将一维孪生信号转换为二维时–频谱图,使其格式与视觉模型输入要求对齐。为使视觉–语言模型适配机械系统的智能运维任务,采用两阶段微调策略,包括视觉与文本编码器适配;两阶段均使用 LoRA 技术实现高效参数调优。预训练 ViT 作为视觉编码器,经微调后增强从时频表示中提取故障相关模式的能力;同时,ChatGLM-6B 作为文本编码器。为使模型对齐领域特定知识(如诊断术语与推理逻辑),利用 LoRA 联合微调视觉与文本编码器,确保跨模态表征学习最优。QueryTransformer 模块通过可学习查询注意力机制,将提取的视觉特征转换为语义丰富的文本表示,从而桥接 ViT 与 ChatGLM-6B。两阶段训练流程逐次优化视觉与文本模态:基于 LoRA的轻量适配在冻结绝大部分预训练编码器参数的同时注入领域知识,有效抑制灾难性遗忘。LoRA 层被选择性嵌入视觉与语言编码器的关键组件,使模型在可训练参数大幅减少的情况下仍获得与全参数微调相当的性能。第一阶段聚焦时频谱图的视觉特征抽取,第二阶段转向基于文本的故障理解与决策生成,最终形成覆盖数据解读与动态决策的闭环智能维护体系。 图5 基于深度数字孪生驱动LVLMs的故障诊断框架4.2 预训练视觉模型的微调在 FDGLM 框架中,ViT充当视觉模型的骨干。ViT 已在大规模公开图像数据集上完成充分预训练,对自然图像的视觉表征提取能力强劲 [44]。然而,由于振动信号谱图与常规图像在视觉特性上存在本质差异,若冻结视觉编码器、仅训练语言模型,效果并不理想。受近期研究 [32] 启发,我们采用 LoRA策略对预训练 ViT 进行微调,使其能够有效捕捉由振动信号生成的时频表示的独特特征。通过增强 ViT 对工业谱图的建模能力,框架得以提取更具判别力的故障特征,微调流程示于图 6。 图6 基于LoRA的视觉模型微调ViT的操作方式是将输入图像划分为固定大小的块,这些块随后作为顺序输入格式中的元素进行处理,如图7所示。对于尺寸为 的输入图像,该图像被重塑为大小为 ,其中 和 分别表示图像的高度、宽度和通道数。 是输入序列的长度, 是向量的维度。图像被均匀地划分为不重叠的块,并展平成一个维度为 的序列。生成的序列包含 个块,每个块被表示为维度为 的向量。为了捕获块级表示,每个块通过一个可学习的线性投影矩阵 投影到 维的潜在空间中,从而得到形状为 的统一表示矩阵。 图7 图像块及位置嵌入示意图 一个可学习的类标记,记为 ,被添加到块序列的前面,以聚合全局上下文并实现整体图像理解。为了保持块之间的位置信息关系,一个可学习的位置信息编码矩阵 被添加到嵌入的块序列中。在本研究中,使用正弦/余弦函数生成位置信息编码,如公式(3)所定义:其中 和 分别表示位置编码向量中的偶数和奇数索引, 表示序列中每个标记的位置。正弦/余弦编码不仅捕获了相对位置的信息,还减少了序列表示中的冗余 [45]。经过上述变换后,最终的输入序列记为 。综上,为在多状态且高质量数据稀缺的条件下构建智能对话诊断模型,本文提出数字孪生驱动的大规模视觉-语言故障诊断框架。主要创新包括:(1) 研发实用化数字孪生驱动视觉-语言诊断框架;(2) 利用数字孪生构建大规模高质量数据集,满足大规模模型训练需求;(3) 提出故障诊断视觉-语言模型,采用两阶段训练策略对视觉模块与语言模块进行渐进式微调;(4) 开展全面验证,证明该框架在单工况、跨工况及跨数据集场景下均具备智能化多场景诊断性能。本文结构如下:第二节回顾智能故障诊断与大规模模型相关研究;第三节阐述数字孪生模型;第四节介绍所提视觉-语言框架;第五节给出实验结果;第六节总结关键发现并展望未来研究方向。其中 、 和 分别表示查询、键和值矩阵, 表示注意力头的维度。整合LoRA矩阵可以实现自注意力机制的自适应调节。如Eq.(1)式中,注意力矩阵的约束形式表示为:如图6所示,微调过程冻结了ViT模型的所有预训练参数,只更新插入的LoRA矩阵。为了确保跨多个健康状态的准确分类,交叉熵损失被用作主要分类目标:此外,为提升模型对振动信号时频表示中显著特征的敏感度,我们引入对比学习策略:构建正、负样本对,最大化正对相似度并最小化负对相似度;采用 Circle Loss 对该策略进行优化,从而增强模型在工况多变或设备差异下对同一故障类型的识别鲁棒性 [48]。其中, 与 分别表示类内相似度与类间相似度; 与 分别为类间与类内阈值; 与 为非负权重系数; 为缩放超参数。Circle Loss 旨在最大化类内相似度并最小化类间相似度。第一阶段的总体损失函数由上述两项损失加权求和得到:两项损失虽共同优化视觉特征表征,却各有侧重:交叉熵损失作为首要分类准则,为模型划定健康状态间的决策边界,实现故障精准归类;Circle 对比损失则提升模型对振动信号时频图中细微特征的敏感度,强化其捕获故障本质特性的能力,并促使所学特征更具判别力且工况不变,显著增强跨工况诊断的鲁棒性与泛化性。二者协同,既保证分类精度,又大幅提升模型的适应性与韧性。4.3 查询变换器由Salesforce Research开发的查询变换器(Q-Former:Query Transformer)是一种轻量级的变换器架构,有效地连接了预训练的视觉和语言编码器。它促进了强大的跨模态特征对齐和特定任务的适应。其主要目标是将视觉特征映射到大语言视觉模型的语义空间中,最小化参数更新,从而最大限度地重用冻结的预训练组件。如图 8 所示,Q-Former 从冻结的 ViT 编码器提取的特征中构建一组可学习的视觉查询向量;这些查询向量捕获特定语义属性,如故障类别与缺陷尺寸。Q-Former 架构包含三大关键模块:交叉注意力、自注意力与前馈神经网络。在交叉注意力层,查询向量与视觉 token 交互,提取与文本数据语义对齐的任务相关信息;自注意力机制随后促进查询间的内部交互,增强语义一致性;所得表征经前馈网络进行非线性变换并调整输入格式。通过多个 Q-Former 块后,输出的查询向量封装高级视觉语义,并被送入语言编码器进行联合训练。为优化 Q-Former 的表征能力,Salesforce Research 引入多目标优化策略,最小化文本对比损失、文本匹配损失及图像条件文本生成损失。更多实现细节参见文献 [49]。 图8 Q - Former的架构通过使用可学习的查询向量,Q-Former 有效地融合了视觉和语言表示。它无缝地融入了所提出的两阶段训练策略中,使视觉特征与文本语义对齐,并使大型语言模型能够基于视觉上下文生成连贯且特定领域的文本输出。4.4 预训练语言模型的微调在本小节中,预训练的 ChatGLM-6B 语言模型采用 LoRA 方法进行微调,以优化其在工业故障诊断任务中的性能。通过利用定制设计的图文配对数据集,微调后的模型能够从文本描述中提取与故障相关的特征,并将其与相应的故障模式关联。此外,该模型对特定任务要求的理解得到了提升,能够生成准确且具上下文感知的文本解释。在智能维护的全面知识基础支持下,该模型还提供简洁且可行的建议,以辅助操作决策。图文数据集构建的详细信息见第 5.1 节。如图9所示,诊断文本首先被切分为适合模型处理的离散单元;随后这些 token 被嵌入为连续向量,以捕获文本的语义内容。对于给定文本序列 ,嵌入过程生成向量表示 ,其中 为将序列映射至潜在语义空间的嵌入函数 [7]。通过 Q-Former 生成的时频视觉 token 与文本 token 拼接,形成多模态 token 流;该统一表征被送入预训练语言模型进行进一步微调。按照与视觉编码器相同的调参策略,在语言模型选定的自注意力层插入 LoRA 矩阵;优化目标采用自回归损失函数:其中 表示长度为 的输出序列中的第 t 个标记。自回归损失使模型能够生成在语法和语义上与诊断上下文一致的响应,从而产生富有洞察力的健康评估和可实施的维护建议。 图9 基于LoRA的语言模型微调4.5 实现流程总而言之,FDGLM 框架通过基于 LoRA 技术的两阶段微调流程,将通用视觉-语言模型转化为面向故障诊断的领域专用系统;该策略同时实施视觉与语言适配,以提升诊断任务性能。第一阶段(视觉模型微调)包含三个主要步骤:(1)利用 STFT 将合成孪生信号转为二维时频表示,形成大规模图像数据集;(2)预训练视觉编码器提取可捕获关键故障特征的判别特征;(3)构建正、负样本对,并通过联合最小化分类损失与 Circle 损失,使用 LoRA 微调视觉编码器,从而增强特征判别力与模型鲁棒性。第二阶段(语言模型微调)包括四个关键步骤:(1)构建配对的图像-文本数据集,涵盖视觉特征与故障语义描述;(2)使用已微调编码器提取视觉特征,确保跨模态一致性;(3)Query Transformer 将视觉特征投影至语言嵌入空间,并与文本 token 融合,生成统一的多模态表征;(4)采用自回归损失对经 LoRA 增强的语言模型进行微调,以产生连贯且任务特定的文本输出。通过该两阶段流程,FDGLM 在多种工业场景的智能故障诊断中展现强劲性能,提供可扩展且可泛化的解决方案。 编辑:赵栓栓校核:李正平、陈凯歌、曹希铭、赵学功、白亮、任超、海洋、陈宇航、Kira、Tina、王金、赵诚、肖鑫鑫、张优该文资料搜集自网络,仅用作学术分享,不做商业用途,若侵权,后台联系小编进行删除来源:故障诊断与python学习

未登录
还没有评论
课程
培训
服务
行家
VIP会员 学习计划 福利任务
下载APP
联系我们
帮助与反馈