首页/文章/ 详情

新锐期刊一区TOP论文推荐|结合可解释性与不确定性的刀具剩余使用寿命自适应预测方法

7天前浏览407

本期给大家推荐结合可解释性与不确定性的刀具剩余使用寿命自适应预测方法在高端制造领域,刀具剩余使用寿命(Remaining Useful Life, RUL)的精准预测直接关乎加工质量与生产能效,是实现智能化切削工艺的核心环节。然而,实际工况中有限的无标签样本、退化过程固有的强不确定性,以及传统模型对大量历史标注数据的依赖,长期制约着RUL预测方法的工程适用性。针对这一瓶颈,本文提出一种融合多源传感信息与贝叶斯自适应推理的全新预测框架:该模型无需离线训练,仅依托在线观测即可动态更新退化参数,并内嵌延迟拒绝与自适应Metropolis-Hastings策略以显式量化不确定性。经刀具磨损实验验证,新方法在无需大规模标注数据的前提下,显著提升预测鲁棒性与可解释性,为工业场景下的小样本RUL预测提供了兼具实用价值与理论深度的技术路径。

论文基本信息

论文题目:An adaptive RUL prediction approach for cutting tools incorporated with interpretability and uncertainty  

论文期刊:Reliability Engineering and System Safety

Doi10.1016/j.ress.2024.110705

作者:Zenghui Wang (a), Guanghui Zhou (a,b,*), Chao Zhang (a,b), Jiancong Liu (a), Fengtian Chang (c), Yaguang Zhou (a), Chong Han (a), Dan Zhao (a,b)
论文时间:2025年
机构:(a) School of Mechanical Engineering, Xi’an Jiaotong University, Xi’an 710049, PR China 

(b) State Key Laboratory for Manufacturing Systems Engineering, Xi’an Jiaotong University, Xi’an 710049, PR China 

(c) School of Construction Machinery, Chang’an University, Xi’an 710064, PR China

作者简介:周光辉,工学博士,教授,博士生导师。1996年、1999年与2003年分别获西安交通大学工学学士、硕士与博士学位。2000年、2004年分别在香港大学作Research Assistant和访问学者,20049月到西安交通大学任教,2010年-2011年在美国佛罗里达州立大学作访问学者,入选教育部新世纪优秀人才支持计划,获陕西省“三秦人才”津贴。近年来围绕智能制造与产品服务系统技术、复杂机电产品协同优化设计与低碳设计、离散车间制造执行系统高效低碳运行理论与方法三个研究方向,先后承担包括国家973863、国家自然科学基金、科技部创新方法专项、科技部科技支撑计划、工信部智能制造专项、工信部数控重大专项、广东省教育部产学研项目等国家省部及企业级纵横向项目40余项,发表学术论文200余篇,出版学术专著2本,主编/参编教材及教学参考书12部;申报国家发明专利58项,授权43项;登记计算机著作版权28项;获教育部自然科学一等奖1项,陕西省科学技术二等、三等奖各1项,陕西省高等学校自然科学一等奖2项,二等奖1项,行业协会奖2项,陕西省学位与研究生教育学会研究生教学成果一等奖、二等奖各1项,西安交通大学教学成果(研究生)一等奖1项、二等奖2项;获陕西省优秀博士学位论文。(摘自西安交通大学教师主页)
通讯作者邮箱:ghzhou@mail.xjtu.edu.cn

摘要

刀具剩余使用寿命(Remaining Useful Life, RUL)的可靠预测对于保障加工质量、推动可持续发展至关重要,是高性能加工的核心组成部分。传统方法在加工过程中应对不确定性、保证可解释性方面面临重大挑战。为在小样本、无标签数据集场景下预测刀具RUL,并量化退化模型中的不确定性,本文提出一种基于多源数据融合与贝叶斯推理的自适应RUL预测方法。具体而言,本文提出一种基于刀具退化过程的自适应贝叶斯迭代更新模型。该模型无需大量有标签样本或离线训练,同时兼顾可解释性与不确定性。此外,将贝叶斯推理结合延迟拒绝与自适应Metropolis-Hastings策略,用于更新退化模型中的不确定性参数。这使得退化模型能够通过持续观测,实时自适应逼近实际磨损趋势。所提方法通过刀具磨损实验数据验证,与其他方法相比,平均均方根误差(Root Mean Square Error, RMSE)分别降低27.00%11.60%。值得注意的是,该方法不依赖大规模有标签历史数据集,能有效缓解不确定性的影响,为实际工业应用中的RUL预测提供了一种新思路。

关键词刀具;剩余寿命预测;贝叶斯理论;DRAM算法;可解释性;不确定性

目录

1 引言

1.1 研究背景

1.2 相关研究

1.3 研究不足与动机

2 方法

2.1 所提自适应RUL预测框架

2.2 所提RUL预测方案细节

3 关键支撑技术

3.1 特征提取与观测量概述

3.2 基于贝叶斯的不确定性量化

4 实验案例

4.1 实验装置与数据描述

4.2 评估指标

4.3 实验案例

4.4 讨论

结论

5.1 贡献

5.2 未来研究方向

1 引言

1.1 研究背景

随着现代信息技术的发展,其与传统制造业的深度融合给全球制造业格局带来重大变革,开启了智能制造新浪潮[1-3]。为应对新一轮工业革命带来的机遇与挑战,美国、德国、日本等发达国家相继推出“工业 4.0”“先进制造伙伴计划”等战略举措,以保持国际市场竞争优势。中国同样启动“中国制造2025”战略与“新质生产力”倡议,加速高端装备制造业的智能化转型升级[4, 5]。

面对制造业日益激烈的竞争与产品多样化需求,金属切削加工承担了90%以上关键零部件生产任务。刀具作为加工过程中最活跃的元件,极易发生磨损,直接影响切削效率与加工质量。刀具磨损是刀具与工件间的摩擦、剪切力、冲击共同引发机械摩擦、切削热与化学交互作用导致的退化现象。刀具磨损是金属切削的关键影响因素,决定零件质量、切屑形成与整体加工经济性[4, 6, 7]。若未及时更换严重磨损的刀具,会破坏工件表面完整性、降低机床系统刚度,甚至引发严重生产事故[8, 9]。反之,过早更换刀具会中断生产连续性,增加加工现场停机时间。刀具使用不当的负面影响如图1所示。统计数据显示,超过30%的刀具寿命因过于保守的更换策略被浪费;40%的加工质量问题源于刀具失效;50%的刀具碰撞事故由机床无法监测刀具崩损导致;超过70% 的金属切削过程缺乏刀具状态预测性维护[10]。因此,精准可靠的刀具RUL预测对提升刀具可持续性、改善加工性能至关重要[6-8]。

 

图1 不合理使用刀具的危害

当前,新兴智能技术与工业大数据的快速发展引发了刀具RUL预测技术革命。各类预测方法不断涌现,借助先进传感设备[11,12]、信号处理算法[13,14] 与深度学习模型[15-17]实现 RUL 预测,推动RUL预测向智能化方向发展。但实际加工长期处于断续切削、高速、重载等恶劣环境,获取全生命周期数据并不现实。同时,切削过程必然存在噪声、测试误差、退化非线性等不确定性,未考虑不确定性的RUL预测结果不可靠[18,19]。此外,许多传统数据驱动方法往往忽略刀具磨损背后与摩擦、磨粒、热等因素相关的物理机制 —— 具体包括黏着磨损、磨粒磨损、热疲劳磨损及切削力引发的磨损。这导致此类方法物理可解释性低,在变工况下泛化性能差。

1.2 相关研究

本节综述刀具 RUL 预测相关研究,分析现有不足与研究动机。近年来,学者围绕刀具RUL预测开展大量研究,取得诸多代表性成果,可归纳为两类:数据驱动方法与物理驱动方法。

数据驱动方法又可细分为基于数据统计与随机模型的方法、基于深度学习的方法[7]。Aramesh 等[20]构建基于威布尔分布基线的比例风险模型,预测变工况下刀具磨损演化。Yu[21]采用逻辑回归模型,利用以逻辑概率表示的健康指标在线预测刀具RUL。此外,Zhang等[22]采用马尔可夫链蒙特卡洛(Markov Chain Monte Carlo, MCMC)方法更新威布尔比例风险模型参数,提出刀具可靠性与平均寿命概率估计方法。这类基于统计模型的方法结构与参数相对简单,易于部署实现,能考虑退化过程中的不确定性,提供刀具磨损状态概率估计、置信区间与不确定性量化结果。但此类模型往往依赖特定分布假设,难以基于连续观测实时动态估计RUL。

而基于深度学习的方法借助先进人工智能技术捕捉刀具退化趋势,通过误差反馈更新模型参数或权重[23,24]。Lei 等(201 [25]、2020 [26]、2021 [27])提出多种改进卷积神经网络(Convolutional Neural Network, CNN)与循环神经网络(Recurrent Neural Network, RNN)模型,在旋转机械 RUL 预测中表现优异。Guo等[28]与Liu等[29]将注意力机制融入深度学习,在复杂RUL预测任务中表现出色。Chen等[30]提出基于多模态融合与集成迁移学习的航空发动机 RUL 预测方法,实现变工况下有效预测。此外,Yang等[31]提出基于深度流核网络的元学习模型,解决无标签小样本数据问题。Javed等[32]建立融合增量学习与小波-极限学习机的预测框架,可在线更新退化模型。基于上述研究,Xu等[33]采用卷积自编码器网络提取特征,结合状态退化模型实现滚动轴承 RUL 在线预测。Mao等[17]融合历史全寿命数据先验信息,构建递归时间序列预测模型,通过深度对抗回归网络实现滚动轴承RUL在线预测。

这些代表性方法借助统计模型与机器学习技术,凭借强大的特征提取与回归能力受到关注。诸多方法已通过实时监测数据成功实现 RUL 在线预测。但它们往往需要大量高质量数据[1,18],且通常依赖数据分布相似的假设。此外,这些方法因“黑箱”特性饱受诟病[34,35],无法严谨、物理地解释数据与 RUL 间的内在关联。同时,离线训练的预测模型能否适配新预测任务,仍需进一步探索。

相比之下,物理驱动方法以系统内在物理原理与机制为基础,建立参数具备明确物理意义的物理方程或数学模型,模型可解释性强。这类模型结构通常简洁,可通过监测数据在线更新,逐步收敛至实际退化趋势[36–38]。此外,它们可通过严谨物理推导实现各时刻 RUL 迭代估计。Jaydeep等[39]提出基于贝叶斯理论与泰勒退化方程的刀具 RUL 预测框架。在此基础上,Jaydeep等[40]进一步拓展泰勒刀具寿命方程,通过模型参数量化刀具寿命与切削速度、进给量的关系,并采用Metropolis-Hastings算法更新不确定性参数。Yang等[41]将健康指标作为观测量引入交互式多模型(Interactive Multi-Model, IMM)估计框架,通过扩展卡尔曼滤波(Extended Kalman Filter, EKF)估计刀具磨损与RUL。Downey等[42]提出基于多并行退化机制的锂离子电池物理预测方法,成功将机理退化分析结果融入非线性模型实现RUL预测。此外,Wang等[36]对比分析粒子滤波(Particle Filter, PF)、卡尔曼滤波(Kalman Filter, KF)与贝叶斯推理更新退化模型的性能,结果表明多数情况下贝叶斯推理性能优于其他方法。这类方法通过严谨数学推导描述磨损过程,不严重依赖大量历史数据,在长期退化预测中具备不可替代的优势。但需注意,切削速度、切削深度、刀具材料等因素间的交互作用往往高度复杂,简单物理模型难以完整刻画。这一局限可能导致预测不准确甚至失效。

基于上述代表性研究,数据驱动与物理驱动模型的核心区别在于底层思路不同。数据驱动模型采用统计方法或机器学习技术构建,物理驱动模型以系统内在机制与成熟理论为基础。两类模型均能实现精准预测与在线更新。物理驱动模型的优势在于可解释性——能基于系统物理原理解释退化过程,结构相对简洁,可通过参数校准实时更新以适配新监测工况。而数据驱动方法虽同样能实现精准预测,但在揭示系统退化关键诱因、适配陌生工况方面存在局限。此外,数据驱动模型结构通常更复杂,实现实时更新往往需要更高算力。综上,方法选择取决于监测数据特性与系统物理特性的认知程度。

1.3 研究不足与动机

多数数据驱动预测方法依赖大量带RUL标签的监测数据进行离线模型训练,且预测精度往往依赖在线数据分布与离线训练数据分布的相似性。但实际加工过程中,获取大量退化数据仍面临巨大挑战。受相关研究启发,研究不足可总结如下:

 依赖高质量标签数据:传统数据驱动方法往往依赖高质量有标签样本,且通常假设数据分布相似。在此背景下,无标签小样本场景下的RUL预测成为重大挑战[7,19]。

 忽略不确定性:多数传统方法忽略加工过程中噪声、切削液、电磁干扰、测试误差等不确定性,这必然降低预测结果的可信度。

 物理可解释性有限:现有数据驱动方法无需理解刀具磨损机制,但物理可解释性有限。结合刀具磨损机制开展自适应RUL预测值得深入探索。

这些挑战推动本文设计一种兼具可解释性与不确定性的新型刀具RUL自适应预测方法。本研究核心贡献可归纳为三方面:

 小样本场景性能:所提方法在无标签小样本场景下表现优异,无需高成本离线训练。与传统数据驱动方法相比,平均RMSE分别降低27.00%与11.60%。

 自适应不确定性量化:采用延迟拒绝自适应Metropolis算法(Delayed Rejection Adaptive Metropolis, DRAM)实现贝叶斯推理,自适应量化退化模型未知参数的不确定性,自适应迭代提供可靠RUL预测。

 可解释性提升:将贝叶斯理论与更新后退化模型结合,为方法提供坚实理论基础与更强可解释性,优于传统数据驱动方法。

本文后续结构如下:第2节介绍所提方法框架,详述预测方案;第3节阐述相关理论与技术;第4节给出案例研究;第5节总结全文。

2 方法

2.1 所提自适应RUL预测框架

本节聚焦所提自适应刀具RUL预测方法,概述框架与具体流程。该方法包含以下关键步骤:

首先,从多通道信号中提取多域特征,对筛选后的特征降维以提升预测效率;其次,构建健康指标作为观测量,指导迭代推理过程;随后,采用DRAM算法量化指数退化模型(Exponential Degradation Model, EDM)中未知参数的不确定性,使模型通过迭代自适应收敛至实际退化趋势;最后,通过铣削实验验证所提方法的可靠性。

图2展示所提方法的整体架构。本研究核心贡献在于将退化模型、主成分分析(Principal Component Analysis, PCA)、贝叶斯推理等多种理论与技术融入统一框架,应用于刀具 RUL 预测。在高质量有标签监测数据不足的场景下,该方法充分考虑磨损不确定性与物理可解释性,实现自适应、无监督RUL预测。 

 

图2 所提出的RUL预测方案框架

2.2 所提 RUL 预测方案细节

本节详细阐述结合可解释性与不确定性的自适应刀具RUL预测方法,所提方法具体流程如图3所示。

具体步骤可总结如下:

步骤1:采集加工过程中海量多通道监测数据s;

步骤2:通过信息处理技术提取监测数据多域特征,采用斯皮尔曼相关系数初步筛选特征;

步骤3:利用PCA技术对筛选后的多域特征降维融合,构建健康指标作为观测量x

步骤4:确定不确定性参数θ的先验分布 π(θ),设置采样次数T与非自适应阶段T₀,通过2.2节DRAM算法自适应更新指数退化模型(Exponential Degradation Model, EDM)不确定性参数,逼近实际退化趋势;

步骤5:通过更新后退化模型M(θ)得到当前时刻刀具RUL的后验概率分布p(θ|x)。

需注意,先验分布通常基于专家知识与历史经验。若无此类信息,可依据贝叶斯原理采用均匀先验,以降低主观不确定性的影响。此外,多数数据驱动方法直接将原始传感器数据映射至目标RUL标签,获取精准标签的成本往往较高。相比之下,所提方法通过从原始传感器信号提取多域特征、构建健康指标,解决标签依赖问题。随后将该指标与更新后退化模型结合,预测刀具健康状态。当预测值超过预设阈值时,可递归推断刀具RUL

 

图3 所提预测方法的整体结构

3 关键支撑技术

本节主要讨论相关研究理论与技术,详细介绍特征提取与不确定性量化的理论及方法。

3.1 特征提取与观测量概述

3.1.1 多域特征提取

号特征提取是从监测数据中获取能反映系统状态信息的过程,以应对监测数据的高维度特性,是故障诊断、军事目标识别等多个领域的基础与关键。刀具磨损监测中,原始信号通常包含异常值、噪声等,且数据量庞大,往往无法直接捕捉磨损退化趋势。通过特征提取对信号预处理,可揭示磨损相关关键信息、降低噪声、减少数据冗余,进而提升RUL预测精度。

假设信号s=[s₁, s₂, ⋯, sₙ]长度为n,即每个采集通道的数据点数量。每个通道共提取24项特征,除最大值、最小值、中位数外,其余21项特征的具体表达式列于表1。通过提取时域特征,可获取刀具磨损过程中信号的整体变化。本文提取均值、方差、峰值等13项时域特征,反映信号的平均水平、离散程度与极值位置,为刀具磨损状态提供基础信息。同时,刀具磨损过程中的信号通常包含不同频率分量,可通过傅里叶变换等频域分析方法提取。本文提取频率质心、均方频率等9项频域特征,获取不同频率分量对刀具磨损的贡献程度信息。时频域方面,采用小波分解对信号进行3层分解,选用“db3”小波基函数,提取对局部微小变化敏感的小波总能量。

表1 所提取特征的计算公式

 

3.1.2 PCA 技术与健康指标构

多源信号提取特征后,数据量显著降低,但剩余数据仍可能包含无关或冗余特征,降低预测效率与精度,甚至引发维度爆炸问题。因此,需进一步特征融合以实现降维。

本文采用PCA技术融合提取的多域特征,缓解噪声对RUL预测的负面影响。该降维过程类似信息融合,可充分利用多源数据的互补性[43]。PCA在状态估计、目标识别、军事控制等领域具备广阔发展与应用前景。PCA核心思路是通过计算样本协方差矩阵的特征向量,将特征从输入空间线性映射至低维特征空间。提取主成分前,需对原始特征数据标准化以消除量纲影响。PCA具体步骤如下:

(1)计算信号协方差矩阵,表达式为

     

(2)求取    的特征值    与单位正交特征向量    

     

   个较大特征值    代表前    个主成分的方差,    对应的特征向量    为主成分    在原始变量上的系数。主成分方差贡献率δᵢ表示信息含量:

     

   个主成分累计贡献率大于85%,提取的主成分特征即可反映原始高维特征信息。 (3)计算信号样本的主成分得分:

     

其中        为特征主成分矩阵,即压缩后的特征数据,相同工况下得到的低维特征与磨损程度高度相关。

3.2 基于贝叶斯的不确定性量化

3.2.1 贝叶斯模型更新原理

受材料性能、加工误差、测试噪声等因素影响,系统监测往往存在各类不确定性。当前,贝叶斯推理凭借扎实的概率推理数学基础,在不确定性量化与分析中展现巨大潜力。与传统方法仅通过添加误差项处理退化不确定性不同,贝叶斯方法可在获取新观测时动态更新不确定性估计。这种持续优化预测的特性对精准RUL预测至关重要[44]。

贝叶斯方法最突出的优势在于,结合先验信息与观测数据可推断不确定性参数的后验概率密度函数(Probability Density Function, PDF)[45,46],表达式为

     

其中    为观测样本;    为待更新不确定性参数向量;    为不确定性参数先验分布向量,通常取广义无偏均匀分布,        为常数;    为给定条件下的条件分布,通常称为似然函数,描述给定不确定性参数    时观测样本    出现的概率;假设独立测试次数为    ,贝叶斯方程中似然函数表达式为

     

其中    表示实际观测,即本文构建的实际健康指标;    表示模型预测结果,即本文退化模型的健康指标预测值;    为观测协方差矩阵。将式 (6) 代入式 (5),PDF 可进一步写为

     

其中    为与    无关的常数。工业应用中,响应表达式通常为隐式,导致积分运算难以实现,因此通常采用随机采样方法估计PDF,以解决复杂积分运算问题。

3.2.2 DRAM算法

当前,Metropolis-Hastings(MH)算法是贝叶斯推理中广泛应用的随机采样方法,通过生成后验样本简化贝叶斯方程中的积分运算。但该算法主要适用于单参数不确定性场景,参数维度升高时采样效率显著下降,马尔可夫链难以捕捉统计特性[47]。

为克服高维不确定性参数带来的挑战,本文引入DRAM算法实现贝叶斯推理。DRAM结合延迟拒绝策略与自适应采样,生成更高质量的后验样本,保障 RUL 预测中不确定性量化的稳定性。采样过程具体步骤如下[48, 49]:

(1)设置DRAM参数:非自适应采样长度    、采样迭代次数    ,在先验分布范围内获取初始样本    ; 

(2)选取初始方差为    的建议分布    ,基于当前样本    通过建议分布生成候选样本     ; 

(3)计算    的接受概率,基于建议分布的对称性    ,表达式为

     

(4)选取服从    分布的变量    ,若    则接受    ,即    ;否则通过更新后建议分布    生成候选样本    ,重复步骤(3)、(4)判断是否接受候选样本;

(5)采样迭代至    时,根据生成的后验样本更新建议分布协方差矩阵    

     

其中    为缩放因子,为保障接受概率处于合理范围,Gelman教授建议    取值为        为参数维度[50];    通常取        为协方差矩阵;        维单位矩阵[51];(6) 迭代至    次时终止采样,得到收敛的后验样本序列,即马尔可夫链。剔除马尔可夫链非收敛燃烧期样本,即可获取不确定性参数的统计特性。

4 实验案例

4.1 实验装置与数据描述

4.1.1 C-MAPSS数据集

为评估所提刀具RUL预测方法性能,采用PHM 2010提供的刀具磨损数据集。实验环境框架与具体设置如图4所示。实验在高速数控(Computer Numerical Control, CNC)铣床上开展,工件材料为不锈钢,采用3刃铣刀铣削。每次切削中,刀具X向切削长度108mm,径向切深0.125mm,轴向切深0.2mm,主轴转速10400r/min,X向进给速度1555mm/min。选取后刀面磨损量(VB)评估刀具磨损,判定磨损标准为 VB≥0.15mm。同步开展在线信号采集与离线磨损测量。本文采集铣削过程中7路信号,具体为X、Y、Z向铣削力信号,X、Y、Z向振动信号与声发射(Acoustic Emission, AE)信号。

 

图4 切削实验的设置

如图4所示,实验平台由四部分组成:CNC铣床、离线刀具磨损测量模块、在线信号采集模块、信号处理与存储模块。工作台与工件间安装三向Kistler测力仪,获取X、Y、Z向实时铣削力;工件上安装 Kistler 压电加速度计,采集三向振动信号;此外,工件上安装 Kistler 声发射传感器,捕捉高频应力波。采集信号经NI数据采集卡(NI DAQ)放大,采样频率50kHz。同时,采用LEICA MZ12显微镜测量每次切削后的刀具磨损量。详细设置列于表2。

表2 实验平台的详细信息

 

铣削过程中,以50kHz采样频率采集7路信号(X/Y/Z向铣削力、X/Y/Z向振动、声发射),单把刀具共完成315次切削。为获取可靠刀具磨损监测数据,采用6把刀具开展6次切削试验,分别记为C₁–C₆。本文采用C₁–C₄监测数据评估所提方法性能。

需强调,所提融合多域特征提取与基于贝叶斯不确定性量化框架的方法,适用于多种数据集。但数据集必须同时包含加工信号数据与对应刀具磨损数据,才能保障方法有效性。

4.2 评估指标

本文采用平均绝对误差(Mean Absolute Error, MAE)、均方根误差(Root Mean Square Error, RMSE)与决定系数    [18, 52]评估RUL预测结果。各指标介绍如下: (1)MAE。MAE 表达式为

     

其中        时刻实际RUL(i=1,2,⋯,N);        时刻预测RUL。MAE 越小表示预测精度越高。 (2)RMSE。RMSE表达式为

     

RMSE是另一常用指标,对误差大小更敏感。RMSE越小表示预测越准确。 (3)        表达式为

     

   是评估拟合程度的指标,表示预测模型解释实际变化的比例,取值范围0-1,越接近1拟合效果越好。

4.3 实验案例

为验证特征提取对揭示刀具磨损退化趋势的重要性,以    为例,图5展示铣削力与振动全寿命信号,随切削时间波动显著,表明刀具磨损随切削次数增加而加剧。但从多通道信号中难以直接获取磨损退化趋势,需对海量信号进一步分析处理。本文提取多域24项特征(公式列于表 2),提升海量信号的信息密度。

 

图5 刀具在整个切削过程中的多通道信号

由于刀具早期磨损退化相对缓慢,该阶段RUL预测意义有限。研究重点应放在磨损后期RUL预测,及时预测对刀具更换、降低生产风险至关重要。此外,为评估所提方法解决小样本问题的能力,仅采用磨损数据集前200次切削时刻作为训练数据更新退化模型,随后通过更新后模型实现RUL预测。从前200个数据点提取多域特征,构建健康指标作为观测量,指导DRAM随机采样过程。需注意,训练集大小影响预测精度与效率,需根据实际情况与计算机性能合理选择。同时需剔除训练集中冗余特征,保障RUL预测精度。以    为例,前200次切削时刻形成特征矩阵    。X向振动信号中提取的24项特征如图6所示。

 

图6 X向振动信号的24项特征 

为提升预测精度与效率,需筛选特征矩阵中不敏感、冗余特征。由于退化过程通常随时间单调变化,选取与时间呈单调关系的特征最适合表征该趋势。斯皮尔曼相关系数为非参数统计量,常用于衡量两个变量间的单调关系。本文计算每项特征与对应时间向量的斯皮尔曼相关系数,表达式为

     

其中    为斯皮尔曼相关系数,取值范围[−1,1],        分别表示完全负相关与完全正相关,    表示无相关性;    为两次观测的排序差值;    为观测次数。图7展示7路信号提取特征的    计算结果,设置阈值0.9,剔除斯皮尔曼相关系数低于阈值的特征。最终,    筛选后得到特征矩阵    。需注意,不同刀具需保留的特征略有差异。

 

图7 不同通道信号特征的斯皮尔曼相关系数

随后,如2.2节所述,多通道信号经特征提取与初步筛选后,数据量显著降低,但仍包含部分无关或冗余特征。因此,本文采用PCA技术进一步对筛选后特征降维。需注意,各通道信号特征的量纲与数量级差异较大,筛选后特征矩阵     融合前采用Z-score方法标准化。降维结果如图8所示,一阶主成分贡献率高达92%,表明一阶主成分包含原始信号92%的信息。这说明原始信号冗余度高,或主要变化集中在少数方向。因此,可保留一阶主成分替代原始信号,并采用三次指数平滑法[53]获取健康指标。

 

图8 前两个主成分及其累积贡献率 

工程应用中,EDM通常用于描述系统与设备的退化趋势,在多种工业场景RUL预测中表现优异。EDM描述随时间呈指数速率退化的系统,其指数退化特性与电子设备老化、材料疲劳、机械部件磨损等诸多实际系统退化趋势一致。此外,EDM构建简便,模型参数具备明确物理意义。因此,本文采用EDM表征刀具退化趋势[54,55],表达式为

     

其中    为健康指标值;    为常数,表示刀具初始状态或初始退化程度;    为衰减幅度参数,表示刀具初始状态与寿命终点间的退化幅度;    为衰减速率参数,用于控制EDM下降速率,反映退化速度。        决定退化趋势,且包含多种不确定性,直接影响RUL预测精度。因此,本案例将两个未知参数作为不确定性参数    ,采用3.2.2节DRAM算法开展贝叶斯推理,再通过持续采集的实时健康指标迭代更新EDM不确定性参数。 假设不确定性参数均值服从二维独立高斯分布矩阵,标准差设为0.1,参数均值范围设为[−10,10]。依据贝叶斯理论,DRAM算法中建议分布设为对称高斯分布,初始方差设为0.8,可随推理自适应更新。为充分考虑不确定性,初始采样点在采样范围内随机生成,采样迭代20000次,非自适应阶段    设为1000。 为降低数据随机性的负面影响,按照图2所示框架,采用所提方法预测4把刀具    的RUL。图9展示4把刀具预测RUL与实际RUL的实验结果。需注意,底部绿色 区域表示预测RUL的相对误差,两条深绿色虚线表示置信度    的置信区间边界,二者包围的浅绿色 区域为置信区间,代表20%预测偏差的容忍范围。可见,受不确定性干扰,4把刀具早期预测RUL存在不同幅度波动,但随迭代估计,预测RUL逐渐逼近实际RUL。同时,预测RUL基本落在对应置信区间内,表明所提方法可缓解不确定性对预测的负面影响,通过自适应迭代推理实现各时刻更优的RUL预测。

 

图9 4把刀的RUL预测结果 

为验证所提方法的优越性,本文实现多种常用刀具RUL预测数据驱动方法,具体为支持向量机(Support Vector Machine, SVM)[56]、长短期记忆网络(Long Short-Term Memory, LSTM)[57]与混合模型(CNN-BLSTM)[58]。同时纳入两种经典物理模型驱动方法(参考文献 [59,60])与所提方法对比。需注意,所有6种预测模型均采用    数据集前200次切削时刻数据作为训练集。随后将预测结果与图9中红色实线表示的实际RUL对比,计算3.2节所述评估指标。 具体模型参数设置如下:SVM模型包含两个超参数:惩罚参数    与径向基(Radial Basis Function, RBF)核参数    。这些参数构成二维网格空间,采用网格搜索算法与三重交叉验证策略确定最优超参数(        )。LSTM 模型中,隐藏单元数量设为特征向量维度的两倍,隐藏层与输出层分别采用双曲正切S型与对数S型激活函数。训练过程中,采用共轭梯度法更新权重与偏置,最大迭代次数设为200,丢弃率(Dropout)设为0.2以防止过拟合,性能目标设为    。混合模型及另外两种物理驱动方法的参数设置见参考文献[58,59,60]。 5种模型预测结果汇总于表3。SVM与LSTM的平均RMSE分别为7.93与6.55。相比之下,所提方法平均RMSE为5.79,降幅分别为27.00%与11.60%。SVM与LSTM的平均MAE分别为7.31与6.00。而所提方法平均MAE为5.20,降幅分别为28.86%与13.33%。结果表明,与传统方法相比,所提方法预测性能更优、更可靠,取得满意结果且具备强可行性。

表3 不同现有方法实验预测结果的比较

 

与方法#1相比,所提方法预测结果更优,RMSE 与 MAE 平均降幅分别为 23.92% 与 23.42%。该提升源于方法#1采用标准 MH 采样算法,通常仅适用于单维参数空间。而 DRAM 算法的延迟拒绝与自适应采样策略,可在高维参数空间实现高效随机采样,进而提升退化模型参数更新效果。 如表3所示,所提模型预测精度与方法#2、混合模型相当,但后两种方法在部分数据集上精度更高。需注意,方法#2与混合模型参数更复杂,参数化成本更高,直接影响最终RUL预测精度。例如,方法#2采用贝叶斯更新与期望最大化(Expectation-Maximization, EM)算法估计退化模型参数,再通过粒子滤波算法实现状态估计。粒子滤波的大量超参数会显著影响RUL估计结果。因此,所提方法在计算成本与操作便捷性方面具备优势,是更高效的RUL预测选择。

4.4 讨论

对图9与表3所示实验结果综合分析表明,所提方案实现高精度RUL预测,优于常用预测方法。需强调,传统数据驱动方法通常需要大量标签数据进行离线训练,训练成本高昂。相比之下,所提方法无需标签样本,通过自适应迭代估计即可取得满意结果。这一特性表明该方法在解决无标签预测挑战方面具备巨大潜力。

此外,DRAM算法的应用实现退化模型中不确定性参数的自适应更新,提升预测的不确定性表征能力与方法整体可解释性。如图9所示,RUL预测值始终落在置信区间内,凸显所提方法的可解释性与可靠性。

5 结论

5.1 贡献

本文提出一种自适应方法,用于无标签样本数据、退化模型存在参数不确定性场景下的刀具RUL预测。所提方法主要贡献归纳为三方面:(1)无需大量带RUL标签的历史数据开展高成本离线训练,展现自适应、无监督预测潜力;(2)采用DRAM算法定量评估退化模型未知参数的不确定性,实现考虑不确定性的RUL预测迭代更新;(3)贝叶斯理论与更新后退化模型的结合,为方法提供坚实理论基础,提升可解释性。

为验证所提方法可行性,采用PHM 2010刀具磨损实验数据,结果表明方法性能优于多种代表性方法。具体而言,与SVM、LSTM相比,所提方法平均RMSE分别降低27.00%与11.60%。此外,与其他代表性预测方法相比,所提方法整体预测性能更稳定。综上,所提方法在精度与可解释性方面取得显著进步,为工业系统RUL预测提供有价值思路,推动刀具可持续利用。

5.未来研究方向

未来研究初步思路如下:首先,鉴于加工场景的复杂性与非线性,将采集更多加工数据进一步验证所提方法;其次,研究退化模型快速重构与集成机制,提升方法在复杂应用场景下的适用性。

编辑:陈宇航

校核:李正平、陈凯歌曹希铭、赵学功、白亮、任超、海洋、Leo、Kira、Tina、王金、赵诚、肖鑫鑫、张优

该文资料搜集自网络,仅用作学术分享,不做商业用途,若侵权,后台联系小编进行删除


来源:故障诊断与python学习
ACTMechanicalSystem振动疲劳碰撞非线性燃烧航空电子海洋UM理论电机化机材料创新方法数字孪生DAP
著作权归作者所有,欢迎分享,未经许可,不得转载
首次发布时间:2026-08-19
最近编辑:7天前
故障诊断与python学习
硕士 签名征集中
获赞 87粉丝 152文章 328课程 0
点赞
收藏
作者推荐

Information Fusion|重庆大学攻克域偏移难题,提出零样本复合故障诊断新框架

本期聚焦旋转机械零样本复合故障诊断新进展。零样本故障诊断长期受域偏移与特征混淆两大技术瓶颈制约,单一原型表征不足、生成样本稳定性差更是领域普遍短板。重庆大学秦毅教授团队近日提出三原型融合(triple-prototype fsion, TPF)框架,为旋转机械复合故障诊断提供了全新技术路径。该框架融合仿真生成、实测特征、先验知识三类异构原型,从表征源头弥合域间分布差异;通过多分布融合对比学习优化正样本构造,强化特征判别力以破解特征混淆;配套模型 - 样本双维度稳定扩散模型,全面提升生成样本质量。实验证实,该方法无需复合故障训练样本即可实现高精度诊断,性能优于8种主流基准方法,相关研究内容已开源于https://github.com/QinYi-team/TPF。论文基本信息论文题目:Beyond single prototype: A multi-prototype fusion framework with contrastive learning and diffusion model for zero-shot fault diagnosis 论文期刊:Information Fusion论文日期:2026年论文链接:https://doi.org/10.1016/j.inffus.2026.104399作者:Lv Wang (a), Junyu Qi (b), Yi Qin *(a)机构:a. State Key Laboratory of Mechanical Transmission for Advanced Equipment, Chongqing University, Chongqing 400044, China; b. Reutlingen Research Institute (RRI), Reutlingen 72762, Germany.通讯作者简介:秦毅,重庆大学教授,于重庆大学机械电子工程系获工学博士学位。长期致力于智能故障诊断与装备健康管理、动力学建模与数字孪生、智能无人系统以及智能制造等领域的创新研究。秦毅教授在国内外权威学术期刊及高水平会议上发表论文230余篇,研究成果涵盖《IEEE Transactions on Industrial Informatics》《Mechanical Systems and Signal Processing》《Reliability Engineering and System Safety》等知名期刊,学术影响力广泛。他长期担任国家重点研发计划、长江学者奖励计划、国家自然科学基金等多项国家级与省部级科研项目评审专家,深度参与国际学术交流与期刊建设。在学术组织方面,秦毅教授是中国机械工程学会、中国振动工程学会的高级会员,并担任IEEE可靠性学会重庆分会副主席,在智能故障诊断与动态测试技术领域积累了深厚的学术声望。(来源:https://faculty.cqu.edu.cn/YiQin)目录1 摘要2 引言3 预备知识3.1 扩散模型3.2 马尔可夫链蒙特卡罗(MCMC)方法3.3 对比学习4 三原型融合模型4.1 问题定义4.2 整体框架4.3 模型 - 样本稳定扩散模型4.4 多分布融合对比学习4.5 原型融合模块5 实验验证5.1 BCF 数据集实验5.2 东北电力大学(NEEPU)数据集实验5.3 补充实验6 结论1 摘要随着工业装备复杂程度不断提升,旋转机械复合故障的发生频次日益增多。然而故障数据的获取难度极大。零样本学习领域近年取得的研究进展,为训练阶段无对应样本时识别未知复合故障提供了可行技术手段。但现有方法普遍存在域偏移与特征混淆问题,导致诊断精度大幅下降。针对上述问题,本文提出一种三原型融合(triple-prototype fusion,TPF)框架,用于零样本故障诊断。首先,构建原型融合框架以解决域偏移问题。该框架融合仿真故障生成原型、实测故障提取特征原型与先验知识构建理论原型,缓解仅依靠单一原型信息不足带来的域偏移现象。其次,设计多分布融合对比学习机制处理特征混淆问题。该机制在正样本生成过程中引入多元分布先验信息,提升构造正样本的区分度。此外,本文提出模型 — 样本稳定扩散模型,用以增强样本生成稳定性。该模型分别从模型训练、样本去噪两个维度引入稳定约束机制,全方位提升生成样本的稳定程度。通过两组实验案例验证了三原型融合框架的有效性。该框架无需任何复合故障训练样本,即可完成未知复合故障诊断。与 8 种经典模型及前沿零样本学习算法开展对比测试,本文所提 TPF 框架具备更优诊断性能。关键词:复合故障诊断;扩散模型;对比学习;原型融合;零样本学习2 引言在现代工业中,旋转机械是大多数生产过程中不可或缺的组成部分,其稳定性和可靠性直接影响生产效率与安全。轴承等关键部件在长期运行中不可避免地会发生故障,这些故障可能导致设备停机,并造成重大经济损失和安全隐患。因此,及时、准确的故障诊断尤为重要。除单一故障外,旋转机械中还会出现复合故障。与单一故障相比,复合故障具有相互耦合的特点,诊断难度较大。因此,研究高精度的复合故障诊断算法十分必要。现有的复合故障诊断方法大致分为两类:基于信号处理的方法和基于人工智能的方法。基于信号处理的方法主要将复合故障分解为单一故障进行诊断,常用的方法包括小波变换和变分模态分解。尽管这些方法在某些场景下有效,但其特征提取需要大量专家知识,限制了其在复杂工业环境中的泛化性和可扩展性。基于人工智能的方法又可进一步分为浅层学习算法和深度学习算法。浅层学习技术通常利用传统机器学习方法进行复合故障诊断。基于深度学习的方法依赖大量数据进行训练,然而在实际应用中,获取大量数据(尤其是复合故障数据)通常不切实际。为解决目标数据收集困难的问题,提出了零样本学习方法。零样本学习方法仅使用可见类别的数据和辅助信息即可识别未见类别,在故障诊断领域也引起了广泛关注。尽管现有零样本诊断技术取得了可接受的性能,但仍存在若干挑战,包括:1) 零样本学习方法需要定义相应的原型作为基准。然而,大多数零样本诊断方法仅考虑设计的理论原型或生成原型。由于训练数据和测试数据具有不同的故障类型,仅基于训练数据设计的原型将与测试数据的实际原型存在显著偏差,导致诊断性能急剧下降。这一问题称为域偏移问题,如图1(a)左侧所示。2) 当前大多数零样本诊断研究缺乏对初始特征的预处理,或仅使用简单方法进行处理。如图1(b)左侧所示,由于缺乏训练,未见测试类型的特征往往呈现显著重叠,对后续诊断性能产生不利影响。因此,开发一种提高初始故障特征可分性的技术对于实现更高诊断精度至关重要。图1 零样本诊断中的现有问题与解决方案:(a)域偏移问题;(b)特征混淆问题除零样本诊断方法的局限性外,传统的信号扩散模型仅依赖前一样本进行去噪,容易导致去噪过程的不稳定性。为解决上述三个问题,本文提出了一种三原型融合(TPF)模型用于零样本复合故障诊断。首先,构建了三原型融合框架以缓解零样本学习中的域偏移问题。该三原型框架的设计灵感来源于多源信息融合的互补性。它构建并整合了三种不同类型的原型:生成原型、特征原型和理论原型。生成原型完全由模型生成,基于可见数据输入扩散生成模型以生成未见域样本,然后进行聚类,不依赖任何未见域的真实观测数据,反映了模型自身的固有构建能力。特征原型直接从真实未见域故障数据中提取,通过无监督聚类从实际数据中获得,能够反映未见类别的实际特征。理论原型基于先验知识或故障机理构建,代表理论层面定义的理想参考。理论原型是零样本诊断中原型构建的常用方法,通过先验知识建立可见域和未见域的共同属性,从而仅利用可见域数据即可构建两个域的原型。生成原型和特征原型是本文提出的创新构建方法。最终原型从三个不同角度构建:数据的先验知识、模型学习的特征以及实际未见域特征。通过三者之间的互补性,增强了原型的完整性,有效缓解了未见域的偏移问题。此外,本文还开发了一种多分布融合对比学习机制。该机制有效提高了初始特征的可分性,从而提升了后续诊断性能,如图1(a)右侧所示。在该机制中,提出了一种新的正样本构建方法,引入多种分布的先验知识生成具有额外内在特征的样本,提高了提取特征的可分性。在该机制中,使用马尔可夫链蒙特卡洛(MCMC)方法对先验分布知识进行采样,并使用所提出的扩散模型生成样本。此外,还构建了模型-样本稳定扩散模型(model-sample stabiliztion diffusion model, MSSDM)以提高扩散模型在生成样本时的稳定性。在MSSDM中,引入了指数移动平均(exponential moving average, EMA)机制以增强模型训练的稳定性,并建立了回溯机制以增强去噪过程的稳定性。本文的主要贡献可总结如下:提出了一种三原型融合框架以解决零样本学习中的域偏移问题。在该框架中,构建的原型在了解任何故障或模型生成信息之前整合了样本的实际特征信息,提供了更全面的原型以缓解域偏移问题。为增强特征的可分性,开发了一种多分布融合对比学习机制。在生成正样本阶段注入多分布信息,引导生成的样本具有额外的基本特征,提高了提取特征的可分性。提出了一种模型-样本稳定扩散模型(MSSDM)以增强基于扩散的框架中生成样本的稳定性。该框架集成了两种关键稳定机制:引入指数移动平均机制以增强模型训练的稳定性;设计回溯机制以增强样本去噪过程的稳定性。通过上述两种机制,样本生成的稳定性得以增强。3 预备知识3.1 扩散模型扩散模型是一种基于概率扩散过程的生成模型。该模型利用扩散的逆过程,通过逐步去噪生成高质量数据样本。扩散模型主要包括两个过程:扩散过程与逆过程。扩散过程在每个时间步 中逐步向样本添加噪声。在此过程中,当前样本仅与前一时刻相关,可视为一个马尔可夫过程。每一步的转移概率 由下式给出: 其中 是第 步获得的数据, 表示高斯分布的方差超参数, 表示单位矩阵。第 步的数据可表示如下: 其中 表示第一步的高斯噪声。数据可通过重参数化技巧表示如下: 其中 , 。该处理技巧解决了随机采样过程中的求导难题。反向扩散过程为逐步去噪过程:从标准正态分布噪声出发,逐级去除噪声,最终还原生成目标数据。各时间步的样本更新公式可表示为: 其中 为神经网络训练得到的噪声预测网络, 代表第 步的标准差, 为高斯噪声。模型依照上述步骤从时间步 迭代至 0;每一步均对当前样本更新并持续降噪,直至输出最终生成样本。扩散模型通常选用U-Net 作为基础骨干网络。U-Net 具备多尺度特征提取能力与跳跃连接结构,能够辅助模型更好地复原样本细节。本文将模型预测噪声与真实噪声之间的均方误差作为损失函数,具体表达式如下: 3.2 马尔可夫链蒙特卡罗(MCMC)方法 马尔可夫链蒙特卡罗(MCMC)方法是从复杂分布中采样的有效工具。MCMC 的基本原理是构造一条马尔可夫链,使采样数据的状态分布最终收敛至目标分布。在 MCMC 方法中,目标平稳分布与状态转移矩阵满足细致平衡条件,表达式如下: 其中 为状态分布, 代表状态转移矩阵, 为接受概率。上述采样流程中,若接受概率 数值偏低,会造成大量样本被拒绝。为此引入梅特罗波利斯-黑斯廷斯(Metropolis-Hastings)采样算法解决该问题。对上式两侧同乘相同系数进行缩放后,在依旧满足细致平衡条件的前提下,接受概率能够得到提升。因此改进后的接受概率表达式可改写为: 通过上述过程,定义了选定的状态转移矩阵、目标平稳分布以及所需的样本数量。通过采样即可获得对应于所需分布的样本集。3.3 对比学习对比学习是一种旨在增强数据可分性的无监督技术。其目标是最大化不同样本之间的一致性,同时最小化与其他实例的一致性。目前,对比学习在故障诊断领域已引起广泛关注。尽管该方法展现出了相当的性能,但在对比样本的构建方面缺乏优化,而这对后续特征提取具有显著影响。为弥补这一空白,本文设计了一种多分布融合对比学习机制,以在样本构建阶段增强判别性特征提取。4 三原型融合模型在本节中,首先介绍零样本诊断的相关定义与符号。随后,描述所提出的TPF方法的诊断流程。接下来,对该框架中提出的三个关键模块进行详细说明:模型-样本稳定扩散模型、多分布融合对比学习机制以及三元原型融合模块。4.1 问题定义零样本复合故障诊断任务可定义如下:该任务的目标是通过可见单一故障识别未见复合故障。可见单一故障类别可表示为 。未见复合故障类别可表示为 。其中, 和 分别表示可见单一故障与未见故障的样本, 和 分别为可见类别与未见类别的标签。在零样本学习中,属性 和 通常用于辅助识别未见类别的类型。参数 和 分别表示可见样本与未见样本的数量。参数 和 分别表示属性与样本的维度。零样本复合故障诊断的目标可形式化表示为: 其中 是未见故障的预测标签, 表示由 和 组成的属性。4.2 整体框架TPF模型的整体框架如图2所示。首先,生成正样本与生成原型。正样本的构建是对比学习的重要组成部分。在TPF模型中,正样本由所提出的多分布引导的MSSDM生成。从可见故障样本中提取单分布特征并进行融合。使用MCMC采样生成所需数量的多分布表示,随后将这些表示嵌入MSSDM中以合成所需的正样本。具体生成过程详见第4.3节。此外,生成的原型由MSSDM、特征提取器和聚类算法共同构建。 图2 所提出的TPF模型的整体框架第二步是对比训练与特征对齐。对比学习框架中的三元组样本由锚点样本、正样本和负样本组成,可表示为 。TPF中某一类别的锚点样本采用原始样本,而对应的负样本则来自另一类别的原始样本。例如,选择四种故障类型作为锚点样本,包括正常状态、内圈故障、外圈故障和滚动体故障;对应的负样本分别具有以下故障类型:内圈故障、外圈故障、滚动体故障和正常状态。此外,锚点样本与对应的正样本属于同一类别。将锚点样本、正样本和负样本按不同故障顺序排列,形成训练数据集。采用宽混合扩张卷积神经网络(WHDCNN)作为特征提取器,提取的中间特征可表示为 ,其中 表示特征的维度。在本文框架中,最后一层提取的特征称为属性特征 。三元组损失用于缩小锚点特征 与正特征 之间的差异,同时扩大 与负特征 之间的差异。三元组损失函数定义如下: 其中 表示边际系数。均方误差损失用于将属性特征 与其对应的属性(即理论原型 )对齐。该过程可形式化表示为: 其中 表示属性特征,该特征源自特征提取器的最后一层。总体训练损失可表示为: 其中 表示控制三元组损失影响的超参数。然后,使用自适应矩估计优化器更新全连接层的参数 ,如下所示: 图2中的第三部分展示了所提出框架的测试阶段。首先,通过训练好的特征提取器获取未见故障的特征 。然后,通过聚类与匹配算法获取特征原型。接着,最终原型由三个不同层面的原型融合而成。不同原型的具体构建与融合过程详见第4.5节。最后,利用最近邻估计对最终原型与未见特征进行匹配。第 个未见样本的标签表示如下: 4.3 模型 - 样本稳定扩散模型4.3.1 特征提取器U-net广泛用于扩散模型中。为了更好地适应具有特定标签的一维数据生成,对网络结构进行了重新设计。在所设计的网络中引入了时间嵌入和标签嵌入。所设计的U-net网络结构如图3所示。该网络主要包括收缩过程和扩展过程。收缩过程包含三个模块,每个模块中执行两次卷积操作和一次最大池化操作。在扩展过程中,对数据执行与压缩过程类似的操作,即通过两次反卷积操作和一次上采样操作。在扩展过程中使用跳跃连接以丰富原始特征信息。 图3 所设计的U-Net结构4.3.2 模型-样本稳定机制为进一步提高扩散模型的稳定性,设计了一种模型稳定机制,具体过程如图4所示。 图4 所提出的MSSDM的训练过程该机制包含两项改进:模型稳定性与样本稳定性。引入指数移动平均( EMA )机制以稳定模型。 EMA 提供更平滑的参数估计,有助于减少单次训练迭代引起的随机波动并提高稳定性。 EMA 机制中的参数 可按如下方式更新: 其中 表示权重因子, 是第 轮时的模型参数。提出去噪稳定机制以稳定样本。传统的扩散模型大多依赖前一样本进行去噪,这容易导致样本不稳定,且难以在去噪过程中纠正错误。为解决这一问题,在去噪过程中的规律时间步引入前一样本的特征,以减少不同时间步之间的显著特征偏移。具体过程可表述如下: 其中 表示扩散模型的总时间步数, 表示控制初始样本比例的比重系数。4.4 多分布融合对比学习为提高提取特征的可分性,在所提出的框架中引入对比学习机制。在对比学习中,正样本与负样本的构建一直是一个挑战。为此,构建了一种多分布引导的正样本构建机制。该机制引入数据分布的先验知识来构造正样本。此外,如图5(a)和(b)所示,单一分布特征存在显著重叠,导致区分能力相对较低。相比之下,图5(c)显示融合分布的特征实现了较高的可分性。因此,引入多种分布特征的先验知识以生成更具判别性的样本。在图5中,NC、IF、OF和BF分别表示轴承的不同健康状态,其中NC表示正常状态,IF表示内圈故障,OF表示外圈故障,BF表示滚动体故障。在图5(a)和(b)中,x轴表示样本特征的均值或方差,y轴表示通过核密度估计方法估计的对应概率密度。在图5(c)中,x轴表示样本特征的均值,y轴表示样本特征的方差,z轴表示概率密度。多分布融合对比学习的具体过程如下所述。 图5 轴承复合故障数据集中单一故障的分布:(a)均值分布;(b)方差分布;(c)融合分布第一步是获取数据的分布特征 ,将所获得的分布作为目标分布 。第二步是对数据的特征分布进行采样,例如均值分布和方差分布。采用MCMC算法对目标分布进行采样,以正态分布 作为提议分布。在第 步,由提议分布生成的样本 的接受率可计算如下: 接下来,从均匀分布中生成一个随机数 ,用于决定是否接受样本 :其中 表示第 步的状态。通过连续生成和迭代,可以得到一系列服从目标分布的分布信息 。通常,前 个样本可以忽略,因为马尔可夫链尚未达到其平稳分布。第三步是分布信息嵌入。将数据的原始标签信息和分布信息融合在一起,输入到MSSDM模型中进行生成。4.5 原型融合模块本节介绍三种原型(生成原型、特征原型和理论原型)的构建与融合方法。三种原型构建的整体框架如图6所示。理论原型 通过对单一故障的数据与故障机制进行分析而构建。 图6 原型融合模块的整体框架每种类型的故障原型包含九个不同属性,涵盖故障类型、脉冲特征及脉冲幅值,详见表2。表2 为滚动轴承设计的九个属性 幅值相关属性源自信号的均方根(RMS)值。其计算公式定义如下: 其中 表示时域数据。频率相关属性通过对信号频谱的分析进行提取: 其中 表示频域数据。对于单一故障,可直接获取其数据及对应的属性。对于复合故障,其属性通过对单一故障属性进行逻辑运算推导得出。对于幅值相关属性,在融合不同单一故障的幅值相关属性时,取平均幅值的上限作为复合故障的幅值相关属性。故障类型和频率相关属性通过以下方式获得: 其中 和 分别表示可见故障 和未见故障 原型的前 个元素。这些元素对应于故障类型及相关频率。生成原型 的建立基于MSSDM。首先,将单一故障样本及其对应的属性标签输入MSSDM进行训练。然后,由训练好的MSSDM使用复合故障的属性标签生成复合故障样本 。接着,利用单一故障的实际样本 训练特征提取器。随后,通过训练好的特征提取器获取生成复合故障的特征 。最后,采用高斯混合模型(GMM)寻找生成复合故障样本的生成原型。高斯混合分布定义如下: 其中 表示分布的数量, 是分布权重, 是均值, 表示协方差矩阵, 表示第 个高斯分布的概率密度函数。GMM使用期望最大化算法迭代参数。数据 属于第 个高斯分布的概率 可计算如下: GMM中均值向量 的更新方法可表示如下: 在所提出的框架中,生成的复合故障特征的均值向量被用作生成原型: 特征原型 的构建过程与前述生成原型类似。首先,通过在实际单一故障样本上训练得到的特征提取器获取实际复合故障特征。随后,使用GMM算法对实际复合故障特征的均值矩阵 进行聚类。与生成原型不同的是,特征原型对无标签的未见类别特征进行聚类。因此,设计了一种最近邻匹配算法来获取特征原型的标签。由于理论原型的标签是已知的,特征原型的标签通过这两类原型之间的距离来定义。距离矩阵 可计算如下: 特征原型的标签取为其最近理论原型的标签。然后,所有特征原型的标签 均可获得。具体特征原型可表述为: 特征原型在测试阶段构建,不使用任何未见类别的标签。此外,训练阶段不涉及任何未见类别的数据。该过程完全符合标准的零样本学习范式。最后,将三种不同的原型融合在一起,融合原型可以表述如下: 其中 和 分别为生成原型和特征原型的权重系数。5 实验本节通过两个轴承复合故障诊断实验对TPF方法进行评估。第一个实验使用定制构建的轴承复合故障(BCF)测试平台,第二个实验采用东北电力大学(NEEPU)的轴承故障平台。为进一步证明所提出模型的优势,开展了全面的消融研究,包括不同模块和原型的消融实验。此外,还进行了参数敏感性分析以确定最优参数。每个实验重复五次,并报告平均诊断结果及相应的标准差。5.1 BCF实验5.1.1 实验描述定制的故障实验平台由以下部件组成:负载电机、转速-扭矩测量仪、行星齿轮减速器、轴承测试模块及驱动电机。实验设计在四种扭矩负载条件下评估七种不同的轴承健康状态。轴承故障分为七类:正常状态(NC);三种单一故障状态:外圈(OF)、内圈(IF)和滚动体(BF);以及三种复合故障状态:外圈与内圈(OI)、滚动体与外圈(BO)、滚动体与内圈(IB)。负载电机施加四种工况:0、2、4和6 N⋅m(负载0–3)。驱动电机转速和采样频率分别固定为500 rpm和12 kHz。平台结构如图7(a)所示,七种不同测试轴承的图像如图7(b)所示。 图7 BCF实验平台与测试轴承:(a) 具体结构;(b) 测试轴承理论原型的构建是零样本学习的基础之一。该原型基于第4.5节中建立的九个属性,并结合故障机理及BCF数据集中单一故障数据的分析得出,如图8所示。此外,在所提出的TPF框架中,模型仅使用单一故障数据进行训练,并在复合故障上进行评估,采用70%/30%的训练/测试划分。为扩充数据集,采用滑动窗口技术,每个样本包含3072个数据点。模型采用的学习率为0.00005,多分布融合对比学习权重 。 图8 BCF实验中设计的理论原型 5.1.2 结果与讨论为验证TPF框架在复合故障诊断中的有效性,将该模型与八种典型及当前最优方法进行了比较。此外,还将所提方法与FDAT的一种变体FDAT-I进行了比较,比较的更多细节详见第5.2.2节。所有对比方法均使用与所提出TPF模型相同的属性,以确保公平比较。DAP和IAP方法中的属性分类器均采用卷积神经网络。FDAT和SCE方法使用基于随机森林的分类器,与其原始实现一致。对于DEM方法,特征维度设置为256,与所提出的TPF模型一致。LIV方法保留其原始超参数配置进行识别。四种负载条件下各方法的诊断精度如表3所示。表3 BCF实验中九种不同方法的平均诊断精度 TPF方法凭借其强大的特征分离能力和域偏移缓解能力,在不同方法中获得了最高的平均诊断精度。所提出的ZSPE框架在四个任务中的精度分别达到66.33%、82.62%、97.11%和90.71%。总体而言,不同工况下的诊断精度是可接受的。尽管在负载0条件下诊断精度的提升相对较低,但在工况1–3中,所提出方法相比其他方法在诊断精度上表现出明显的改善。特别地,当仅使用单一故障样本进行训练时,在负载2和负载3条件下复合故障的平均诊断精度均超过90%。这一观察表明TPF方法在零样本故障诊断方面具有潜力。此外,为进一步进行定量分析,图9展示了TPF在四种负载条件下的混淆矩阵。可以看出,由于不同负载条件下数据分布的变化,OI和IB的诊断精度存在波动,而BO的诊断精度达到100%。总体而言,TPF框架仅使用单一故障数据进行训练即可实现复合故障的诊断。 图9 TPF模型在BCF数据集上四种不同负载下获得的混淆矩阵5.2 NEEPU实验5.2.1 实验细节为验证TPF框架的泛化能力和优势,在NEEPU数据集上进行了额外实验。与定制轴承复合故障实验类似,NEEPU数据集包含七种健康状态:正常状态(NC)、单一故障(OF、IF和BF)以及复合故障(OI、BO和IB)。在本实验中,通过磁力制动器对轴承施加不同负载,分别为0 N·m(负载0)、0.1 N·m(负载1)、0.2 N·m(负载2)和0.3 N·m(负载3)。训练集为每个单一故障类别分配700个样本,测试集为每个复合故障类别分配300个样本,与BCF实验一致。超参数(如学习率和权重参数)与BCF实验设置相同。此外,与BCF实验类似,理论原型基于NEEPU数据集的分析得出,如图10所示。 图10 NEEPU实验中设计的理论原型5.2.2 结果与讨论NEEPU实验的零样本故障诊断结果如表4所示。所提出的TPF框架同样与BCF实验中评估的八种典型及当前最优模型进行了基准比较。TPF框架在四种负载条件下的诊断精度分别为74.07%、90.58%、84.06%和82.96%。与BCF实验相比,不同条件下的诊断精度相对稳定,这可能归因于不同工况之间的差异较小。TPF的诊精精度高于其他零样本学习方法,总体诊断结果令人满意。表4 实验中九种不同方法的平均诊断精度 此外,所提出TPF在四种不同负载条件下的混淆矩阵如图11所示,提供了每种故障类型的详细诊断精度,进一步展示了TPF模型的诊断能力。 图11 所提出的TPF模型在NEEPU数据集上四种不同负载下获得的混淆矩阵值得注意的是,在某些负载条件下,几种经典方法相比部分较新方法展现出更高的诊断精度。这一观察结果可能与以下方面有关:首先,经典方法通常采用相对简单的训练流程,并已在各种实际场景中得到广泛验证,这可能有助于其在不同数据集上实现稳定的泛化性能。相比之下,较新的方法通常包含更复杂的特征预处理或联合优化策略。例如,FDAT和SCE涉及特征提取器和属性分类器的联合训练,而LIV将信号转换为图像表示并联合训练特征提取器和生成对抗模型。尽管这些设计旨在增强表示能力,但模型复杂度的增加也可能引入额外的优化挑战,从而在特定条件下影响泛化性能。其次,更复杂的架构通常对超参数配置更为敏感。当训练数据有限或超参数未经过广泛调优时,其潜力可能无法充分发挥,导致在某些场景下诊断性能较低。此外,为验证假设,对FDAT方法进行了架构改进。原始实现采用传统机器学习技术作为特征提取器,并要求特征提取器和属性分类器进行联合训练,这可能增加过拟合风险并导致性能较旧方法下降。为检验这一可能性,将原始特征提取和属性分类模块替换为基于CNN的结构,并将该变体记为FDAT-I。两个数据集上的实验结果列于表3和表4。对于BCF数据集,在四种工况下的诊断精度分别为71.93%、70.17%、67.57%和77.30%。对于NEEPU数据集,对应的精度分别为71.63%、82.33%、72.50%和74.33%。与原始FDAT方法相比,改进版本在不同条件下展现出一致的性能提升,并优于较早的方法。这为本文的假设——特征提取器和属性分类器的联合训练会降低零样本故障诊断的精度,提供了额外的实证支持。然而,改进模块结构可以缓解这一问题。5.3 拓展实验5.3.1 不同模块的消融实验为验证所设计的原型融合模块与多分布融合对比学习机制的有效性,在BCF和NEEPU数据集上进行了消融实验。不同负载下的两组实验结果如图12所示。横坐标标签中的WCWF-0表示在负载条件0下,TPF不含对比学习机制和原型融合模块。类似地,WC表示不含多分布融合对比学习机制,WF表示不含原型融合模块。无论是对比学习机制还是原型融合模块,单独缺失时均未能达到最高诊断精度。这一观察结果表明,改善判别性特征和校正域偏移的必要性。综合来看,所提出的TPF在多分布融合对比学习机制和原型融合模块的支持下,在所有上述实验中均能取得最佳性能。这表明所提出的MSSDM和原型融合模块在零样本诊断任务中是有效的。 图12 不同数据集中消融实验的平均诊断精度:(a) BCF数据集;(b) NEEPU数据集5.3.2 不同原型的消融实验为进一步评估每个原型的贡献,进行了多项消融研究。两个数据集在八种负载条件下的平均诊断精度如图13所示。符号WG、WF和WT分别表示TPF模型不含生成原型、特征原型和理论原型。例如,WG-0表示负载条件0下不含生成原型的TPF模型的诊断精度。结果表明,缺失任一原型均会导致诊断精度下降,证实了每个组件的独立贡献。值得注意的是,理论原型对模型性能的影响最为显著,在某些场景下,其消融导致精度下降近20%。这一显著影响可归因于理论原型在构建过程中融合了已知数据和先验知识,同时在训练过程中具有监督性参与。总体而言,三种原型的融合实现了最高的诊断精度,表明每种原型在模型中均发挥着关键且非冗余的作用。 图13 两个数据集中四种不同负载下原型消融实验的平均诊断精度:(a) BCF数据集;(b) NEEPU数据集5.3.3 计算成本分析为提供计算成本比较,基于三项指标进行了分析:参数量、浮点运算量和100个样本的测试时间。十种方法的计算成本对比如表5所示。表5 十种不同方法的计算成本 参数量和FLOPs主要针对深度学习和机器学习方法进行计算。在FLOPs计算中,除LIV方法使用尺寸为64×64的图像作为输入外,其余方法均以长度为3072的单个样本作为输入。测试时间指样本输入模型后的推理时间。对于FDAT和SCE方法,所使用的随机森林为非参数模型,其参数量取决于训练样本规模且具有一定随机性,基于100个训练样本提供了近似估计。在对比方法中,DAP、IAP、ESZSL、SJE和FDAT-I使用相似的卷积神经网络作为特征提取器,因此参数量和FLOPs相当。LIV使用了更复杂的特征提取器和生成对抗网络,导致参数量最高。所提出的TPF方法由于集成了扩散模型和三原型融合策略,具有相对更多的参数和更高的FLOPs。然而,其100个样本的平均测试时间仅为42.33毫秒,处于可接受范围内。总体而言,所提出TPF方法的计算成本是合理的。5.3.4 参数敏感性分析为研究不同系数 和 对诊断精度的影响,进行了超参数敏感性分析实验。 和 分别是生成原型和特征原型的权重系数。根据经验,将两个系数分别设置为 中的不同值,以观察其对精度的影响。首先,将两个系数的值设为相同。在NEEPU和BCF实验中的具体诊断精度如图14所示。在两个实验中,不同系数下的诊断精度略有波动。在NEEPU实验中,当系数设置为0.1时,在四种工况下均达到最高诊断精度。相反,在BCF实验中,当系数取0.15时获得最高诊断精度。 图14 (a) BCF和(b) NEEPU数据集上四种负载条件下等值融合系数的敏感性分析随后,为进一步分析敏感性,将 固定为第一步中每个数据集获得的最优值,并在相同范围 内变化 。结果如图15所示。 图15 两个数据集上四种负载条件下参数的敏感性分析实验:(a) BCF数据集;(b) NEEPU数据集结果表明,当 在测试范围内变化时,诊断精度保持相对稳定,但存在一定波动。总体观察表明, 过大可能导致性能轻微下降。在两个数据集上,当 分别设置为0.15和0.1时,达到最高的平均精度。因此,在NEEPU实验中, 和 均设为0.15,而在BCF实验中均设为0.1。6 结论为应对零样本故障诊断中的域偏移与特征融合挑战,本文开展了以下工作。首先,开发了一种三原型融合框架以缓解域偏移问题。该框架融合了完全由模型合成的生成原型、从故障数据中导出的特征原型以及基于先验知识构建的理论原型。所提出的TPF模型整合了来自先验知识、实际特征与训练模型三个维度的信息,有效缓解了单一原型信息不足所导致的域偏移问题。其次,针对特征融合问题,提出了一种多分布融合对比学习机制。该机制在生成正样本时引入了多种分布的先验信息,使构建的正样本更具判别性,从而引导提取更具判别力的特征。此外,还提出了一种模型-样本稳定扩散模型,以提高样本生成的稳定性。所提出的模型从模型训练和样本生成两个方面引入稳定机制以提升稳定性。在两个轴承复合故障实验中验证了所提出TPF的有效性。与八种典型模型及当前最优模型相比,所提出模型具有最高的诊断精度。编辑:Jin校核:李正平、陈凯歌、Leo、曹希铭、赵学功、白亮、任超、海洋、Tina、陈宇航、Kira、肖鑫鑫、赵诚、张优该文资料搜集自网络,仅用作学术分享,不做商业用途,若侵权,后台联系小编进行删除来源:故障诊断与python学习

未登录
还没有评论
课程
培训
服务
行家
VIP会员 学习计划 福利任务
下载APP
联系我们
帮助与反馈