首页/文章/ 详情

故障诊断大模型 | 可解释的机器故障诊断大型语言模型(上)

2月前浏览780

    本期推荐论文提出了一种创新的FD-LLM框架,将大语言模型(LLMs)应用于可解释故障诊断。通过设计字符串标记化机制,将振动信号的FFT和包络频谱编码为文本序列,使LLMs能够直接处理传感器数据。FD-LLM包含两个互补的训练范式:分类导向方法用于量化评估诊断性能,频谱语言建模方法则生成人类可读的故障解释。在多个公开轴承数据集上的实验表明,Llama3系列模型在有效性、适应性、鲁棒性和少样本泛化性方面均表现优异,特别是在频谱建模任务中,模型能够识别特征频率、谐波和边带,并生成准确的诊断结论。该研究为工业智能维护提供了一种兼具高精度与可解释性的新思路。由于论文篇幅较长,分为上下两篇介绍。

    论文基本信息

    论文题目:

    Large language models for explainable fault diagnosis of machines

    论文日期:2025

    论文链接

    https://doi.org/10.1016/j.engappai.2025.113131

    作者:

    Hamzah A.A.M. Qaid (a) , Bo Zhang (b) , Shuai Su (b), Dan Li (c) , See-Kiong Ng (d) , Wei Li (b,∗)

    a: School of Mechatronic Engineering, China University of Mining and Technology, Xuzhou, 221116, China

    b: School of Computer Science and Technology/School of Artificial Intelligence, China University of Mining and Technology, Xuzhou 221116, China 

    c: School of Software Engineering, Sun Yat-Sen University, Zhuhai 519080, China

    d: Institute of Data Science, National University of Singapore, Singapore 117602, Singapore

    作者简介:

    李伟,教授,中国矿业大学城市应急技术装备研究中心主任。(https://faculty.cumt.edu.cn/LW12345678/zh_CN/index.htm

    目录

    摘要

    1. 引言

    2. 相关工作

        2.1 智能故障诊断

        2.2 基于大语言模型的时间序列数据

    3. 方法

        3.1 FD-LLM框架

            3.1.1 分类导向训练方法

            3.1.2 上下文感知频谱语言建模方法

        3.2 数据预处理

            3.2.1 FFT预处理

            3.2.2 统计摘要

            3.2.3 变分模态分解

            3.2.4 时间序列数据编码

            3.2.5 指令微调

    4. 实验

        4.1 数据与评估任务

            4.1.1 数据集

            4.1.2 评估任务

        4.2 模型

        4.3 设置

        4.4 评估指标

        4.5 结果与讨论

            4.5.1 基于分类导向的评估

            4.5.2 上下文感知频谱语言建模评估

    5. 结论

    摘要

    大型语言模型(LLM)在从文本数据中提取复杂概念表征方面展现出卓越能力,广泛应用于各类实际场景。然而,在智能故障诊断(IFD)领域,利用振动信号等传感器数据至关重要,但由于时间序列数据与LLM输入特征之间的模态差异,这一目标仍面临挑战。现有解决方案往往仅将LLM视为分类器,忽视了其对振动数据进行理解与推理的潜力。本文提出了一种新型基于LLM的故障诊断框架(FD-LLM),通过将振动信号编码为文本表示形式实现信号与LLM的对接。FD-LLM采用分类导向方法,将故障诊断转化为多类别分类任务以评估LLM性能;同时引入上下文感知的频谱语言建模方法,实现可解释且基于推理的故障分析。我们在多个数据集和噪声条件下使用FD-LLM评估了四种开源LLM模型的有效性、适应性和鲁棒性。结果表明:LLaMA等模型不仅具备稳健的诊断性能、出色的零样本适应能力,还能在小样本学习场景下实现跨数据集的高效泛化;进一步证明LLM完全能够实现可解释的故障诊断。

    关键词: 智能故障诊断,大语言模型,时间序列编码,指令微调

    1.引言

    在智能制造和数字化产业时代,状态监测(CM)已成为确保运行可靠性、安全性和成本效益不可或缺的关键手段。状态监测系统利用传感器数据(如振动、声学、温度等)及先进分析技术来评估设备健康状况,及时发现设备劣化迹象及潜在故障(Jardine等人,2006)。然而,状态监测的真正价值在于其诊断智能性:即通过解析传感器信号模式来确定故障类型、严重程度及位置的能力(Nunes等人,2023)。因此,有效的故障诊断必须具备抗噪声能力、适用于不同设备及运行工况的普适性,并提供可解释的推理机制以支持复杂工业环境中的人工决策。

    传统的诊断方法高度依赖人工模式识别和专家主导的信号分析,这些方法虽然有效,但缺乏可扩展性及对多样化工业场景的适应能力(Abid等人,2021)。随着传感技术和计算能力的发展,机器学习(ML)与深度学习(DL)方法已成为智能故障诊断(lFD)系统的核心支撑要素(Surucu等人,2023)。过去二十年间,这类数据驱动方法在处理复杂时间序列信号方面展现出卓越性能(Liu等人,2018;Zhao等人,2020),推动了其在各行业的广泛应用。然而仍存在诸多挑战:大多数基于机器学习和深度学习的模型在应用于新设备或运行环境时需要大量重新训练;缺乏可解释性;且难以整合异构传感器信息——这些因素均限制了其在实际应用中的可靠性和透明度。

    大型语言模型(LLMs)(Zhao等人,2023;Zhou等人,2023)的出现——例如GPT-2(Radford等人,2019)、Llama-2(Touvron等人,2023)以及Qwen-2(Yang等人,2024)——彻底改变了人工智能领域的发展格局。这些模型最初为自然语言处理(NLP)而开发,在推理、抽象和泛化方面展现出卓越能力,使其成为推动通用人工智能(AGl)发展的理想候选方案。多模态LLM(MLLMs)的最新进展进一步提升了其处理跨域数据的能力,为其在lFD中的应用开辟了新可能性。实现这一整合的核心前提是将传感器数据编码为与大语言模型(LLM)兼容的格式。当前研究探索了多种方法,包括基于字符串的分词技术和统计摘要技术(Gru-ver等人,2023;Jin等人,2023)、模态特定编码器(Belyaeva等人,2024),以及将时间信号转换为图像以供大语言模型使用的基于视觉的变换方法(如Qwen-VL,Bai等人,2023)。

    基于这些进展,新兴研究开始利用大语言模型(LLM)通过多种编码方案进行IFD。例如针对振动数据设计的模态专用架构(Tao等人,2025)、结合多模态语言模型(MLLM)的基于视觉的谱表示方法(Wang等人,2025)。在预测与健康管理(PHM)领域,更广泛的研究致力于开发能够处理多项任务的大规模基础模型——包括故障诊断、剩余使用寿命预测和异常检测(Yaguo等人,2025)。此外,LLM提示机制与自校正微调技术已应用于HVAC故障诊断:经过微调的GPT-3.5甚至超越了GPT-4,实现了近乎完美的准确率(Zhang等人,2025)。尽管取得这些进展,当前研究仍主要聚焦于弥合模态差异与提升分类精度,而未能充分挖掘LLM固有的认知优势,如上下文推理、抽象化能力和自然语言生成能力。因此,大语言模型在实现可解释且可解读的故障诊断方面的潜力仍未被充分探索。要真正超越传统的机器学习和深度学习框架,基于大语言模型的方法必须充分利用这些能力来实现可解释的故障诊断,使模型能够对信号特征进行推理并生成人类可读的解释。

    利用大型语言模型推进可解释性故障诊断面临双重挑战:一是缺乏能够将传感器信号与文本解释相匹配的多模态数据集;二是构建时域数据集本身存在固有困难。这些挑战源于专家标注资源有限、缺乏标准化诊断规则,以及复杂且对噪声敏感的动态特性会掩盖故障特征。缓解这些问题的一个有前景方向是从时域转向频域分析——后者能提供更具可解释性和物理意义的表征方式。频域中的特征故障频率建立了频谱成分与缺陷类型之间的明确关联,从而简化了对齐信号-文本对的生成过程。该方法与近期基于可解释深度学习的研究方向一致,这些研究通过利用频谱表征中明显的特征频段和谐波结构来量化可解释性(Li等人,2023;Brito等人,2023)。

    为应对这些挑战并充分发挥大型语言模型(LLM)在故障诊断(IFD)中的推理潜力,我们提出了FD-LLM——一种基于LLM的故障诊断框架,该框架整合了两种互补的训练方法第一种是面向分类的方法,旨在使LLM适用于多类别故障诊断,并能够系统评估诊断的有效性、泛化能力和鲁棒性这三大关键但尚未充分研究的性能维度;第二种是具备上下文感知能力的频谱语言建模方法,不仅超越了传统分类任务,还能解析频谱内容并生成易于理解的故障机制说明。与以往依赖特定模态编码器或多模态LLM的研究不同,FD-LLM采用了一种简单而高效的基于字符串的分词方案,可将快速傅里叶变换(FFT)或包络谱转换为文本序列。这种方法既保留了频域结构特征(如峰值、谐波和边带),又促进了频谱模式与文本推理之间的关联。我们的研究成果总结如下:

    (1)我们提出FD-LLM这一双轨框架,它融合了以分类为导向的建模范式与频谱-语言建模范式,能够在IFD中同时实现定量评估与定性可解释性。

    (2)我们设计了一种基于字符串的分词机制,可直接将FFT和包络谱编码为文本序列,并提出一种多模态监督微调(SFT)数据集构建方法,实现谱图与诊断描述的精准对齐。

    (3)采用基于分类的评估流程,我们对多种开源大语言模型(如Ll-ama模型、Qwen1.5-7B和Mistral7B-v0.2)进行了性能基准测试以评估其诊断能力。通过频谱-语言建模方法,我们证明了大语言模型能够对频谱表示进行推理、识别与故障相关的证据,并生成可解释且易于人类阅读的解释结果。

    2.相关工作

    2.1.智能故障诊断(IFD)

    智能故障诊断(IFD)长期以来一直是工业维护领域的核心课题,其重大进展主要得益于机器学习(ML)和深度学习(DL)的发展。早期基于ML的方法依赖于通过信号处理提取的人工特征(Wang等,2017),并利用支持向量机(SVM)(Wu与Meng,2006;Tang等,2010)、K近邻算法(KNN)(Wang,2016;Pandya等,2013)、朴素贝叶斯(Zhao等,2009;Muralidharan与Sugumaran,2012)以及人工神经网络(ANN)(Mrugalski等,2008;Rafiee等,2007)等分类器进行故障识别。尽管这些方法在特定场景下效果显著,但它们高度依赖特征工程的质量,并难以处理大规模复杂数据集。

    深度学习(DL)的出现通过实现直接从原始传感器信号中自动提取特征,标志着范式的转变。卷积神经网络(CNNs)已被广泛应用于捕捉振动数据中的空间层次结构(Zhang等人,2017b;Ince等人,2016),而循环神经网络(RNNs)则利用时间序列数据中的时序依赖性(Yuan等人,2016;Zhao等人,2016)。尽管效果显著,深度学习模型通常需要大量标注数据进行训练,并且往往难以在不同设备或运行条件下进行泛化,除非经过大量重新训练。此外,其黑箱特性阻碍了可解释性,限制了在关键工业应用中的可信度。

    为解决这些局限性,领域适应(DA)技术应运而生,旨在提升模型在不同领域的迁移能力(Zhao等人,2019)。目前已出现多种方法论,包括闭集领域适应(CSDA)(Zhang等人,2022)、部分领域适应(PDA)(Wang等人,2022)以及开放集领域适应(OSDA)(Guo等人,2022)。近期进展如伪标签引导的双分类器网络(Sun等人,2025b)以及基于时频融合的开放集分类方法(Sun等人,2025a)显著提升了故障识别性能与鲁棒性。然而,领域适应方法仍面临诸多挑战:其效果往往取决于源域与目标域之间的相似度,显著差异会降低性能;需要进行重训练或微调,计算成本较高;且如何在不同运行条件下实现稳定的适应性调整,仍是实际应用中的未解难题。

    2.2.使用大型语言模型(LLMs)处理的时间序列数据

    主流大型语言模型并非天生适用于时间序列数据处理,但最新研究表明该领域潜力日益显著(Jin等人,2024)。目前已有三种主要策略被提出以弥合这一差距:基于视觉的表征方法、特定模态编码器以及基于文本的编码方案。

    基于视觉的方法可将时间序列数据转化为图表或图像,使多模态大语言模型(MLLMs)能够对其进行处理(Chen等人,2025)。虽然这种方法能有效利用预训练的视觉-语言模型,但往往会丢失精细的时间信息,并受图像分辨率限制。

    模态特定编码器利用嵌入层或预训练编码器将数值序列映射至大语言模型的输入空间。Spathis与Kawsar(2024)采用轻量级嵌入层及提示设计来缓解文本与数值数据之间的模态差异。Time-LLM(Jin等人,2023)利用前缀提示将时间序列输入重编程至语言空间以提升预测性能;而TEST(Sun等人,2023)则通过对比学习和软提示使时间序列嵌入向量与大语言模型对齐。尽管这些方法能够从振动信号中准确分类故障类型,但往往掩盖了频谱特征(如特征频率、谐波及边带),从而限制了模型的可解释性与推理能力。

    基于文本的编码方法将时间序列数据转换为语言模型可解析的数值字符串。例如,Gruver等人(2023)提出了基于字符串的数值简单分词方案;而Ansari等人(2024)则开发了可逆缩放与量化方法,适用于基于Transformer的序列建模。然而这些方法主要针对时序预测而非故障诊断设计。相比之下,我们的编码流程专注于频谱域表征——诊断特征表现为结构化的频率模式(如峰值、谐波、边带)。提出的频谱到文本编码方案在原有分词框架基础上实现了双重改进:(1)在频域操作以保留谐波结构和相对振幅;(2)应用量化与缩放处理以保持频谱成分间的比例关系。其核心创新点在于将频谱模式与文本诊断描述对齐,从而构建能结合频谱证据与专家语言解释的多模态数据集。与直接时域编码相比,这种对齐方式为基于大语言模型(LLM)的故障诊断提供了更具可解释性且语义更丰富的基础。

    3.方法

    3.1.FD-LLM框架

    FD-LLM框架通过两条主要流程将大语言模型(LLM)应用于故障诊断:(1)以分类为导向的方法用于直接故障识别(图1);(2)基于上下文感知的频谱-语言建模方法,旨在提升可解释性并利用编码后的频谱特征支持专家交互(图2)。FD-LLM将原始振动信号预处理为三种表示形式:统计摘要、FFT向量以及频率-振幅谱。这些表示形式可用于通过低秩自适应(LoRA)对LLM进行指令调参。分类流程充分利用所有表示形式,而频谱-语言建模流程则仅使用频谱数据生成可解释的诊断洞察。

    3.1.1.基于分类的训练方法

    为了评估不同LLM在不同信号表示(包括统计摘要、编码FFT向量和编码频谱数据)下的诊断性能,采用了分类导向流程。具体来说,给定一个故障样本        和一个相应的提示       (其中包含了机器运行条件和诊断指令),目标是学习一个基于LLM的分类器,将        映射到标签空间       。该分类系统可以表示为:

       
     

    其中        表示系统生成的原始文本输出。

    由于LLM以自然语言生成预测,使用标准的深度学习指标评估其性能需要将文本输出和相应的真实标签映射为数值格式。为方便起见,我们定义一个映射函数       ,使得       ,其中       表示数值标签空间。

    3.1.2.基于上下文感知的频谱语言建模方法

    频谱-语言建模流程训练LLM对频谱特征进行推理并阐述与故障相关的模式,从而实现可解释和交互式诊断。它使LLM能够识别和描述故障特征——如特征频率、谐波和边带——同时生成人类可理解的结论。形式化地说,给定一组频谱样本       ,其中每个        表示一个频谱的频率-幅值对序列,以及一个自然语言提示       ,目标是生成一个响应       (观察和结论),捕捉        中的相关故障特征。该方法的任务可以表示为:

         

    其中 FDllm 表示解释        并通过分析        中的模式和故障特征来生成        的系统。

    然而,开发一个具有强大频谱模式理解和推理能力的故障诊断LLM需要高质量的多模态(频谱-语言)训练数据。为此,我们采用了一种机制来提取描述频谱属性(如主导故障频率、边带和谐波)的文本观察,随后给出指示机器健康状态的结论。多模态数据构建过程如图2所示。

     

    图1. FD-LLM分类导向型训练框架的总体架构。针对统计特征、FFT特征及频谱特征,分别采用了三种预处理流程。

     

    图2. FD-LLM频谱-语言建模方法的概述。

    该过程包含三个步骤。首先,通过变分模态分解(VMD)将不同轴承健康状态(包括内圈故障、外圈故障、滚动体故障以及正常状态)的振动信号转换为频谱表示同时,利用轴承几何参数(滚珠直径       、节圆直径       、滚珠数量       和转速来计算理论故障相关频率,如轴频       、滚珠通过频率(      、      )和滚珠自转频率(      ),以及它们的谐波和边带。其次,使用计算出的故障特征频率自动标注每个频谱样本,生成一组属性。对于每个特征频率,提取相应的幅值,包括特征频率处及其相邻频点(由频率分辨率决定)的幅值,以确保与故障模式的精确对齐。类似地,识别谐波倍数和边带特征以丰富标注属性。第三,使用预定义的故障特定模板(       用于指令,       用于答案)生成问答对。对于每种故障类型,随机选择一个模板,并用提取的属性、领域知识规则和故障类型填充,同时将编码后的幅值和文本频率描述附加到输入中。

    为确保多模态数据集的鲁棒性和多样性,每种故障类型设计了三个不同的模板,以捕捉不同的诊断视角,从而增强LLM生成上下文丰富响应的能力。振动信号被分割为1秒的片段,以实现1:1的频率分辨率,从而能够进行精确的频谱分析并准确识别故障相关频率。此外,还进行了人工验证过程,审查标注过程以验证生成的文本描述是否与频谱特征准确对齐,确保数据集的事实一致性,从而有效训练LLM。

    3.2.数据预处理

    3.2.1.FFT预处理

    给定一组时域振动信号       ,其中 J 是信号总数,每个信号被分割成 K 个片段,每个片段长度为 L。第 k 个片段记为       ,其中       。这种分割有助于减少振动信号的长度,确保它们不会超过LLM的最大序列长度(例如,MISTRAL的最大上下文长度为32k个token,Llama3支持高达8k个token),同时增加了训练样本的数量。对于每个片段       ,我们计算FFT,它本质上是离散傅里叶变换(DFT)的高效实现。DFT的数学表达式为:

         

    其中 i 是虚数单位。

    我们进一步计算每个FFT系数的幅值为       。为确保各片段之间的一致性,我们通过其最大值对幅值进行缩放,即       。这得到了归一化的、非负的FFT表示       ,从而避免了不必要的符号标记化。来自所有信号的完整FFT处理样本集可以表示为       ,其中       ,对于       ,且       

    随后,将FFT处理后的样本进行编码,并整合到相应的数据生成模板中,如表1所示。

    3.2.2.统计摘要

    对于每个片段      ,我们提取了包含15个时域与频域特征的集 合。时域特征包括均值、均方根值(RMS)、标准差、峰因子、偏度、形状因子、峰度、峰峰值、能量因子及脉冲因子;频域特征则涵盖峰值频率、峰间频率、谱峰度、谱带宽和谱偏度。这些特征的具体构成及其对应的数学公式详见表A.1。为确保与大语言模型(LLM)兼容,所有特征均通过转换为预定义提示模板中的简洁文本摘要进行序列化处理,该模板列于表1中。

    表1 用于生成训练数据的模板

         

    3.2.3.变分模态分解

    采用变分模态分解(VMD)作为预处理步骤,用于提取振动信号的包络谱。VMD将振动信号自适应地分解为预定义数量的模态,有效地将故障相关成分与噪声分离。然后可以从主导模态中提取包络谱。其目标是:(i)获得一种对噪声鲁棒且泛化的表示,该表示保留与轴承故障频率相关的信息;(ii)获得一种能够生成带有明确推理步骤的数据的信号表示,使模型能够遵循指令并执行逐步故障诊断。

    具体来说,给定一个信号 x(n),将其分解为有限数量的模态 u_h(n),每个模态围绕特定的中心频率       ,其带宽使用        范数进行估计。这种分解通过求解一个约束变分优化问题来实现,该问题最小化所有模态的总带宽,条件是它们的和能够重构原始信号。这确保了每个模态保持窄带并在频域中良好分离。数学上,优化问题表述如下:

       
     

    公式(4)中的优化问题通过引入二次惩罚因子        和拉格朗日乘子        转化为无约束问题。增广拉格朗日函数表示为:

       
     

    公式(5)可以使用交替方向乘子法(ADMM)求解,该方法迭代更新模态       、它们的中心频率        和拉格朗日乘子       ,直到收敛。

    从主导VMD模态导出的包络谱被用于两个训练流程。对于分类导向的流程,编码后的频谱被整合到与FFT样本类似的数据生成模板中,并在指令中加入知识规则。对于频谱建模方法,数据生成遵循图2所示的步骤。轴承的缺陷特征频率在附录B中介绍。

    3.2.4.时间序列数据编码

    LLM依赖标记化(tokenization)将输入文本转换为标记序列,这是一个关键过程,因为微小的差异可能显著改变模型行为。字节对编码(BPE)是一种常用的标记化技术,它将输入数据作为位串处理,根据其在训练数据中的频率生成标记。然而,BPE可能将数值分割成多个与其数字不对齐的标记,影响模型解释数值数据(如频谱样本)的能力。将这些数据正确编码为文本格式以确保准确的标记化,对于获得可靠的LLM预测至关重要。

    受Gruver等人(2023)的启发,我们将FFT和频谱样本转换为适合LLM标记化的字符串数字序列。给定一个样本       ,我们定义了一个编码函数       ,该函数执行一系列可逆步骤:符号处理、量化和字符串标记化,如下详述,并在附录C算法(C1至C4)中形式化。

    符号处理: 函数        处理每个频谱值        的符号,以确保与可能的负值兼容,尽管频谱数据本质上是非负的。该符号确定如下:

       
     

    这将产生一个符号数组       ,如算法C1所示。对于非负数据,通常有       ,从而最小化不必要的符号标记。

    量化: 函数        处理频谱值的高精度问题,以提高计算效率并减少标记使用。对于每个       ,绝对值        乘以       (其中 D 是小数位数),并截断为整数:      。缺失值(NaN)在布尔掩码        中标记,其中        表示 NaN,否则       。输出是一个量化数组       ,其中每个        是一个整数(对于 NaN 为 0),如算法C2详述。最大值被限制为        以确保有限位表示。

    字符串标记化: 函数        将量化数组       、符号数组        和缺失掩码        转换为字符串表示,如算法C3所示。每个        被转换为十进制数字字符串,不带小数点或空格,以优化Llama-3、Mistral等LLM的标记化。

    组合编码函数: 复合函数 encode() 协调这些步骤,如算法C4所形式化:

       
     

    这产生了一个可逆的字符串表示       ,其中值可以通过解析标记、将整数除以        并应用        中的符号来解码,缺失值通过 M 处理。

    3.2.5.指令微调

    指令微调(Instruction tuning)是一种全监督微调技术,用于在特定目标领域上进一步训练LLM。这种方法不仅增强了LLM遵循人类指令的可控性,还使其能够将现有知识适应到新任务的细微要求中。最近的研究表明,经过指令微调的LLM在未见任务上表现出强大的零样本泛化能力,这在工业故障诊断中是一个非常有价值的特性,因为有限的数据和多样的运行条件对构建鲁棒、泛化的系统构成了重大挑战。

    为了实现高效的指令微调并减少计算负担,我们采用了低秩适配(LoRA),它在模型层中引入可训练的低秩矩阵,以实现参数高效的适配。对于任意预训练权重矩阵       ,LoRA 用低秩分解表示权重更新矩阵       ,使得:

       
       

    其中        是一个缩放因子,通常用于控制权重更新的幅度,而        是关于        的常数。低秩矩阵        和        分别使用随机高斯分布和零进行初始化。

    在微调过程中,只有低秩矩阵        和        被更新,而原始权重矩阵        保持冻结。在前向传播中,输入        同时被冻结的        和可训练的        处理,它们的输出按坐标求和。

    (实验及结论见下篇)

    编辑:Kira
    校核:李正平、陈凯歌、赵栓栓、曹希铭、赵学功、白亮、任超、海洋、陈宇航、Tina、王金、赵诚、肖鑫鑫、张优
    该文资料搜集自网络,仅用作学术分享,不做商业用途,若侵权,后台联系小编进行删除
    来源:故障诊断与python学习
    振动通用航空ANSAUGpython海洋UMLMS声学理论电机化机控制人工智能
    著作权归作者所有,欢迎分享,未经许可,不得转载
    首次发布时间:2026-06-23
    最近编辑:2月前
    故障诊断与python学习
    硕士 签名征集中
    获赞 87粉丝 152文章 327课程 0
    点赞
    收藏
    作者推荐

    MSSP代码开源||受音素启发的声学帧嵌入轻量级Transformer用于滚动轴承故障诊断

    声学故障诊断如何兼顾精度与轻量化?这篇文章受语音音素处理启发,提出ASFE-Transformer:通过解析振幅-相位双通道表征、声学帧嵌入降维及SD-GLU局部增强,以0.09M参数实现99.75%+准确率,为边缘端实时诊断开辟新路径。 本期受作者邀请,给大家推荐这篇安徽大学机器人学院刘方教授团队的论文,论文第一作者为团队博士生彭麟昊。作者提出了一种受音素处理范式启发的轻量级声学帧嵌入Transformer,用于滚动轴承声学故障诊断。针对声学信号短时非平稳特征难辨识及Transformer计算开销大的问题,该方法首先通过解析振幅-相位表示模块构建包含瞬时幅值和相位的双通道物理表征;其次设计声学帧嵌入模块将连续波形聚合为紧凑的帧级token序列,在保留瞬态故障线索的同时显著降低序列长度与计算复杂度;最后提出Swish-深度门控线性单元替代传统前馈网络,通过嵌入轻量级深度可分离卷积增强局部上下文感知。在两个轴承声学数据集上的实验表明,ASFE-Transformer(Acoustic Segment-Frame Embedded Transformer,声学段帧嵌入Transformer)以仅0.09M参数和13.66M FLOPs(Floating Point Operations,浮点运算次数)的极轻量设计,实现了99.75%和99.90%的诊断准确率,并在强噪声环境下展现出优异的鲁棒性,为工业边缘设备实时部署提供了可行方案。 为了感谢大家长期以来的支持,作者特地公开了代码,希望对大家学习有所帮助,同时文章质量很高,希望大家多多引用,支持为爱发电大佬们。 论文基本信息论文题目: Phoneme-inspired acoustic frame embedded lightweight transformer for rolling bearing fault diagnosis论文期刊:Mechanical Systems and Signal ProcessingDoi:https://doi.org/10.1016/j.ymssp.2026.114030作者: Linhao Peng a, Fang Liu a, Zhongliang Lv b, Yongbin Liu a, Min Xia c 论文时间: 2026年3月 机构: a School of Electrical Engineering and Automation, Anhui University, Hefei 230601, Chinab School of Mechanical and Intelligent Manufacturing, Chongqing University of Science & Technology, Chongqing 401331, Chinac Department of Mechanical and Materials Engineering, The University of Western Ontario, London, Ontario, Canada作者简介: 彭麟昊,安徽大学电气工程与自动化学院电气工程专业在读博士生,入选2025年中国科协青年科技人才培育工程博士生专项计划。以第一作者身份在MSSP、IEEE TIM等国际权威期刊发表SCI论文6篇。曾获研究生国家奖学金,省级三好学生,省级优秀硕士毕业论文,主持安徽省教育厅科学研究项目(自然科学类)博士生专项1项。邮箱:z24101006@stu.ahu.edu.cn。刘方,安徽大学电气工程与自动化学院教授、博士生导师、机器人学院副院长,研究方向为机电系统动态监测与智能运维,主持国家自然科学基金项目3项、安徽省重点研发计划1项(省市联合资助600万元)、安徽省自然科学基金优秀青年项目、青年项目各1项(青年项目获评A类结题)。与科大讯飞、富煌科技等上市公司开展多项产学研合作研究。在国内外重要学术期刊发表SCI/EI收录论文60余篇,包含多篇ESI高被引论文,第一发明人授权发明专利19项。核心成果发表于MSSP、IEEE Transactions系列汇刊等国内外本领域权威期刊。邮箱:ufun@ahu.edu.cn。吕中亮,重庆科技大学机械与智能制造学院教授,博士生导师,院长兼任重庆市高校重点实验室主任,致力于智能运维与大数据分析研究。主持国家/省部级重点及一般项目17项。发表论文37篇,其中被SCI/EI收录25篇,3篇论文入选中国知网《学术精要数据库》高影响力论文。申请专利25项,已授权21项。曾获重庆市科技进步一等奖、二等奖及中国产学研合作创新奖等荣誉。邮箱:2010024@cqust.edu.cn。刘永斌,安徽大学电气工程与自动化学院教授、博士生导师,安徽省学术和技术带头人,智慧电网数字协同技术安徽省联合共建学科重点实验室主任。长期从事高端装备智能诊断与运维、智能材料驱动与传感、机器人及工业现场自动化等方向的研究。主持基础加强计划子项目1项,国家自然科学基金面上项目3项,安徽省科技攻坚创新计划、中国博士后科学基金特别资助项目、中国博士后科学基金面上资助项目、安徽省重点研发计划、安徽省自然科学基金,安徽安徽省教育厅自然科学基金重点项目及企业委托项目多项;在国内外知名期刊会议上发表了学术论文100余篇,其中SCI/EI检索期刊论文80余篇;获授权发明专利30余项。邮箱:ybliu@ahu.edu.cn。夏敏,加拿大Western University机械与材料工程系副教授,机器智能实验室(MIN Lab)主任,研究领域涵盖机器学习、状态监测、先进制造过程监控与优化、工业数据挖掘及智慧清洁能源系统。在机电一体化和工业信息学领域的顶级期刊及会议上发表论文100余篇,自2020年起连续入选斯坦福大学发布的"全球前2%顶尖科学家"榜单(基于学术成果影响力)。主导过加拿大、英国和日本的19个科研项目,总经费达2000万加元(其中作为首席研究员获资370万加元)。邮箱:min.xia@uwo.ca。摘要基于声学的故障诊断因其在不同运行条件下具有高度灵活性和适用性而受到越来越多的关注。近期研究表明,基于Transformer的架构在建模长时程时间依赖关系方面表现出卓越能力,因此特别适用于复杂时间序列的表示与分析。然而,将Transformer应用于声学故障诊断仍面临以下关键挑战:首要难题在于如何在复杂的环境干扰中区分短时程非平稳声学特征;同时,在计算资源有限的情况下如何保证模型的诊断性能也是一大挑战。受音素处理范式(即将连续语音离散化为有意义单元)的启发,本文提出了一种轻量级声学片段帧嵌入Transformer,称为ASFE -Transformer,以有效解决这些问题。首先,引入解析振幅-相位表示模块以生成物理意义明确的表征,确保多维声学信号的瞬时演变特性得到准确保留;其次,开发声学帧嵌入模块,在嵌入阶段将连续分析样本聚合为单一标记。该策略不仅生成了更高效的标记序列,显著提升了瞬态故障信号的可识别性,同时大幅降低了计算负担。最后,提出新型Swish深度门控线性单元对Transformer的前馈网络进行重构,在Swish激活门控机制中嵌入轻量级深度卷积层,使编码器具备局部感知偏置能力。针对两个轴承声学数据集的全面实验表明,所提出的框架在保持轻量化设计的同时实现了稳健的诊断性能,并突出了其在实际工业部署中的强大潜力。 关键词:滚动轴承;故障诊断;Transformer;幅度-相位表示;帧嵌入;轻量级框架 目录1 引言2 理论背景 2.1 声学信号的振幅与相位表征 2.2 基于Transformer的神经网络3 所提方法 3.1 ASFE-Transformer架构 3.2 解析振幅-相位表征 3.3 声学帧嵌入模块 3.4 所提方法的整体诊断流程4 研究结果 4.1 方法描述与参数设置对比 4.2 案例一:基于抛物面端盖声学镜的声学信号数据集 4.3 案例二:来自KAIST的轴承声学数据集5 讨论 5.1 所提模块有效性分析 5.2 帧长度影响分析 5.3 可解释性分析6 结论7 结论代码可用性注:小编能力有限,如有翻译不恰之处,请多多指正~ 若想进一步拜读完整版,请下载原论文进行细读。 1 引言滚动轴承作为旋转机械中的关键支撑部件,其运行状况直接影响工业设备的稳定性和安全性。随着自动化和智能制造的不断发展,机械系统的运行条件变得越来越复杂,轴承故障成为性能下降和意外停机的主要原因之一。因此,监测和诊断轴承健康状况对于确保机械系统长期可靠、高效运行具有重要意义和工程价值。 目前,滚动轴承运行状态的表征主要依赖于振动、电流、温度和声学等多种物理信号。其中,振动和声学信号是反映轴承系统动态特性最广泛使用的两种模态。振动信号对结构响应变化极为敏感,已成为传统监测中的主要诊断源。相比之下,声学信号能够进行非接触测量,部署灵活且成本低,并且可以在不干扰设备运行的情况下捕获结构振动和能量辐射特性。因此,分析运行信号的声学特性已成为一种有前景的故障识别方法。Chen等人开发了一种基于声学标识符的特征提取框架,该框架显著提高了机器人砂带系统的监测效率,而Jiang等人提出了一种自适应复合加权索引图,增强了基于声学特征的机械诊断的鲁棒性。数据驱动技术的最新进展,特别是深度学习,进一步提高了故障检测的能力。通过分析声学信号,这些技术可以直接处理原始数据并自动学习基本特征表示。其中,以卷积神经网络为代表的数据驱动方法在基于声学的故障诊断中取得了显著进展。例如,Ayantha等人首先进行声源分离以恢复与故障相关的声学成分,然后通过一维CNN(Convolutional Neural Network,卷积神经网络)实现机械故障诊断。Wang等人提出了一种混合注意力驱动的卷积对抗网络,该网络在强噪声条件下实现了鲁棒的诊断性能。Yin等人开发了一种多任务学习时间卷积网络,该网络结合声场信息,能够在低信噪比下实现准确的变速箱诊断。然而,当应用于声学故障诊断时,基于CNN的方法面临固有的局限性。卷积操作主要捕获局部幅度变化,但缺乏对声学信号中的长时时间依赖性和相位连续性进行建模的能力。 与卷积网络不同,Transformer利用自注意力在所有时间步动态建模依赖性,以实现全局感受野和更有效的时间表征。受益于这种能力,越来越多的研究将Transformer架构引入故障诊断。Ding等人提出了一种时频Transformer模型,能够有效地从振动信号中提取特征表示。Dong等人在Transformer架构中引入了多专家反馈层,并提高了机械故障诊断中决策的可靠性。尽管Transformer擅长捕获全局时间依赖性,但它们在对细粒度局部特征进行建模方面效果较差。为了解决这个问题,最近有研究将这两种架构集成到统一框架中,以实现更全面、高效的故障诊断。Kim等人提出了一种时频融合框架,该框架将卷积编码器与Transformer层集成,以从非平稳信号中提取分层表示。Yang等人开发了一种基于分层Transformer架构的全局特征感知机制,该机制有效地融合了局部和全局特征,并在有限的训练数据和复杂的运行条件下表现出卓越的诊断性能。尽管这些混合框架已显示出有前景的性能,但它们的高计算成本和内存需求限制了它们在实时、资源受限的工业环境中的适用性。一些研究人员已经认识到这些局限性,并提出了有效的改进方法,如轻量级架构设计和改进的注意力机制,以减轻计算负担同时保持诊断准确性。Fang等人引入了一种基于Transformer结构的改进卷积单元,该单元在保留特征提取能力的同时,大大减少了模型参数的数量。Yan等人提出了一种轻量级故障诊断框架,称为LiConvFormer,该框架在多个基准数据集上展示了效率和鲁棒性。Shao等人提出了一种LSFConvformer框架,该框架将轻量级Convformer建模与打乱的时频融合相结合,以提高特征提取效率和诊断鲁棒性。 虽然数据驱动方法在基准数据集上取得了令人印象深刻的准确性,但它们通常依赖大量参数冗余和计算资源来隐式学习特征表示。除了这种计算开销外,一个基本限制在于信号模态本身:现有的诊断框架主要是为振动信号设计的,而从麦克风获得的声学测量的性质在根本上是不同的。对于滚动轴承,麦克风捕获整个过程中产生的空气传播声音,在此过程中滚动元件接近缺陷、进入缺陷区域、与局部损伤相互作用,随后离开该区域。在这种相互作用期间,滚动、滑动和冲击行为以不同的比例、持续时间和能量分布发生,并且这些特征与故障类型和严重程度密切相关。这种复杂性意味着声学信号中具有诊断信息的成分是高度瞬态的且结构多样。这就引出了一个关键的研究问题:通过显式编码这些判别的声学进化模式,以显著最小化的模型复杂性来实现具有竞争力的诊断准确性是否可行?通过类比,故障诱发声波的产生机制与人类语音产生具有显著相似性。图1表明,如果将局部缺陷区域视为声源通道,滚动体与缺陷相互作用时产生的每个短声脉冲可被视为类似于单个音节的发音。随着轴承持续旋转,这些连续的声脉冲形成一个连贯的声学序列,类似于一个口语句子。此外,每次相互作用中的滚动、滑动和冲击分量在概念上可与音素进行比较,音素是语音中最小的区别单元。受音素处理范式启发,即连续语音被离散为有意义的单元,这项工作提出了一种轻量级的声学段帧嵌入Transformer。所提出的方法基于三项核心架构创新。 图1. 轴承故障声波与人类语音产生之间的概念类比(1) 在输入层,引入解析幅度-相位表示以构建具有物理意义的双通道表示,并实现幅度和相位的联合建模 (2) 开发了一个声学帧嵌入模块,将连续的声学波形转换为紧凑的帧级令牌。这种令牌化策略保留了滚动、滑动和冲击相互作用产生的短时时间结构,类似于捕捉语音中的音素细节。通过将长波形转换为简洁的信息令牌序列,AFEM(Acoustic Frame Embedding Module,声学帧嵌入模块)在保留关键瞬态故障信息的同时,明确缩短了序列长度并大幅降低了计算复杂度。 (3) 通过一种新颖的Swish深度门控线性单元对Transformer的前馈网络进行重新设计。引入门控机制以选择性地控制信息流,并允许模型专注于信息丰富的故障特征,同时抑制无关噪声。这种设计加强了全局时间依赖性建模,同时通过高效的局部特征大幅降低了计算复杂度。本文的其余部分组织如下。第2节介绍了通过希尔伯特变换表征声学幅度和相位的理论基础,以及标准Transformer。第3节详细阐述了所提出的ASFE-Transformer、AAPR(Analytic Amplitude-Phase Representation,解析幅度-相位表示)、AFEM和改进的Transformer编码器。第4节展示了在两个基准数据集上的广泛实验结果,以验证所提方法的优越性。第5节讨论了模型的内部机制,包括模块有效性、帧长度影响和特征可解释性。最后,第6节总结了研究并展望了未来的挑战。2 理论基础在本节中,首先介绍解析信号构建的原理,并解释这种方法如何表征声学信号的瞬时幅度和相位以揭示完整的瞬态故障特征。随后,回顾标准Transformer的基本架构,为本文引入的具体改进提供结构基础。2.1 声学信号的幅度和相位表征在轴承运行期间,麦克风捕获的声学信号是潜在声场的实值投影。尽管这种实际测量反映了瞬时压力波动,但它本质上掩盖了与机械组件内能量传输延迟、结构共振和模态散射紧密相关的伴随相位变化。最近的研究表明,这种与相位相关的信息在表征瞬态传播行为以及声发射和旋转机械声学中的共振引起的失真方面起着关键作用。 为解决这一限制,从实信号重建潜在的正交分量,如图2(b)所示,以形成解析信号表示。这种解析表示提供了对瞬时幅度和相位的直接访问,能够更完整地描绘信号的时变动态,并提高故障诱发声学响应的描述保真度。其中, 表示希尔伯特算子, 表示柯西主值,x(t)是实际声压信号, 是其相位偏移90°的正交分量。在频域中,其中, 是傅里叶变换,x(f)是x(t)的频谱,f是频率(Hz),sgn(f)是符号函数。公式(2)表明 x(t) 的正频率和负频率分量经历相反的相位旋转,抑制冗余频谱对称性,并产生片面解析表示:其中z(t)为复解析信号, 表示与局部声能成比例的瞬时幅度包络, 表示跟踪共振和阻尼时间演化的瞬时相位。为了进一步表征振荡分量的动态变化,即瞬时相位的时间导数。可得到瞬时角频率,并反映由不同机械起源的缺陷引起的局部调制或共振频率偏移。例如,滚动型缺陷通常会在A(t)中引入周期性幅度调制,摩擦磨损会在 中产生连续的宽带相位波动,而碰撞故障会在A(t)和 中产生尖锐的相位跳变并伴有瞬态峰值。图2. 解析信号构造及复表示生成的机制图2(a)展示了复平面中方程(3)的几何解释。解析向量z(t)随时间旋转并形成一条螺旋轨迹,其在实轴和虚轴上的投影分别对应于x(t)和 。这种演化共同表征了声传播过程中的幅度衰减和相位延迟,并提供了更完整的瞬时信号动态表示。2.2基于Transformer的神经网络Transformer通过自注意力机制建立全局交互,并能够在整个序列上进行动态上下文聚合。其计算过程可总结如下,整体架构如图3所示。给定一个输入特征序列其中N表示序列长度(时间位置数量),D是特征维度,并且向每个token添加位置编码 以保留时间上的顺序信息。组合表示写为Transformer编码器由M个相同的层组成,每个层包含一个多头自注意力块和一个逐位置前馈网络,通过残差捷径和层归一化连接。对于第m层,计算可表示为其中 表示层归一化,以及m=1,2,...,M。MHSA(Multi-Head Self-Attention,多头自注意力)模块通过 的查询、键和值投影计算所有时间位置之间的成对相关性,并允许模型根据特征相似性自适应地处理相关时间步。然后FFN(Feed-Forward Network,前馈网络)对每个位置独立应用两次带有非线性激活的线性变换,并在特征空间中扩展模型的表示能力。通过堆叠的编码器层,Transformer逐步整合局部变化和长程时间依赖性,并形成分层表示 。图3 基于Transformer的神经网络架构3 提出的方法在本节中,将系统地阐述所提出的轻量级帧嵌入声学Transformer的架构。基于此架构,构建了一个用于基于声学的滚动轴承故障诊断的端到端ASFE-Transformer框架。该框架由三个核心模块组成: AAPR、AFEM和改进的Transformer编码器。以下小节将对每个组件进行详细描述。3.1 ASFE-Transformer架构所提出的ASFE-Transformer构成了一个专门为高效声学故障诊断设计的端到端框架。图4表明,在输入阶段,使用AAPR将真实声学信号转换为双通道解析表示,该表示产生捕获瞬时幅度和相位的同相和正交分量。然后,AFEM将连续波形划分为重叠的短时帧,并将每个帧线性投影到一个紧凑的嵌入向量中。得到的帧令牌与一个可学习的类别令牌和位置编码一起,形成一个序列表示。 这些帧令牌随后由改进的Transformer编码器进行处理,该编码器将低维MHSA与轻量级SD-GLU(Swish-Depthwise Gated Linear Unit,Swish深度门控线性单元)集成在一起。MHSA模块通过在整个声学序列中建立全局相关性来捕获帧之间的长程依赖性,而SD-GLU通过通道级门控和令牌轴深度卷积增强局部时间连续性。在整个编码器中应用层归一化和残差连接以稳定训练并确保高效的特征传播。最后,编码器输出的全局类别令牌聚合来自所有帧令牌的判别信息,并被馈送到线性分类器中以产生最终的故障类别。以下各节将对所提出框架中的每个组件进行深入说明。图4 ASFE-Transformer架构3.2 解析幅度-相位表示实值信号X(t)通过AAPR转换为其解析对应物。该转换产生一个正交分量 ,它相对于X(t)相位偏移90°,并形成一个复值表示。因此,声学信号可以表示为其中 和 分别表示实部和虚部。这种解析公式提供了幅度和相位演变的统一描述,并作为后续深度表示学习的输入基础。3.3声学帧嵌入模块在3.2节中获得的解析声学信号 通过AFEM转换为逐帧序列表示。这一步将波形重新构造为与Transformer的建模要求相匹配的短时声学单元,其详细架构如图5所示。图5 声学框架嵌入模块的框架考虑到轴承声学信号在短时间间隔内保持准平稳,应用长度为L, 且步长为R的滑动窗口将信号分割为重叠帧。对于第i帧,分割后的数据表示为其中 是起始索引,N=[(T-L)/R]+1表示总帧数。这种分割保留了与瞬态声学事件相关的局部幅度-相位结构。每个帧被展平并映射为一个D维嵌入,如下所示其中vec( )将2×L帧展开为一个2L维向量, 是可学习的投影参数。此操作将每个短时幅度和相位模式转换为具有统一特征维度的紧凑令牌。为了聚合用于故障分类的全局信息,在帧嵌入序列之前添加一个可学习的类别令牌 。得到的令牌序列表示为:其中, 用作占位符,用于在通过Transformer层后捕获整个信号的全局语义表示。为了编码时间顺序,将位置编码 添加到令牌序列中。如图所示,特定的位置向量 按元素添加到其相应的令牌中:其中P保留了每个帧的相对位置,并使Transformer能够对周期性冲击行为和传播引起的时间延迟进行建模。得到的H,从类别令牌嵌入 开始,用作后续编码器层的输入。通过将连续波形转换为紧凑的帧序列,AFEM有效地将序列长度从T减少到N=T/(L-R)。由于自注意力操作的计算复杂度与输入长度成二次方关系,即 ,N的减少导致理论复杂度与直接处理原始波形相比降低了约 。因此,AFEM不仅保留了短时声学特征,还显著提高了计算效率。3.4 Transformer编码器按照3.3节中描述的声学帧嵌入,序列表示 由一个改进的Transformer编码器处理,该编码器旨在对跨帧令牌的全局和局部依赖性进行建模。此编码器保留了标准Transformer的自注意力架构,同时引入了结构改进以更好地适应准平稳声学特征。图6说明了整个过程。每个编码器层接收输入 并产生输出 。该层由两个子模块组成:MHSA和前馈子网络,它们与残差连接和层归一化操作交错。MHSA机制通过计算所有令牌对之间的注意力权重来捕获帧令牌之间的全局相关性。与传统Transformer将嵌入维度D均匀分配给头不同,所提出的结构对查询、键和值映射采用固定的低维投影:其中 ,h是头的数量。每个头在维度为 和 的紧凑子空间上操作,这大大降低了注意力操作的二次复杂度。注意力分布的计算方式如下然后将上下文表示进行聚合,如下所示其中 将拼接后的头部输出投影回模型维度。此操作产生一个全局注意力表示,对声学帧之间的长程依赖关系进行编码。为了增强局部建模能力,前馈子网络被重新设计为SD-GLU,如图6下部所示。受注意力机制中的门控机制启发,SD-GLU引入了非线性调制和令牌级卷积上下文。该过程定义如下其中 是一个扩展投影,F是隐藏维度。激活采用SwiGLU公式,其中 表示Sigmoid线性单元函数,并确保平滑但响应灵敏的门控行为。 与传统的逐点前馈网络不同,所提出的SD-GLU在令牌维度上纳入了一维深度卷积:其中每个通道独立地与大小为k=5的内核进行卷积。从物理意义上讲,这个内核大小被设计为与故障脉冲的时间尺度对齐。鉴于每个帧令牌代表一个亚毫秒级的音素单元(0.3-0.8毫秒),5的内核大小将局部感受野扩展到大约1.5-4.0毫秒。这个持续时间有效地覆盖了故障诱发共振事件的特征演变(通常由起始、峰值和衰减阶段组成)。因此,深度卷积使模型能够捕捉相邻帧形成的声学音节的形态连续性,弥合离散令牌和连续故障瞬变之间的差距。然后将局部增强后的输出投影回嵌入空间:其中 , 表示来自前一个归一化的残差输入。这个深度卷积引入了一种声学感知归纳偏差,补充了MHSA的全局感受野,并使模型能够有效地捕捉轴承声学信号中固有的瞬态脉冲特征和周期性调制。在堆叠 个这样的编码器层之后,最终的类别令牌聚合来自所有帧令牌的判别信息,并被输入到线性分类器进行故障识别。图6 Transformer编码器的详细架构3.5所提出方法的整体诊断过程基于ASFE-Transformer,本文提出了一种用于滚动轴承声学诊断的轻量级框架。图7显示整个过程包括三个主要阶段。首先,从轴承试验台采集声学信号,并通过滑动窗口进行分割,以构建训练集、验证集和测试集。其次,通过AAPR获得解析后的声学信号,由声学帧嵌入模块转换为段帧序列表示,然后输入到轻量级改进的Transformer编码器进行有监督的故障分类。第三,将训练好的模型应用于测试样本,并从多个角度进行综合评估。图7 所提出方法的整体诊断过程4 实验分析本节首先阐述了各案例研究的实验平台、数据采集及实现细节,随后通过多维度性能分析,将 ASFE -Transformer与当前最先进的模型在诊断性能、计算效率以及不同噪声条件下的鲁棒性方面进行了对比评估。4.1方法描述与参数设置的比较为全面评估所提出方法的有效性和优越性,我们在两个基准数据集上进行了大量实验:一个采用抛物面声学镜自开发的轴承声学数据集,以及KAIST(Korea Advanced Institute of Science and Technology,韩国科学技术院)提供的轴承声学数据集。所有实验均在统一的计算环境中完成,所用软件包括PyTorch 2.1、 NVIDIA RTX 3060(12 GB内存)、Intel i5-12600KF处理器及32 GB内存。为了进行公平比较,所有模型在两个数据集上都使用相同的训练设置从头开始训练。初始学习率固定为0.001,并在整个训练过程中使用余弦退火调度器进行动态调整。模型参数使用Adam优化器进行优化。采用32的批量大小,每个模型训练50个轮次。为确保统计可靠性,所有实验独立重复进行五次,并报告平均性能。为便于重现性并清晰概述模型配置,表1总结了所提ASFE-Transformer的核心参数和实现细节。表1 所提出的ASFE-Transformer的核心参数和实现细节总结所提出的框架与一组全面的基线模型进行了比较,这些模型包括具有代表性的经典架构和近期的先进Transformer变体。这些被比较的模型涵盖了广泛的设计理念,从专注于局部特征提取的卷积增强网络到强调全局依赖性建模的先进注意力驱动架构,并建立了一个全面、平衡的评估基准。被比较的方法总结如下。(1) MA1DCNN:一个由堆叠的一维卷积和池化层组成的经典轻量级基线,它专注于通过固定的感受野和静态权重滤波来提取局部判别特征。(2) Transformer:最初为序列数据建模而开发的基于标准注意力的编码器,能够通过自注意力机制捕捉长程时间依赖性,而无需依赖卷积层或循环层。(3) ViT:一种用于声学分析的视觉Transformer架构的改编版本,将帧级声学片段视为视觉令牌,并通过逐块注意力操作捕捉全局上下文信息。(4) MCSwinT:一种多尺度Swin Transformer变体,通过移位窗口分区对局部和全局依赖性进行分层建模,并增强多分辨率特征表示。(5) CLFormer:一种对比轻量级Transformer,将紧凑的自注意力块与对比学习目标相结合,以提高在噪声数据条件下的特征可辨别性。(6) ConvFormer-NSE:一种卷积增强Transformer,结合了邻域自增强机制,以加强局部感受野交互,同时保持全局上下文感知。(7) LiConvFormer:一种轻量级卷积Transformer,在Transformer主干中嵌入共享的多尺度卷积模块,并在计算效率和诊断准确性之间实现了有效的权衡。4.2 案例一:基于抛物面端盖声镜的声学信号数据集4.2.1 实验平台和数据描述我们开发了一个基于声镜的轴承诊断平台来验证所提出的方法。图8显示实验装置由一台三相异步电动机、一台西门子变频器、一个声学故障轴承基座速度显示器和一个数据采集单元组成。测试轴承是一个LYCN/NU407圆柱滚子轴承,其详细结构参数总结在表2中。图8 实验平台及其示意图图9 不同类型故障的测试轴承表2 LYC N/NU407ECM的轴承参数图10 案例一中不同轴承状态下解析声学信号和相平面轨迹的可视化模拟典型的轴承退化状况,通过精密加工在内圈、滚动体和外圈中引入了三种局部故障,即磨损、点蚀和裂纹。图9表明,实验设计包括九种故障组合和一种正常状况,从而产生10种轴承状态。在测试过程中,主轴转速在900 r/min下保持恒定,径向载荷为5kN。以20Hz的采样率采集声学信号,每种轴承状态的记录持续时间为30秒。为确保数据一致性和严格评估,在模型输入之前实施了标准化的预处理流程。首先,通过Z分数归一化对原始声学信号进行标准化,以消除幅度缩放差异。其次,使用长度为1024个点、步长为512个点(50%重叠)的滑动窗口将归一化后的连续信号切片为离散的模型输入样本。最后,为防止时间依赖性偏差,在将生成的样本划分为训练集、验证集和测试集之前,对其进行随机打乱,每个类别分别包含300、100和200个样本,详见表3。为直观展示处理后数据的特征,图10可视化了经过预处理层后的10种轴承状态的双通道声学信号及其相应的相平面轨迹。表3 案例一中10种轴承数据的详细信息4.2.2 案例一的诊断结果与性能比较图11表明,在声学故障诊断任务的训练过程中,所有模型都呈现出明显的收敛趋势。值得注意的是,MA1DCNN基线表现出快速收敛和稳定的优化。大多数Transformer变体在20个epoch内实现了稳定优化,而标准Transformer收敛缓慢且残差损失较高,这表明其对声学特征的表示能力有限。CLFormer在训练和验证阶段也表现出不稳定的波动,泛化能力较弱。相比之下,其他模型,特别是改进的Transformer变体,收敛平稳,验证损失持续较低且准确率高,对声学数据表现出更好的适应性。为了进一步量化诊断性能和计算效率,评估结果列于表4和图12中。标准的1D - CNN基线在诊断性能方面表现出色,准确率达到99.60%,证实了卷积架构在特征提取方面的有效性。所有基于Transformer的模型在声学故障诊断任务中表现都很强劲,而提出的ASFE-Transformer总体准确率最高,达到99.75%,比基线Transformer高出5.4%。值得注意的是,ASFE-Transformer保持了轻量级设计,具有0.09M参数和13.66M FLOPs,展现出高计算效率。相比之下,ViT和MCSwinT达到了相当的准确率(分别为98.50%和99.55%),但需要更高的计算成本。模型复杂度和训练时间并没有严格的正相关关系。需要承认的是,上述计算指标主要关注神经网络推理。理论上,预处理阶段(希尔伯特变换和帧分割)会带来额外开销。然而,帧分割实际上是零成本的内存索引操作,对于1024的输入长度,希尔伯特变换仅增加约0.10 MFLOPs。与模型的推理成本相比,这种开销可以忽略不计(<1%),且比标准深度网络低几个数量级。此外,由于预处理不涉及可学习参数,存储优势(0.09M)不受影响。至关重要的是,这种参数减少代表了硬件部署的决定性阈值,而不仅仅是数值上的减少。资源受限的边缘设备(如Cortex-M系列微控制器)通常片上内存有限(通常<512 KB)。一个具有0.32M参数(在Float32中占用~1.28MD)的标准“轻量级”基线将超过此容量,需要进行耗能的片外内存访问。相比之下,ASFE - Transformer(约360 KB)完全适合片上SRAM(Static Random-Access Memory,静态随机存取存储器),实现“零拷贝”推理,消除内存访问瓶颈,确保工业物联网节点的实时响应能力。图13展示了八个基于Transformer的模型的混淆矩阵。标准Transformer在几个类别中表现出明显的误分类,而ViT和CLFormer有所改进但仍存在不完美的区分。相比之下,MA1DCNN、LiConvFormer、Convformer-NSE和提出的ASFE-Transformer显示出几乎对角线的矩阵,非对角线误差最小,在声学诊断中表现出高度可靠、一致的故障识别。图11 案例一中不同方法的准确率和损失曲线:(a) 训练损失,(b) 训练准确率,(c) 验证损失,(d) 验证准确率表4 案例一中不同方法的诊断性能和模型复杂度4.2.3 各类别中不同方法的性能分析为评估不同方法在各类故障分类中的性能表现,图13展示了八种基于Transformer模型的混淆矩阵。标准Transformer在多个类别中存在明显的误分类现象,而ViT和CLFormer虽有所改进,但区分能力仍不完善。相比之下,MA1DCNN、LiConvFormer、Convformer-NSE及本文提出的 ASFE -Transformer均呈现出近乎对角线的混淆矩阵,离对角线误差极小,且在声学诊断中展现出高度可靠且一致的故障识别能力。图12 基于5次重复试验的案例一中不同方法诊断性能比较的可视化图13 案例一中不同方法的混淆矩阵:(a) MA1DCNN,(b) Transformer,(c) ViT,(d) CLFomer,(e) MCSwinT,(f) Convfomer-NSE,(g) LiConvFormer,以及(h) ASFE-Transformer4.2.4 案例一中不同方法的噪声鲁棒性分析为系统评估不同干扰水平下模型的鲁棒性,向原始样本中注入加性高斯白噪声。注入噪声的强度由SNR(Signal-to-Noise Ratio,信噪比)控制,定义为:其中 和 分别表示原始信号的功率和添加噪声的功率。实验涵盖了从5dB到-5dB的信噪比水平范围。为消除特定噪声实现的随机性并确保统计可靠性,在每个信噪比水平下使用不同的随机种子重复评估5次,并将平均准确率作为最终结果报告。表5和图14展示了不同模型在不同噪声水平下的诊断鲁棒性。MA1DCNN基线在干净数据上表现良好,证实了一维卷积神经网络在理想条件下的有效性。然而,在信噪比=-5dB时其准确率降至94.10%,表明静态卷积特征对强干扰有些敏感。相比之下,ASFE-Transformer表现出卓越的稳定性,实现了98.33%的最高平均准确率,在信噪比=-5dB时仍保持96.85%。这表明与固定的局部卷积相比,内容自适应注意力机制对声学噪声具有更强的抵御能力。同时,标准Transformer在信噪比=-5dB时大幅降至79.48%,而ViT和CLFormer等其他变体对噪声干扰也表现出不同程度的敏感性。表5 不同方法在各种信噪比条件下的诊断准确率图14 各种方法在不同信噪比条件下的性能变化曲线基于稳健性分析,进一步评估了诊断性能与模型复杂度之间的关系。图15显示,所提出的ASFE-Transformer在保持0.09M参数的紧凑架构和13.66 M FLOP的同时,实现了最高的平均准确率(98.33%)。LiConvFormer获得了相当的准确率(98.13%),但复杂度略高。虽然MA1DCNN基线产生了具有竞争力的平均准确率97.29%,但它需要2.63 M参数。相比之下,MCSwinT需要大量的计算,但没有成比例的收益,而标准Transformer的准确率和效率较低。图15 平均准确率与模型复杂度之间的关系:(a) FLOPs与平均准确率;(b) 参数与平均准确率4.2.5 案例一中不同方法的T-SNE可视化为了进一步评估在严重噪声条件下的特征可分性,图16显示了在SNR =-5dB时不同模型的T-SNE可视化。标准Transformer和CLFormer表现出相当大的类别重叠,表明在噪声环境中的判别能力有限。ViT和MA1DCN 有适度的改进,但相邻类别之间仍存在边界模糊问题。相比之下,LiConvFormer,特别是所提出的ASFE-Transformer显示出紧凑、分离良好的聚类,并在声学故障诊断中展示了其强大的噪声鲁棒性和卓越的特征表示。图16 案例一中不同方法在SNR下的T-SNE可视化:(a) MA1DCNN (b) Transformer, (c) ViT, (d) CLFomer, (e) MCSwinT, (f) Convfomer-NSE, (g) LiConvFormer, 和 (h) ASFE-Transformer4.3 案例二:来自KAIST 的轴承声学数据集4.3.1 实验平台和数据描述由KAIST开发的轴承故障测试台由三相感应电动机、齿轮箱、两个轴承壳体、扭矩计以及用于负载控制的滞后制动器组成,其详细布局如图17所示。该系统在0、2和4 Nm三种不同负载条件下,以3010转/分钟的额定速度运行。利用放置在轴承壳体A附近的PCB378B02麦克风,以51.2 KHz的采样频率收集声学信号。该数据集包括四种轴承健康状态,即正常、内圈故障、外圈故障和滚动体故障。通过精密加工,人工引入了不同严重程度的故障,其中内外圈缺陷的裂纹尺寸分别为0.3和1.0毫米,如图18所示。每次声学记录持续60秒,以确保足够的时间分辨率,从而实现可靠的信号分析。仅利用来自KAIST轴承数据集的声学信号进行模型验证,而未考虑其他传感器模式。声学数据根据与案例一相同的程序进行预处理,确保信号分段、归一化和样本划分的一致性。表6总结了所使用声学数据的详细信息。类似地,图19展示了预处理的双通道信号和相位轨迹的可视化。图17 旋转机械试验台及其组件的布局图18 按裂纹尺寸的轴承:(a)内圈0.3毫米,(b)内圈1.0毫米,(c) 外圈0.3mm,和(d) 外圈1.0mm表6 案例二中五种类型轴承数据的详细信息图19 案例二中不同轴承状态下分析声学信号和相平面轨迹的可视化图20 案例二中不同方法的精度和损失曲线:(a)训练损失,(b)训练精度,(c)验证损失,以及(d)验证精度4.3.2案例二的诊断结果与性能比较图20展示了不同基于Transformer的模型在案例二中的训练与验证曲线,而表7与图21汇总了相应的定量结果。所有模型在50轮次内均实现了令人满意的收敛,但其性能差异显著。所提出的ASFE-Transformer取得了最高准确率99.90%,较基线Transformer提升4.2%,且保持最低计算成本,仅需0.24 M参数量及15.69 M浮点运算次数。LiConvFormer与MA1DCNN亦达到具有竞争力的准确率,但需更高计算资源。相比之下,CLFormer表现出较低准确率(87.50%)及不稳定收敛,表明其特征表征能力较弱。这些结果进一步证明了所提方法在声学故障识别中的卓越效率与诊断能力。4.3.3各类别中不同方法的性能分析图22展示了案例二不同基于Transformer模型的混淆矩阵。结果表明,所有模型都能有效区分主要的轴承故障类别,但其分类可靠性有所不同。标准Transformer和CLFormer表现出明显的误分类,特别是在内圈和外圈故障之间,并且特征辨别能力有限。ViT和MCSwinT改善了类别分离,但在相似故障类型中仍表现出轻微混淆。相比之下,MA1DCNN、LiConvFormer和所提出的ASFE-Transformer产生了几乎完美的对角矩阵。表7 案例二中不同方法的诊断性能和模型复杂度4.3.4 案例二中不同方法的噪声鲁棒性分析图21 基于5次重复试验的案例二中不同方法诊断性能比较的可视化图表8和图23展示了不同基于Transformer的模型在各种信噪比(SNR)下的诊断准确率。随着SNR降低,所有模型的性能都有不同程度的下降。所提出的ASFE-Transformer保持了最高的整体稳定性,平均准确率达到95.11%,在SNR=-5dB时仅有轻微下降。LiConvFormer也表现出很强的鲁棒性,平均超过94%。相比之下,标准Transformer和CLFormer在低SNR条件下准确率大幅下降,在SNR 时分别降至71.75%和65.00%。图22 案例二中不同方法的混淆矩阵:(a)MA1DCNN,(b)Transformer,(c)ViT,(d)CLFomer,(e)MCSwinT,(f)Convfomer-NSE,(g)LiConvFormer,以及(h)ASFE-Transformer图23 各种方法在不同SNR条件下的性能变化曲线表8 不同方法在各种SNR条件下的诊断准确率同样,图24展示了案例二中模型复杂度与诊断性能之间的关系。所提出的ASFE-Transformer在仅具有 0.09 M参数和13.66 M FLOP的情况下,在准确率(95.11%)和效率之间实现了最佳平衡。LiConvFormer在中等复杂度下也表现良好,而MCSwinT和ViT则产生了高计算成本且没有显著收益。标准Transformer和CLFormer显示出低准确率和效率。图24 平均准确率与模型复杂度之间的关系:(a)FLOP与平均准确率,以及(b)参数与平均准确率4.3.5 案例二中不同方法的T-SNE可视化为了评估在严重噪声条件下的特征分布,不同基于Transformer的模型的T-SNE可视化结果如图25所示。所有模型在故障类别之间都表现出一定程度的重叠,但分布紧凑性有所不同。标准Transformer和CLFormer显示出较大的类间混合,表明特征辨别能力较弱。ViT和MCSwinT实现了更清晰的边界,但仍存在部分重叠。相比之下,MA1DCNN、LiConvFormer和所提出的ASFE-Transformer显示出更紧凑且可区分的聚类。图25 案例二中不同方法在SNR下的T-SNE可视化:(a)MA1DCNN,(b)Transformer,(c)ViT,(d)CLFomer,(e)MCSwinT,(f)Convfomer-NSE,(g)LiConvFormer,以及(h)ASFE-Transformer5 讨论进一步分析所提出的ASFE-Transformer的配置属性,在本节中,详细研究分为三个部分:首先,进行消融研究以验证每个核心模块的有效性。其次,分析帧长度对模型性能和效率的影响。最后,对学习到的特征的可解释性进行可视化,以验证所提出的方法如何进一步促进瞬态故障线索的局部归因。5.1 所提出模块的有效性分析为了评估所提出架构中每个组件的贡献,设计了六种比较方法。方法1去除AAPR以验证双通道声学表示的作用,而方法2排除AFEM以评估帧级时间特征提取的有效性。方法3-5用三种常见的前馈结构(即MLP、GLU和SwiGLU)替换所提出的SD-GLU进行结构比较。为确保公平比较,所有这些变体的隐藏维度扩展率严格固定为r=2(导致隐藏维度为128)。这种严格控制确保任何观察到的性能差异仅归因于所提出模块的结构优势,而不是模型容量的变化。方法6对应于完整的ASFE-Transformer框架。表9 不同模块对诊断性能和复杂度影响的结果图26 不同模块对诊断性能影响的柱状图表9和图26表明,去除AAPR(方法1)使准确率从99.75%降至97.95%,而消除AFEM(方法2)则使其降至98.85% 。准确率分别下降1.8%和0.91%,证实了双通道声学表示和帧级时间嵌入在提高故障可分离性方面的关键作用。至关重要的是,这两个模块之间的相互作用是协同作用而非冗余作用。AAPR充当“特征增强器”,明确解耦复杂的调制信息,确保输入特征包含丰富的物理归纳偏差(例如,瞬时动态)。与此互补的是,AFEM充当“结构组织者”,将这些动态特征稳定为准平稳的帧令牌。这种组合建立了一种相互增强的“双流”表示:AAPR确保令牌包含有区分性的物理内容,而AFEM为有效的注意力建模提供必要的结构连贯性。在FFN变体中,所提出的SD-GLU实现了最高的诊断准确率(99.75%),比标准的SwiGLU(方法5)高出2.15%,同时保持了几乎相同的计算成本。这一结果表明,纳入轻量级深度卷积有效地增强了局部令牌交互和特征辨别能力,而不会大幅增加模型复杂性。表10 不同帧长度对诊断性能和复杂性的影响5.2 帧长度的影响分析为研究时间粒度对模型表示和计算效率的影响,在AFEM中通过改变帧长度L进行了分析。在重叠率固定为0.5的情况下,增加L会减少总帧数P=2T/L-1并降低注意力成本 ,但会增大嵌入和FFN计算量。表10显示,当L=16时,所提出的模型实现了99.75%的最高诊断准确率,具有中等复杂度参数(13.66M FLOPs)和高吞吐量(1594.31样本/秒)。从物理角度来看,最佳帧长度(L=16)对应于大约0.31-0.80ms的持续时间,这取决于采样率。鉴于故障引起的结构共振通常表现出多毫秒的衰减,这种亚毫秒级粒度有效地起到了组成音素的作用,在单个脉冲内捕获瞬时上升沿和相位调制。这种精确的分辨率减轻了较长帧(例如L=48,≈2.4ms)中固有的时间模糊性,而较长帧有将高频判别细节平均化的风险。定量比较证实了这种物理特性。极短的帧(例如L=6)限制了时间上下文,削弱了特征辨别能力并将准确率降低到97.20%。相反,延长帧长度(L≥40)会增加模型复杂度(0.33-0.44M参数)和计算成本(17.18-18.51M FLOPs),但不会提高准确率;实际上由于信息冗余和有效帧交互减少,准确率下降到了98.65%。值得注意的是,随着L增加,吞吐量从1549提高到了1760样本/秒,这表明推理延迟与理论计算复杂度并非严格正相关。5.3 可解释性分析为了更好地理解所提出模型的行为,应用Grad-CAM++来可视化所提出的ASFE-Transformer在真实(AC)和虚拟(PC)声学通道上对10种故障类别的时间注意力。在图27中,突出显示的区域对应于具有高诊断重要性的时间段。通过将波形分割成短时声学帧,该模型使Grad-CAM++能够在特定帧内精确地定位瞬态故障脉冲并增强时间可解释性。该模型始终专注于包含故障引起的脉冲的瞬态、高能区域,同时抑制以噪声为主的段。两个通道都表现出互补的激活模式,并证实基于希尔伯特的双通道表示使网络能够更有效地捕获幅度和相位信息。这些结果表明,所提出的模型不仅实现了准确的故障识别,还提供了清晰的时间可解释性。图27 使用Grad - CAM++对10个随机样本的可视化:(a) NOR,(b)INC,(c)INP,(d)INW,(e)BAC,(f)BAP,(g)BAW,(h)ORC,(i)ORP,和(j)ORW6 结论为了解决表征声学信号的短时非平稳性与保持计算效率之间的矛盾,本研究受音素处理范式启发,提出了一种轻量化 ASFE-Transformer。具体而言,该模型通过 AAPR 表征声学信号的瞬时演化过程,并显式分离其中的复杂调制成分,从而提升对非平稳声学特征的刻画能力。在此基础上,AFEM 将连续波形离散为准平稳的帧级标记,在保持瞬态故障线索结构完整性的同时,有效稳定特征学习过程。此外,所提出的 SD-GLU 弥补了标准 Transformer 局部归纳偏置不足的问题,使编码器能够兼顾全局依赖建模与局部形态细化。综合验证结果表明,该设计使模型优于现有先进基线方法,并在仅 0.09 M 参数量的超轻量化规模下分别取得 99.75% 和 99.90% 的诊断准确率,因而高度适用于资源受限边缘设备上的实时部署,可解释性进一步证实了模型能够精准关注由故障诱发的判别性声学冲击片段。未来的研究将通过开发自适应帧分割策略,将该框架扩展到变速工况,该策略能使嵌入粒度与瞬时旋转运动学动态同步,从而减轻时间扭曲效应,并在非平稳条件下保持特征不变性。此外,虽然本研究中使用的AWGN(Additive White Gaussian Noise,加性高斯白噪声)是一个标准基准,但需要认识到,实际工业声学环境通常具有非平稳、“有色”噪声和谐波干扰的特征。因此,后续研究的一个关键方向是使用现场工业数据验证模型的鲁棒性。这一阶段将专注于通过实证验证“音素启发式”架构在复杂运行环境中区分故障瞬态的形态特征与结构化背景干扰方面的理论优势。7 代码可用性为了促进重现性和进一步的研究,我们提供了提出的ASFE-Transformer的完整实施代码:https://github.com/ Lab-of-AMFD/ASFE-Transformer。编辑:赵栓栓校核:李正平、陈凯歌、曹希铭、赵学功、白亮、任超、海洋、陈宇航、Kira、Tina、王金、赵诚、肖鑫鑫、张优该文资料搜集自网络,仅用作学术分享,不做商业用途,若侵权,后台联系小编进行删除来源:故障诊断与python学习

    未登录
    还没有评论
    课程
    培训
    服务
    行家
    VIP会员 学习计划 福利任务
    下载APP
    联系我们
    帮助与反馈