首页/文章/ 详情

故障诊断大模型 | 可解释的机器故障诊断大型语言模型(下)

3月前浏览991

    接上篇(故障诊断大模型 | 可解释的机器故障诊断大型语言模型(上)),论文提出了一种创新的FD-LLM框架,将大语言模型(LLMs)应用于可解释故障诊断。通过设计字符串标记化机制,将振动信号的FFT和包络频谱编码为文本序列,使LLMs能够直接处理传感器数据。FD-LLM包含两个互补的训练范式:分类导向方法用于量化评估诊断性能,频谱语言建模方法则生成人类可读的故障解释。在多个公开轴承数据集上的实验表明,Llama3系列模型在有效性、适应性、鲁棒性和少样本泛化性方面均表现优异,特别是在频谱建模任务中,模型能够识别特征频率、谐波和边带,并生成准确的诊断结论。下篇主要介绍实验和讨论,更多实验细节可查看论文附录。

    论文基本信息

    论文题目:

    Large language models for explainable fault diagnosis of machines

    论文日期:2025

    论文链接:

    https://doi.org/10.1016/j.engappai.2025.113131

    作者:

    Hamzah A.A.M. Qaid (a) , Bo Zhang (b) , Shuai Su (b), Dan Li (c) , See-Kiong Ng (d) , Wei Li (b,∗)

    a: School of Mechatronic Engineering, China University of Mining and Technology, Xuzhou, 221116, China

    b: School of Computer Science and Technology/School of Artificial Intelligence, China University of Mining and Technology, Xuzhou 221116, China 

    c: School of Software Engineering, Sun Yat-Sen University, Zhuhai 519080, China

    d: Institute of Data Science, National University of Singapore, Singapore 117602, Singapore

    作者简介:

    李伟,教授,中国矿业大学城市应急技术装备研究中心主任。(https://faculty.cumt.edu.cn/LW12345678/zh_CN/index.htm)

    目录

    摘要

    1. 引言

    2. 相关工作

        2.1 智能故障诊断

        2.2 基于大语言模型的时间序列数据

    3. 方法

        3.1 FD-LLM框架

            3.1.1 分类导向训练方法

            3.1.2 上下文感知频谱语言建模方法

        3.2 数据预处理

            3.2.1 FFT预处理

            3.2.2 统计摘要

            3.2.3 变分模态分解

            3.2.4 时间序列数据编码

            3.2.5 指令微调

    4. 实验

        4.1 数据集与评估任务

            4.1.1 数据集

            4.1.2 评估任务

        4.2 模型

        4.3 设置

        4.4 评估指标

        4.5 结果与讨论

            4.5.1 基于分类导向的评估

            4.5.2 上下文感知频谱语言建模评估

    5. 结论

    4.实验

    4.1.数据集与评估任务

    4.1.1.Datasets

    我们采用了四个公开可用的轴承数据集,这些数据集同时涵盖了受控环境与真实工况下的故障状态:

    CWRU:凯斯西储大学数据集(CWRU,2024)包含来自轴承的振动信号,这些轴承在内圈、外圈及滚动体处均存在人工诱发的缺陷(缺陷直径分别为0.007英寸、0.014英寸和0.021英寸)。信号采集于驱动端(DE)与风扇端(FE),测试涵盖四种载荷条件(0–3马力)及1730–1797转/分钟转速范围,采样率分别为12kHz和48kHz。本研究采用来自DE和FE端的12kHz数据。

    MFPT:机械故障预防技术数据集(Bech-hoefer,2025)提供了在不同载荷条件下正常状态、内圈故障及外圈故障的单通道振动信号。数据采样频率为97.656kHz(包含三种正常状态和三种外圈故障,载荷270磅,频率25Hz)以及48.9328kHz(包含七种内圈故障和七种外圈故障,载荷范围25–300磅)。本研究未包含97.656kHz处的三个外圈信号。

    XJTU-SY:XJTU-SY数据集(Wang等人,2020)由西安交通大学与Sumyoung科技有限公司联合开发,属于运行至失效型数据集,包含在三种工况(12kN–2100rpm、11kN–2250rpm、10kN–2400rpm)下测试的15个轴承样本,采样率为25.6kHz。该数据集仅使用水平振动信号。

    PU:帕德博恩大学数据集(Lessmeier等人,2016)包含32个轴承样本:其中6个为健康轴承,12个带有人工诱发故障(7个外圈轴承,5个内圈轴承),另有14个通过加速寿命试验获得真实故障样本,所有样本均以64kHz采样率采集。该数据集定义了两个子集:PU-art(人工诱发故障样本)和PU-real(运行至失效信号样本)。

    CWRU和MFPT数据集提供了来自受控实验室环境、带有人工诱导故障的高质量数据;而XJTU-SY数据集则通过运行至失效实验反映了实际环境中的性能退化情况。PU数据集结合了这两种数据类型,可同时评估两种故障类型。表2汇总了各数据集及其运行条件与健康状态(正常、IRF、ORF、REF)。其中90%的数据用于训练,10%用于测试。符号0HP–3HP表示负载水平;DE和FE分别指驱动端和风扇端。设置35Hz12kN表示转速为35Hz、径向力为12kN;而N09_M07_F10则对应900rpm转速、0.7Nm扭矩及1000N径向力。

    所有信号均按第3.2节所述方法进行预处理。在 FFT 分析和统计分析中,每个时域信号均被分割为长度为2048个样本、重叠率为50%的片段;统计预处理仅应用于驱动端(CWRU -DE)和风扇端(CWRU -FE)信号,所得样本数量与经 FFT 处理的数据一致。对于频谱样本,其片段长度对应1秒数据(由各数据集的采样率决定),并采用90%的重叠率。尽管该重叠率较高,但受限于信号持续时间较短及片段长度为1秒的特点,既避免了过度冗余,又能确保足够的采样密度以捕捉瞬态频谱特征。

    为提取适用于频谱-文本编码的包络谱,所有数据集中的分段信号均采用VMD变换处理,预设模态数       、惩罚因子       。对于PU数据集,则使用       ,并在VMD前应用低通滤波器以抑制噪声干扰(尤其是电源相关的频率成分)。虽然先前研究通常采用5–8个模态(Li等,2020; Zhang等,2017a),但我们选择10个模态以确保额外频率成分(如边带和谐波)得到充分保留。这一选择对维持所提出的频谱-文本编码所需的结构化频谱信息至关重要——该编码依赖峰的相对间距和幅度与文本诊断特征相匹配。惩罚因子        选取于常见报告范围(1000–2000)内,以确保模态分离稳定。所有参数设置均通过跨数据集实验验证:对于内部和外部故障信号,采用第4、5、6个VMD模态重建滤波信号,确保提取的频谱保留仅使用单一模态时常缺失的边带和谐波;而对于球形故障信号,则使用第1和第2个模态。

    表2 轴承数据集摘要

     

    4.1.2.评估任务

    分类导向型方法:该方法涵盖以下任务。

    有效性评估:我们利用FFT和CWRU数据集中的统计样本,对四种开源大语言模型(LLM)的有效性进行了验证。CWRU数据集包含高质量的振动信号,为评估这些模型并将其性能与传统基于机器学习(ML)和深度学习(DL)的方法进行对比提供了可靠依据。

    适应性评估:采用零样本评估方法来检验大语言模型在不同运行环境及组件条件下的适应能力。所有模型均在0HPDE子集(见表3)上训练,并按以下方式评估:

    (1)子集内评估: 为在相同运行条件下评估性能,按照标准故障诊断实验设置,选取10%的0HPDE样本进行评估;

    (2)跨运行条件: 为评估同一机械部件(驱动端)在不同负载和转速条件下的适应性,模型分别在1HPDE、2HPDE和3HPDE子集上进行测试;

    (3)组件间评估: 为评估模型在不同机器组件间的可迁移性,所有模型均在风扇端的0HPFE和1HPFE子集上进行评估。

    稳健性评估:为降低计算开销并避免重复实验,仅选择性能最佳的模型用于后续的稳健性及评估任务。该评估旨在检验模型对信号质量变化的适应能力。首先,在0HPDE子集上通过引入模拟噪声(如高斯噪声、拉普拉斯噪声等),设置信噪比(SNR)从-9dB至9dB不等来测试稳健性;随后将评估扩展至其他数据集,并采用FFT和频谱表示法,以进一步验证模型在不同信号特性下的性能一致性。

    少样本学习环境下的泛化能力评估:本研究在少样本学习场景下评估模型的泛化性能。具体而言,模型首先在CWRU数据集上进行预训练,随后利用有限数量的标注样本分别适配MFPT、XJTU-SY、PU-art及PU-real数据集。对于MFPT数据集,少样本适应阶段包含70个故障样本(每种故障类型各35个)和30个正常样本;XJTU-SY数据集仅包含IRF和ORF两类样本,每个类别从不同运行条件下选取50个样本以确保数据多样性;PU-art数据集采用两种配置:(1)包含100个样本且类别分布与MFPT一致的子集;(2)包含180个IRF/ORF样本和70个正常样本的250样本子集;PU-real数据集则使用250个样本,其类别分布与PU-art配置完全一致。

    表3 适应性研究(CWRU)的数据集配置:统计处理样本数量与FFT样本数量相同。

    上下文感知频谱语言建模: 该方法的核心在于开发一种故障诊断大型语言模型(FDllm),该模型能够遵循指令并解析故障信号的频谱特征,生成基于文本的响应。与依赖特定模态编码器的方法不同,我们的编码方法保留了振动信号的频谱特性,从而能够生成包含频谱数据及对应观测结果的样本集。在本任务中,仅使用来自所有数据集的频谱样本。

    4.2.模型

    机器学习算法: 我们采用SVM——一种广泛应用于识别齿轮、滚动轴承等旋转机械部件健康状态的机器学习方法。

    深度学习算法: WDCNN(Zhang等人,2017b)经过轻微修改后被采用:首个卷积核的尺寸从64缩至16,步长减至2以匹配我们数据集中的样本长度。1DCNN-SeNet(Xu等人,2024)是另一基准模型,旨在提取关键方位特征并自适应地加权重要通道以辅助故障诊断。

    开源大语言模型: 我们选取了四种开源大语言模型——Llama3-8B、Llama3-8B-Instruct、Qwen1.5-7B和Mistral-7B,以构建涵盖不同模型家族的代表性基准。在筛选时,其对时间序列光谱数据的性能尚未明确。Mistral被纳入考量是因为其在零样本场景下的异常检测研究中已展现出显著潜力(Alnegheimish等,2024);而Qwen则因其在工业应用中的日益普及而被选中。此外,还有较小规模的Llama模型可供选择。Llama3.2-1B-Instruct和Llama3.2-3B-Instruct用于评估小型模型相较于大型模型的泛化能力。

    4.3.设置

    由于机器学习(ML)和深度学习(DL)算法仅能接收数值输入,我们仅在ML模型中使用统计数据,在DL模型中则使用FFT数据。这种选择符合最佳实践,充分发挥了两种方法的优势——尽管两种模型均可处理任一数据集。相比之下,大语言模型(LLM)能够同时整合文本数据与振动数据,包括统计量、编码后的FFT向量或包络谱。

    所有实验均在配备NVIDIA A10 GPU的设备上进行,训练周期固定为3个epoch。为实现参数高效的微调,我们采用LoRA优化算法(秩数为8、缩放因子为16),覆盖Transformer模型的所有主要线性层(包括注意力机制和多层感知机(MLP)投影层)。训练时每个设备使用2样本批量大小,并采用两步梯度累积策略;优化算法选用AdamW,配合余弦学习率调度器,初始学习率为      。为提升计算效率,模型训练采用4位量化和混合精度(bfloat16)格式。推理阶段所有模型均以4位量化格式运行,既保持与训练过程的一致性,又显著降低GPU内存占用同时保证诊断准确率。该配置使得单块NVIDIA RTX4090(24GB显存)即可实现近乎实时的推理,在资源受限环境下仍能确保稳定性能。

    4.4.评估指标

    在分类任务中,我们采用准确率、F1分数、特异性及G均值来量化诊断性能。为评估上下文感知谱建模能力,采用了RAGAS框架(Es等人,2025),该框架可衡量信息保真度、语义相似性及答案正确性。为进一步量化语言质量,我们使用BLEU和Rouge指标,这些指标能够反映生成解释与参考解释之间的n元语法重叠度及结构对齐程度。

    除了事实准确性外,我们还采用“LLM-as-a-Judge”范式(Zheng等人,2023)来评估解释的合理性。我们要求Qwen-Max针对每个生成的解释相对于真实值给出一个合理性评分(1–5分),其中1表示完全不可信,5表示高度可信。关于评估过程的更多细节详见附录D。图D.1中的提示指令明确同时考虑语言连贯性和语义一致性,并将temperature参数固定为0.0以确保可重复性,从而强制输出结构化结果。已有研究表明,像GPT-4这样的强效LLM模型能与人类偏好达成超过80%的一致性,其一致性水平与人类自身判断相当(Zheng等人,2023)。我们的方法借鉴了这些研究成果,提供了一种可扩展、可解释且有文献支持的人类评估替代方案——而传统人工评估往往成本高昂且劳动密集。

    最后,为确保解释不仅流畅且具有诊断实用性,我们从生成的输出结果中提取故障预测,并采用与上述相同的分类指标对其进行评估。

    4.5.结果与讨论

    4.5.1.基于分类导向的评估方法

    (1)有效性评估

    表4展示了所有模型使用来自驱动端的统计处理数据(CWRUst-DE)和FFT处理数据(CWRUfft-DE),以及来自风扇端的CWRUst-FE和CWRUfft-FE所获得的评估结果。

    经统计处理后的数据: Llama3和Llama3-instruct在CWRUst-DE数据集上均取得了令人满意的结果,准确率分别为94.80%和95.21%;然而在CWRUst-FE数据集上,两种模型的性能均出现下降,准确率分别降低了约10%和5%。相比之下,Qwen1.5和Mistral在两个数据集上均表现出持续较低的准确率,表明其从统计处理后的输入中诊断故障的能力有限。以SVM为代表的机器学习方法在CWRUst-DE数据集上表现最佳,但在CWRUst-FE数据集上准确率有所下降。

    表4 使用CWRU数据集进行有效性评估的结果。

     

    FFT处理后的数据: 在CWRUfft-DE和CWRUfft-FE数据集上评估时,Llama3和Llama3-instruct实现了接近100%的故障诊断准确率;相反,Qwen1.5和Mistral表现持续不佳,进一步凸显了其处理数值数据时的局限性;相比之下,WDCNN和1DCNN-SeNet则取得了具有竞争力的结果。

    基于LLama3的模型在统计表示和FFT表示层面均展现出优于其他大语言模型的诊断准确性,其中使用FFT输入时能获得最一致的结果。其卓越性能源于高效的数值分词技术——将数字序列归并为紧凑的分词单元(例如‘‘314,31415’’ → ‘‘314’’, ‘‘’’,‘‘314’’,‘‘15’’)。相比之下,Mistral和Qwen1.5的准确率较低,主要原因是低效的分词方式将数值拆分为多个分词单元(例如‘‘314’’ → ‘‘3’’, ‘‘1’’, ‘‘4’’),这种拆分会增加输入序列长度,从而降低诊断性能。值得注意的是,由于分词器词汇表差异以及对文本指令、空格和数值边界处理方式的不同,Mistral生成的分词单元数量略多于Qwen1.5。

    为验证分词效果的差异,我们使用各模型的分词器对0HPDE子集中的80个 FFT 样本(每类20个)进行了词元计数分析,结果汇总于图3(a)。Llama3模型生成的词元数量最少:在         时平均为2248.75,在         时为2468.50;Qwen1.5分别平均为2802(        )和5021.5(        );Mistral则分别为3294.5(        )和5464(        )。较低的词元数量与较高的诊断准确率之间存在明显相关性:Llama3系列模型在         时达到完美准确率(100%),在         时准确率为93.52%至94.12%。各类别的G均值评分(图3(b))进一步表明Llama3在所有故障类型中均具有高灵敏度和特异性。Qwen1.5在某些故障类型上表现尚可,但在       时性能下降;而Mistral在正常类别中表现优异,这可能源于正常条件下故障特征较为单一、幅度较小,且经过归一化(如缩放至[0,1]区间)和量化处理后进一步简化,从而减少了词元数量并缓解了Mistral的分词效率问题。

     

    图3. 分词分析

    (2)适应性评估

    表5和表6分别展示了所有模型使用统计数据与FFT处理数据得出的评估结果。

    经统计处理的数据: 如表5所示,评估结果表明所测试模型在不同目标领域中均表现出较低的适应性。这很可能源于统计表示方法的本质——其仅能捕捉振动信号的整体特性,而可能忽略对适应不同运行条件至关重要的细微变化或局部模式。因此,评估结果表明统计表示方法并未提升大语言模型的泛化能力。

    表5 基于统计处理数据的模型适应性评估结果

     

    FFT处理数据:表6汇总了FFT数据的评估结果。Llama模型展现出强大的泛化能力,能够适应未见过的操作场景并保持高性能表现。值得注意的是,较小规模的变体(Llama3.2-1B-Instruct和Llama3.2-Instruct)取得了与大型模型相当的结果,表明紧凑架构在经过适当微调后能有效捕捉特征谱模式。相比之下,Qwen1.5在多样化场景下的性能显著下降,而Mistral则持续表现欠佳;WDCNN和IDCNN-SENet虽取得竞争力结果但适应性有限(这与非大语言模型基线的表现预期一致)。跨组件评估(如0HPFE和1HPFE)显示所有模型均出现明显性能下滑,凸显其因领域变化导致对新机械部件的泛化能力较差。

    表6 基于FFT处理数据的模型适应性评估结果

     

    图4提供了更深入的分析结果,展示了大语言模型(LLM)的各类故障G均值分布。鉴于不同Llama变体表现相近,本文仅报告规模较大的模型数据。在跨条件评估中,两种Llama模型均能以高分识别所有故障类型,表明其对同一组件下不同负载和运行速度条件具有强泛化能力。Qwen1.5-7B表现出竞争力较强的诊断性能;但随着领域差异增大,其各故障类别的诊断表现趋于失衡。相比之下,Mistral-7B在驱动端的适应性明显较差:尽管能稳定识别正常状态,其各故障类别的G均值常低于0.60。在跨组件评估中,所有模型性能均显著下降,反映出明显的领域偏移现象——Llama模型对正常状态仍保持完美识别能力,但在故障类别(尤其是REF类,G均值小于0.25)上表现不佳;Qwen的IRF检测能力中等(约0.75–0.83),但在ORF和REF类上的表现欠佳;而Mistral在所有故障类别上均取得均衡但一般的诊断效果(约0.48–0.59)。这些结果表明,组件几何形状和转速的差异会导致光谱故障特征出现显著偏差,从而引起所有模型诊断性能的明显下降。

     

    图4. 不同大语言模型在不同运行条件及跨组件迁移设置下的各类别G-means性能表现。

    (3)稳健性评估

    图5展示了该模型在0HPDE子集上针对高斯噪声、布朗噪声、拉普拉斯噪声及紫噪声(信噪比范围为–9 dB至9 dB)的鲁棒性评估结果。

    该模型在所有噪声类型和信噪比水平下均保持高度稳健性。在布朗噪声条件下,模型在所有信噪比下均实现完美精度,表明其对低频失真具有强抗干扰能力;在高斯噪声和拉普拉斯噪声中,性能随信噪比增加而稳步提升,从0dB起即可达到完全精度。紫噪声在低信噪比下会导致性能显著下降(–9dB时为65%),这很可能源于其高频干扰效应,但模型能快速恢复,在3dB起即实现100%精度。这些结果充分证明该模型能在多种噪声环境下保持稳定性能。值得注意的是,在中高信噪比范围内模型能迅速收敛至完美精度,凸显了其出色的鲁棒性及在噪声环境中的实际应用潜力(详见表7)。

     

    图5. Llama3-8B-instruct在含模拟噪声的0HPDE子集下的鲁棒性评估。

    表7 在不同信噪比(SNR)水平及不同噪声类型下,数据集0HPDE的性能指标。

     

    表8汇总了Llama3-8B-instruct模型在所有数据集上使用FFT和频谱样本时的性能表现。在FFT表示框架下,该模型在大多数场景中均展现出稳健的诊断性能。该方法在PU-art和PU-real数据集上的效果有限;相比之下,包络谱输入能显著提升所有数据集的性能表现,尤其在PU-art和PU-real数据集上效果尤为明显。然而对于PU-real数据集而言仍存在挑战:在不同运行条件下,内外层故障频率高度接近,加之电源谐波干扰的影响,使得准确分类变得复杂。

    表8 使用FFT和光谱样本对所有数据集进行Llama3-8B-instruct模型评估的结果。

     

    此外,为更好地理解我们的研究结果,我们将FD-LLM与DiagLLM(Wang等人,2025)进行对比——后者是一种基于大语言模型的新方法,采用多模态模型(Qwen2-VL-7B)并以光谱图像作为输入。DiagLLM在XJTU-SY数据集上的准确率达到98.44%,在PU-art和PU-real两个子集的综合测试中达到88.51%;但其实验均在相对有限的数据条件下进行。相比之下,我们的模型是在多个公开可用的数据集上训练和评估的,展现出更优的泛化能力。该模型在使用 FFT 和频谱表示两种方式时均展现出相当或更高的诊断准确率,在 XJTU -SY和PU-art数据集上达到100%准确率,在PU-real数据集上达到89.79%准确率。与依赖视觉编码器和多模态融合的DiagLLM不同,FD-LLM通过基于字符串的分词技术将频谱数据直接编码为文本形式。这种设计既保留了谐波、边带等关键频域特征,又为大语言模型提供了更自然的输入格式,使其能够直接以文本序列形式处理频谱信息。

    (4)基于少样本学习的泛化能力评估

    为评估Llama3-8B-instruct模型在少样本学习场景下的泛化能力,我们在CWRU数据集上训练该模型,并经过少样本学习阶段后,在MFPT、XJTU-SY、PU-art和PU-real数据集上进行测试。如表9所示,尽管每个数据集仅提供100个样本,该模型仍能在大多数数据集上展现出强大的泛化能力。然而,在PU-real数据集上的评估结果表明,由于该数据集包含复杂且重叠的故障模式,模型表现存在挑战。总体而言,虽然通过少样本学习可以有效缓解对大量标注数据的依赖需求,但这种优势在将知识从简单数据分布迁移至更复杂数据分布时可能受到限制。

    表9 利用少样本学习的频谱样本对Llama3-8B-instruct模型进行泛化能力评估。

     

    4.5.2.上下文感知频谱语言建模评估:

    对Llama3-8B-Instruct模型进行微调以开发故障检测能力。该诊断语言模型被称为FDllm。对其评估涵盖四个互补维度:(i)利用RAGAS指标衡量与语谱上下文的事实一致性;(ii)通过BLEU和Ro-uge分数评估解释质量;(iii)遵循“LLM-as-a-Judge”范式进行合理性验证;(iv)故障预测的分类准确率。这一多维度框架共同验证了FDllm的诊断可靠性和可解释性。

    表10汇总了实验结果。FDllm在RAGAS任务中实现了95.7%的保真度评分,表明生成的回答与底层光谱证据具有高度事实一致性。较高的语义相似度(95.1%)和回答正确率(94.0%)进一步证实FDllm能准确捕捉光谱特征,且未引入虚假或无关内容。

    表10 FDllm在谱系建模任务中的评估结果。评估指标涵盖事实一致性、文本生成质量、合理性及分类性能。

     

    此外,该模型生成的解释与参考文本之间表现出高度一致性,这体现在较高的BLEU分数和Rouge分数上,这些指标均反映了强大的语义连贯性和语言质量。

    为评估合理性,由独立的基于大语言模型(LLM)的评审专家对生成的解释进行了语言连贯性和领域合理性评估。FDllm获得平均合理性得分为89.2%,标准差为0.130,表明大多数解释在技术层面具有连贯性且在语境上站得住脚。

    在诊断性能方面,FDllm实现了98.82%的准确率和F1值,证实了其将光谱模式与相应故障状态有效关联的强大能力。

    FDllm采用的谱-语言建模方法能够提供可解释且基于上下文的故障诊断结果,这正是工业维护领域的关键需求——工程师需要透明的预测与推理依据。与传统深度学习(DL)方法(Li 等,2023; Brito 等,2023)虽能实现高精度但因表示方式不透明而缺乏可解释性不同,FDllm利用语言建模生成人类可读的解释说明。这些解释明确将谐波、边带及特征峰等频谱特征与特定故障类型(如内圈缺陷、外圈缺陷及滚动体缺陷)关联起来,提供清晰的因果关系解析。相比之下,梯度加权类激活映射(Grad-CAM)和夏普利加性解释(Shap)等事后可解释人工智能(XAI)技术仅生成抽象的显著性图,需深厚的专业知识支撑,且鲜少提供直接的机制理解。通过 RAGAS 指标、BLEU/rouge分数以及LLM-as-a-Judge框架进行定量评估证实,FDllm的解释既与频谱证据事实相符,又具有语义连贯性。通过融合分类与推理功能,FDllm提升了系统透明度、增强了操作人员信任度并优化了决策支持能力,使维护人员能够将诊断结论追溯至可解释的频谱特征。此外,其基于大语言模型(LLM)的推理机制能够实现跨不同组件和运行条件的灵活适配,有效克服传统 XAI 方法存在的任务特定局限性。未来研究可通过开发更多样化的多模态数据集并优化模型效率,进一步提升解释的丰富性,以满足更广泛的工业应用场景需求。

    为实现信号加载、预处理及频谱提取的自动化,并支持交互式诊断对话,FDllm被部署在基于代理的框架中。图6展示了两个代表性的示例,演示了FDllm的诊断性能:第一个示例呈现了对应外圈故障的简单频谱,仅观测到80Hz处的外圈故障频率及其谐波;第二个示例则展示了118Hz处内圈故障的复杂频谱,包含旋转频率、内圈故障频率、其谐波以及相关边带信号。

    在第一个频谱中,主故障频率出现在80Hz处,振幅为192。然而,FDllm识别出附近一个位于81.12Hz、振幅为39的峰值,这与理论上的外圈故障频率一致。尽管存在这一差异,FDllm仍能准确解析与故障相关的谐波模式,并精确判断轴承健康状况。在第二个案例中,FDllm成功解析了该频谱:识别出主故障频率为118Hz,边带频率分别为93Hz和143Hz,谐波频率分别为236Hz和354Hz。系统恰当地忽略了旋转频率,因其对诊断结果无贡献。在这两种情况下,FDllm均提供了正确且可靠的故障诊断结果。

    图6.使用外圈和内圈故障信号的示例  

    5.结论

    本研究提出了FD-LLM这一创新框架,该框架通过两种训练范式(仅分类范式与频谱-语言建模范式)将振动信号与大语言模型(LLMs)相结合用于故障诊断。结果表明,当结合FFT和频谱表示时,LLMs在基于振动的故障诊断中具有显著优势。研究结果从三个维度展开讨论:有效性与适应性、鲁棒性与泛化能力以及可解释性。

    有效性与适应性。 基于Llama3的模型在性能上优于Qwen1.5和Mistral等竞争对手,这得益于其高效的数值分词技术能够保留频谱信息;而竞争模型中的过度分词则会降低性能。虽然FFT表示有助于增强域内知识迁移能力,但由于传感器位置和机械结构存在差异,跨组件泛化仍面临挑战。未来研究可探索采用更大的上下文窗口以解决Mistral和Qwen等模型存在的数据碎片问题,并整合双重表示(如统计表示与FFT表示)以提升模型的适应性。

    鲁棒性与少样本泛化能力。 Llama3-8B-instruct模型在低信噪比条件下仍能保持稳健性能,并在多种数据集上展现出强大的少样本泛化能力。该模型仅需少量标注数据即可实现高准确率,显著降低了对大型标注数据集的依赖。

    可解释性。 谱-语言建模技术使FDllm能够将复杂的振动数据转化为可解读且语义丰富的诊断报告。然而,有限的多模态数据集限制了深度诊断交互功能,因此需要借助基于外部知识库的检索增强生成(RAG)技术。尽管模型参数量高达8B,但采用4位FB16量化方案可在单块RTX4090 GPU上实现高效部署和近乎实时的推理。未来研究可重点开发基于模拟频谱信号构建的多样化问答对齐数据集,以提升跨设备领域的交互能力和泛化性能;此外,优化策略还能提升模型在资源受限工业环境中的扩展性和部署效率。

    编辑:Kira
    校核:李正平、陈凯歌、赵栓栓、曹希铭、赵学功、白亮、任超、海洋、陈宇航、Tina、王金、赵诚、肖鑫鑫、张优
    该文资料搜集自网络,仅用作学术分享,不做商业用途,若侵权,后台联系小编进行删除
    来源:故障诊断与python学习
    振动旋转机械电源航空UGpython海洋UMLMS理论电机化机试验人工智能
    著作权归作者所有,欢迎分享,未经许可,不得转载
    首次发布时间:2026-06-23
    最近编辑:3月前
    故障诊断与python学习
    硕士 签名征集中
    获赞 87粉丝 153文章 336课程 0
    点赞
    收藏
    作者推荐

    故障诊断大模型 | 通过LLM驱动的层次化跨模态对齐实现可泛化的故障诊断

    本期推荐论文提出了一种基于大语言模型(LLM)驱动的分层跨模态对齐方法(HCMA_GPT),旨在解决旋转机械故障诊断中的泛化性难题。针对振动信号与文本模态差异大、工况多变及数据不平衡等挑战,该框架创新性地构建了信号-文本协同表示模块,将时域特征转化为富含领域知识的文本描述,并设计了从浅层到深层的跨模态特征对齐与融合机制,有效缩小了时序数据与文本语义的分布差异。利用LLM强大的推理能力,该模型在多数据集、变工况及数据不平衡场景下均表现出卓越的诊断精度与鲁棒性,为工业设备的智能运维提供了新的统一解决方案。论文基本信息论文题目:Towards generalizable fault diagnosis via LLM-driven hierarchical cross-modal alignment论文日期:2026论文链接:https://doi.org/10.1016/j.knosys.2026.115897作者:Jie Wang (a), Ze Sun (b), Jiale Zhang (b), Haidong Shao (a),* , Yiming Xiao (a), Bin Liu (c)a: College of Mechanical and Vehicle Engineering, Hunan University, Changsha 410082, China b: China Ship Scientific Research Center, Wuxi 214082, China c: Department of Management Science, University of Strathclyde, Glasgow G1 1XQ, UK 作者简介:邵海东,1990年生,副教授,博士生导师,岳麓学者,西北工业大学本硕博,瑞典吕勒奥理工大学博士后,IEEE Senior Member,湖南省优青,湖湘青年英才(湖南省青年科技人才)。(来自学校官网) 目录1 引言2 相关工作 2.1 大型语言模型 2.2 多模态故障诊断3 所提方法 3.1 信号-文本协同表示模块 3.2 分层跨模态特征对齐与融合模块 3.3 基于大语言模型4 案例研究 4.1 数据集描述 4.2 多数据集实验结果分析 4.3 模型可迁移性评估 4.4 数据不平衡下的评估 4.5 消融实验 5 结论 摘要生成式人工智能(AI)的最新进展已在多个领域实现了革命性突破。作为生成式AI的核心,大型语言模型(LLM)具备强大的泛化能力和推理能力,为建立统一的故障诊断框架提供了可能性。该框架能够克服现有方法在应对多数据集、跨场景迁移及数据不平衡等挑战时的局限性。然而,由于连续振动信号与离散文本之间存在显著的模态差异,如何有效利用LLM处理时间序列数据以进行故障诊断仍是关键挑战。本研究提出了一种基于LLM的分层跨模态对齐方法(HCMA_GPT)来解决这一问题:首先构建信号-文本协同表示模块,从原始振动信号生成富含领域知识的文本描述;随后将这些描述与原始信号联合编码,以增强故障特征的多样性和语义表达力。其次,我们设计了一个分层化的跨模态特征对齐与融合模块,旨在实现从表层到深层信号与文本数据之间的特征对齐与融合。通过最小化两种模态间的分布差异,该模块显著提升了基于语义训练的大语言模型(LLM)对时间序列数据的应用能力。最后,我们利用LLM的泛化能力和推理能力,开发出一套创新的统一故障诊断框架。在多个数据集、不同工况及数据不平衡场景下进行的大量实验表明,HCMA_GPT能有效提升诊断准确性,并展现出卓越的鲁棒性和泛化能力。关键词: 大型语言模型、跨模态特征对齐与融合故障诊断、跨条件的数据失衡1.引言在当前的工业生产格局中,旋转机械占据着不可或缺的地位。此外,对旋转机械进行及时、准确的故障诊断对于确保设备运行的稳定性和可靠性至关重要,因为尽早识别潜在故障能有效避免经济损失和安全事故[1,2]。传感器技术的进步使得能够持续从旋转机械中采集海量数据[3,4],为数据驱动的状态监测奠定了坚实基础。与基于人工设计特征的经典方法不同,深度学习(DL)在故障诊断研究中受到了广泛关注[5-7]。凭借其卓越的特征表示能力和非线性建模能力,基于深度学习的故障诊断方法能够自动从数据中识别运行状态和故障类型。为提升基于深度学习的故障诊断可信度,Xiao等人将贝叶斯变分学习引入旋转机械诊断,以量化结果不确定性[8]。Wang等人设计了一个结合局部窗口注意力和全局网格注意力的协同注意力模块,实现了模型参数的轻量化。该模型即使在更强噪声和更小样本量条件下也能获得优异的诊断效果[9]。Xiao等人。他们开发了一种用于多传感器数据的层次化融合策略,能够有效提取故障信息,从而显著提高了诊断准确性[10]。Cen等人提出了一种结合扩散模型与多标签网络的复合故障诊断方法,在零样本学习场景下实现了对旋转机械中已知及未知故障类别的精准识别[11]。尽管现有的基于数据湖的故障诊断方法已经展现出令人鼓舞的准确性,但在实用性和泛化能力方面存在以下局限:(1)大多数模型都是针对特定数据集和运行场景量身定制的。如图1所示,为适应不同数据集而修改模型的特征提取和分类模块,严重限制了其在多样化环境和故障模式下的适用性。因此,要建立一个仅需单一参数集即可在多个数据集上实现有效故障诊断的基础模型仍具挑战性[12];(2)在实际工业场景中,机械设备常面临负载变化、转速波动和温度变化等多种工况。这些波动会导致同类型故障的特征分布出现显著差异,使得在跨工况场景下难以保持稳定的判别能力和泛化性能[13];(3)机械系统主要在正常工况下运行,导致可用数据存在严重失衡。故障样本通常十分稀缺,导致训练过程存在偏差,且对少数故障类别识别能力较差,从而影响基于深度学习的故障诊断模型的诊断可靠性[14]。为克服这些局限性,人们提出了多种改进方法。例如,为应对动态环境中故障诊断的复杂性,Huang等人提出了一种基于多源领域迁移的创新框架[15];Wang等人专注于源数据的安全性,开发了一种通过在目标数据上构建三种不同的损失函数来适配源模型至目标领域的新型方法[16];为解决部分迁移学习中私有样本与公开样本对齐导致的负面迁移问题,Chen等人提出了利用类别一致性匹配的注意力小波网络[17];Lin等人设计了一种基于生成对抗网络的新模型以解决数据不平衡问题,该方法通过生成高保真故障样本有效增加了少数类别样本的数量[18];Han等人通过设计多尺度扩张卷积神经网络和改进的交叉熵损失函数,使网络能够优先学习少数类别特征信息[19]。然而,现有方法往往仅针对孤立问题进行解决:例如引入迁移学习以提升跨条件适应性,而少数模型架构仅优化特定数据集的诊断性能。如图2所示,迄今为止尚不存在能够同时应对多数据集多样性、跨条件泛化能力和数据不平衡等综合挑战的统一框架。 近年来,大型语言模型(LLM)的持续进步推动了自然语言处理(NLP)领域的快速发展。诸如GPT和BERT等基础模型,通过在海量多样化语料库上的预训练,积累了丰富的通用知识和强大的表征能力。它们高效迁移并适应下游任务的能力,为解决上述挑战提供了广阔前景。然而,基于LLM的故障诊断研究相对有限,主要面临以下两大挑战:首先是领域知识差异——LLM在预训练中获得的知识与故障诊断所需的专门化诊断逻辑存在差异,导致难以直接进行可靠的诊断推理;其次是数据模态鸿沟——LLM通常处理离散的tokens,而振动信号属于连续时间序列数据。如何将振动信号有效转换为LLM可理解的序列,以弥合这一模态差异,仍是当前的关键挑战。为应对上述挑战,本研究开发了一种基于大语言模型(LLM)的层次化跨模态对齐模型HCMA_GPT,用于故障诊断。该框架通过注入故障诊断领域的专业知识来弥合领域知识差距,并通过信号与文本特征的层次化对齐来消除数据模态差异。在多个数据集、不同工况及数据不平衡场景下进行的全面实验验证表明,所提出的方法不仅有效提升了诊断准确性,还具备卓越的鲁棒性和泛化能力。本研究的主要贡献如下:(1)本研究构建了一个信号-文本协同表示模块,用于从原始振动信号生成富含领域知识的文本描述。这些描述随后与原始信号进行联合编码,以增强故障特征的多样性和语义表达能力。(2)该模块实现了分层跨模态特征对齐与融合,旨在实现从浅层到深层信号数据与文本数据之间的特征对齐与融合。通过最小化两种模态之间的分布差异,该模块提升了基于语义训练的大语言模型(LLM)对时间序列数据的应用能力。(3)通过利用大语言模型(LLM)的泛化与推理能力,我们开发了一种新型统一故障诊断模型。该模型能有效应对多数据集、跨场景迁移及数据不平衡等复杂挑战,展现出卓越的鲁棒性和泛化能力。本文其余部分安排如下:第2节回顾相关研究;第3节详细阐述所提出的HCMA_GPT框架;第4节通过在多个数据集、跨条件及数据不平衡场景下的大量实验验证HCMA_GPT的有效性;最后,第5节对本文进行总结。2.相关工作2.1.大型语言模型大语言模型(LLMs)是通过对海量无标注语料进行自监督预训练获得的。其核心能力源于Transformer的自注意力机制,该机制使其能够有效捕捉给定文本中的长距离依赖关系。得益于预训练和微调范式,该模型具备强大的泛化能力和推理能力,能高效适应文本、图像及视频处理等多种下游任务。例如,Radford等人通过对比学习实现了图像与自然语言之间的跨模态对齐;预训练模型展现出卓越的零样本迁移能力[20]。Zhou等人提出了一种基于LLM的时间序列预测模型:在微调时间序列相关模块时,冻结预训练LLM的注意力层和前馈网络层[21];Jin等人构建了可有效将时间序列数据与LLM集成的重编程框架[22];Fan等人则……提出了一种基于LLM的风力发电场维护团队分配与路线规划决策方法[23]。机械故障诊断是一项典型的时序序列分类任务。由于实际应用中的性能会受到复杂运行条件和动态环境的显著影响,因此开发具有强泛化能力和可扩展性的模型至关重要。凭借强大的泛化能力和推理能力,大型语言模型(LLM)为解决这些挑战提供了新途径。然而,主流的预训练LLM(如BERT、GPT和Qwen)主要是在庞大的通用文本语料库上训练的,因此难以直接涵盖故障诊断的专业逻辑。受限于这种领域知识差距,LLM在旋转机械故障诊断中的应用仍十分有限,亟待进一步探索。2.2.多模态故障诊断由于工业场景中传感器类型的多样化,所采集的振动信号在形式和来源方面呈现出多模态特征[24]。有效融合这些异构信号对于提升诊断性能至关重要。通过联合利用同一故障的不同模态信息,可获得更全面的故障特征用于故障诊断。Kim等人通过结合时域和频域特征,在显著噪声环境下实现了有效的故障诊断[25]。Ma等人设计了一种深度耦合自编码器,用于实现振动与声学数据等不同模态的特征提取与融合[26]。为从振动信号中充分提取故障信息,Cheng等人采用视觉点阵方法将信号转换为二维图像,从而扩展了数据模态[27]。Chang等人运用注意力机制融合时域与频域的多模态信息,该方法能有效识别噪声干扰下的故障模式[28]。Peng等人构建了一个整合时域、频域及其他特征的多模态知识图谱,有效捕捉了不同故障之间的复杂关联关系[29]。现有关于多模态故障诊断的研究主要集中在两种方向:要么融合不同类型的传感器信号(如振动和声音),要么联合表征单一信号的多域特征(如频谱和小波图像)。相比之下,关于文本数据与连续振动信号之间的跨模态对齐研究则较为有限。此外,由于当前大语言模型(LLM)主要基于文本语料库进行训练,其推理机制依赖于离散的文本序列,这使得它们难以直接适应连续振动信号。因此,为了推动大语言模型在故障诊断中的应用,实现时间序列信号与文本之间的跨模态对齐与融合至关重要。3.所提出的方法所提出方法的工作流程如图3所示。该方法主要由三个核心模块组成:信号-文本协同表示模块、层次化跨模态特征对齐与融合模块,以及基于大语言模型(LLM)的故障判定模块。其中,前两个模块使得该方法能够成功将时间序列数据转化为特征表示。这些表示形式对大语言模型(LLM)而言易于理解,无需对其进行微调即可用于推理。该方法有效缩小了连续时间序列数据与离散文本之间的差距,从而提升了大语言模型在故障诊断任务中的直接适用性与泛化能力。各模块的具体细节将在以下小节中详细阐述。 3.1.信号-文本协同表示模块在本模块中,时域特征提取是实现信号-文本协同表征的主要步骤。如表1所示,该模块共提取了六项时域特征,包括最大值、最小值、方差及变化趋势。这些时域特征精准刻画了振动信号的能量分布与动态变化趋势。特征提取主要实现两大目的:首先,通过引入多模态信息提升振动信号表征的全面性与多样性;其次,将时域特征转化为结构化的文本描述,从而便于将时间序列数据转换为大语言模型能够处理的表征形式。表1 从振动信号中提取的时域特征 1)时间序列补丁嵌入。 为将长时序数据分解为局部片段并转换为适用于大语言模型输入的向量,对振动信号数据进行标记嵌入。给定时间序列数据 (其中C为输入通道数,L为输入长度),我们首先使用长度为P、步长为S的滑动窗口将数据分割为N个补丁, 。 随后,每个数据块通过嵌入层从低维特征映射到高维特征空间,从而增强数据的特征表示能力。 其中d表示映射特征的维度。2)文本提示嵌入。 上述提取的时间域特征共同构成一个多维特征集。为充分发挥大语言模型在文本语义建模方面的优势,本模块将前述特征集转化为富含领域语义的文本描述,如图4所示。具体而言,提取的时间域统计信息会被动态注入预定义的诊断模板中。通过此过程,物理特征被转化为适配大语言模型输入范式的上下文序列。首先,使用预训练的分词器将文本序列映射为离散的标记索引 (其中 表示序列长度)。随后,通过预训练模型的嵌入层进行向量化处理,具体表达如下: 其中 表示预训练大语言模型(LLM)的词嵌入矩阵,D代表序列维度。该过程不仅将离散时间域特征文本转化为连续向量表示,还能继承预训练语料库中的语义知识,从而为后续跨模态特征对齐与融合建立统一的表征空间。3.2.分层跨模态特征对齐与融合模块为实现跨模态故障特征的全面对齐与融合,并增强大语言模型(LLM)对时间序列数据的理解能力,本文提出了一种分层化的跨模态特征对齐与融合模块。该模块以信号-文本协同表征模块输出的文本提示嵌入向量、时间序列数据嵌入向量以及预训练LLM的词嵌入矩阵作为输入。在对齐过程中,首先通过嵌入层的跨模态特征对齐与融合机制,将原始时间序列特征与LLM的全局基础词汇空间进行对齐,从而实现数据分布的初步统一。随后,深度语义交互对齐与融合层促进了卷积神经网络(CNN)提取的判别性物理特征与LLM处理的动态上下文特征之间的深度交互。通过从浅层到深层的分层特征交互机制,该模块逐步弥合了两种模态之间的语义鸿沟。1)在嵌入层进行跨模态特征对齐与融合。 由于预训练大语言模型的词嵌入矩阵是对语义文本知识的压缩表示,我们会在词嵌入矩阵与时间序列片段嵌入之间进行跨模态特征匹配。其目的在于使时间序列片段嵌入能够学习词嵌入矩阵的特征分布。具体而言,时间序列片段嵌入通过线性投影生成查询矩阵 ,而词嵌入矩阵则被投影以生成键值矩阵。 其中 表示时间序列补丁嵌入, 代表词嵌入矩阵,而 则指线性投影的权重。接下来,通过在来自不同模态的查询矩阵和键矩阵之间执行点积运算,计算出原始注意力分数。这些分数随后经过缩放和softmax归一化处理,生成跨模态注意力权重分布,该分布有效表征了两种模态特征之间的相关性。随后,该权重分布被乘以值矩阵。 其中 表示第i个头的输出, 代表 的维度。最后,将所有头部的输出进行拼接,并通过线性投影在嵌入层完成跨模态特征对齐。 其中 表示连接函数,而 代表线性投影的权重。图4. 时域特征的文字描述。2)深度语义交互对齐与融合层。 在嵌入层进行的特征对齐与融合利用大语言模型(LLM)的预训练权重,从信号域到基础语义层面建立初步投影。基于初始对齐结果,深度语义交互特征对齐将深度编码的时间特征与LLM解析出的动态文本表征相结合。这一过程成功将时间序列数据从基础语义映射转化为具备上下文感知能力的文本融合结果。具体而言,对于在嵌入层 对齐的时间序列补丁嵌入,采用表2中详述的CNN架构来进一步提取深度特征 。对于文本提示嵌入,使用预训练的GPT2模型来提取深度语义特征 。此处, 捕捉故障相关的判别特征,而 则封装了故障的语义模式及运行条件的上下文关系。与嵌入层的跨模态分布对齐类似, 通过线性映射生成查询矩阵 ,而 则经过两个独立的线性映射生成键矩阵 和值矩阵 。随后,采用跨模态注意力机制用于实现深度多模态特征对齐。 其中 表示线性投影的权重, 表示 的维度。表2 CNN参数 3.3.基于LLM的故障决策模块基于LLM的故障决策模块由一个基于GPT2的LLM和一个分类器组成。LLM的深层网络过于专精于自然语言处理,因此不适用于旋转机械故障诊断。为此,该模块仅提取预训练GPT-2模型的前六个变压器层作为特征提取主干。经过分层跨模态特征对齐与融合模块处理后,时间序列补丁嵌入与文本提示嵌入之间实现了深度语义统一。 是一种复合特征,它将振动信号的物理特性与文本提示的语义信息相结合。这种融合特征与预训练大语言模型的处理范式完美契合,能够充分发挥该模型在语义理解与特征提取方面的优势。具体而言, 被输入到基于GPT2的大模型中,其多层Transformer架构会提取富含故障特征的高级特征表示。这些特征随后被输入下游分类器,通过全连接层将其映射至故障类别空间,最终生成对应故障类型的概率分布。采用交叉熵损失函数LCE来计算预测标签与实际标签之间的差异。 其中N表示样本数量,C代表类别数量; 分别表示第i个样本属于类别c的实际标签,而 则表示第i个样本属于类别c的预测概率。值得注意的是,在所提出的方法中,基于GPT2的大语言模型参数被完全冻结。具体而言,在训练过程中我们仅优化信号-文本协同表征模块以及分层跨模态特征对齐与融合模块。通过分层对齐操作,时间序列特征逐步融合到文本语义空间中,确保最终融合后的特征与大语言模型的处理范式完美契合。4.案例研究本研究采用五个实验数据集(包括SDUST变速箱数据集、SDUST轴承数据集、QPZZ-II轴承数据集、BJUT变速箱数据集和XJTU变速箱数据集),以验证所提出的HCMA_GPT模型在多数据集、不同条件及数据不平衡情况下的性能表现。所有任务均在配备 NVIDIA GeForce RTX4090 GPU 的硬件平台上完成,软件环境包含 Python3.13、PyTo-rch2.8 和 CUDA12.6,代码开发使用 PyCharm 进行。模型训练时设置批量大小为64,学习率为0.0001,总训练轮数为50轮,并采用 Adam 优化器更新网络参数。4.1.数据集描述数据集1:在SDUST齿轮箱数据集中,振动数据采集自一台电机驱动的实验装置。采样频率设定为25.6kHz。该数据集包含七种健康状态:正常状态、行星齿轮断裂故障、行星齿轮点蚀故障、行星齿轮磨损故障、太阳齿轮断裂故障、太阳齿轮点蚀故障以及太阳齿轮磨损故障[30]。数据集2:对于轴承SDUST数据集,其实验设置与数据集1完全相同,采样频率为25.6kHz。实验模拟了四种健康状态:正常状态、内环故障、外环故障和滚子元件故障。每种故障状态对应三种不同的损伤严重程度:0.2毫米、0.4毫米和0.6毫米,共计形成10种健康状态类别(含正常状态)。实验在三种转速下进行:1500转/分钟、1800转/分钟和2000转/分钟[31]。数据集3:在QPZZ-II轴承数据集中,振动数据采集自一台配备额定功率为0.75kW驱动电机的测试装置。采样频率设定为25.6kHz。该数据集包含五种健康状态:正常状态、内圈故障、外圈故障、滚动体故障以及滚动体与外圈复合故障[32]。数据集4:在BJUT齿轮箱数据集中,振动信号采集自风力涡轮机传动系统测试装置中的行星齿轮箱。采样频率为48kHz。该数据集包含五个样本。健康状态分为:正常状况(NC)、齿轮齿断裂(BT)、齿轮磨损(WG)、根部裂纹(CR)及缺齿(MT)[33]。数据集5:在XJTU行星齿轮箱数据集中,振动信号采集自一台以1800转/分钟电机转速运行的测试装置。采样频率设定为20.48kHz。该数据集包含九种健康状态,涵盖四种行星齿轮箱故障和四种轴承故障,具体包括:正常状态、齿面磨损、齿缺损、齿根裂纹、齿断裂、滚珠故障、内圈故障、外圈故障以及混合故障[34]。图5展示了对应五个数据集的测试装置。这些数据集源自不同的设备,涵盖了多种类型的故障、严重程度及运行条件。利用如此多样化的实验数据旨在验证模型在动态条件下的泛化能力和鲁棒性。每个样本包含1024个数据点;为增加样本数量,相邻样本之间采用了30%的重叠比例。实验中每个数据集使用1000个样本,并按8:2的比例划分为训练集和测试集。为确保可靠性,我们对五次独立运行的结果取了平均值。整个实验过程中均采用0.0001的学习率。图5. 各数据集的测试装置:(a)SDUST齿轮箱数据集与SDUST轴承数据集;(b)QPZZ-II轴承数据集;(c)BJUT齿轮箱数据集;(d)XJTU行星齿轮箱数据集。4.2.对多个数据集的实验结果进行分析我们在五个不同的数据集上对所提出的方法与现有的基准方法进行了比较分析。参与对比的模型包括HCMA_BERT、Time-LLM、ViT、WDCNN、Autoformer和PEDformer。如表3和图6所示,所提出的方法在数据集1、2、4、5上实现了最高的诊断精度,并取得了平均准确率。这表明,通过分层特征对齐模块实现的振动信号与文本知识的有效对齐与融合,能够将振动信号转化为大语言模型(LLM)可理解的特征输入。LLM强大的非线性建模能力有助于深入提取这些融合特征,从而实现对不同数据集中共性故障特征的自适应识别。GPT与BERT在诊断准确性上的微小差异揭示了两个关键点:首先,这凸显了大型语言模型(LLM)非线性建模能力在故障诊断领域的广阔应用潜力;其次,验证了所提出的信号-文本协同表征模块与层次化特征对齐模块在将振动信号与时域特征的文本描述相匹配方面的有效性。Time-LLM的诊断准确率仅为71.45%,表明其未能充分将振动信号转化为大型语言模型可理解的特征。尽管其他对比模型在特定数据集上表现良好,但其稳健性和泛化能力不足,限制了它们在复杂多变的故障诊断环境中的应用潜力。表3 各方法在不同数据集上达到的诊断准确性 图6. 不同方法在多个数据集上的诊断准确率柱状图。4.3.模型可转移性评估为进一步验证HCMA_GPT在不同运行条件下的泛化能力,我们在SDUST轴承数据集上进行了跨条件诊断实验。该数据集包含三种运行条件:1500rpm(条件0)、1800rpm(条件1)和2000rpm(条件2)。实验配置及诊断结果详见表4。特别值得注意的是,在任务R1至R3中(所提出的模型在两种运行条件组合上训练并在第三种未知条件下测试),诊断准确率始终保持在95%以上;而在更具挑战性的任务R4至R9中(模型在单一运行条件下训练并在另一种未知条件下测试),其准确率仍维持在80%以上。为更好地说明HCMA_GPT的有效性,我们针对第4.2节中平均准确率最高的两种方法进行了对比实验。图7展示了迁移诊断准确率。结果表明,所提出的方法显著优于对比模型。值得注意的是,在R6和R9任务中,该方法的准确率分别比第二优方法高出34.20%和39.55%,这证明了HCMA_GPT在跨条件任务中卓越的泛化性能。所提出方法在跨条件任务中表现出的一致且卓越的诊断性能,充分证明了其对复杂多变工业环境的强适应性。因此,该方法在实际工程应用中具有巨大潜力。表4 数据集2上跨条件任务的实验设置与诊断准确性 4.4.基于数据不平衡的评估为模拟实际运行工况——即机械设备长期处于正常工作状态且故障样本稀缺的情况,我们构建了不平衡数据集T1-T5。实验基于BJUT变速箱数据集进行,旨在验证所提方法在数据不平衡条件下的诊断性能。表5列出了不同任务下各类故障的样本数量(其中80%样本用于训练,20%用于测试)。在不平衡数据集的故障诊断中,仅依赖准确率无法真实反映模型的诊断性能,因此采用精确率、召回率和F1值作为评估指标。这些指标不仅能反映整体诊断性能,还能全面体现模型对各类故障(尤其是少数故障样本)的识别能力。各指标的具体计算公式如下: 其中TP表示真阳性,FP表示假阳性,FN表示假阴性。所提出方法在各不平衡数据集上的诊断结果如图8所示。如图所示,当健康状态间的样本分布相对均衡时(例如任务T1-T3中正常样本与故障样本的比例约为1:0.8至1:0.4),模型在所有四项指标——准确率、精确率、召回率和F1值上均保持优异性能。值得注意的是,该方法在任务T1中取得了最佳综合表现,准确率达到97.62%,F1值为97.52%。随着任务T4和T5中故障样本比例逐渐降低(分别为1:0.2至1:0.1),该方法仍展现出显著的鲁棒性:在极度不平衡的任务T5中,其准确率达到88.93%,精确率、召回率和F1值均为80.03%,76.20%和77.31%。这表明,尽管存在严重的类别不平衡问题,所提出的方法仍具备高水平的诊断能力。F1分数超过77%的结果有效验证了该方法在不平衡故障诊断中的实用价值与稳定性。如图9所示,我们采用混淆矩阵来展示各类故障类型的具体分类结果。其中,标签0至4分别对应五种健康状态:BT、MT、NC、CR和WG。在各类数据不平衡任务中,健康状态2、3和4的识别准确率始终超过90%;然而健康状态0与1之间存在轻微混淆现象,这归因于这两种故障模式在激励模式和冲击特性上的相似性。结合行星式变速器的复杂耦合效应,这些因素导致振动信号特征高度相似,从而增加了区分难度。表5 数据集4上数据平衡任务的实验设置 图9. 所提方法在不同任务中的混淆矩阵:(a)数据平衡;(b)T1;(c)T2;(d)T3;(e)T4;(f)T5。 4.5.消融实验为验证所提出模块的有效性,我们开展了消融实验,结果如图10所示。在五个实验任务中,所提出的方法均显著优于仅依赖时间序列数据或文本描述的单模态基线方法。这一结果充分证明了信号-文本协同表示模块的必要性。具体而言,纯文本模型在不同任务中的表现波动较大,准确率介于29.71%至76.90%之间,表明单模态文本数据难以全面表征故障的物理特征;其主要功能在于提供语义指导,帮助将时间序列数据转化为大语言模型可理解的语义表示。相比之下,仅使用时间序列数据的模型虽然性能稳定,但受限于领域差异和模态障碍,无法充分发挥大语言模型强大的特征提取与推理能力,导致其性能上限远低于多模态对齐与融合方法。值得注意的是,所提出的方法在数据集2上达到了99.65%的峰值准确率,比最佳单模态基线方法高出5%以上。这一结果证实:通过信号-文本协同表征以及层次化特征对齐与融合技术,该模型成功结合了振动信号的物理特性与文本描述的语义信息。这有效缩小了两种模态之间的差异,提升了大语言模型(LLM)对时间序列数据的适用性。图10. 消融实验的实验结果。5.结论本研究开发了一种基于大语言模型(LLM)的新型故障诊断方法。首先,从原始信号中提取富含领域知识的文本描述。这些描述与原始时间序列数据共同通过分层跨模态特征对齐与融合模块进行处理,实现从浅层到深层的双模态特征对齐与融合。该过程有效缩小了两种模态间的特征分布差异,提升了LLM对时间序列数据的适用性。最后,采用基于GPT2的大语言模型对提取的故障特征进行精准识别。与传统针对特定数据集和应用场景设计的诊断模型不同,本方法在五个异构数据集上实现了97.32%的平均准确率,较基线模型显著提升超过8.62%。为模拟真实工业场景,研究设计了涉及多种跨条件及数据不平衡场景的诊断任务。该方法在所有场景中均保持超过80%的准确率,展现出卓越的适应性和鲁棒性。此外,还开展了消融研究以验证各独立模块对整体性能的有效贡献。尽管所提出的方法在故障诊断任务中表现优异,但大型语言模型(LLM)在工业领域的泛化潜力仍有待深入探索。未来的研究将引入多任务提示策略和自适应损失权重调整机制,以构建一个集成故障诊断、设备状态监测及剩余使用寿命预测功能的统一智能模型框架。此次整合将进一步提升大型语言模型(LLM)在工业领域的表征能力与应用范围。编辑:Kira校核:李正平、陈凯歌、赵栓栓、曹希铭、赵学功、白亮、任超、海洋、陈宇航、Tina、王金、赵诚、肖鑫鑫、张优该文资料搜集自网络,仅用作学术分享,不做商业用途,若侵权,后台联系小编进行删除来源:故障诊断与python学习

    未登录
    还没有评论
    课程
    培训
    服务
    行家
    VIP会员 学习计划 福利任务
    下载APP
    联系我们
    帮助与反馈