本期推荐论文提出了一种基于大语言模型(LLM)驱动的分层跨模态对齐方法(HCMA_GPT),旨在解决旋转机械故障诊断中的泛化性难题。针对振动信号与文本模态差异大、工况多变及数据不平衡等挑战,该框架创新性地构建了信号-文本协同表示模块,将时域特征转化为富含领域知识的文本描述,并设计了从浅层到深层的跨模态特征对齐与融合机制,有效缩小了时序数据与文本语义的分布差异。利用LLM强大的推理能力,该模型在多数据集、变工况及数据不平衡场景下均表现出卓越的诊断精度与鲁棒性,为工业设备的智能运维提供了新的统一解决方案。
论文题目:
Towards generalizable fault diagnosis via LLM-driven hierarchical cross-modal alignment
论文日期:2026
论文链接:
https://doi.org/10.1016/j.knosys.2026.115897
作者:
Jie Wang (a), Ze Sun (b), Jiale Zhang (b), Haidong Shao (a),* , Yiming Xiao (a), Bin Liu (c)
作者简介:
邵海东,1990年生,副教授,博士生导师,岳麓学者,西北工业大学本硕博,瑞典吕勒奥理工大学博士后,IEEE Senior Member,湖南省优青,湖湘青年英才(湖南省青年科技人才)。(来自学校官网)1 引言
2 相关工作
2.1 大型语言模型
2.2 多模态故障诊断
3 所提方法
3.1 信号-文本协同表示模块
3.2 分层跨模态特征对齐与融合模块
3.3 基于大语言模型
生成式人工智能(AI)的最新进展已在多个领域实现了革命性突破。作为生成式AI的核心,大型语言模型(LLM)具备强大的泛化能力和推理能力,为建立统一的故障诊断框架提供了可能性。该框架能够克服现有方法在应对多数据集、跨场景迁移及数据不平衡等挑战时的局限性。然而,由于连续振动信号与离散文本之间存在显著的模态差异,如何有效利用LLM处理时间序列数据以进行故障诊断仍是关键挑战。本研究提出了一种基于LLM的分层跨模态对齐方法(HCMA_GPT)来解决这一问题:首先构建信号-文本协同表示模块,从原始振动信号生成富含领域知识的文本描述;随后将这些描述与原始信号联合编码,以增强故障特征的多样性和语义表达力。其次,我们设计了一个分层化的跨模态特征对齐与融合模块,旨在实现从表层到深层信号与文本数据之间的特征对齐与融合。通过最小化两种模态间的分布差异,该模块显著提升了基于语义训练的大语言模型(LLM)对时间序列数据的应用能力。最后,我们利用LLM的泛化能力和推理能力,开发出一套创新的统一故障诊断框架。在多个数据集、不同工况及数据不平衡场景下进行的大量实验表明,HCMA_GPT能有效提升诊断准确性,并展现出卓越的鲁棒性和泛化能力。
关键词: 大型语言模型、跨模态特征对齐与融合故障诊断、跨条件的数据失衡
在当前的工业生产格局中,旋转机械占据着不可或缺的地位。此外,对旋转机械进行及时、准确的故障诊断对于确保设备运行的稳定性和可靠性至关重要,因为尽早识别潜在故障能有效避免经济损失和安全事故[1,2]。
传感器技术的进步使得能够持续从旋转机械中采集海量数据[3,4],为数据驱动的状态监测奠定了坚实基础。与基于人工设计特征的经典方法不同,深度学习(DL)在故障诊断研究中受到了广泛关注[5-7]。凭借其卓越的特征表示能力和非线性建模能力,基于深度学习的故障诊断方法能够自动从数据中识别运行状态和故障类型。为提升基于深度学习的故障诊断可信度,Xiao等人将贝叶斯变分学习引入旋转机械诊断,以量化结果不确定性[8]。Wang等人设计了一个结合局部窗口注意力和全局网格注意力的协同注意力模块,实现了模型参数的轻量化。该模型即使在更强噪声和更小样本量条件下也能获得优异的诊断效果[9]。Xiao等人。他们开发了一种用于多传感器数据的层次化融合策略,能够有效提取故障信息,从而显著提高了诊断准确性[10]。Cen等人提出了一种结合扩散模型与多标签网络的复合故障诊断方法,在零样本学习场景下实现了对旋转机械中已知及未知故障类别的精准识别[11]。
尽管现有的基于数据湖的故障诊断方法已经展现出令人鼓舞的准确性,但在实用性和泛化能力方面存在以下局限:(1)大多数模型都是针对特定数据集和运行场景量身定制的。如图1所示,为适应不同数据集而修改模型的特征提取和分类模块,严重限制了其在多样化环境和故障模式下的适用性。因此,要建立一个仅需单一参数集即可在多个数据集上实现有效故障诊断的基础模型仍具挑战性[12];(2)在实际工业场景中,机械设备常面临负载变化、转速波动和温度变化等多种工况。这些波动会导致同类型故障的特征分布出现显著差异,使得在跨工况场景下难以保持稳定的判别能力和泛化性能[13];(3)机械系统主要在正常工况下运行,导致可用数据存在严重失衡。故障样本通常十分稀缺,导致训练过程存在偏差,且对少数故障类别识别能力较差,从而影响基于深度学习的故障诊断模型的诊断可靠性[14]。
为克服这些局限性,人们提出了多种改进方法。例如,为应对动态环境中故障诊断的复杂性,Huang等人提出了一种基于多源领域迁移的创新框架[15];Wang等人专注于源数据的安全性,开发了一种通过在目标数据上构建三种不同的损失函数来适配源模型至目标领域的新型方法[16];为解决部分迁移学习中私有样本与公开样本对齐导致的负面迁移问题,Chen等人提出了利用类别一致性匹配的注意力小波网络[17];Lin等人设计了一种基于生成对抗网络的新模型以解决数据不平衡问题,该方法通过生成高保真故障样本有效增加了少数类别样本的数量[18];Han等人通过设计多尺度扩张卷积神经网络和改进的交叉熵损失函数,使网络能够优先学习少数类别特征信息[19]。然而,现有方法往往仅针对孤立问题进行解决:例如引入迁移学习以提升跨条件适应性,而少数模型架构仅优化特定数据集的诊断性能。如图2所示,迄今为止尚不存在能够同时应对多数据集多样性、跨条件泛化能力和数据不平衡等综合挑战的统一框架。
近年来,大型语言模型(LLM)的持续进步推动了自然语言处理(NLP)领域的快速发展。诸如GPT和BERT等基础模型,通过在海量多样化语料库上的预训练,积累了丰富的通用知识和强大的表征能力。它们高效迁移并适应下游任务的能力,为解决上述挑战提供了广阔前景。然而,基于LLM的故障诊断研究相对有限,主要面临以下两大挑战:首先是领域知识差异——LLM在预训练中获得的知识与故障诊断所需的专门化诊断逻辑存在差异,导致难以直接进行可靠的诊断推理;其次是数据模态鸿沟——LLM通常处理离散的tokens,而振动信号属于连续时间序列数据。如何将振动信号有效转换为LLM可理解的序列,以弥合这一模态差异,仍是当前的关键挑战。
为应对上述挑战,本研究开发了一种基于大语言模型(LLM)的层次化跨模态对齐模型HCMA_GPT,用于故障诊断。该框架通过注入故障诊断领域的专业知识来弥合领域知识差距,并通过信号与文本特征的层次化对齐来消除数据模态差异。在多个数据集、不同工况及数据不平衡场景下进行的全面实验验证表明,所提出的方法不仅有效提升了诊断准确性,还具备卓越的鲁棒性和泛化能力。本研究的主要贡献如下:
(1)本研究构建了一个信号-文本协同表示模块,用于从原始振动信号生成富含领域知识的文本描述。这些描述随后与原始信号进行联合编码,以增强故障特征的多样性和语义表达能力。
(2)该模块实现了分层跨模态特征对齐与融合,旨在实现从浅层到深层信号数据与文本数据之间的特征对齐与融合。通过最小化两种模态之间的分布差异,该模块提升了基于语义训练的大语言模型(LLM)对时间序列数据的应用能力。
(3)通过利用大语言模型(LLM)的泛化与推理能力,我们开发了一种新型统一故障诊断模型。该模型能有效应对多数据集、跨场景迁移及数据不平衡等复杂挑战,展现出卓越的鲁棒性和泛化能力。
本文其余部分安排如下:第2节回顾相关研究;第3节详细阐述所提出的HCMA_GPT框架;第4节通过在多个数据集、跨条件及数据不平衡场景下的大量实验验证HCMA_GPT的有效性;最后,第5节对本文进行总结。
大语言模型(LLMs)是通过对海量无标注语料进行自监督预训练获得的。其核心能力源于Transformer的自注意力机制,该机制使其能够有效捕捉给定文本中的长距离依赖关系。得益于预训练和微调范式,该模型具备强大的泛化能力和推理能力,能高效适应文本、图像及视频处理等多种下游任务。例如,Radford等人通过对比学习实现了图像与自然语言之间的跨模态对齐;预训练模型展现出卓越的零样本迁移能力[20]。Zhou等人提出了一种基于LLM的时间序列预测模型:在微调时间序列相关模块时,冻结预训练LLM的注意力层和前馈网络层[21];Jin等人构建了可有效将时间序列数据与LLM集成的重编程框架[22];Fan等人则……提出了一种基于LLM的风力发电场维护团队分配与路线规划决策方法[23]。
机械故障诊断是一项典型的时序序列分类任务。由于实际应用中的性能会受到复杂运行条件和动态环境的显著影响,因此开发具有强泛化能力和可扩展性的模型至关重要。凭借强大的泛化能力和推理能力,大型语言模型(LLM)为解决这些挑战提供了新途径。然而,主流的预训练LLM(如BERT、GPT和Qwen)主要是在庞大的通用文本语料库上训练的,因此难以直接涵盖故障诊断的专业逻辑。受限于这种领域知识差距,LLM在旋转机械故障诊断中的应用仍十分有限,亟待进一步探索。
由于工业场景中传感器类型的多样化,所采集的振动信号在形式和来源方面呈现出多模态特征[24]。有效融合这些异构信号对于提升诊断性能至关重要。通过联合利用同一故障的不同模态信息,可获得更全面的故障特征用于故障诊断。Kim等人通过结合时域和频域特征,在显著噪声环境下实现了有效的故障诊断[25]。Ma等人设计了一种深度耦合自编码器,用于实现振动与声学数据等不同模态的特征提取与融合[26]。为从振动信号中充分提取故障信息,Cheng等人采用视觉点阵方法将信号转换为二维图像,从而扩展了数据模态[27]。Chang等人运用注意力机制融合时域与频域的多模态信息,该方法能有效识别噪声干扰下的故障模式[28]。Peng等人构建了一个整合时域、频域及其他特征的多模态知识图谱,有效捕捉了不同故障之间的复杂关联关系[29]。
现有关于多模态故障诊断的研究主要集中在两种方向:要么融合不同类型的传感器信号(如振动和声音),要么联合表征单一信号的多域特征(如频谱和小波图像)。相比之下,关于文本数据与连续振动信号之间的跨模态对齐研究则较为有限。此外,由于当前大语言模型(LLM)主要基于文本语料库进行训练,其推理机制依赖于离散的文本序列,这使得它们难以直接适应连续振动信号。因此,为了推动大语言模型在故障诊断中的应用,实现时间序列信号与文本之间的跨模态对齐与融合至关重要。
所提出方法的工作流程如图3所示。该方法主要由三个核心模块组成:信号-文本协同表示模块、层次化跨模态特征对齐与融合模块,以及基于大语言模型(LLM)的故障判定模块。其中,前两个模块使得该方法能够成功将时间序列数据转化为特征表示。这些表示形式对大语言模型(LLM)而言易于理解,无需对其进行微调即可用于推理。该方法有效缩小了连续时间序列数据与离散文本之间的差距,从而提升了大语言模型在故障诊断任务中的直接适用性与泛化能力。各模块的具体细节将在以下小节中详细阐述。
在本模块中,时域特征提取是实现信号-文本协同表征的主要步骤。如表1所示,该模块共提取了六项时域特征,包括最大值、最小值、方差及变化趋势。这些时域特征精准刻画了振动信号的能量分布与动态变化趋势。特征提取主要实现两大目的:首先,通过引入多模态信息提升振动信号表征的全面性与多样性;其次,将时域特征转化为结构化的文本描述,从而便于将时间序列数据转换为大语言模型能够处理的表征形式。
表1 从振动信号中提取的时域特征
1)时间序列补丁嵌入。 为将长时序数据分解为局部片段并转换为适用于大语言模型输入的向量,对振动信号数据进行标记嵌入。给定时间序列数据 (其中C为输入通道数,L为输入长度),我们首先使用长度为P、步长为S的滑动窗口将数据分割为N个补丁, 。
随后,每个数据块通过嵌入层从低维特征映射到高维特征空间,从而增强数据的特征表示能力。
其中d表示映射特征的维度。
2)文本提示嵌入。 上述提取的时间域特征共同构成一个多维特征集。为充分发挥大语言模型在文本语义建模方面的优势,本模块将前述特征集转化为富含领域语义的文本描述,如图4所示。具体而言,提取的时间域统计信息会被动态注入预定义的诊断模板中。通过此过程,物理特征被转化为适配大语言模型输入范式的上下文序列。
首先,使用预训练的分词器将文本序列映射为离散的标记索引 (其中 表示序列长度)。随后,通过预训练模型的嵌入层进行向量化处理,具体表达如下:
其中 表示预训练大语言模型(LLM)的词嵌入矩阵,D代表序列维度。该过程不仅将离散时间域特征文本转化为连续向量表示,还能继承预训练语料库中的语义知识,从而为后续跨模态特征对齐与融合建立统一的表征空间。
为实现跨模态故障特征的全面对齐与融合,并增强大语言模型(LLM)对时间序列数据的理解能力,本文提出了一种分层化的跨模态特征对齐与融合模块。该模块以信号-文本协同表征模块输出的文本提示嵌入向量、时间序列数据嵌入向量以及预训练LLM的词嵌入矩阵作为输入。在对齐过程中,首先通过嵌入层的跨模态特征对齐与融合机制,将原始时间序列特征与LLM的全局基础词汇空间进行对齐,从而实现数据分布的初步统一。随后,深度语义交互对齐与融合层促进了卷积神经网络(CNN)提取的判别性物理特征与LLM处理的动态上下文特征之间的深度交互。通过从浅层到深层的分层特征交互机制,该模块逐步弥合了两种模态之间的语义鸿沟。
1)在嵌入层进行跨模态特征对齐与融合。 由于预训练大语言模型的词嵌入矩阵是对语义文本知识的压缩表示,我们会在词嵌入矩阵与时间序列片段嵌入之间进行跨模态特征匹配。其目的在于使时间序列片段嵌入能够学习词嵌入矩阵的特征分布。具体而言,时间序列片段嵌入通过线性投影生成查询矩阵 ,而词嵌入矩阵则被投影以生成键值矩阵。
其中 表示时间序列补丁嵌入, 代表词嵌入矩阵,而 则指线性投影的权重。
接下来,通过在来自不同模态的查询矩阵和键矩阵之间执行点积运算,计算出原始注意力分数。这些分数随后经过缩放和softmax归一化处理,生成跨模态注意力权重分布,该分布有效表征了两种模态特征之间的相关性。随后,该权重分布被乘以值矩阵。
其中 表示第i个头的输出, 代表 的维度。最后,将所有头部的输出进行拼接,并通过线性投影在嵌入层完成跨模态特征对齐。
其中 表示连接函数,而 代表线性投影的权重。

图4. 时域特征的文字描述。
2)深度语义交互对齐与融合层。 在嵌入层进行的特征对齐与融合利用大语言模型(LLM)的预训练权重,从信号域到基础语义层面建立初步投影。基于初始对齐结果,深度语义交互特征对齐将深度编码的时间特征与LLM解析出的动态文本表征相结合。这一过程成功将时间序列数据从基础语义映射转化为具备上下文感知能力的文本融合结果。
具体而言,对于在嵌入层 对齐的时间序列补丁嵌入,采用表2中详述的CNN架构来进一步提取深度特征 。对于文本提示嵌入,使用预训练的GPT2模型来提取深度语义特征 。此处, 捕捉故障相关的判别特征,而 则封装了故障的语义模式及运行条件的上下文关系。与嵌入层的跨模态分布对齐类似, 通过线性映射生成查询矩阵 ,而 则经过两个独立的线性映射生成键矩阵 和值矩阵 。随后,采用跨模态注意力机制用于实现深度多模态特征对齐。
其中 表示线性投影的权重, 表示 的维度。
表2 CNN参数
基于LLM的故障决策模块由一个基于GPT2的LLM和一个分类器组成。LLM的深层网络过于专精于自然语言处理,因此不适用于旋转机械故障诊断。为此,该模块仅提取预训练GPT-2模型的前六个变压器层作为特征提取主干。经过分层跨模态特征对齐与融合模块处理后,时间序列补丁嵌入与文本提示嵌入之间实现了深度语义统一。 是一种复合特征,它将振动信号的物理特性与文本提示的语义信息相结合。这种融合特征与预训练大语言模型的处理范式完美契合,能够充分发挥该模型在语义理解与特征提取方面的优势。具体而言, 被输入到基于GPT2的大模型中,其多层Transformer架构会提取富含故障特征的高级特征表示。这些特征随后被输入下游分类器,通过全连接层将其映射至故障类别空间,最终生成对应故障类型的概率分布。采用交叉熵损失函数LCE来计算预测标签与实际标签之间的差异。
其中N表示样本数量,C代表类别数量; 分别表示第i个样本属于类别c的实际标签,而 则表示第i个样本属于类别c的预测概率。值得注意的是,在所提出的方法中,基于GPT2的大语言模型参数被完全冻结。具体而言,在训练过程中我们仅优化信号-文本协同表征模块以及分层跨模态特征对齐与融合模块。通过分层对齐操作,时间序列特征逐步融合到文本语义空间中,确保最终融合后的特征与大语言模型的处理范式完美契合。
本研究采用五个实验数据集(包括SDUST变速箱数据集、SDUST轴承数据集、QPZZ-II轴承数据集、BJUT变速箱数据集和XJTU变速箱数据集),以验证所提出的HCMA_GPT模型在多数据集、不同条件及数据不平衡情况下的性能表现。所有任务均在配备 NVIDIA GeForce RTX4090 GPU 的硬件平台上完成,软件环境包含 Python3.13、PyTo-rch2.8 和 CUDA12.6,代码开发使用 PyCharm 进行。模型训练时设置批量大小为64,学习率为0.0001,总训练轮数为50轮,并采用 Adam 优化器更新网络参数。
数据集1:在SDUST齿轮箱数据集中,振动数据采集自一台电机驱动的实验装置。采样频率设定为25.6kHz。该数据集包含七种健康状态:正常状态、行星齿轮断裂故障、行星齿轮点蚀故障、行星齿轮磨损故障、太阳齿轮断裂故障、太阳齿轮点蚀故障以及太阳齿轮磨损故障[30]。
数据集2:对于轴承SDUST数据集,其实验设置与数据集1完全相同,采样频率为25.6kHz。实验模拟了四种健康状态:正常状态、内环故障、外环故障和滚子元件故障。每种故障状态对应三种不同的损伤严重程度:0.2毫米、0.4毫米和0.6毫米,共计形成10种健康状态类别(含正常状态)。实验在三种转速下进行:1500转/分钟、1800转/分钟和2000转/分钟[31]。
数据集3:在QPZZ-II轴承数据集中,振动数据采集自一台配备额定功率为0.75kW驱动电机的测试装置。采样频率设定为25.6kHz。该数据集包含五种健康状态:正常状态、内圈故障、外圈故障、滚动体故障以及滚动体与外圈复合故障[32]。
数据集4:在BJUT齿轮箱数据集中,振动信号采集自风力涡轮机传动系统测试装置中的行星齿轮箱。采样频率为48kHz。该数据集包含五个样本。健康状态分为:正常状况(NC)、齿轮齿断裂(BT)、齿轮磨损(WG)、根部裂纹(CR)及缺齿(MT)[33]。
数据集5:在XJTU行星齿轮箱数据集中,振动信号采集自一台以1800转/分钟电机转速运行的测试装置。采样频率设定为20.48kHz。该数据集包含九种健康状态,涵盖四种行星齿轮箱故障和四种轴承故障,具体包括:正常状态、齿面磨损、齿缺损、齿根裂纹、齿断裂、滚珠故障、内圈故障、外圈故障以及混合故障[34]。
图5展示了对应五个数据集的测试装置。这些数据集源自不同的设备,涵盖了多种类型的故障、严重程度及运行条件。利用如此多样化的实验数据旨在验证模型在动态条件下的泛化能力和鲁棒性。每个样本包含1024个数据点;为增加样本数量,相邻样本之间采用了30%的重叠比例。实验中每个数据集使用1000个样本,并按8:2的比例划分为训练集和测试集。为确保可靠性,我们对五次独立运行的结果取了平均值。整个实验过程中均采用0.0001的学习率。

图5. 各数据集的测试装置:(a)SDUST齿轮箱数据集与SDUST轴承数据集;(b)QPZZ-II轴承数据集;(c)BJUT齿轮箱数据集;(d)XJTU行星齿轮箱数据集。
我们在五个不同的数据集上对所提出的方法与现有的基准方法进行了比较分析。参与对比的模型包括HCMA_BERT、Time-LLM、ViT、WDCNN、Autoformer和PEDformer。如表3和图6所示,所提出的方法在数据集1、2、4、5上实现了最高的诊断精度,并取得了平均准确率。这表明,通过分层特征对齐模块实现的振动信号与文本知识的有效对齐与融合,能够将振动信号转化为大语言模型(LLM)可理解的特征输入。LLM强大的非线性建模能力有助于深入提取这些融合特征,从而实现对不同数据集中共性故障特征的自适应识别。
GPT与BERT在诊断准确性上的微小差异揭示了两个关键点:首先,这凸显了大型语言模型(LLM)非线性建模能力在故障诊断领域的广阔应用潜力;其次,验证了所提出的信号-文本协同表征模块与层次化特征对齐模块在将振动信号与时域特征的文本描述相匹配方面的有效性。Time-LLM的诊断准确率仅为71.45%,表明其未能充分将振动信号转化为大型语言模型可理解的特征。尽管其他对比模型在特定数据集上表现良好,但其稳健性和泛化能力不足,限制了它们在复杂多变的故障诊断环境中的应用潜力。
表3 各方法在不同数据集上达到的诊断准确性

图6. 不同方法在多个数据集上的诊断准确率柱状图。
为进一步验证HCMA_GPT在不同运行条件下的泛化能力,我们在SDUST轴承数据集上进行了跨条件诊断实验。该数据集包含三种运行条件:1500rpm(条件0)、1800rpm(条件1)和2000rpm(条件2)。实验配置及诊断结果详见表4。特别值得注意的是,在任务R1至R3中(所提出的模型在两种运行条件组合上训练并在第三种未知条件下测试),诊断准确率始终保持在95%以上;而在更具挑战性的任务R4至R9中(模型在单一运行条件下训练并在另一种未知条件下测试),其准确率仍维持在80%以上。
为更好地说明HCMA_GPT的有效性,我们针对第4.2节中平均准确率最高的两种方法进行了对比实验。图7展示了迁移诊断准确率。结果表明,所提出的方法显著优于对比模型。值得注意的是,在R6和R9任务中,该方法的准确率分别比第二优方法高出34.20%和39.55%,这证明了HCMA_GPT在跨条件任务中卓越的泛化性能。所提出方法在跨条件任务中表现出的一致且卓越的诊断性能,充分证明了其对复杂多变工业环境的强适应性。因此,该方法在实际工程应用中具有巨大潜力。
表4 数据集2上跨条件任务的实验设置与诊断准确性
为模拟实际运行工况——即机械设备长期处于正常工作状态且故障样本稀缺的情况,我们构建了不平衡数据集T1-T5。实验基于BJUT变速箱数据集进行,旨在验证所提方法在数据不平衡条件下的诊断性能。表5列出了不同任务下各类故障的样本数量(其中80%样本用于训练,20%用于测试)。在不平衡数据集的故障诊断中,仅依赖准确率无法真实反映模型的诊断性能,因此采用精确率、召回率和F1值作为评估指标。这些指标不仅能反映整体诊断性能,还能全面体现模型对各类故障(尤其是少数故障样本)的识别能力。各指标的具体计算公式如下:
其中TP表示真阳性,FP表示假阳性,FN表示假阴性。
所提出方法在各不平衡数据集上的诊断结果如图8所示。如图所示,当健康状态间的样本分布相对均衡时(例如任务T1-T3中正常样本与故障样本的比例约为1:0.8至1:0.4),模型在所有四项指标——准确率、精确率、召回率和F1值上均保持优异性能。值得注意的是,该方法在任务T1中取得了最佳综合表现,准确率达到97.62%,F1值为97.52%。随着任务T4和T5中故障样本比例逐渐降低(分别为1:0.2至1:0.1),该方法仍展现出显著的鲁棒性:在极度不平衡的任务T5中,其准确率达到88.93%,精确率、召回率和F1值均为80.03%,76.20%和77.31%。这表明,尽管存在严重的类别不平衡问题,所提出的方法仍具备高水平的诊断能力。F1分数超过77%的结果有效验证了该方法在不平衡故障诊断中的实用价值与稳定性。
如图9所示,我们采用混淆矩阵来展示各类故障类型的具体分类结果。其中,标签0至4分别对应五种健康状态:BT、MT、NC、CR和WG。在各类数据不平衡任务中,健康状态2、3和4的识别准确率始终超过90%;然而健康状态0与1之间存在轻微混淆现象,这归因于这两种故障模式在激励模式和冲击特性上的相似性。结合行星式变速器的复杂耦合效应,这些因素导致振动信号特征高度相似,从而增加了区分难度。
表5 数据集4上数据平衡任务的实验设置
图9. 所提方法在不同任务中的混淆矩阵:(a)数据平衡;(b)T1;(c)T2;(d)T3;(e)T4;(f)T5。 为验证所提出模块的有效性,我们开展了消融实验,结果如图10所示。在五个实验任务中,所提出的方法均显著优于仅依赖时间序列数据或文本描述的单模态基线方法。这一结果充分证明了信号-文本协同表示模块的必要性。具体而言,纯文本模型在不同任务中的表现波动较大,准确率介于29.71%至76.90%之间,表明单模态文本数据难以全面表征故障的物理特征;其主要功能在于提供语义指导,帮助将时间序列数据转化为大语言模型可理解的语义表示。相比之下,仅使用时间序列数据的模型虽然性能稳定,但受限于领域差异和模态障碍,无法充分发挥大语言模型强大的特征提取与推理能力,导致其性能上限远低于多模态对齐与融合方法。值得注意的是,所提出的方法在数据集2上达到了99.65%的峰值准确率,比最佳单模态基线方法高出5%以上。这一结果证实:通过信号-文本协同表征以及层次化特征对齐与融合技术,该模型成功结合了振动信号的物理特性与文本描述的语义信息。这有效缩小了两种模态之间的差异,提升了大语言模型(LLM)对时间序列数据的适用性。

图10. 消融实验的实验结果。
本研究开发了一种基于大语言模型(LLM)的新型故障诊断方法。首先,从原始信号中提取富含领域知识的文本描述。这些描述与原始时间序列数据共同通过分层跨模态特征对齐与融合模块进行处理,实现从浅层到深层的双模态特征对齐与融合。该过程有效缩小了两种模态间的特征分布差异,提升了LLM对时间序列数据的适用性。最后,采用基于GPT2的大语言模型对提取的故障特征进行精准识别。与传统针对特定数据集和应用场景设计的诊断模型不同,本方法在五个异构数据集上实现了97.32%的平均准确率,较基线模型显著提升超过8.62%。为模拟真实工业场景,研究设计了涉及多种跨条件及数据不平衡场景的诊断任务。该方法在所有场景中均保持超过80%的准确率,展现出卓越的适应性和鲁棒性。此外,还开展了消融研究以验证各独立模块对整体性能的有效贡献。
尽管所提出的方法在故障诊断任务中表现优异,但大型语言模型(LLM)在工业领域的泛化潜力仍有待深入探索。未来的研究将引入多任务提示策略和自适应损失权重调整机制,以构建一个集成故障诊断、设备状态监测及剩余使用寿命预测功能的统一智能模型框架。此次整合将进一步提升大型语言模型(LLM)在工业领域的表征能力与应用范围。
编辑:Kira