本期推荐论文提出了一种创新的FD-LLM框架,将大语言模型(LLMs)应用于可解释故障诊断。通过设计字符串标记化机制,将振动信号的FFT和包络频谱编码为文本序列,使LLMs能够直接处理传感器数据。FD-LLM包含两个互补的训练范式:分类导向方法用于量化评估诊断性能,频谱语言建模方法则生成人类可读的故障解释。在多个公开轴承数据集上的实验表明,Llama3系列模型在有效性、适应性、鲁棒性和少样本泛化性方面均表现优异,特别是在频谱建模任务中,模型能够识别特征频率、谐波和边带,并生成准确的诊断结论。该研究为工业智能维护提供了一种兼具高精度与可解释性的新思路。由于论文篇幅较长,分为上下两篇介绍。
论文题目:
Large language models for explainable fault diagnosis of machines
论文日期:2025
论文链接:
https://doi.org/10.1016/j.engappai.2025.113131
作者:
Hamzah A.A.M. Qaid (a) , Bo Zhang (b) , Shuai Su (b), Dan Li (c) , See-Kiong Ng (d) , Wei Li (b,∗)
a: School of Mechatronic Engineering, China University of Mining and Technology, Xuzhou, 221116, China
b: School of Computer Science and Technology/School of Artificial Intelligence, China University of Mining and Technology, Xuzhou 221116, China
c: School of Software Engineering, Sun Yat-Sen University, Zhuhai 519080, China
d: Institute of Data Science, National University of Singapore, Singapore 117602, Singapore
作者简介:
李伟,教授,中国矿业大学城市应急技术装备研究中心主任。(https://faculty.cumt.edu.cn/LW12345678/zh_CN/index.htm)摘要
1. 引言
2. 相关工作
2.1 智能故障诊断
2.2 基于大语言模型的时间序列数据
3. 方法
3.1 FD-LLM框架
3.1.1 分类导向训练方法
3.1.2 上下文感知频谱语言建模方法
3.2 数据预处理
3.2.1 FFT预处理
3.2.2 统计摘要
3.2.3 变分模态分解
3.2.4 时间序列数据编码
3.2.5 指令微调
4. 实验
4.1 数据与评估任务
4.1.1 数据集
4.1.2 评估任务
4.2 模型
4.3 设置
4.4 评估指标
4.5 结果与讨论
4.5.1 基于分类导向的评估
4.5.2 上下文感知频谱语言建模评估
5. 结论
大型语言模型(LLM)在从文本数据中提取复杂概念表征方面展现出卓越能力,广泛应用于各类实际场景。然而,在智能故障诊断(IFD)领域,利用振动信号等传感器数据至关重要,但由于时间序列数据与LLM输入特征之间的模态差异,这一目标仍面临挑战。现有解决方案往往仅将LLM视为分类器,忽视了其对振动数据进行理解与推理的潜力。本文提出了一种新型基于LLM的故障诊断框架(FD-LLM),通过将振动信号编码为文本表示形式实现信号与LLM的对接。FD-LLM采用分类导向方法,将故障诊断转化为多类别分类任务以评估LLM性能;同时引入上下文感知的频谱语言建模方法,实现可解释且基于推理的故障分析。我们在多个数据集和噪声条件下使用FD-LLM评估了四种开源LLM模型的有效性、适应性和鲁棒性。结果表明:LLaMA等模型不仅具备稳健的诊断性能、出色的零样本适应能力,还能在小样本学习场景下实现跨数据集的高效泛化;进一步证明LLM完全能够实现可解释的故障诊断。
关键词: 智能故障诊断,大语言模型,时间序列编码,指令微调
在智能制造和数字化产业时代,状态监测(CM)已成为确保运行可靠性、安全性和成本效益不可或缺的关键手段。状态监测系统利用传感器数据(如振动、声学、温度等)及先进分析技术来评估设备健康状况,及时发现设备劣化迹象及潜在故障(Jardine等人,2006)。然而,状态监测的真正价值在于其诊断智能性:即通过解析传感器信号模式来确定故障类型、严重程度及位置的能力(Nunes等人,2023)。因此,有效的故障诊断必须具备抗噪声能力、适用于不同设备及运行工况的普适性,并提供可解释的推理机制以支持复杂工业环境中的人工决策。
传统的诊断方法高度依赖人工模式识别和专家主导的信号分析,这些方法虽然有效,但缺乏可扩展性及对多样化工业场景的适应能力(Abid等人,2021)。随着传感技术和计算能力的发展,机器学习(ML)与深度学习(DL)方法已成为智能故障诊断(lFD)系统的核心支撑要素(Surucu等人,2023)。过去二十年间,这类数据驱动方法在处理复杂时间序列信号方面展现出卓越性能(Liu等人,2018;Zhao等人,2020),推动了其在各行业的广泛应用。然而仍存在诸多挑战:大多数基于机器学习和深度学习的模型在应用于新设备或运行环境时需要大量重新训练;缺乏可解释性;且难以整合异构传感器信息——这些因素均限制了其在实际应用中的可靠性和透明度。
大型语言模型(LLMs)(Zhao等人,2023;Zhou等人,2023)的出现——例如GPT-2(Radford等人,2019)、Llama-2(Touvron等人,2023)以及Qwen-2(Yang等人,2024)——彻底改变了人工智能领域的发展格局。这些模型最初为自然语言处理(NLP)而开发,在推理、抽象和泛化方面展现出卓越能力,使其成为推动通用人工智能(AGl)发展的理想候选方案。多模态LLM(MLLMs)的最新进展进一步提升了其处理跨域数据的能力,为其在lFD中的应用开辟了新可能性。实现这一整合的核心前提是将传感器数据编码为与大语言模型(LLM)兼容的格式。当前研究探索了多种方法,包括基于字符串的分词技术和统计摘要技术(Gru-ver等人,2023;Jin等人,2023)、模态特定编码器(Belyaeva等人,2024),以及将时间信号转换为图像以供大语言模型使用的基于视觉的变换方法(如Qwen-VL,Bai等人,2023)。
基于这些进展,新兴研究开始利用大语言模型(LLM)通过多种编码方案进行IFD。例如针对振动数据设计的模态专用架构(Tao等人,2025)、结合多模态语言模型(MLLM)的基于视觉的谱表示方法(Wang等人,2025)。在预测与健康管理(PHM)领域,更广泛的研究致力于开发能够处理多项任务的大规模基础模型——包括故障诊断、剩余使用寿命预测和异常检测(Yaguo等人,2025)。此外,LLM提示机制与自校正微调技术已应用于HVAC故障诊断:经过微调的GPT-3.5甚至超越了GPT-4,实现了近乎完美的准确率(Zhang等人,2025)。尽管取得这些进展,当前研究仍主要聚焦于弥合模态差异与提升分类精度,而未能充分挖掘LLM固有的认知优势,如上下文推理、抽象化能力和自然语言生成能力。因此,大语言模型在实现可解释且可解读的故障诊断方面的潜力仍未被充分探索。要真正超越传统的机器学习和深度学习框架,基于大语言模型的方法必须充分利用这些能力来实现可解释的故障诊断,使模型能够对信号特征进行推理并生成人类可读的解释。
利用大型语言模型推进可解释性故障诊断面临双重挑战:一是缺乏能够将传感器信号与文本解释相匹配的多模态数据集;二是构建时域数据集本身存在固有困难。这些挑战源于专家标注资源有限、缺乏标准化诊断规则,以及复杂且对噪声敏感的动态特性会掩盖故障特征。缓解这些问题的一个有前景方向是从时域转向频域分析——后者能提供更具可解释性和物理意义的表征方式。频域中的特征故障频率建立了频谱成分与缺陷类型之间的明确关联,从而简化了对齐信号-文本对的生成过程。该方法与近期基于可解释深度学习的研究方向一致,这些研究通过利用频谱表征中明显的特征频段和谐波结构来量化可解释性(Li等人,2023;Brito等人,2023)。
为应对这些挑战并充分发挥大型语言模型(LLM)在故障诊断(IFD)中的推理潜力,我们提出了FD-LLM——一种基于LLM的故障诊断框架,该框架整合了两种互补的训练方法。第一种是面向分类的方法,旨在使LLM适用于多类别故障诊断,并能够系统评估诊断的有效性、泛化能力和鲁棒性这三大关键但尚未充分研究的性能维度;第二种是具备上下文感知能力的频谱语言建模方法,不仅超越了传统分类任务,还能解析频谱内容并生成易于理解的故障机制说明。与以往依赖特定模态编码器或多模态LLM的研究不同,FD-LLM采用了一种简单而高效的基于字符串的分词方案,可将快速傅里叶变换(FFT)或包络谱转换为文本序列。这种方法既保留了频域结构特征(如峰值、谐波和边带),又促进了频谱模式与文本推理之间的关联。我们的研究成果总结如下:
(1)我们提出FD-LLM这一双轨框架,它融合了以分类为导向的建模范式与频谱-语言建模范式,能够在IFD中同时实现定量评估与定性可解释性。
(2)我们设计了一种基于字符串的分词机制,可直接将FFT和包络谱编码为文本序列,并提出一种多模态监督微调(SFT)数据集构建方法,实现谱图与诊断描述的精准对齐。
(3)采用基于分类的评估流程,我们对多种开源大语言模型(如Ll-ama模型、Qwen1.5-7B和Mistral7B-v0.2)进行了性能基准测试以评估其诊断能力。通过频谱-语言建模方法,我们证明了大语言模型能够对频谱表示进行推理、识别与故障相关的证据,并生成可解释且易于人类阅读的解释结果。
智能故障诊断(IFD)长期以来一直是工业维护领域的核心课题,其重大进展主要得益于机器学习(ML)和深度学习(DL)的发展。早期基于ML的方法依赖于通过信号处理提取的人工特征(Wang等,2017),并利用支持向量机(SVM)(Wu与Meng,2006;Tang等,2010)、K近邻算法(KNN)(Wang,2016;Pandya等,2013)、朴素贝叶斯(Zhao等,2009;Muralidharan与Sugumaran,2012)以及人工神经网络(ANN)(Mrugalski等,2008;Rafiee等,2007)等分类器进行故障识别。尽管这些方法在特定场景下效果显著,但它们高度依赖特征工程的质量,并难以处理大规模复杂数据集。
深度学习(DL)的出现通过实现直接从原始传感器信号中自动提取特征,标志着范式的转变。卷积神经网络(CNNs)已被广泛应用于捕捉振动数据中的空间层次结构(Zhang等人,2017b;Ince等人,2016),而循环神经网络(RNNs)则利用时间序列数据中的时序依赖性(Yuan等人,2016;Zhao等人,2016)。尽管效果显著,深度学习模型通常需要大量标注数据进行训练,并且往往难以在不同设备或运行条件下进行泛化,除非经过大量重新训练。此外,其黑箱特性阻碍了可解释性,限制了在关键工业应用中的可信度。
为解决这些局限性,领域适应(DA)技术应运而生,旨在提升模型在不同领域的迁移能力(Zhao等人,2019)。目前已出现多种方法论,包括闭集领域适应(CSDA)(Zhang等人,2022)、部分领域适应(PDA)(Wang等人,2022)以及开放集领域适应(OSDA)(Guo等人,2022)。近期进展如伪标签引导的双分类器网络(Sun等人,2025b)以及基于时频融合的开放集分类方法(Sun等人,2025a)显著提升了故障识别性能与鲁棒性。然而,领域适应方法仍面临诸多挑战:其效果往往取决于源域与目标域之间的相似度,显著差异会降低性能;需要进行重训练或微调,计算成本较高;且如何在不同运行条件下实现稳定的适应性调整,仍是实际应用中的未解难题。
主流大型语言模型并非天生适用于时间序列数据处理,但最新研究表明该领域潜力日益显著(Jin等人,2024)。目前已有三种主要策略被提出以弥合这一差距:基于视觉的表征方法、特定模态编码器以及基于文本的编码方案。
基于视觉的方法可将时间序列数据转化为图表或图像,使多模态大语言模型(MLLMs)能够对其进行处理(Chen等人,2025)。虽然这种方法能有效利用预训练的视觉-语言模型,但往往会丢失精细的时间信息,并受图像分辨率限制。
模态特定编码器利用嵌入层或预训练编码器将数值序列映射至大语言模型的输入空间。Spathis与Kawsar(2024)采用轻量级嵌入层及提示设计来缓解文本与数值数据之间的模态差异。Time-LLM(Jin等人,2023)利用前缀提示将时间序列输入重编程至语言空间以提升预测性能;而TEST(Sun等人,2023)则通过对比学习和软提示使时间序列嵌入向量与大语言模型对齐。尽管这些方法能够从振动信号中准确分类故障类型,但往往掩盖了频谱特征(如特征频率、谐波及边带),从而限制了模型的可解释性与推理能力。
基于文本的编码方法将时间序列数据转换为语言模型可解析的数值字符串。例如,Gruver等人(2023)提出了基于字符串的数值简单分词方案;而Ansari等人(2024)则开发了可逆缩放与量化方法,适用于基于Transformer的序列建模。然而这些方法主要针对时序预测而非故障诊断设计。相比之下,我们的编码流程专注于频谱域表征——诊断特征表现为结构化的频率模式(如峰值、谐波、边带)。提出的频谱到文本编码方案在原有分词框架基础上实现了双重改进:(1)在频域操作以保留谐波结构和相对振幅;(2)应用量化与缩放处理以保持频谱成分间的比例关系。其核心创新点在于将频谱模式与文本诊断描述对齐,从而构建能结合频谱证据与专家语言解释的多模态数据集。与直接时域编码相比,这种对齐方式为基于大语言模型(LLM)的故障诊断提供了更具可解释性且语义更丰富的基础。
FD-LLM框架通过两条主要流程将大语言模型(LLM)应用于故障诊断:(1)以分类为导向的方法用于直接故障识别(图1);(2)基于上下文感知的频谱-语言建模方法,旨在提升可解释性并利用编码后的频谱特征支持专家交互(图2)。FD-LLM将原始振动信号预处理为三种表示形式:统计摘要、FFT向量以及频率-振幅谱。这些表示形式可用于通过低秩自适应(LoRA)对LLM进行指令调参。分类流程充分利用所有表示形式,而频谱-语言建模流程则仅使用频谱数据生成可解释的诊断洞察。
为了评估不同LLM在不同信号表示(包括统计摘要、编码FFT向量和编码频谱数据)下的诊断性能,采用了分类导向流程。具体来说,给定一个故障样本 和一个相应的提示 (其中包含了机器运行条件和诊断指令),目标是学习一个基于LLM的分类器,将 映射到标签空间 。该分类系统可以表示为:
其中 表示系统生成的原始文本输出。
由于LLM以自然语言生成预测,使用标准的深度学习指标评估其性能需要将文本输出和相应的真实标签映射为数值格式。为方便起见,我们定义一个映射函数 ,使得 ,其中 表示数值标签空间。
频谱-语言建模流程训练LLM对频谱特征进行推理并阐述与故障相关的模式,从而实现可解释和交互式诊断。它使LLM能够识别和描述故障特征——如特征频率、谐波和边带——同时生成人类可理解的结论。形式化地说,给定一组频谱样本 ,其中每个 表示一个频谱的频率-幅值对序列,以及一个自然语言提示 ,目标是生成一个响应 (观察和结论),捕捉 中的相关故障特征。该方法的任务可以表示为:
其中 FDllm 表示解释 并通过分析 中的模式和故障特征来生成 的系统。
然而,开发一个具有强大频谱模式理解和推理能力的故障诊断LLM需要高质量的多模态(频谱-语言)训练数据。为此,我们采用了一种机制来提取描述频谱属性(如主导故障频率、边带和谐波)的文本观察,随后给出指示机器健康状态的结论。多模态数据构建过程如图2所示。
图1. FD-LLM分类导向型训练框架的总体架构。针对统计特征、FFT特征及频谱特征,分别采用了三种预处理流程。
图2. FD-LLM频谱-语言建模方法的概述。
该过程包含三个步骤。首先,通过变分模态分解(VMD)将不同轴承健康状态(包括内圈故障、外圈故障、滚动体故障以及正常状态)的振动信号转换为频谱表示。同时,利用轴承几何参数(滚珠直径 、节圆直径 、滚珠数量 )和转速来计算理论故障相关频率,如轴频 、滚珠通过频率( 、 )和滚珠自转频率( ),以及它们的谐波和边带。其次,使用计算出的故障特征频率自动标注每个频谱样本,生成一组属性。对于每个特征频率,提取相应的幅值,包括特征频率处及其相邻频点(由频率分辨率决定)的幅值,以确保与故障模式的精确对齐。类似地,识别谐波倍数和边带特征以丰富标注属性。第三,使用预定义的故障特定模板( 用于指令, 用于答案)生成问答对。对于每种故障类型,随机选择一个模板,并用提取的属性、领域知识规则和故障类型填充,同时将编码后的幅值和文本频率描述附加到输入中。
为确保多模态数据集的鲁棒性和多样性,每种故障类型设计了三个不同的模板,以捕捉不同的诊断视角,从而增强LLM生成上下文丰富响应的能力。振动信号被分割为1秒的片段,以实现1:1的频率分辨率,从而能够进行精确的频谱分析并准确识别故障相关频率。此外,还进行了人工验证过程,审查标注过程以验证生成的文本描述是否与频谱特征准确对齐,确保数据集的事实一致性,从而有效训练LLM。
给定一组时域振动信号 ,其中 J 是信号总数,每个信号被分割成 K 个片段,每个片段长度为 L。第 k 个片段记为 ,其中 。这种分割有助于减少振动信号的长度,确保它们不会超过LLM的最大序列长度(例如,MISTRAL的最大上下文长度为32k个token,Llama3支持高达8k个token),同时增加了训练样本的数量。对于每个片段 ,我们计算FFT,它本质上是离散傅里叶变换(DFT)的高效实现。DFT的数学表达式为:
其中 i 是虚数单位。
我们进一步计算每个FFT系数的幅值为 。为确保各片段之间的一致性,我们通过其最大值对幅值进行缩放,即 。这得到了归一化的、非负的FFT表示 ,从而避免了不必要的符号标记化。来自所有信号的完整FFT处理样本集可以表示为 ,其中 ,对于 ,且 。
随后,将FFT处理后的样本进行编码,并整合到相应的数据生成模板中,如表1所示。
对于每个片段 ,我们提取了包含15个时域与频域特征的集 合。时域特征包括均值、均方根值(RMS)、标准差、峰因子、偏度、形状因子、峰度、峰峰值、能量因子及脉冲因子;频域特征则涵盖峰值频率、峰间频率、谱峰度、谱带宽和谱偏度。这些特征的具体构成及其对应的数学公式详见表A.1。为确保与大语言模型(LLM)兼容,所有特征均通过转换为预定义提示模板中的简洁文本摘要进行序列化处理,该模板列于表1中。
表1 用于生成训练数据的模板
采用变分模态分解(VMD)作为预处理步骤,用于提取振动信号的包络谱。VMD将振动信号自适应地分解为预定义数量的模态,有效地将故障相关成分与噪声分离。然后可以从主导模态中提取包络谱。其目标是:(i)获得一种对噪声鲁棒且泛化的表示,该表示保留与轴承故障频率相关的信息;(ii)获得一种能够生成带有明确推理步骤的数据的信号表示,使模型能够遵循指令并执行逐步故障诊断。
具体来说,给定一个信号 x(n),将其分解为有限数量的模态 u_h(n),每个模态围绕特定的中心频率 ,其带宽使用 范数进行估计。这种分解通过求解一个约束变分优化问题来实现,该问题最小化所有模态的总带宽,条件是它们的和能够重构原始信号。这确保了每个模态保持窄带并在频域中良好分离。数学上,优化问题表述如下:
公式(4)中的优化问题通过引入二次惩罚因子 和拉格朗日乘子 转化为无约束问题。增广拉格朗日函数表示为:
公式(5)可以使用交替方向乘子法(ADMM)求解,该方法迭代更新模态 、它们的中心频率 和拉格朗日乘子 ,直到收敛。
从主导VMD模态导出的包络谱被用于两个训练流程。对于分类导向的流程,编码后的频谱被整合到与FFT样本类似的数据生成模板中,并在指令中加入知识规则。对于频谱建模方法,数据生成遵循图2所示的步骤。轴承的缺陷特征频率在附录B中介绍。
LLM依赖标记化(tokenization)将输入文本转换为标记序列,这是一个关键过程,因为微小的差异可能显著改变模型行为。字节对编码(BPE)是一种常用的标记化技术,它将输入数据作为位串处理,根据其在训练数据中的频率生成标记。然而,BPE可能将数值分割成多个与其数字不对齐的标记,影响模型解释数值数据(如频谱样本)的能力。将这些数据正确编码为文本格式以确保准确的标记化,对于获得可靠的LLM预测至关重要。
受Gruver等人(2023)的启发,我们将FFT和频谱样本转换为适合LLM标记化的字符串数字序列。给定一个样本 ,我们定义了一个编码函数 ,该函数执行一系列可逆步骤:符号处理、量化和字符串标记化,如下详述,并在附录C算法(C1至C4)中形式化。
符号处理: 函数 处理每个频谱值 的符号,以确保与可能的负值兼容,尽管频谱数据本质上是非负的。该符号确定如下:
这将产生一个符号数组 ,如算法C1所示。对于非负数据,通常有 ,从而最小化不必要的符号标记。
量化: 函数 处理频谱值的高精度问题,以提高计算效率并减少标记使用。对于每个 ,绝对值 乘以 (其中 D 是小数位数),并截断为整数: 。缺失值(NaN)在布尔掩码 中标记,其中 表示 NaN,否则 。输出是一个量化数组 ,其中每个 是一个整数(对于 NaN 为 0),如算法C2详述。最大值被限制为 以确保有限位表示。
字符串标记化: 函数 将量化数组 、符号数组 和缺失掩码 转换为字符串表示,如算法C3所示。每个 被转换为十进制数字字符串,不带小数点或空格,以优化Llama-3、Mistral等LLM的标记化。
组合编码函数: 复合函数 encode() 协调这些步骤,如算法C4所形式化:
这产生了一个可逆的字符串表示 ,其中值可以通过解析标记、将整数除以 并应用 中的符号来解码,缺失值通过 M 处理。
指令微调(Instruction tuning)是一种全监督微调技术,用于在特定目标领域上进一步训练LLM。这种方法不仅增强了LLM遵循人类指令的可控性,还使其能够将现有知识适应到新任务的细微要求中。最近的研究表明,经过指令微调的LLM在未见任务上表现出强大的零样本泛化能力,这在工业故障诊断中是一个非常有价值的特性,因为有限的数据和多样的运行条件对构建鲁棒、泛化的系统构成了重大挑战。
为了实现高效的指令微调并减少计算负担,我们采用了低秩适配(LoRA),它在模型层中引入可训练的低秩矩阵,以实现参数高效的适配。对于任意预训练权重矩阵 ,LoRA 用低秩分解表示权重更新矩阵 ,使得:
其中 是一个缩放因子,通常用于控制权重更新的幅度,而 是关于 的常数。低秩矩阵 和 分别使用随机高斯分布和零进行初始化。
在微调过程中,只有低秩矩阵 和 被更新,而原始权重矩阵 保持冻结。在前向传播中,输入 同时被冻结的 和可训练的 处理,它们的输出按坐标求和。
(实验及结论见下篇)