本期给大家分享一篇小编近期阅读的1区top文章。如果有故障诊断相关方向研究人员希望宣传自己研究成果,欢迎大家在公 众号后台与小编联系投稿,大家一起交流学习。
本期推荐的这篇是西安交通大学许权宁的文章,本文系统综述了工业故障诊断从“数据驱动深度模型”走向“大模型时代”的完整技术脉络:首先回顾了传统规则/模型/数据三类范式的演进瓶颈,继而梳理了大型语言模型、视觉模型与多模态视觉-语言模型(LVLMs:Large Vision-Language Models)在故障预测与健康管理(PHM:Prognostics and Health Management) 领域的最新进展,指出通用大模型因缺乏工业知识、难以应对跨工况分布漂移与高质量样本稀缺等痛点;在此基础上,重点剖析了数字孪生驱动的深度合成数据、参数高效微调(LoRA:Low-Rank Adaptation)、跨模态对齐与对比学习等关键技术如何协同解决样本不足、域泛化与可解释性三大核心问题,最终提出面向多场景、可对话、可迁移的下一代智能故障诊断大模型研究框架与未来挑战。
由于文章篇幅过长,小编将分两次为大家翻译介绍这篇论文。第一篇推文提出融合深度数字孪生与大型视觉-语言模型的故障诊断框架故障诊断通用语言模型(FDGLM:Fault Diagnosis General Language Model),利用虚拟实体生成高质量振动样本,经短时傅里叶变换(STFT:Short-Time Fourier Transform)转为时频图,再借助LoRA策略对视觉和语言模块进行两阶段微调,实现跨工况、跨设备智能诊断,并构建人机交互式维护决策,突破工业数据稀缺与泛化瓶颈。
希望对大家的学习有所帮助,文章质量很高同时希望大家可以多多引用。
论文题目: Deep digital twin-powered large vision-language model for multi-scenario industrial fault diagnosis
论文期刊:Advanced Engineering Informatics
Doi:https://doi.org/10.1016/j.aei.2025.103997
a National Key Lab of Aerospace Power System and Plas ma Technology, Xi’an Jiaotong University, Xi’an 710049, China
b State Key Laboratory for Manufacturing System Engineering, Xi’an Jiaotong University, Xi’an 710049, China
c School of Mechanical Engineering, Xi’an Jiaotong University, Xi’an, Shaanxi 710049, China
1 引言
2 相关研究
2.1 智能故障诊断
2.2 大规模模型
3 深度数字孪生模型
3.1 滚动轴承的虚拟表示
3.2 虚拟-物理数据流融合
4 所提出的大规模视觉-语言模型
4.1 模型架构
4.2 预训练视觉模型的微调
4.3 查询变换器
4.4 预训练语言模型的微调
4.5 实现流程
5 实验验证
5.1 数据集配置与预处理
5.2 实验设计与实现细节
5.3 数字孪生模型验证
5.4 单工况验证
5.5 跨工况验证
5.6 跨数据集验证
5.7 超参数分析
5.8 消融实验
6 结论
作为工业界与学术界人工智能领域的首要研究焦点,大规模模型已在多学科掀起新一轮技术浪潮。在自然语言处理、计算机视觉与科学计算等领域,这些模型衍生出大语言模型[1,2]、视觉模型[3]及天气预报模型[4]等多元变体。通过跨学科融合,它们进一步演化为融合视觉与文本数据的多模态视觉-语言模型[5,6],以及面向工业视觉监测的多模态对话模型[7]。这些技术对装备健康管理与工业系统智能化升级展现出变革性潜力。
故障诊断作为故障预测与健康管理的核心环节,依托传感器信号分析实现故障类型识别、故障部位定位及严重程度评估。近十年来,计算机科学的范式迁移推动了基于深度学习的诊断方法取得显著突破[8]。凭借端到端学习机制,此类方法在面向特定运行工况定制的数据集上展现出卓越诊断性能。然而,由于域间分布漂移,其性能在不同工况或不同设备间往往难以泛化[9]。将大规模模型技术融入PHM框架,尤其是通过面向故障诊断的专用时序建模架构,为保障机械设备运行稳定性提供了变革性视角[10]。在工业数据集上微调后,预训练视觉-语言模型能够以强泛化能力与上下文理解力完成故障诊断。
此外,多模态数据的有效利用以实现缺陷全面表征仍是持续显著的研究挑战。在真实工业环境中,先进传感系统通常产生多源数据流,涵盖振动、声信号、文本描述及视觉图像。学者已针对各类信号模态展开广泛研究:例如,Löwenmark 等提出弱监督技术语言处理框架,借助自然语言标注提升模型性能[11];Lei 等提出变工况轴承振动信号域自适应诊断方法[12];Liu 等构建动态视觉数据神经形态故障诊断框架,利用脉冲神经网络实现高效特征提取,并通过迁移与元学习增强泛化[13]。大规模模型凭借异构模态对齐、互补特征融合及语义推理[14],在整合文本、图像、音频、视频数据方面展现强大能力,实现全面信息理解与生成。OpenAI 的对比语言-图像预训练(CLIP:Contrastive Language–Image Pre-Training)[15]通过对比学习将视觉与文本模态投影至共享语义空间,实现高效跨模态对齐与检索。将工业图像与文本信息融合后,视觉-语言模型在故障诊断中展现出变革性应用潜力。
深度神经网络架构的演进呈现出参数规模持续扩大的显著趋势。以Transformer框架为代表的大规模预训练模型已相对传统神经网络实现显著性能跃升。依据Vapnik-Chervonenkis维度理论,模型容量、泛化能力与所需训练数据量存在根本关联——即模型越复杂,所需样本越多[16]。因此,构建大规模故障诊断模型亟需高质量数据集且须具备充足样本多样性。然而,工业环境中设备故障发生频率低且复现成本高昂,导致采集多样化多状态数据以构建全面数据集极为困难[17]。为突破该瓶颈,研究者已探索多种数据增强方法:Hei 等提出融合Wasserstein距离与工况标签嵌入生成对抗网络的方法,利用注意力驱动预自适应模块缓解分布漂移[18];Yu 等将信号标签嵌入去噪扩散概率模型,并优化网络架构以提升层内与层间特征表示,实现不平衡数据条件下的精准轴承故障诊断[19]。然而,生成模型固有地难以在合成数据质量与训练规模间取得平衡,因而无法彻底解决数据稀缺问题。数字孪生技术通过利用丰富虚拟资源于工业生态系统内模拟故障状态,为构建高质量训练数据集提供了变革性解决方案[20,21]。Yu 等提出数字孪生特征输入框架,建立虚拟映射关系,实现非接触故障诊断[22]。本文尝试通过孪生数据构建全面训练集,以支撑视觉-语言模型的训练。
综上,为在多状态且高质量数据稀缺的条件下构建智能对话诊断模型,本文提出数字孪生驱动的大规模视觉-语言故障诊断框架。主要创新包括:(1) 研发实用化数字孪生驱动视觉-语言诊断框架;(2) 利用数字孪生构建大规模高质量数据集,满足大规模模型训练需求;(3) 提出故障诊断视觉-语言模型,采用两阶段训练策略对视觉模块与语言模块进行渐进式微调;(4) 开展全面验证,证明该框架在单工况、跨工况及跨数据集场景下均具备智能化多场景诊断性能。本文结构如下:第二节回顾智能故障诊断与大规模模型相关研究;第三节阐述数字孪生模型;第四节介绍所提视觉-语言框架;第五节给出实验结果;第六节总结关键发现并展望未来研究方向。
2.1 智能故障诊断
在旋转机械领域,借助 DT 的动态建模正成为研究热点;优质的动态模型是 DT 建模的根基,可为后续虚实交互提供高保真虚拟信号。当前研究主要集中于轴承、齿轮与转子系统。对轴承系统,研究重心为轴承损伤(如内圈、外圈及滚动体损伤)的动态建模,主要关注轴承自身力学特性,而不考虑转子系统影响。对齿轮传动系统,研究重心为裂纹、剥落、磨损、断齿等故障状态下齿轮传动系统的动态建模。对转子系统,当前重心主要为不平衡、不对中、碰摩、机座松动等工况下的转子系统动态建模 [50]。这三类系统所采用的主要建模方法包括:基于物理的模型(如集中参数模型、有限元模型、刚−柔耦合模型)、唯象模型以及数据驱动模型。
从另一个角度来看,故障诊断经历了四个关键的开发阶段。如图1(a)所示,传统的诊断技术主要集中在一维振动信号分析上。这些模型通常使用工业数据从零开始进行训练,但往往受到泛化能力有限的影响,并且需要大量的训练样本。如图1(b)所示,预训练模型显著降低了对标记样本的依赖。通过将一维信号转换为图像,已经建立的视觉模型(如视觉Transformers(ViT:Vision Transformers)[28])成功应用于故障诊断。大型语言模型(LLMs:Large Language Models)利用其在序列信号处理方面的强大能力,为PHM引入了新的范式。这些模型通过智能人机交互在分类和预测任务中实现了高性能[3,4]。如图1(d)所示,视觉-语言模型超越了LLMs的局限性,通过动态融合视觉和文本特征来增强多模态推理能力[7,29]。具体而言,使用信号处理技术将一维信号转换为二维表示。这种转化不仅满足了基于视觉模型的输入要求,还增强了与故障相关的特征,同时减少了因采样频率差异和设备特定变异而引起的伪影。LVLMs利用领域特定的文本语料库实现准确的故障分类和因果推断。此外,通过利用视觉和语言特征之间的深度交互,该模型支持高精度的故障诊断和在工业应用中的知情决策。因此,本研究重点关注使用LVLMs进行精确的轴承故障诊断。
图1 不同阶段的故障诊断办法
2.2 大规模模型
大规模模型是计算机科学中的一个关键前沿,最初出现在自然语言处理(NLP:Natural Language Processing)领域[30]。为了处理图像和视频等视觉数据模态,这些模型已经演变为大规模视觉-语言架构。通过将视觉和文本数据映射到统一的语义空间,这些模型实现了跨模态的相关性和理解。Luo等人提出了一种对比跨模态去噪框架,通过结合跨模态匹配与模态内部去噪,利用被遮挡和未遮挡视频帧之间的对比来改善视觉-文本对齐[31]。然而,由于缺乏领域特定的知识,现有的大型语言模型在工业视觉数据上的表现不尽如人意。近期的研究努力专注于为PHM应用开发专用的LLMs。Wang等人开发了一种多模态晶圆缺陷数据集,并使用LVLMs实现了高精度的多类缺陷识别[32]。Zheng等人针对复杂系统的故障诊断进行了初步研究,使用预训练的大型模型进行数据集大小、数据预处理和可解释性等因素的定量和定性评估[33]。Tao等人推出了首个用于轴承故障诊断的大型语言模型,通过统计分析选择振动信号特征,并验证其在少样本和跨数据集场景下的性能[10]。Tang等人提出了一种针对少样本和零样本场景设计的大规模视觉-语言模型。通过联合优化交叉熵损失、焦点损失和Dice损失,该模型在样本有限的情况下也能实现准确的故障识别[29]。针对故障诊断的LLMs研究仍处于早期阶段,如何在故障数据稀缺的条件下有效操作仍是一个主要挑战。
从头训练含数亿到万亿参数的大规模模型计算开销惊人,于是学界转向参数高效微调:仅更新极少额外参数即可把预训练模型“挪”到新任务。全参数微调虽更新全部权重,却丝毫未减算力负担;当前把通用大型视觉-语言模型拉进垂直场景,几乎全靠这类“轻量”微调,主流套路有 Adapter、Prefix-Tuning 和低秩适应。Adapter 在每个 Transformer 层塞入轻量前馈子模块 [34],训练时只动这些“小插头”,思路简单却额外加层,推慢推理,且参数效率与优化深度仍受限;Prefix-Tuning 把一串可训练的“前缀 token”贴到输入,靠冻结主干、只调前缀来引导输出 [35],但连续软提示直接学习极易震荡、收敛糟糕;相比之下,LoRA 用低秩矩阵逼近权重更新 [36],在算力与性能间切出最优权衡——Meta 的工作已证实,预训练模型本征维度极低,在此压缩子空间微调即可媲美全参更新;LoRA 仅对高维 权重矩阵做低秩分解、训练其中一小撮参数,便实现“四两拨千斤”。
令预训练模型中 特定层的原始权重矩阵记为 ,微调更新为 ,得到更新后的参数矩阵 。根据LoRA假设,更新 可以用两个低秩矩阵的乘积近似: ,其中 , 和 。这里, 作为一个超参数控制着低秩近似的复杂度。与传统的微调更新整个矩阵 不同,LoRA只需要 个额外参数,显著降低了计算成本和内存占用。如图2所示,在前向过程中,给定一个输入 ,,层的输出h被计算为:
矩阵 使用高斯分布初始化,而 初始化为零矩阵。值得注意的是,尽管只引入了少量的额外参数,LoRA实现了与完全微调相当的性能,同时大幅降低了计算和内存成本[38]。
图2 LoRA微调方法示意图
深度数字孪生(DDT:Deep Digital Twin)技术通过将深度学习算法嵌入数字孪生框架,并以生成模型为桥梁,实现虚拟-物理的高保真映射 [39]。概念上,DDT 由三大核心单元构成:物理实体、虚拟实体以及虚实映射网络 [40]。为构建覆盖全健康状态的大规模训练数据集,本文借助 DDT 生成多样化多健康状态数据。
3.1 滚动轴承的虚拟表示
在为精准复现轴承振动特征与失效机理,本文以六自由度动力学模型作为虚拟映射:如图 3 所示,该模型将六个自由度分配至内圈、外圈与壳体部件。
该模型融合滚动体非线性接触、润滑油膜阻尼及缺陷效应等关键因素。运动方程基于 Hertz 接触理论建立,用以刻画滚动体与滚道间的弹性相互作用;针对不同故障类型,通过将几何缺陷参数与动态响应数据耦合,量化缺陷引发的位移扰动。非线性接触力由接触变形计算,速度相关阻尼则表征油膜效应。轴承系统微分方程见式 (2)。采用 Runge-Kutta 法数值求解,获得机匣振动位移,并通过二阶差分生成仿真加速度信号。详细建模流程与参数设置参见文献 [41]。该虚拟建模方式可大规模生成多故障数据集,服务于下游基础模型训练。
图3 滚动轴承的虚拟表示
3.2 虚拟-物理数据流融合
基于前期研究 [41,42,43],本文采用 CycleGAN架构建立虚拟域与物理域的双向数据转换,如图 4 所示。具体而言,该框架配置两对镜像对称的生成器-判别器,实现仿真振动信号与真实振动信号的循环映射。训练过程通过对抗损失与循环一致性损失的联合优化进行引导,其中对抗损失与循环一致性损失的比例设为 0.1 [41]。通过每对生成器-判别器之间的迭代对抗学习,仿真信号被转换为高保真的合成信号,即孪生信号。实验结果表明,这些孪生信号在波形特征上与实际测量数据高度一致,能够有效捕捉环境噪声及故障相关信息。因此,所生成的数据可直接用于故障诊断、剩余使用寿命预测等下游任务。更多实现细节参见文献 [41,42]。

图4 基于CycleGAN框架的虚实数据流融合
为提升故障诊断的可及性与智能化水平,本文提出数字孪生驱动的大规模视觉-语言模型机械故障诊断框架。该框架实现 LVLM 在工业场景下的实用化部署,并缓解标注数据稀缺带来的训练瓶颈;通过将专家知识注入模型,进一步增强自动化能力,显著简化日常维护与巡检流程。
4.1 模型架构
DGLM 采用时–频谱图分析,以支持直观且高效的人机交互故障识别。如图 5 所示,整体框架由三大模块组成:数字孪生模块、信号预处理模块与 FDGLM。首先,通过虚拟–物理数据流集成构建深度数字孪生模型,生成大量孪生信号用于 FDGLM 训练。随后,信号预处理模块利用 STFT 将一维孪生信号转换为二维时–频谱图,使其格式与视觉模型输入要求对齐。为使视觉–语言模型适配机械系统的智能运维任务,采用两阶段微调策略,包括视觉与文本编码器适配;两阶段均使用 LoRA 技术实现高效参数调优。预训练 ViT 作为视觉编码器,经微调后增强从时频表示中提取故障相关模式的能力;同时,ChatGLM-6B 作为文本编码器。为使模型对齐领域特定知识(如诊断术语与推理逻辑),利用 LoRA 联合微调视觉与文本编码器,确保跨模态表征学习最优。QueryTransformer 模块通过可学习查询注意力机制,将提取的视觉特征转换为语义丰富的文本表示,从而桥接 ViT 与 ChatGLM-6B。
两阶段训练流程逐次优化视觉与文本模态:基于 LoRA的轻量适配在冻结绝大部分预训练编码器参数的同时注入领域知识,有效抑制灾难性遗忘。LoRA 层被选择性嵌入视觉与语言编码器的关键组件,使模型在可训练参数大幅减少的情况下仍获得与全参数微调相当的性能。第一阶段聚焦时频谱图的视觉特征抽取,第二阶段转向基于文本的故障理解与决策生成,最终形成覆盖数据解读与动态决策的闭环智能维护体系。
图5 基于深度数字孪生驱动LVLMs的故障诊断框架
4.2 预训练视觉模型的微调
在 FDGLM 框架中,ViT充当视觉模型的骨干。ViT 已在大规模公开图像数据集上完成充分预训练,对自然图像的视觉表征提取能力强劲 [44]。然而,由于振动信号谱图与常规图像在视觉特性上存在本质差异,若冻结视觉编码器、仅训练语言模型,效果并不理想。受近期研究 [32] 启发,我们采用 LoRA策略对预训练 ViT 进行微调,使其能够有效捕捉由振动信号生成的时频表示的独特特征。通过增强 ViT 对工业谱图的建模能力,框架得以提取更具判别力的故障特征,微调流程示于图 6。
图6 基于LoRA的视觉模型微调
ViT的操作方式是将输入图像划分为固定大小的块,这些块随后作为顺序输入格式中的元素进行处理,如图7所示。对于尺寸为
图7 图像块及位置嵌入示意图
一个可学习的类标记,记为
其中
综上,为在多状态且高质量数据稀缺的条件下构建智能对话诊断模型,本文提出数字孪生驱动的大规模视觉-语言故障诊断框架。主要创新包括:(1) 研发实用化数字孪生驱动视觉-语言诊断框架;(2) 利用数字孪生构建大规模高质量数据集,满足大规模模型训练需求;(3) 提出故障诊断视觉-语言模型,采用两阶段训练策略对视觉模块与语言模块进行渐进式微调;(4) 开展全面验证,证明该框架在单工况、跨工况及跨数据集场景下均具备智能化多场景诊断性能。本文结构如下:第二节回顾智能故障诊断与大规模模型相关研究;第三节阐述数字孪生模型;第四节介绍所提视觉-语言框架;第五节给出实验结果;第六节总结关键发现并展望未来研究方向。
其中
如图6所示,微调过程冻结了ViT模型的所有预训练参数,只更新插入的LoRA矩阵。为了确保跨多个健康状态的准确分类,交叉熵损失被用作主要分类目标:
此外,为提升模型对振动信号时频表示中显著特征的敏感度,我们引入对比学习策略:构建正、负样本对,最大化正对相似度并最小化负对相似度;采用 Circle Loss 对该策略进行优化,从而增强模型在工况多变或设备差异下对同一故障类型的识别鲁棒性 [48]。
其中,
两项损失虽共同优化视觉特征表征,却各有侧重:交叉熵损失作为首要分类准则,为模型划定健康状态间的决策边界,实现故障精准归类;Circle 对比损失则提升模型对振动信号时频图中细微特征的敏感度,强化其捕获故障本质特性的能力,并促使所学特征更具判别力且工况不变,显著增强跨工况诊断的鲁棒性与泛化性。二者协同,既保证分类精度,又大幅提升模型的适应性与韧性。
4.3 查询变换器
由Salesforce Research开发的查询变换器(Q-Former:Query Transformer)是一种轻量级的变换器架构,有效地连接了预训练的视觉和语言编码器。它促进了强大的跨模态特征对齐和特定任务的适应。其主要目标是将视觉特征映射到大语言视觉模型的语义空间中,最小化参数更新,从而最大限度地重用冻结的预训练组件。
如图 8 所示,Q-Former 从冻结的 ViT 编码器提取的特征中构建一组可学习的视觉查询向量;这些查询向量捕获特定语义属性,如故障类别与缺陷尺寸。Q-Former 架构包含三大关键模块:交叉注意力、自注意力与前馈神经网络。在交叉注意力层,查询向量与视觉 token 交互,提取与文本数据语义对齐的任务相关信息;自注意力机制随后促进查询间的内部交互,增强语义一致性;所得表征经前馈网络进行非线性变换并调整输入格式。通过多个 Q-Former 块后,输出的查询向量封装高级视觉语义,并被送入语言编码器进行联合训练。为优化 Q-Former 的表征能力,Salesforce Research 引入多目标优化策略,最小化文本对比损失、文本匹配损失及图像条件文本生成损失。更多实现细节参见文献 [49]。
图8 Q - Former的架构
通过使用可学习的查询向量,Q-Former 有效地融合了视觉和语言表示。它无缝地融入了所提出的两阶段训练策略中,使视觉特征与文本语义对齐,并使大型语言模型能够基于视觉上下文生成连贯且特定领域的文本输出。
4.4 预训练语言模型的微调
在本小节中,预训练的 ChatGLM-6B 语言模型采用 LoRA 方法进行微调,以优化其在工业故障诊断任务中的性能。通过利用定制设计的图文配对数据集,微调后的模型能够从文本描述中提取与故障相关的特征,并将其与相应的故障模式关联。此外,该模型对特定任务要求的理解得到了提升,能够生成准确且具上下文感知的文本解释。在智能维护的全面知识基础支持下,该模型还提供简洁且可行的建议,以辅助操作决策。图文数据集构建的详细信息见第 5.1 节。
如图9所示,诊断文本首先被切分为适合模型处理的离散单元;随后这些 token 被嵌入为连续向量,以捕获文本的语义内容。对于给定文本序列
其中
图9 基于LoRA的语言模型微调
4.5 实现流程
编辑:赵栓栓
校核:李正平、陈凯歌、曹希铭、赵学功、白亮、任超、海洋、陈宇航、Kira、Tina、王金、赵诚、肖鑫鑫、张优
该文资料搜集自网络,仅用作学术分享,不做商业用途,若侵权,后台联系小编进行删除