工业设备的故障诊断,能不能像 ChatGPT 一样:看懂时频图、说清故障原因、还能给维修建议?这篇一区顶刊论文给出的答案是:可以,数字孪生 × 多模态大模型:工业故障诊断进入“可对话时代”🤖。
本期推荐的这篇是西安交通大学许权宁的文章,本文系统综述了工业故障诊断从“数据驱动深度模型”走向“大模型时代”的完整技术脉络:首先回顾了传统规则/模型/数据三类范式的演进瓶颈,继而梳理了大型语言模型、视觉模型与多模态视觉-语言模型(LVLMs:Large Vision-Language Models)在故障预测与健康管理(PHM:Prognostics and Health Management) 领域的最新进展,指出通用大模型因缺乏工业知识、难以应对跨工况分布漂移与高质量样本稀缺等痛点;在此基础上,重点剖析了数字孪生驱动的深度合成数据、参数高效微调(LoRA:Low-Rank Adaptation)、跨模态对齐与对比学习等关键技术如何协同解决样本不足、域泛化与可解释性三大核心问题,最终提出面向多场景、可对话、可迁移的下一代智能故障诊断大模型研究框架与未来挑战。
由于文章篇幅过长,小编将分两次为大家翻译介绍这篇论文。第一篇推文系统梳理了大型视觉-语言模型在工业故障诊断中的瓶颈与突破:围绕“高质量跨工况数据难获取、模型通用知识难迁移”两大痛点,作者先回顾数据驱动、模型驱动与知识驱动三类智能诊断范式的演进,指出传统深度方法在跨域泛化上的先天缺陷;随后提出“深度数字孪生”思路,用六自由度轴承动力学+CycleGAN 虚拟-实测闭环映射,低成本生成高保真、多健康状态振动样本,为后续大型视觉-语言模型训练提供足量且物理一致的时频图谱数据,奠定多场景诊断基础。
本篇推文聚焦实验验证与落地价值。在CWRU、HUST、PU、XJTU四数据集上,FDGLM单工况准确率99.5%,跨工况仍达91.5%,跨数据集95.9%,均显著优于CNN、ViT、VisualGLM等基线;消融试验证实两阶段微调与双损失缺一不可,LoRA秩8、每类3000样本即达最优,数字孪生数据把真实信号相似度从0.5提升到0.92,为工业现场少样本、强噪声环境下的可迁移、可解释智能维护提供了即用型解决方案。
希望对大家的学习有所帮助,文章质量很高同时希望大家可以多多引用。如果有故障诊断相关方向研究人员希望宣传自己研究成果,欢迎大家在公众 号后台与小编联系投稿,大家一起交流学习。
论文链接:通过点击最左下角的阅读原文进行在线阅读及下载。
论文题目: Deep digital twin-powered large vision-language model for multi-scenario industrial fault diagnosis
论文期刊:Advanced Engineering Informatics
Doi:https://doi.org/10.1016/j.aei.2025.103997
a National Key Lab of Aerospace Power System and Plas ma Technology, Xi’an Jiaotong University, Xi’an 710049, China
b State Key Laboratory for Manufacturing System Engineering, Xi’an Jiaotong University, Xi’an 710049, China
c School of Mechanical Engineering, Xi’an Jiaotong University, Xi’an, Shaanxi 710049, China
1 引言
2 相关研究
2.1 智能故障诊断
2.2 大规模模型
3 深度数字孪生模型
3.1 滚动轴承的虚拟表示
3.2 虚拟-物理数据流融合
4 所提出的大规模视觉-语言模型
4.1 模型架构
4.2 预训练视觉模型的微调
4.3 查询变换器
4.4 预训练语言模型的微调
4.5 实现流程
5 实验验证
5.1 数据集配置与预处理
5.2 实验设计与实现细节
5.3 数字孪生模型验证
5.4 单工况验证
5.5 跨工况验证
5.6 跨数据集验证
5.7 超参数分析
5.8 消融实验
6 结论
为全面评估所提出的数字孪生驱动 LVLM 在故障诊断中的性能,本文在四种轴承数据集上开展大量实验,覆盖三大场景:单工况、跨工况与跨数据集泛化。单工况场景仅含一台机器且参数固定,主要考核模型对标准故障模式的识别能力;跨工况场景让同一台机器在不同负载或转速下运行,用以检验模型对工况变化的鲁棒性;跨数据集场景则引入不同机器或实验平台,测试模型对异构数据源的适应性。该评估方案系统验证了所提框架在多样应用场景下的精度与鲁棒性。
5.1 数据集配置与预处理
实验共使用三个公开数据集与一个自采数据集,详情如下:(1) CWRU 轴承数据集:该广泛使用的基准数据集包含健康、内圈故障、外圈故障及滚动体故障四种状态;每种故障按缺陷尺寸再分轻、中、重三级,共在四种负载-转速组合下采集,采样频率 12 kHz,轴承型号 SKF 6205。(2) HUST 轴承数据集:涵盖健康状态及滚动体、内圈、外圈的轻微与严重故障,涉及多转速工况;采用三轴加速度计记录振动信号,轴承型号 ER-16 K,采样频率 25.6 kHz。(3) PU 数据集:包含内圈、外圈及复合故障的多级严重程度;故障通过人工损伤与加速寿命试验引入,采样频率 64 kHz,轴承型号 SKF 6203。(4) XJTU 数据集(研究团队自采):利用轴承故障模拟平台采集,含健康、内圈故障、外圈故障、滚动体故障四种状态,共十二种运行工况,采样频率 12 kHz,轴承型号 SKF 6207。
基于上述数据集,本文构建了对应的多模态图像-文本数据集,用于模型训练与评估。具体而言,以 STFT 将一维振动信号转为二维时频表征:截取 1024 点信号段并变换为时频图像,作为视觉输入。针对数据稀缺问题,利用所提出的深度数字孪生模型预先大规模生成训练样本。每张时频图像配对一条硬提示,如 “What is the fault with the bearing?”,引导语言模型;对应的文本标签依据专家知识预设模板自动生成,内容涵盖诊断结果、健康状态描述及维护建议,亦可借助 ChatGPT 等大语言模型辅助生成。
5.2 实验设计与实现细节
鉴于真实工业场景数据采集困难且大模型天然面临数据稀缺,本研究采用深度数字孪生方法,合成覆盖多种健康状态的大规模振动信号,用于扩充数据集并支撑所提模型的充分训练。为验证框架有效性,本文与传统机器学习算法、深度学习算法及先进计算机视觉分类模型开展对比实验,具体基线方法包括多层感知机(MLP:Multilayer Perceptron)、支持向量机(SVM:Support Vector Machine)、卷积神经网络(CNN:Convolutional Neural Network),以及 VGG16、ResNet18、DenseNet、ViT、Swin Transformer、ConvNeXt、ChatGLM2-6B-chat [10] 和 VisualGLM [32] 等深度模型。为保证评估严谨全面,采用四项广泛认可的指标:召回率(REC:Recall)、F1 分数(F1:F1-score)、准确率(ACC:Accuracy)与精确率(PRE:Precision) [50],每项指标均在多次独立实验上取平均,以降低随机性并增强统计鲁棒性。
所提出的 FDGLM 框架以预训练 ViT为视觉编码器,ChatGLM-6B 为文本编码器。为提升微调性能,LoRA 矩阵被均匀且分层地注入两个编码器的选定层 [7,32,51]:具体而言,LoRA 矩阵嵌入 ViT 的第 0、13、26、38 层以及 ChatGLM-6B 的第 0、13、27 层,并设为可训练参数。训练过程分两阶段,分别进行 10 000 次与 5 000 次迭代,学习率 0.001,批次大小 8。所有训练均在显存 86 GB 的 NVIDIA A40 GPU 上完成。值得注意的是,每种健康状态类别通过第 3 章所述数字孪生框架扩充至 3 000 个样本,确保所有故障类别数据均衡。后续消融实验进一步探究样本量与诊断性能之间的关系。
5.3 数字孪生模型验证
为评估所提出数字孪生模型的有效性,本节对比合成孪生信号与 XJTU 数据集真实测量的相似度与保真度。虚拟-物理映射网络使用 Adam 优化器训练,批次大小为 10,共 500 个 epoch,每类包含 150 个训练样本;初始学习率设为 0.01,每 50 个 epoch 衰减一次。所有实验在 Windows 11 系统、PyTorch 2.1 环境下完成,计算平台为 Intel Core i7-12650H CPU、GeForce RTX 4060 GPU 及 16 GB RAM;更多实现细节见文献 [41]。轴承动态参数汇总于表 1,图 10 给出外圈故障工况下的信号对比。通过定义几何与运行参数,虚拟实体生成各健康状态的仿真振动响应;这些响应经预训练的虚拟-物理映射网络映射,得到对应孪生信号。以外圈故障为例,图 10 在时域、频域与包络域分别对比仿真信号、孪生信号与真实信号;为公平比较,所有信号幅值均归一化至 [-1, 1] 区间。
表1 采用SKF - 6207中的轴承参数
图10 对比分析了XJTU数据集的外圈故障响应:( a )、( d )和( g )说明了测量数据的时间轮廓、频谱特征和解调频谱;( b )、( e )和( h )与模拟数据相对应;而( c ),( f )和( i )描述了虚拟孪生数据。
在时域中,三种信号均呈现重复性冲击模式且变化趋势一致;仿真信号因虚拟实体理想化构建而波形清晰、冲击尖锐,不含测量噪声、制造公差或安装误差,真实信号则受环境噪声畸化。包络谱中,所有信号均清晰显示故障特征频率及其谐波;值得注意的是,仿真信号对内圈与滚动体缺陷相关频率成分予以强化,而真实信号中这些成分因多源振动与噪声被削弱,给直接模型更新与校准带来困难。包络谱幅值方面,仿真与真实信号在特征频率位置一致但幅度不同,孪生信号有效补偿该失配:在虚拟-物理映射过程中,引入环境与故障相关信息,同时保留测试观测到的高频共振响应,使仿真信号转化为孪生信号后故障频率及谐波得到凸显,表明该方法在吸收环境影响的同时保持故障信息。该性能得益于映射网络的多层级架构:Self-ONN 编码器实现层内高效特征提取,注意力增强跳跃连接强化层间表征,多深度编码器保证多尺度学习,而采用复合损失的对抗训练机制促进跨域信息融合与分布对齐 [41]。
为进一步评估信号相似度,对归一化信号进行分布拟合分析。图 11 给出滚动体、内圈、外圈三类故障在单位时间内的振动响应高斯拟合结果,表明映射网络有效对齐跨域细节与空间特征,融合环境及振动信息,将仿真信号转化为近似真实测量的孪生信号,显著缩小分布差异。此外,采用皮尔逊相关系数量化信号相似度(表 2):仿真-真实信号相似度约 0.5,孪生-真实信号相似度超过 0.92,大幅提升其用于诊断模型训练的价值。
图11 数据分布拟合于XJTU数据集。( a )滚动体故障,( b )内圈故障,( c )外圈故障
表2 不同状态下信号相似度的比较
5.4 单工况验证
表 3 与表 4 分别给出 XJTU 与 HUST 轴承数据集在单一工况下的诊断结果,展示各方法性能。经 STFT 处理后,振动信号的时频表示显著提升了轴承故障状态的可表征性 [52]。在所有轴承状态中,所提 FDGLM 始终优于其他方法,总体诊断准确率超过 99.5%。传统机器学习算法(包括 SVM 与 MLP)表现较差;在训练数据充足的前提下,基于 Transformer 的网络较传统卷积神经网络优势明显,因此 DCNN、ResNet18、DenseNet121 与 VGG16 性能均低于 ViT、Swin-Transformer 及所提 FDGLM。值得注意的是,ResNet18 与 DenseNet121 利用多通道特征复用提升分类性能,在 HUST 数据集上分别取得 95.678% 与 97.282% 的准确率。采用分层移位窗口注意力的 Swin-Transformer 位列第二,在 XJTU 与 HUST 数据集上分别达到 99.300% 与 99.100% 的准确率。ChatGLM2-6B-chat 作为代表性大语言模型,依赖 24 个手工提取的时域与频域特征输入 [10],在两个基准数据集上平均诊断准确率为 98.5% 与 98.2%;然而,其单一文本模态的依赖性限制了诊断能力的进一步提升。相比之下,VisualGLM 采用两阶段协同微调策略进行领域适配,输入为时频图像,在同一基准数据集上分类准确率达到 99.1% 与 98.9%。基于 Transformer 架构的 FDGLM 采用两阶段微调策略优化时频图像特征表示,并利用 Query Transformer 对齐视觉与文本模态。图 12 给出表现最优模型的混淆矩阵,DenseNet121、VGG16、ViT、Swin Transformer、ChatGLM2-6B-chat、VisualGLM 与 FDGLM 均实现接近完美的故障分类。图 12 中,坐标轴标签 1–7 分别对应以下轴承状态:健康状态、轻微与严重滚动体故障、轻微与严重内圈故障、轻微与严重外圈故障。健康状态易于区分,而同类型不同严重程度的故障分类难度较大,导致基线方法出现多数误分类。
表3 在XJTU数据集上的对比实验结果

表4 在HUST数据集上的对比实验结果
图12 对 HUST 数据集上各种方法的混淆矩阵进行比较。(a) 支持向量机 (SVM),(b) 多层感知器 (MLP),© 深度卷积神经网络 (DCNN),(d) ResNet18,(e) DenseNet121,(f) VGG16,(g) ViT,(h) Swin-Transformer,(i) ConvNeXt,(j) ChatGLM2-6B-chat,(k) VisualGLM,(l) FDGLM
由表 3 可见,除表现最差的 SVM 外,FDGLM 在微调阶段的可训练参数最少(0.86 M)。尽管总参数量达 72 亿,FDGLM 借助 LoRA 技术,仅在视觉编码器第 0、13、26、38 层与语言编码器第 0、13、27 层插入轻量可训练矩阵,其余预训练参数全部冻结,既保留基座模型表达能力,又实现工业故障诊断的高效领域适配,凸显以极低微调开销完成工业数据处理的巨大潜力。训练平台上,我们对各方法进行单样本推理延迟量化分析:如表 3 所示,传统机器学习与深度学习模型推理时间远短于大规模模型,差异主要源于参数量与结构复杂度。值得注意的是,ChatGLM2-6B-chat 的推理延迟高出一个数量级,根源在于其生成机制与架构设计:相比仅需一次前向的传统判别模型,LLM 通常采用自回归策略生成文本序列,输出长度 L 需 L 次前向,且每次均包含计算开销远高于卷积的自注意力机制;LVLM 额外引入视觉编码器与跨模态融合模块,推理时间最长。未来可通过量化(将权重与激活由高精度转低精度以减少内存、加速计算)、系统级推理优化与模型编译、架构级剪枝与知识蒸馏等手段提升大规模模型推理效率。我们进一步在搭载 i7-12650H 处理器、GeForce RTX 4060 GPU 与 16 GB 内存的笔记本上进行推理实验,延迟虽适度增加,模型仍稳定运行,验证了边缘部署的可行性。
此外,FDGLM 通过人机交互实现智能故障诊断:其友好界面即使对非专业用户也能输出精准健康评估。如图 13 所示,界面分为左右两栏——左侧展示时频谱图与输入区,右侧呈现诊断结果与维护建议。与传统方法仅输出标签不同,FDGLM 依托知识增强语料,可生成详细健康评估、推断潜在故障根因并提供维护指导;同时支持文本与视觉多模态输入,弥合图像诊断与自然语言处理的鸿沟。图 14 与图 15 给出更多健康状态的定性诊断示例,可见模型在不同文本提示下均保持强鲁棒性,持续实现准确故障识别、因果分析与建议生成。作为 PHM(Prognostics and Health Management)领域的重大进展,该视觉-语言框架以智能、交互的解决方案超越传统方法,将精准诊断与易用部署相结合,显著提升工业设备的智能维护水平。
图13 轴承健康状态评估人机交互界面的演示
图14 轴承健康状态评估人机交互界面的演示在HUST数据集上使用FDGLM进行故障诊断的定性案例研究。( a )轻微滚动体故障,( b )严重滚动体故障,( c )轻微内圈故障
图15 不同文本提示的故障诊断定性案例研究。( a )严重的内圈故障,( b )轻微的外圈故障,( c )严重的外圈故障
为评估通用 LVLM 在工业时频图像识别中的有效性,本研究对比三款代表性模型:Qwen 3、DeepSeek-V3.1 与 GPT-5。图 16 以 HUST 数据集中“轻微内圈故障”时频图为输入,统一查询指令为 “What is the fault with the bearing?”。Qwen 3 仅检测到谱图中与机械缺陷相关的离散异常频率成分,未能指明具体故障类别,亦未提供失效机理解读或维护建议。DeepSeek-V3.1 起初未识别输入为轴承振动信号时频图;在补充提示 “This is a time–frequency diagram of the bearing vibration signal” 后,仍无法判定故障类别,仅能分析潜在原因并给出维护建议。GPT-5 表现最佳,直接识别出内圈故障并构建连贯推理链,但仍缺乏对根本失效机理的解释、决策支持洞察及故障严重度量化。实验揭示通用 LVLM 在工业诊断中的两大关键局限:(i) 专用时频特征辨识能力不足,导致诊断精度下降;(ii) 训练语料工业知识匮乏,制约其生成符合 PHM 需求的失效分析与维护策略。这些缺陷凸显了本文提出 FDGLM 框架在工业故障诊断中的必要性与技术优势。
图16 在HUST数据集上使用其他LVLM进行故障诊断的定性案例研究。( a ) Qwen 3,( b ) Deepseek-V3 . 1,( c ) GPT - 5
5.5 跨工况验证
为评估所提 FDGLM 模型在未见运行工况下的诊断泛化能力,我们利用 CWRU 与 HUST 轴承数据集设计跨工况迁移诊断实验。如表 5 所示,每个数据集包含四种不同的转速-负载组合工况;据此,为每个数据集构建四项跨工况诊断任务(表 6),用以检验模型在不同运行工况下的诊断迁移性能。
表5 CWRU和HUST数据集的运行工况
表6 跨工况诊断任务配置与诊断准确性
实验结果表明,尽管不同运行条件导致分布偏移,FDGLM 在所有跨工况任务中仍保持高诊断准确率:在 CWRU 数据集上,面对转速与负载变化,准确率均超过 93.0%;在转速变化显著的 HUST 数据集上,任务 3 准确率最低(89.0%),四项任务平均准确率达 91.5%。这些结果证实 FDGLM 在单数据集跨工况诊断中具备强适应性与鲁棒性;尽管性能较单工况略有下降,但在未改动模型架构或损失函数的前提下取得该表现,凸显了框架固有的泛化能力。
为深入评估跨工况诊断性能,本文聚焦 HUST 数据集任务 4 开展对比实验,基线方法与第 5.4 节保持一致,所有结果取多次独立运行平均,并给出最优运行的混淆矩阵。如表 7 所示,相较于单工况基准,各方法在跨工况场景下均出现性能下降;FDGLM 仍以 93.3% 的分类准确率领先。Swin-Transformer 与 ConvNeXt 降幅较小(约 1–1.5%),性能逼近 FDGLM;传统 CNN 方法鲁棒性不足,准确率普遍低于 90%。ChatGLM2-6B-chat 仅依赖交叉熵损失进行故障诊断,且受限于单一文本模态,跨域诊断效能受限;VisualGLM 虽采用结合交叉熵与对比损失的两阶段协同优化策略,但在工况差异显著的跨域工况下表现仍不理想,表明传统对比损失仍有较大改进空间。
表7 在HUST数据集上针对任务4的对比实验结果

图 17 的坐标轴定义与图 12 保持一致。图 17 显示,与第 5.4 节中同一故障类别内的严重程度误分不同,跨工况验证导致更复杂且分散的错误模式:工况偏移使多数基线模型不仅混淆同一故障的不同严重程度,还错分不同故障类型,充分暴露这些模型在未见工况下面对分布偏移时的泛化局限。FDGLM 在跨工况任务中的鲁棒性部分源于视觉编码器微调阶段采用的 Circle 对比损失——该损失通过增大正样本对相似度、减小负样本对相似度,优化特征空间,促使模型学到在工况变化下仍保持稳定的判别性故障特征,从而提升分布偏移下的泛化能力。总体而言,结果表明 FDGLM 能够捕捉轴承信号在不同工况下的共性故障模式,并将其泛化至未见场景进行诊断,显著增强了模型在多变工况内的诊断泛化能力。
图17 在HUST数据集上对任务4的各种方法的混淆矩阵进行比较。( a ) SVM,( b ) MLP,( c ) Dcnn,( D ) Resnet18,( E ) Densenet121,( f ) Vgg16,( G ) VIT,( H ) Swin-Transform,( I ) Convnext,( J ) Chatglm2-6B-Chat,( K ) Visualglm,( L ) Fdglm
5.6 跨数据集验证
为评估所提 FDGLM 模型的跨域诊断能力,本文利用 XJTU、CWRU、HUST 与 PU 四个独立轴承数据集开展全面跨数据集迁移诊断实验。实验设计确保各数据集健康状态类别严格一致,仅聚焦三类代表性状态:健康、内圈故障与外圈故障。各数据集在轴承型号(如 SKF6205、ER-16 K、SKF6207)、运行工况(转速与负载变化)及环境噪声等方面存在显著异质性,给故障诊断的领域适配带来巨大挑战。表 8 汇总了实验设置与诊断性能。
表8 跨数据集诊断任务配置与诊断准确率
FDGLM 在所有跨数据集任务中的平均分类准确率达 95.9%,彰显其出色的领域泛化能力;值得注意的是,跨数据集任务的平均诊断精度高于跨工况场景,这可归因于跨数据集设置中健康类别更少、诊断目标更一致。任务 1 获得最高诊断准确率,表明模型对 XJTU 数据集的适应性最佳。HUST 数据集采用 ER-16 K 轴承,与其他三个数据集使用的 SKF 系列差异显著,导致任务 3 分类准确率最低(94.7%),说明诊断模型对轴承型号变化存在一定敏感性——该敏感性源于轴承型号与负载-转速条件交互带来的显著分布偏移。结果证实,即使在完全不同数据集上训练与测试,FDGLM 仍保持强劲诊断性能,体现出其提取域不变故障特征并将知识有效迁移至未见领域的能力,显著提升了模型的跨域泛化水平。
5.7 超参数分析
5.7.1 LoRA矩阵的秩
本节研究 LoRA 矩阵秩对所提模型微调性能的影响。LoRA 秩直接决定微调期间引入的可训练参数数量,并显著影响模型对轴承故障诊断的适应能力。尽管更高秩在理论上提供更大参数容量,实际微调性能仍受计算资源、样本规模等实验条件约束。为隔离这些因素,我们在受控实验设置下分析 LoRA 秩与诊断准确率的关系;不同层中的所有 LoRA 矩阵共享同一秩配置。
如表 9 所示,秩按 2 的幂次系统设置为 4、8、16、32 与 64 [32],并在此配置下评估预训练 ViT 与 ChatGLM-6B 的微调性能。提高秩可扩大可训练参数规模、增强模型表征能力,但也增加数据需求与计算开销。实验结果表明,在计算与数据资源受限条件下,诊断准确率并非随 LoRA 秩单调上升,而是呈现非单调趋势:当秩设为 8 时,可训练参数总量为 0.86 M,FDGLM 取得最佳性能;秩超过 16 后,准确率较峰值略有下降,原因在于额外参数在有限数据与硬件条件下引入更高的过拟合风险与优化难度。因此,秩 = 8 在当前配置下达到最优,并被用于本研究所有基于 LoRA 的微调。
表9 不同LoRA矩阵秩次下的诊断性能
5.7.2 训练数据量
如前所述,真实轴承振动数据不足以支撑大规模视觉-语言模型训练:例如,CWRU 与 HUST 数据集采样频率分别为 12 kHz 与 25.6 kHz,但每种健康状态仅提供约 10 s 有效数据;采用 1024 点无重叠分段,每类仅生成约 117 与 250 个样本。即便借助重采样等数据增广,样本总量仍远低于有效训练需求,且增广可能加剧过拟合风险。工业现场故障呈偶发、昂贵特性,进一步导致样本不平衡等复杂挑战。为缓解数据稀缺,本文采用深度数字孪生框架合成覆盖不同健康状态的多样化振动信号;本节考察合成数据集规模与诊断性能之间的关系。
为评估训练数据量的影响并确定达到高准确率所需的最小样本规模,本文开展控制实验:在固定全部超参数与架构的前提下,测试每类 1 000、2 000、3 000、4 000 及 5 000 张时频图像五种样本量,这些图像均由合成振动信号经 STFT 生成;模型在每种配置下训练,并在独立测试集上评估。如图 18 所示,实验结果显示样本量与诊断准确率呈强相关:当每类样本为 1 000 与 2 000 时,模型准确率分别为 0.911 与 0.933,未达理论潜力,表明有限数据无法覆盖故障变异,削弱特征鲁棒性;当每类样本增至 3 000 时,准确率大幅提升至 0.995;继续增至 4 000 与 5 000 仅带来边际提升,无统计学显著改善。因此,在当前数字孪生配置、模型架构与计算约束下,每类 3 000 样本足以使 FDGLM 性能接近最优,结果证实深度数字孪生在扩充训练数据、缓解真实数据局限方面的有效性。
图18 不同样本量下的诊断性能
5.8 消融实验
为严格评估 FDGLM 框架各核心组件的有效性与适应性,本节开展全面消融实验。整体 FDGLM 微调流程分两大阶段:视觉模型微调与语言模型微调。具体而言,在预训练视觉主干适配过程中引入两类损失函数进行联合优化:(1)交叉熵损失,用于增强故障类别可判别性;(2)Circle 对比损失,旨在提升所学特征表示的鲁棒性与泛化性。据此,本研究系统探究两微调阶段的单独及联合效应,以及上述两种视觉损失函数的各自贡献与协同作用。
为保证公平与可比性,所有消融实验仅变动被测组件,其余配置完全一致;评估在 HUST 数据集单一工况下进行,结果汇总于表 10。若直接将预训练语言与视觉模型用于工业数据而不经 LoRA 微调,诊断性能急剧下降,表明预训练模型仅与通用视觉-文本输入对齐,难以从工业谱图中提取具有判别力的类别相关特征。仅微调语言模型时,诊断准确率显著下降且不稳定,说明视觉编码器若未适配,模型无法捕捉显著时频模式,诊断能力受限。单独使用交叉熵或 Circle 损失,诊断准确率分别为 0.977 与 0.973;二者在视觉模型微调中联合应用时,诊断性能进一步提升,凸显互补性:交叉熵损失强化决策边界学习,Circle 损失促进更具判别力且鲁棒的特征嵌入,协同提升编码器提取有效故障特征的能力。借助优化后的视觉编码器,再对语言模型进行微调,可将更丰富的视觉语义与文本表征融合,带来显著性能增益。综上,消融研究证实:视觉模型微调是 FDGLM 适配工业故障诊断的基础;交叉熵与 Circle 损失联合使用优于单独应用;所引入的两阶段微调方案通过联合优化视觉与语言组件,充分释放模型潜力,实现准确且鲁棒的故障诊断。
表10 不同成分的消融研究结果
本文提出一种新颖的数字孪生驱动大规模视觉-语言模型 FDGLM,为工业装备故障诊断提供智能、交互式解决方案。针对高质量多模态训练数据获取难题,采用深度数字孪生技术合成物理一致的振动信号,构建大规模训练语料;并引入两阶段领域适配策略,弥合通用预训练模型与特定工业应用之间的鸿沟。具体而言,视觉编码器以 LoRA 微调,联合交叉熵与 Circle 对比损失,增强时频图像的模式识别能力;语言编码器则借助专家诊断语料微调,实现跨模态语义对齐、故障推理与维护决策支持。大量实验表明,FDGLM 在多种诊断场景中表现优异:单工况准确率 99.6%,变工况 91.5%,跨数据集迁移 95.9%。超参数调优确定了最佳 LoRA 秩与最少样本量;消融研究验证了两阶段适配策略及集成视觉损失设计的有效性。本研究为工业系统智能运维开辟了新范式。未来工作将聚焦于解决真实工业环境中突发故障带来的小样本与零样本挑战;此外,
编辑:赵栓栓
校核:李正平、陈凯歌、曹希铭、赵学功、白亮、任超、海洋、陈宇航、Kira、Tina、王金、赵诚、肖鑫鑫、张优
该文资料搜集自网络,仅用作学术分享,不做商业用途,若侵权,后台联系小编进行删除
来源:故障诊断与python学习