首页/文章/ 详情

2区Top综述||如何融合人工智能大语言模型与知识图谱以增强故障诊断?一项系统性文献综述(上)

4月前浏览654

大语言模型遇上知识图谱,工业故障诊断迎来新范式!这篇2026年新鲜出炉的文章,系统梳理了LLM+KG融合技术的最新进展,从理论框架到实践案例,揭秘如何让AI既"聪明"又"靠谱"。  

本期推荐的这篇特文特大学电气工程、数学与计算机科学学院万·巴尔马维·穆罕 默德·拉扎克的文章本文系统综述了大语言模型(LLMs:Large Language Models)知识图谱(KGs:Knowledge Graphs)融合技术在工业故障诊断中的应用,基于PRISMA框架分析了2017-2025年间37篇文献。研究识别出两种核心范式:LLMs增强KGs(自动化提取故障实体关系,解决传统知识抽取成本高、主观性强的问题)KGs增强LLMs/图检索增强生成(GraphRAG:Graph Retrieval-Augmented Generation)(通过结构化因果路径抑制大语言模型幻觉,提升推理可解释性)。当前研究主要集中于旋转机械、钢铁制造和数控机床领域,微调的BERT模型在知识提取任务中可达98.76%的F1分数GraphRAG系统在故障诊断生成任务中实现92.3%准确率和5.3%的低幻觉率。然而,领域覆盖单一、多语言支持不足(仅中英文)、缺乏可解释性可视化界面等问题仍显著存在。未来研究需向多模态数据融合、多语言扩展、智能体诊断及开源模型私有化部署方向演进这对数字孪生场景中的实时知识推理、跨系统故障溯源及人机协同维护决策具有重要参考价值  

由于文章篇幅过长,小编将分两次为大家翻译介绍这篇论文,第一篇推文涵盖研究背景与方法论,系统阐述大语言模型知识图谱融合的技术动因PRISMA文献筛选流程"设置-本体-抽取-检索-生成"五层分析框架,呈现2017-2025年技术演进脉络37项实证研究核心发现。具体包括:识别LLMs增强KGsKGs增强LLMs/GraphRAG两大范式,揭示BERT模型在知识提取中达98.76% F1分数GraphRAG系统实现92.3%准确率5.3%低幻觉率性能突破,为工业故障诊断的智能化转型奠定方法论基础  

论文基本信息

论文题目: How can the integration of AI large language models and knowledge graph enhance fault diagnosis? A systematic literature review

论文期刊:Applied Soft Computing

Doihttps://doi.org/10.1016/j.asoc.2026.114908

作者:  Wan Barmawi Muhammad Razaq a,Hao Chen Marcos R. Machado b , Maosheng GaoJoão Luiz Rebelo Moreira a
 
论文时间: 2026年1  
机构:   

University of Twente, Faculty of Electrical Engineering, Mathematics, and Computer Science, AE Enschede, 7500, Netherlands

  b University of Twente, Faculty of Behavioural, Management and Social Sciences, Department of High-Tech Business and Entrepreneurship, AE Enschede, 7500, Netherlands

University of Münster, Chair of Information Systems & Supply Chain Management, Münster, Germany

摘要

大型语言模型知识图谱的融合代表了工业场景下故障诊断改进的新兴途径。传统故障诊断方法——包括基于模型的方法基于信号的方法以及基于规则的方法——在管理复杂数据、适应新型故障以及确保推理准确性方面面临持续性挑战。本系统性文献综述评估了37项相关研究,以审视LLMsKGs的协同作用如何缓解上述局限。综述识别出两种主要范式:LLM增强型知识图谱,其自动化地从非结构化工业文本中提取实体关系;以及知识图谱增强型LLM,其将模型推理锚定于结构化因果路径以降低幻觉现象。尽管这两项技术的集成应用正成为增长性研究趋势——尤以2025年发表的11篇论文为峰值——该领域仍处于早期发展阶段。当前研究高度集中于旋转机械钢铁制造计算机数控(CNC:Computer Numerical Control)设备,在行业覆盖广度多语言支持(除英语与汉语外)以及高级评估指标方面存在显著缺口。此外,诸多现有系统缺乏工程师在高风险环境解释推理路径所必需的可解释性。本研究建议,未来研究应着力于:将诊断框架扩展至专业化工业领域、改进领域特定适配机制,并通过交互式可视化结构化推理提升可解释性
关键词故障诊断大型语言模型知识图谱GraphRAG实体与关系抽取

目录

1 引言

理论背景

研究方法

   3.1 框架参考与检索策略

   3.2 文献筛选流程

   3.3 数据收集过程

   3.4 数据综合

研究结果

   4.1 现有故障诊断的挑战

   4.2 KG-LLM融合概念框架

   4.3 应用场景分析与数据集

   4.4 本体论

   4.5 知识提取

   4.6 KG增强LLM(GraphRAG)流程:索引、检索与生成

   4.7 评估与基准测试

5 实践启示

研究缺口分析

   6.1 应用场景(工业机械背景

   6.2 数据集与语言

   6.3 知识提取

   6.4 评估方法

   6.5 可解释性/可视化

   6.6 未来研究方向

7 结论


注:小编能力有限,如有翻译不恰之处,请多多指正~
     若想进一步拜读完整版,请下载原论文进行细读。

1 引言

在工业场景中,机械的维护故障排查对于确保生产平稳可靠、同时使制造商能够高效满足客户需求至关重要。一方面,特定的预防性维护活动在全年例行开展;另一方面,预测性维护则在潜在故障发生前执行[1]。当错误或故障发生时,工程师与操作人员需对故障机械进行故障排查以恢复其功能。在某些行业中,数小时的停机时间或许尚可容忍;然而,在电力生产等关键行业中,即便数分钟的停机也可能导致企业蒙受数百万美元的损失[2]。因此,一套高效的维护与故障排查系统对于实现各行业最小化停机时间运营连续性而言不可或缺。

故障诊断是指识别系统内部物理故障因子的过程,涵盖类型位置严重程度发生时机等要素[3]。部分研究者亦将故障排查纳入故障诊断的范畴[4–7]。已识别的故障需依据设备制造商的规范方法或工程师针对同类问题的既往经验进行修复。其目标在于恢复设备的正常状态,使生产运营得以再度平稳进行。

故障诊断通常被划分为基于模型的方法基于信号的方法以及基于知识的方法[8]。这些类别亦可依据其在执行故障诊断时所采用的信息来源加以区分。基于模型的方法将系统的数学或物理模型与其实际行为进行比对[8,9];当实际行为偏离预期时,即可识别故障。基于信号的故障诊断作为下一类别,更具数据驱动特性,采用历史数据(如传感器数据)[8–10];该技术运用信号处理以检测故障,或采用机器学习技术基于既往历史数据预测失效。基于知识的方法作为另一分类,利用专家知识并基于规则进行推理[8,10];该技术降低了对数据的需求以执行故障诊断,同时规避了前述技术所需复杂建模可能引发的误差。此外,借助规则本体等结构化知识进行外推,还可识别新型故障[10]。

基于知识的故障诊断技术采用结构化知识表示对专家知识进行建模。知识图谱是组织故障信息的有效方式,因其能够表征故障症状根本原因失效模式纠正措施之间以复杂方式关联的关系[11,12]。在工业场景中,此类知识可源自故障排查手册专家经验维护记录及其他非结构化数据源[5,13]。然而,获取并处理这些数据以构建知识图谱面临重大挑战。

从工业数据构建知识图谱面临诸多问题。尽管工业现场存在大量结构化非结构化数据,制造商对这些数据的利用仍显不足。此外,制造设施呈现出促成其动态数据生成的特定特征;这意味着用于抽取知识图谱的模型必须具备处理动态数据的能力。最后,工业场景的多样性——如炼铁能源生产自动化制造——使得难以找到适用于所有这些应用的单一模型。目前,面向工业的大多数知识图谱均适配于针对其特定功能的专用模型,例如面向工业机械的故障诊断或面向高炉的自愈控制[14]。

大型语言模型的最新进展已展现出为知识图谱进行自动化知识抽取的潜力。海量非结构化工业数据——如技术手册维护日志——可由LLMs处理;进而从中抽取相关实体关系以填充知识图谱LLMs能够利用其上下文理解自然语言处理能力,提升知识图谱构建的准确性与效率,从而加速知识图谱构建过程并提高其精度。

大型语言模型在构建工业知识图谱方面虽具潜力,但仍面临诸多挑战。首先,在通用语料库上训练的LLMs可能难以理解行业特定术语,需在专门数据集上进行微调[15]。此外,确保抽取信息的正确性可解释性仍是问题,因为LLMs可能引入错误或幻觉,从而损害故障诊断的可靠性[16]。最后,将LLM抽取的知识添加至结构化知识图谱需经过严格的验证步骤,以确保其与真实世界中设备的运行机理及工业过程的演进趋势保持一致。

本研究旨在评估大型语言模型知识图谱的融合如何改进工业领域的故障诊断流程。指导本研究的研究问题如下:

主要研究问题:

大型语言模型知识图谱的融合如何增强制造业中的故障诊断流程?

子研究问题:

1.现有故障诊断存在哪些挑战,以及如何缓解这些挑战?

2.如何利用LLMsKGs有效整合管理来自多样化数据源的故障诊断数据?

3.何种LLMsKGs模型配置能够为故障诊断提供最准确高效的结果?

2 理论背景

大型语言模型知识图谱的组合近来备受关注,源于这两项技术的互补特性LLMs擅长自然语言理解生成,而KGs提供结构化显式的知识,可增强LLM的性能与可解释性[17]。尽管这两项技术的独特优势已得到充分确立,但其在工业故障诊断中的协同趋势日益显著。本综述围绕这一协同的两种范式展开[18]:第一种为LLM增强型知识图谱,旨在解决知识形式化的难题;第二种为KG增强型LLM,如GraphRAG,旨在解决LLM推理因果追溯的基础问题——二者对故障诊断均至关重要。通过以这两种范式评估文献,本综述审视了近期将LLMs提供的自然语言灵活性KGs结构化表示相结合、面向工业故障诊断应用的架构

研究人员采用LLM增强型知识图谱范式[18],以克服工业场景中人工知识图谱抽取主观性高成本问题。LLM自然语言理解能力可自动化地从工业文本数据中抽取实体与关系,潜在降低传统基于知识的故障诊断知识图谱抽取人工需求[19]。另一方面,KG增强型LLM(特别是采用图检索增强生成GraphRAG架构)被引入以抵消通用LLM固有的幻觉问题。这一架构方法将故障维护结构化可验证领域知识融入推理过程。与标准RAG检索孤立文本片段作为上下文不同,GraphRAG遍历实体间的多跳链接,并支持检索知识的逻辑链式推理,从而产生更具连贯性上下文丰富的响应[20]。这一架构对于分析因果链尤为有用——而因果链正是识别复杂机械故障的关键所在。类似地,图21可视化了分类器的输出层特征。在无增强情况下(图21(a)),大多数故障类型未能清晰界定,证实了严重不平衡导致诊断可分性较差。

3 研究方法

3.1 框架参考与检索策略

本系统性文献综述遵循PRISMA 2020报告规范[21],以确保透明性与可重复性。选择PRISMA的理据在于其在研究人员中的广泛认可,作为开展系统性文献综述的工具。采用PRISMA的结构化方法与本研究的性质相契合——本研究涵盖制造、人工智能及语义学等多个跨学科领域。采用这一结构化方法可确保研究实施方式的透明性,从而提升其可重复性并最小化偏倚。

本研究选择 Scopus¹ 与 Web of Science² 作为系统性文献综述的数据库。选择这两个数据库的原因在于其广泛的科学文献库及其覆盖本研究所针对多学科领域研究的能力。对各数据库的检索日期为2025年11月22日。本研究界定了包含与大型语言模型知识图谱故障诊断相关关键词检索词。为确保检索过程全面性,本研究利用ChatGPT³作为头脑风暴辅助工具,以识别源自研究问题核心关键词同义词等效含义。此外,本研究采用布尔逻辑运算符OR,并将其与AND通配符("*")结合,以查找将LLM应用于故障诊断、将KG应用于故障诊断,或将LLMKG同时应用于故障诊断的研究。检索词如下:

   

检索式包含"本体",因其为知识图谱提供模式结构故障诊断知识图谱依赖于精确定义的本体以表征实体间的关系;因此,理解基于本体的故障诊断对于开发有效的故障诊断知识图谱至关重要。

为了简化分析过程,应用了合格标准,包括纳入和排除标准,以确保只有与研究问题直接相关的记录被纳入研究。表1给出了合格标准。

表1 资格标准

         

关于纳入标准(见表1),本研究纳入会议论文,原因在于知识图谱和/或大型语言模型仍为相对新颖的技术;因此,纳入会议论文可增加捕获相关研究的可能性——即便其未以与期刊论文相同的方式接受同行评审。此外,对于期刊论文,本研究从2015年起始,以展示研究领域如何从使用"本体"演进至2019年"知识图谱"一词在故障诊断领域的首次出现。相较之下,本研究从2020年起开始检索会议论文,以识别尚未在同行评审期刊上发表的最新研究。

3.2 文献筛选流程

与纯粹数据驱动的生成模型相比——后者虽能丰富少数类样本,但往往缺乏物理在识别阶段,从两个数据库中删除了242条重复记录。本研究使用EndNote⁴作为自动化工具,基于标题作者DOI号检测重复数据。根据PRISMA规范,这些记录在筛选阶段被归类为报告,涵盖期刊论文预印本会议摘要研究注册条目学位论文未发表手稿政府报告及其他相关文献[21]。继而通过将报告与先前指定的合格性标准进行比对,继续筛选流程

如表1所示的标准所示,我们开始排除基于原因1的报告,原因1包括2020年以前的会议程序和2015年以前的文章,结果删除了221篇报告。接下来,我们排除了基于原因2的报告,其中包括与工业机械或制造业无关的研究。为了确定相关性,我们在标题和摘要中搜索关键短语,如"生产","工厂","装配","设备","机械"和"制造"。该步骤导致510篇论文被排除。此外,我们根据原因3删除了12篇报告,因为这些报告不是用英文撰写的。 然后,我们排除了Reason 4下的报告,这是研究,虽然与更广泛的主题有关,但并不直接有助于回答我们的主要研究问题。这导致193篇报道被排除在外。在此之后,我们尝试检索涉及下载的报告。我们能够下载所有的报告,最终纳入与我们的系统文献综述相关的研究共37篇。

   

图1 PRISMA 2020流程图说明了研究选择的过程。该图详细介绍了从Scopus和Web of Science数据库中识别出1217条记录,去除242个重复,以及随后根据预定的资格标准筛选出975篇报告。由于缺乏工业机械背景等原因,排除了938篇报告,最终共有37篇研究被纳入最终的系统文献综述。*表明被人类和自动化工具排除的记录。

3.3 数据收集过

在本小节中,本研究明确了在开展出版物全文阅读时专门关注的定性数据文献计量数据;继而综合分析这些数据,以回应所有子研究主题数据及其定义详见表A.9定性数据)与表A.10文献计量数据)。定性数据的最后三项(索引构建知识检索知识生成)并非适用于所有研究。本研究专门针对采用GraphRAG的研究分析这三项技术——在此类研究中,知识图谱通过结构化检索相关知识以支持推理生成,从而增强大型语言模型[22]。

表A.9 从选定论文中提取的定性数据

   
表 A.10  所选论文的计量数据          
         

3.4 数据综合

综上所述,基于概率动力学参数构建数据驱动的数字孪生空间,不仅保持了振动信号的物理真实性,还增强了多样性与泛化能力,为稳健的样本生成及下游模型训练奠定了基础。对于定性数据——特别是关于现有故障诊断方法挑战方面——本研究采用Gioia方法[23],因其为定性研究提供了系统化适应性的方法论路径,尤其适用于新概念新理论原始数据中涌现的归纳式定性研究。本研究采用包含三个阶段的归纳式编码方法。该流程始于数据收集与编码,终于数据结构化可视化。数据收集与编码流程始于一阶编码(受访者中心术语),即从每项研究中提取关键陈述;继而采用二阶编码(研究者中心主题),将一阶术语组织为更宽泛的主题概念;第三步为聚合维度(高层次主题),即将二阶主题聚类为更高层次的理论维度

时间和期刊分布将基于来自 Scopus 和 Web of Science 的文献计量数据。我们使用条形图来描绘年度分布,并通过表格识别期刊和会议以及所发表论文的数量。接下来,对于主题分析,我们根据每篇文档中的重要词汇进行词频统计。

4 研究结果

系统性文献综述(SLR)将研究发现组织为两个主要部分:文献计量图景基于GraphRAG的故障诊断技术定性分析文献计量数据的综合汇总——包括期刊与会议分布表B.11)、时序发表趋势图C.4)及关键词主题聚类图D.5)——详见附录A,以提供关于研究领域演进的背景信息。以下各小节优先呈现定性发现:首先阐述当前文献中识别的挑战,继而展开知识图谱-大型语言模型集成诊断系统概念框架

表 B.11  期刊和会议分布        
       
   

图 C.4 所选文献的时间分布(2017-2025),按研究重点分类。

该图显示了技术从传统本体和知识图谱(KG:Knowledge Graph)框架向最近占主导地位的集成 LLM-KG(GraphRAG)解决方案的发展,后者涵盖了整个 2025 年的研究群体

           

图 D.5 所选研究中关键词频率的词云

4.1 现有故障诊断的挑战    

综上所述,合成信号在保留关键故障相关特征的同时,提升了平滑性和一致性,展示了所提方法在生成用于下游任务的高保真度和可靠故障数据方面的能力。正如图2中的Gioia方法综合所揭示的那样,故障诊断方法在不同的范式中面临着重大的限制。基于模型和基于规则的故障诊断通常依赖于人为消耗,使得难以扩展[6,24]、不一致[25],并且在诊断不熟悉的故障时容易失败[26]。此外,这些范式在推理和推理方面也遇到挑战,例如需要手动规则构建[27]、处理机器内部的复杂组件[25]以及解决规则定义和不确定性[4]。此外,数据驱动的方法受到数据质量和数据复杂性问题的困扰,如碎片[28]、知识稀疏[26]和噪声污染[13],这影响了故障诊断的准确性。此外,对高质量故障数据的要求使得这些方法变得昂贵[29],大规模监控系统的异构性使数据集成复杂化[30]。

   

图2 使用Gioia方法进行现有故障诊断的挑战

大语言模型与知识图谱的融合构建了一种协同框架,其中一项技术的优势可直接弥补另一项技术的固有缺陷以及替代诊断范式的局限性。知识图谱虽具备高度准确性,但传统上因高昂的人工成本和专业化知识需求而难以扩展[19],存在语义不一致问题[31],且在处理有限数据时推理能力薄弱[19],致使其无法有效实现故障诊断。大语言模型凭借其自然语言处理能力,可自动从非结构化工业文本中提取实体与关系,显著降低知识图谱构建的成本与时间,从而缓解上述局限。另一方面,大语言模型常受"幻觉"现象[5]困扰,且其推理过程缺乏透明度[19],导致在工业应用中难以获得信任。知识图谱通过提供结构化、可验证的"单一事实来源",将大语言模型的推理锚定于可靠的因果路径,从而解决这些缺陷。这种相互增强机制使自然语言的灵活性得以与结构化数据的事实准确性相结合,为工程师提供了兼具可解释性且能够处理复杂大规模工业数据的故障诊断系统。

4.2 KG-LLM融合概念框架    
尽管文献计量分析揭示了将大语言模型与知识图谱融合应用于工业故障诊断的趋势,但从技术视角审视,该系统的实现遵循特定的架构与技术路径。为呈现所选研究中各项技术的定性发现,本文构建了如图3所示的概念框架。诊断流程始于系统设置(第4.3节)与数据集定义(第4.1节),二者明确了系统的数据来源、语言学特征及运行边界。本体(第4.4节)为后续知识抽取(第4.5节)提供模式或结构框架,而该环节日益由基于大语言模型的抽取技术所主导。抽取所得的图数据库作为GraphRAG流程(第4.6节)的事实来源,该流程运用索引、检索与生成技术,为用户提供交互式、可解释且具备上下文感知能力的故障排查功能。最终,综合运用多种评估方法(第4.7节)对所构建融合系统的性能进行验证。    

4.3 应用场景分析与数据集

表2呈现了所有入选研究中故障诊断所针对的设置或场景。所考察的论文涵盖了广泛的工业应用领域,表明故障诊断方法具有跨行业的普适性。大量研究(如[13,24,37])聚焦于旋转机械及机械部件,尤其是轴承、电机与齿轮箱。在这些应用场景中,作者旨在利用智能故障诊断应对多样化数据源(如传感器数据、维护日志及专家知识)所带来的挑战,此类数据在旋转机械中较为常见。此外,诸多研究关注具有复杂子系统的工业领域,如重工业与钢铁生产[19,45]、航空航天[7]以及数控机床[4,25]。在这些复杂场景下,传统故障诊断难以定位相互关联的故障。    
表 2  部分研究中故障诊断的工业应用    
   
在能源与电力系统中,故障诊断对汽轮机、压缩机等设备至关重要[6,35],这表明此类设备的故障可能导致严重的工业运行中断。此外,汽车制造与交通运输行业[9,46]亦需智能故障诊断,如汽车生产线故障诊断。复杂装配流程中的故障处理亟需智能诊断方法,因传统方法无法对动态生产环境作出实时响应。          
附录表E.12对入选研究所采用的数据集进行了分类,依据数据来源与结构进行划分,以确保明确区分构建故障诊断知识图谱所需的各类信息形态。这些类别包括:基于历史维护日志与故障报告的历史维护与故障记录;从工程或机械相关论坛等在线平台获取的网络爬取数据集;由工业系统实时传感器读数构成的基于传感器的结构化数据;知识图谱与文本数据,涵盖机器子图、机器手册及故障排查指南等结构化与非结构化文本信息;来源于学术论文等学术资源的文献数据集;以及混合/其他数据集,包括专家访谈、仿真故障数据等不属于上述类别的数据集。          
表E.12 选定研究中使用的数据集          
   
所选研究中,采用文本数据集构建本体和/或知识图谱的研究主要以中文或英文作为数据集语言。如表E.13所示,多数研究以中文和英文作为数据集语言,这一区分凸显了大语言模型与知识图谱故障诊断研究中的语言分布特征。未列入该表的其他研究主要采用基于传感器的数据集,或未注明其文本数据的语言。    
表E.13 所选研究数据集中使用的语言            
         

4.4 本体论

本体对于故障诊断系统中的知识结构化至关重要,因其为知识抽取、表示与推理提供了模式框架。如表3所示,我们在入选研究中识别出两种应用于故障诊断的主要本体技术。

表3 选定研究中的本体类型          
   

第一种为故障中心本体,其核心在于围绕故障及其关联实体组织知识,涵盖故障症状、成因、措施及位置等要素。例如,文献[45]将其本体划分为故障名称、症状、成因、措施及位置等类别,并建立"导致""被缓解于""隶属于"等关系。尽管部分此类本体涉及系统部件(如故障位置),但其主要目标在于捕获故障与其特征之间的关联关系。该本体适用于诊断系统无需系统级表示的场景。

设备/系统中心本体则提供更为系统化的系统分解,从子系统、部件到单个零件等多个层级进行归类,并明确其与故障的关联关系。文献[4]提出了一种面向数控系统故障诊断的本体,将知识从系统层级(如西门子808D)至特定子系统、部件及零件进行层次化组织,并将该系统本体与故障描述、根本原因、可观测症状及推荐解决方案相联结。该本体最适用于复杂系统,在此类系统中单个部件故障可能影响其他子系统,因而需要层次化的系统表示以实现高效的故障追踪。

4.5 知识提取

如表4所示,基于大语言模型的方法利用预训练大语言模型从非结构化文本语料库中抽取实体。文献[45]使用ChatGPT进行命名实体识别(NER:Named Entity Recognition)、关系抽取(RE:Relation Extraction)及因果关系抽取(CRE:Causal Relation Extraction),选取三个代表性数据样本供ChatGPT执行上下文学习,并构建故障诊断领域中的适当实体与关系。文献[29]提出了一种层次化BERT模型,包含向量编码层、基于二分类层的实体识别层以及基于神经网络的关系分类层。为保障知识图谱构建的一致性,文献[41]采用基于BERT的联合模型实现实体与关系的同步抽取。最后,文献[26]提出了ROMGCJE模型(ROMGCJE:Relation-Oriented Model for Joint Extraction of Entities and Relations,面向关系的实体与关系联合抽取模型),该模型运用BERT与深度学习方法同时抽取实体与关系。通过该方法,实体及其上下文关系得以以维持知识图谱开发所需结构依赖性的方式进行表示。

表4 选定研究中的知识提取方法            
         

深度学习方法采用多种神经网络架构以提升实体与关系抽取性能。文献[25]使用BiLSTM-CRF模型(BiLSTM-CRF:Bidirectional Long Short-Term Memory-Conditional Random Field,双向长短期记忆-条件随机场)识别实体边界,并采用TransE(TransE:Translating Embeddings for Modeling Multi-relational Data,用于多关系数据建模的翻译嵌入)进行实体对齐,以避免知识图谱中实体间的歧义。文献[28]运用卷积循环神经网络(CRNN:Convolutional Recurrent Neural Network)与联结主义时序分类(CTC:Connectionist Temporal Classification)算法进行知识构建。这些方法使得从大规模多样化数据集中以更为可靠且可扩展的方式抽取知识成为可能。

基于规则的方法运用组织化且逻辑化的规则进行知识抽取。文献[31]采用主谓宾(SVO:Subject-Verb-Object)框架下的谓词逻辑分析识别故障要素。文献[52]运用基于Prolog的规则推理抽取故障成因,并采用模糊逻辑推理处理故障诊断中的不确定性。另一方面,基于语义与本体的抽取方法(如文献[46])利用预定义分类体系进行语义标注,将非结构化数据转换为适用于知识图谱的格式。最后,文献[27]提出了语义映射策略,该技术将缺陷识别信号(如滚动轴承的CGHMM)与基于本体论的知识库联系起来。

混合方法通过将本体与大语言模型相结合以改进实体与关系抽取。文献[14]将命名实体识别与本体相结合以抽取领域特定的故障数据。Chen与Wang[36]提出了一种融合BERT、ChatGPT及ECE-Net的多模态方法,用于实体抽取、关系识别及故障模式识别。最后,文献[6]采用带指针标注的BERT-WWM模型实现知识融合自动化,将抽取内容整合为结构化知识图谱。大语言模型与本体的结合提升了知识抽取效果,原因在于大语言模型能够处理非结构化数据,而结构化的本体框架则提供一致性、可解释性及领域特定准确性。

4.6 KG增强LLM(GraphRAG)流程:索引、检索与生成

入选研究中的11篇文献展示了知识图谱如何通过提供结构化领域知识以提升大语言模型性能。该融合通过知识图谱中相互关联的实体最小化幻觉现象并增强推理能力,从而改进大语言模型在故障诊断中的表现。本小节考察这些文献如何运用索引、知识检索与知识生成技术,重点阐述知识图谱对大语言模型能力的增强作用。

表5展示了入选研究采用的不同索引技术。故障诊断索引领域的一个趋势是采用混合模型,融合图数据库与向量存储。在该架构中,基于图的索引聚焦于关系三元组(节点与边)以实现多跳因果追踪,而向量索引则聚焦于语义相似性以处理自然语言查询。多数文献采用图数据库技术(如Neo4j图数据库)存储三元组的语义网络。除图数据库外,诸多先进系统还利用额外的索引方法,包括用于管理文本与多模态数据的向量存储。该索引技术实现了超越精确关键词匹配的语义匹配[43]。FAISS等库用于存储BGE-M3等模型的向量嵌入。文献[40]提出了一种扩展方案,包含多模态数据的索引,其通过低秩多模态策略等融合策略整合文本、视觉与数值数据的超节点融合,随后采用BGE-M3、ViT及BERT进行编码,展示了一种将各类工业数据直接纳入索引的技术。

表5 选定研究中的索引方法              
         

上述各类索引策略均存在不同权衡。基于图的索引因其可解释性及执行多跳因果追踪的能力而备受青睐,该特性在运用所定义本体进行故障诊断时具有高度相关性。然而,该方法产生刚性且缺乏语义灵活性,使得处理自然语言或未与图中 特定结构化实体关联的非结构化查询时索引面临挑战。另一方面,融合基于图的索引与向量索引的混合索引通过提供用于逻辑推理的图索引与用于语义检索的向量数据库,解决了上述问题。Neo4j等现代图数据库已提供原生向量索引,将向量存储为节点属性,简化了实现复杂度,无需采用独立的数据库技术存储向量[53]。

依据检索流程的复杂程度,研究中所识别的知识检索技术可分为三种不同方法:单轮检索(Single-Round Retrieval)、混合单遍检索(Hybrid-Single-Pass Retrieval)与多阶段/迭代检索(Multi-Stage/Iterative Retrieval),如表6所示。

表6 选定研究中的知识检索方法              
         

单轮检索是最直接的方法,系统基于用户查询直接检索相关三元组或子图,并立即将检索所得节点传递至大语言模型进行答案生成。文献[6,7]提供了示例,其中从查询中提取的实体直接用于单步检索相关节点。

混合单遍检索是一种略为复杂的方法,系统在单轮检索阶段依次执行基于向量与基于图的语义搜索以检索节点。在文献[34]中,系统计算查询与目标节点间的余弦相似度,随后使用Cypher(Cypher:Neo4j图数据库查询语言)从Neo4j数据库查询周围因果链路(故障成因)。

最后,多阶段/迭代检索是一个动态过程,系统依据诊断需求执行顺序检索操作。该技术的示例包括文献[33]所采用的方法,其通过动态优化知识图谱内部路径的遍历方向以促进多轮交互,或将复杂查询分解为较小子问题以实现更精确检索的方法[5]。

比较这三种策略时,在运行效率与语义深度之间存在权衡。多阶段/迭代检索通过多步知识获取提升检索精度与深度,但以增加延迟及多次交互与决策带来的向量嵌入成本为代价。类似地,混合单遍检索因其多样化的上下文获取来源而提供更精确且相关的检索,但同样具有较高的延迟与嵌入成本。相反,单轮检索虽提供更快的响应时间,但当查询以不同语言表达同一实体时面临检索精度挑战。

知识生成依据大语言模型在处理检索信息与结构化最终输出中的角色进行分类,如表7所示。

表7 选定研究中的生成方法              
         

第一类为完整答案生成,大语言模型主要负责将所有检索信息(包括实时数据与结构化知识图谱路径)整合为增强上下文[43],随后运用提示工程为用户提供自然语言响应。部分研究对大语言模型进行微调或前缀调优以改进上下文回答[5,7]。

第二类为智能体生成,大语言模型的角色从单纯的叙述者转变为积极决策的智能体。该技术不仅生成文本,还生成可执行的诊断动作(如"检查传感器X"),通常需要人在回路交互[50]。

最后一类为部分/结构化转换,为大语言模型提供最为有限的角色,主要作为标准化工具。其核心功能在于将原始非结构化输入文本(如故障症状)转换为标准化输出(如"故障模式"与"故障位置")[45]。输出为结构化数据,而非完整的自然语言叙述性答案。

三种方法之间的根本权衡在于决定优先保障输出完整性还是速度或大语言模型角色的实用性。完整答案生成通过向用户提供详细且叙述性的解释确保最高程度的完整性。然而,该方法通常较慢,因整合复杂输入并生成详细文本需要更多计算资源。另一方面,部分/结构化转换通过将大语言模型的任务限制为基本数据转换(例如从故障症状到故障模式)以最大化速度,使过程更快且更可预测,但以牺牲更广泛的解释为代价。最后,智能体生成包含有助于管理诊断过程的中间活动,但并不立即产生全面且明确的诊断。

4.7 评估与基准测试

表8总结了入选文献所采用的多种评估方法,用以评价故障诊断方法中各类技术的有效性。知识抽取的大多数技术采用标准的基于机器学习的分类任务指标进行评估,如准确率、精确率、召回率及F1分数。这些指标常用于评估从文本语料库中进行实体与关系抽取的效果,以及基于图嵌入技术的有效性。例如,文献[5]采用精确率、召回率及F1分数评估其所采用的命名实体识别(NER:Named Entity Recognition)技术。其他研究如文献[45],通过损失与准确率将所提出的嵌入模型与其他基线嵌入模型进行对比,以验证其诊断准确率的提升。

表8 选文评价方法

           

在采用知识图谱与本体的部分故障诊断应用中,评估通常包含定性与定量相结合的评价。为确认所提出模型的适用性,常采用案例研究与实际应用演示等定性技术。文献[30]等研究采用专家验证及本体验证工具OOOPS!,从结构、功能及可用性分析三个维度进行评估。此外,基于相似度的方法如SimRank算法(文献[4])被用于量化故障成因与现象之间的关联。

基于大语言模型及混合模型采用多种评估方法以提供全面评价。文献[5]结合人工定性评估(多名评估者评分并取平均响应)与基于大语言模型生成评分的自动化定量评估,从准确率、信息量、流畅度及逻辑性四个维度进行评价。文献[7]采用定性评估,将所提出模型(联合知识增强模型)与未调整的ChatGLM-6B及Ernie进行对比。部分混合方法如文献[45],将嵌入模型评估与所提出故障排查方法同CausalKG-ALBERT(同一研究者的早期研究)的知识推荐方法准确率对比相结合。通过定性与定量方法的融合,这些研究确保了对所提出故障诊断技术的完整评估。

4.7.1. 知识提取准确性和效率

提取精度被认为是最高的,RoBERTa-wwm-bilstm-mha-crf[38]为98.76%F1,CFRTE模型[29]为98.00%F1,这是由于在特定领域的语料库上微调变压器模型。然而,这需要对计算资源进行大量投入以完成微调,并需妥善整理标注训练数据。在此情况下,实现如此高的准确率需要对数据标注及技术复杂性进行重大投入。另一方面,对于更难处理的特定数据类型,模型复杂性与性能之间存在权衡。以文献[39]为例,由于工业文本中复杂且重叠的嵌套实体抽取挑战,其在嵌套命名实体识别(NER:Named Entity Recognition)任务中获得的F1分数略低,为81.11%。该任务本质上比扁平NER更具挑战性,尤其在处理稀缺的工业数据时。

Huang与Song[32]所采用的方法在资源效率和提取精度之间进行了权衡,但得出了另一个相反的发现。尽管他们的模糊F1相对较低,为49.8%,但他们能够消除注释和微调的非常昂贵和人力劳动,这使他们获得了优越的部署成本综合分数(0.5482)。他们的方法更强调通过快速工程进行快速和经济的部署,而不是在知识提取基准上实现最佳结果。关于提取和管理的另一个观点是定性评估,由[34]执行,他们对提取的知识三元组实现了95.73%的高语义准确率。然而,这一高分是在与故障维护专家进行统计比较后获得的,这表明人类领域经验对于知识提取的可靠性是必要的。附录表F.14中提供了这些提取方法及其各自指标的全面概述。

表F.14 知识提取和知识生成方法及其报告指标的比较

         
4.7.2. 知识生成准确性和效率    

首先为在实现知识生成高准确率的同时降低幻觉现象,架构设计有时必须复杂化,并需权衡准确率与效率之间的关系。文献[43]采用多阶段检索增强生成(RAG:Retrieval-Augmented Generation)架构,在知识生成中取得优异指标(准确率92.3%,幻觉率5.3%),其原因在于融合了向量检索与图检索,并结合结构化知识图谱因果路径与实时数据。为了展示他们的技术,KG因果路径提供了一个结构化的推理路径,例如“故障→症状→原因→维护”,该路径以从矢量数据库中检索到的数据和实时数据为基础。由此,该架构防止大语言模型在信息缺失时尝试猜测解决方案。该阶段的计算效率通过高吞吐量策略实现,如vLLM框架与量化技术。从其工作可见,该架构在吞吐量方面具有效率;采用vLLM框架与量化使系统处理查询的速度较标准配置提升3.2倍。

另一项值得提及的高准确率知识生成技术来自文献[33]。其采用高度特定且复杂的编码器,即CRCGAT编码器中取得优异性能。该技术成功识别长因果链,产生良好的知识生成指标(故障诊断准确率87%,F1分数80%)。然而,该架构的复杂性导致高资源开销的权衡,因所提出的编码器模型需要更长的训练时间(每轮次7.6秒)及峰值GPU显存使用(11.2 GB),显著高于采用简单图注意力模型作为基线的情况。文献[7]亦展示了知识准确性的高分,其生成答案的准 确率达98.5%,该结果通过真实工业场景测试获得。然而,其未详细阐述答案正确性的测量方法,使得该技术如何产生如此高准确率尚待进一步论证。这些生成模型的技术配置与报告效率分数详见附录表F.14。

编辑:赵栓栓

校核:李正平、陈凯歌曹希铭、赵学功、白亮、任超、海洋、陈宇航、Kira、Tina、王金、赵诚、肖鑫鑫、张优

该文资料搜集自网络,仅用作学术分享,不做商业用途,若侵权,后台联系小编进行删除

来源:故障诊断与python学习

ACTSystemMarc振动旋转机械通用航空航天汽车电力UGpython理论电机数字孪生控制工厂人工智能数控
著作权归作者所有,欢迎分享,未经许可,不得转载
首次发布时间:2026-04-27
最近编辑:4月前
故障诊断与python学习
硕士 签名征集中
获赞 87粉丝 152文章 327课程 0
点赞
收藏
作者推荐

基于数字孪生的物理知情自编码器在不平衡样本条件下的滚动轴承故障诊断(下)

工业设备"看病难"?故障数据稀缺让AI诊断频频"误诊"!天津工业大学团队最新研究将数字孪生与物理神经网络深度融合,让AI不仅"看懂"振动信号,更"理解"轴承背后的力学规律,在故障样本极少的情况下仍能达到99.86%的诊断准确率,为智能工厂的设备运维开辟了新路径。 本期推荐的这篇是天津工业大学机械工程学院教授尚志武的文章,本文系统综述了基于数字孪生的物理信息自编码器(PIAE-DT:Physics-Informed Auto-Encoder based on Digital Twin)在不平衡样本条件下滚动轴承故障诊断中的应用,针对工业场景中故障数据稀缺导致的类别不平衡难题,提出了一种融合物理机理与数据驱动的数据增强新范式;该方法通过将无量纲轴承动态特征嵌入自编码器隐空间,实现刚度、阻尼等关键物理参数的精确辨识与概率分布建模,并基于数字孪生空间的重采样机制生成高保真、多样化的合成故障样本;在凯斯西储大学(CWRU:Case Western Reserve University)公开数据集与高速轴承故障模拟实验平台(HFHP:High-speed Bearing Fault Simulation Experiment Platform)私有数据集上的对比实验表明,PIAE-DT在100:1至1:1的不平衡比例范围内均显著优于合成少数类过采样技术(SMOTE:Synthetic Minority Over-sampling Technique)、变分自编码器VAE(VAE:Variational Autoencoder)、带梯度惩罚的瓦瑟斯坦生成对抗网络(WGAN-GP:Wasserstein GAN with Gradient Penalty)等方法,最高诊断准确率达97.60%与99.86%,为智能制造背景下小样本故障诊断提供了兼具可解释性与鲁棒性的技术路径。 由于文章篇幅过长,小编将分两次为大家翻译介绍这篇论文,第一篇推文(点击直达)提出了基于数字孪生的物理信息自编码器框架,针对滚动轴承故障诊断中故障样本稀缺导致的数据不平衡问题,通过将无量纲物理信息模块嵌入自编码器,实现刚度、阻尼等动态模型参数的精确辨识,并将这些参数映射到概率分布空间进行重采样,从而生成兼具物理一致性与统计多样性的合成故障数据;该方法设计了包含重构损失、无量纲微分损失和数字孪生物理一致性损失的复合损失函数及两阶段训练策略,为后续数据增强与故障诊断奠定理论基础。 本篇推文聚焦实验验证与性能评估,系统开展生成数据质量分析与故障诊断效果验证。首先通过最大均值差异和均方根误差量化评估生成样本的分布相似性与波形保真度,PIAE-DT在两项指标上均显著优于对比方法。随后构建不平衡数据集进行诊断性能测试,结果表明随着不平衡比例从100:1逐步改善至1:1,PIAE-DT持续保持领先,准确率提升幅度最大达36.6%。消融实验进一步揭示了物理信息模块与自编码器结构的协同作用机制,超参数分析确定了最优批次大小、网络深度与学习率配置。t-SNE可视化直观展示了PIAE-DT生成数据具有更清晰的类别可分性,为方法有效性提供了有力佐证。 论文基本信息论文题目: Physics-informed auto-encoder based on digital twin for rolling bearing fault diagnosis under imbalanced sample conditions论文期刊:Engineering Applications of Artificial IntelligenceDoi:https://doi.org/10.1016/j.engappai.2025.113017作者: Ziyu Wang a,b , Cailu Pan a,b , Wanxiang Li c,d , Maosheng Gao e 论文时间: 2025年 机构: a School of Mechanical Engineering, Tiangong University, Tianjin, 300387, China b Tianjin Modern Electromechanical Equipment Technology Key Laboratory, Tianjin, 300387, Chinac TBEA Beijing Tianjin Hebei Intelligent Technology Co., Ltd, Tianjin, 301701, China d TBEA Tianjin Transformer Co., Ltd, Tianjin, 300300, China e TBEA Electrical Equipment Group Co., Ltd, Tianjin, China作者简介:尚志武,男,1977年2月生,天津工业大学机械工程学院教授、正高级工程师、博士生导师。2003年获天津大学机械制造及其自动化专业博士学位。任中国振动工程学会机械动力学专委会委员,兼任天津经济技术开发区正高级职称评委会委员、国家科技奖励评审专家、国际TRIZ协会(MATRIZ)认证专家、甘肃省产业竞争力战略咨询委员会委员 。研究方向涵盖智能诊断与动态测控、机电一体化技术、创新方法与创新设计等领域。(来源:ResearchGate) 摘要在滚动轴承故障诊断中,故障样本稀缺导致故障数据远少于正常数据,引发样本不平衡问题,严重影响诊断准确率。生成式神经网络虽能补充故障数据,但无法确保生成数据充分捕捉轴承动力学特性,从而损害可靠性。本文提出了一种基于数字孪生的物理信息自编码器,用于不平衡条件下的可解释数据增强。通过将融入轴承动态特性的无量纲物理信息模块嵌入自编码器,实现了动态模型参数的辨识,并确保每个学习特征对应具有物理意义的参数,提升了可解释性。辨识后的参数被映射至概率分布,进而通过重采样在数字孪生空间中开发故障数据增强方法,以增加增强数据的多样性。此外,从这些参数重构振动信号进一步提升了增强数据的可靠性,实验结果验证了物理信息模块的有效性。最终,应用PIAE-DT辨识已知样本的动态参数,在数字孪生空间中实现故障数据增强,有效缓解了诊断中的不平衡问题。该方法在公开数据集和私有数据集上进行了评估,最高诊断准确率分别达到97.60%和99.86%,优于其他数据增强方法。 关键词:数据增强;动态模型;故障诊断;不平衡数据;数字孪生 目录1 引言2 相关工作 2.1 自编码器 2.2 物理信息神经网络 2.3 数字孪生3 所提方法 3.1 轴承数字孪生模型 3.2 轴承数字孪生空间 3.3 基于数字孪生的物理信息自编码器 3.4 不平衡样本故障诊断总体框架4 实验 4.1 数据集描述 4.2 不平衡数据集构建 4.3 实验设置 4.4 训练结果分析 4.5 应用于故障诊断5 结论注:小编能力有限,如有翻译不恰之处,请多多指正~ 若想进一步拜读完整版,请下载原论文进行细读。 4 实验4.1 自编码器数据集描述实验在一个公开数据集和一个实验室私有数据集上进行。公开数据集来自凯斯西储大学(Neupane and Seok, 2020),其试验台主要包括驱动电机、扭矩传感器、功率计和电子控制器(图5)。测试对象为SKF6205驱动端轴承,在1797 rpm转速下以12 kHz进行降采样,采集的加速度信号涵盖内圈故障、外圈故障、滚动体故障及正常类别,故障尺寸为7 mil、14 mil和21 mil。实验室私有数据集来自HD-FD-H-03P转子齿轮箱故障模拟试验台(图6),该试验台主要由磁粉制动器、轴承模块、飞轮、扭矩转速计、单向传感器和电机组成;测试对象为SKF6205轴承,在1500 rpm转速下以12 kHz进行降采样,采集的加速度信号包括内圈故障、外圈故障及正常类别,故障尺寸为0.3 mm、0.4 mm和1 mm。 图5 轴承试验台架在凯斯西储大学( Neupane and Seok , 2020) 图6 HFHP自建轴承故障模拟实验平台(潘文卿等, 2023)本文两个数据集的实验轴承均为SKF6205,该轴承的具体参数如表1所示。表1 SKF6205轴承参数 4.2 不平衡数据集构造为更好地模拟工业应用中故障样本稀缺的实际场景,对原始数据集进行人工处理以构建不平衡数据集。首先,采用滑动窗口对原始振动信号进行样本分割,窗口长度为1024,滑动步长(stride)为512。随后,从CWRU和HFHP数据集分别获得10 × 600和7 × 600个样本。每个数据集被随机划分为训练集和测试集,后者记为数据集A(Dataset A),分别包含10 × 100和7 × 100个样本。在训练集中,所有正常(健康)样本被指定为数据集B(Dataset B,1 × 500),同时随机选取1%的故障样本并标记为数据集C(Dataset C,CWRU为9 × 5,HFHP为6 × 5)。剩余故障样本被标记为数据集D(Dataset D,CWRU为9 × 495,HFHP为6 × 495)。数据集B与C共同构成不平衡比为1:100的不平衡数据集,用于训练故障诊断模型。同时,数据集C作为训练生成模型的已知故障样本,数据集D用于评估生成数据的质量。人工生成的故障样本记为数据集E(Dataset E)。通过调整数据集E的样本数量,将数据集B、C和E组合,构建具有不同不平衡比的数据集用于模型训练。具体的数据划分汇总于表2。表2 CWRU和HFHP数据集的使用 通过上述样本划分与处理策略,CWRU和HFHP数据集均被划分为多个子集(数据集A–E),随后用于模型训练、测试及生成样本的评估。这一全面配置支持故障诊断模型的实验开发与验证,特别是在极端类别不平衡条件下模型的鲁棒性与泛化能力方面。4.3 自编码器数据集描述计算硬件配置包括16 GB内存和NVIDIA RTX 4060图形处理器。实现采用Python 3.10,核心依赖库为PyTorch 2.2和NumPy。为确保结果的鲁棒性,性能评估在10次重复独立实验中进行,以减少固有随机性的影响。模型训练200轮,批量大小为5。初始学习率设为0.0005,采用Adam优化器进行优化。为增强收敛稳定性,应用StepLR学习率调度器,每50轮将学习率衰减0.5倍。采用最大范数为1.0的梯度裁剪防止梯度爆炸。在损失函数中加入惩罚项作为正则化形式。模型存储方面,保存检查点,保留200轮后的最终模型以及取得最佳训练性能的模型。为清晰展示网络架构,所提PIAE-DT的结构设计汇总于表3,本研究采用的训练超参数列于表4。表3 参数PIAE-DT 表4 训练超参数 4.4 自编码器数据集描述训练结果分析4.4.1. 训练损失结果分析与纯粹数据驱动的生成模型相比——后者虽能丰富少数类样本,但往往缺乏物理可解释性且与现实系统动力学的一致性不足——数字孪生(DT:Digital Twin)技术提供了一种物理一致的数据增强方法(Cui et al., 2024)。相比之下,DT技术通过融合基于物理的仿真与真实传感器数据,实现了物理一致的数据增强,为解决上述局限性提供了有前景的途径(Yi et al., 2023; Zhang et al., 2023)。 图7 训练过程中不同损失项的训练损失曲线从不同损失项的表现来看,重建损失 在早期迅速下降并逐渐稳定,表明模型能够有效完成重建任务;而无量纲微分损失 和数字双胞胎损失 下降相对较慢,但显示出类似的稳定收敛趋势,表明它们的正则化约束正在逐渐满足;总损失 则保持下降趋势,最终在相对较低的水平上稳定下来,进一步证明了各损失项之间的协调性。总之,所提出的方法能够在训练过程中有效降低误差,并在长时间的迭代周期内保持稳定状态,充分验证了该方法的有效性和可训练性。如图8所示,本文的总体损失函数为不同的子损失项引入了自适应权重系数 、 、 ,分别对应 、 、 。随着训练的进行,这些权重系数可进行动态调整,以平衡各任务在不同阶段对总体优化的贡献。 图8 训练过程中自适应权重系数曲线具体而言,系数 (对应于 )在整个训练过程中保持在相对较高的水平(接近2),表明在优化开始时,模型强调重建损失的重要性,从而确保生成结果与输入质量的一致性;系数 (对应于 )在早期训练阶段逐渐增加,并在后期趋于稳定在约 1 左右,反映出对判别约束的持续关注,这有助于提高模型的判别能力;系数 (对应于 )整体保持在相对较低的水平,表明该约束在整体优化中所占比例较小,主要起到辅助作用。这种自适应加权机制使损失函数能够根据训练过程中不同任务的优化需求自动调整权重,从而避免单一损失项的主导,确保模型在收敛时兼顾重构质量与判别能力,实现更加稳定高效的训练效果。4.4.2. 数字孪生空间结果分析使用包含已知故障样本的数据集C训练生成模型,获取关键动力学参数的概率分布,从而构建CWRU数字孪生空间(图9)。结果表明,当缺陷尺寸变化较小时,无量纲刚度和阻尼参数基本保持稳定,且与缺陷尺寸或类型相关性较弱,更多地受到轴承模型和采集环境的影响。虽然使用固定参数值不会损害振动响应的真实性,但会限制样本多样性;这一问题可通过将参数直方图转换为概率分布并从中采样来缓解。按照相同流程,获得了HFHP数据集C的动力学参数分布(图10)。尽管源自相同的轴承模型,两个数据集却呈现出不同的参数分布,表明动力学参数不仅由缺陷特性决定,还对实验设置、环境噪声及传感器特性敏感。总体而言,图9和图10表明这些参数分布与缺陷尺寸和类型相关性较弱,但强烈反映了测试环境特征。 图9 CWRU数字孪生空间 图10 HFHP数字孪生空间综上所述,基于概率动力学参数构建数据驱动的数字孪生空间,不仅保持了振动信号的物理真实性,还增强了多样性与泛化能力,为稳健的样本生成及下游模型训练奠定了基础。4.4.3. 生成数据可靠性分析通过从两个数据集的数字孪生空间中随机采样,并将采样得到的参数与其对应标签相结合,生成新的故障数据样本。随后将这些参数输入训练好的权重共享解码器以重构振动信号。如图11和图12所示,生成信号在两个数据集中均与原始数据高度吻合。对于CWRU数据集(图11),生成数据在整体波形形状和幅值分布上与真实信号良好对齐。在HFHP数据集(图12)中,生成信号展现出可比拟的幅值范围和时域模式。值得注意的是,在缺陷区域观察到更为明显的振动行为,而非缺陷区域的信号保持平坦且一致。有趣的是,非缺陷区段的生成信号甚至比真实数据更加平滑,表明模型不仅捕捉了关键时序特征,还可能在合成过程中对其进行了增强。 图11 CWRU真实数据与生成数据的对比 图12 HFHP真实数据与生成数据的对比综上所述,合成信号在保留关键故障相关特征的同时,提升了平滑性和一致性,展示了所提方法在生成用于下游任务的高保真度和可靠故障数据方面的能力。4.5 应用于故障诊断4.5.1. 量化评价指标和不平衡率设计为量化模拟数据与实测数据之间的差异,本文采用两种指标:最大均值差异 MMD(Zhang et al., 2022b)和均方根误差 RMSE(Lei et al., 2012)。MMD用于评估数据分布的差异,而RMSE主要关注模拟数据与实测数据之间的幅值差异。数学定义如下:此外,采用分类准确率评估故障诊断性能,其定义为:其中, 表示真实类别为 且预测类别为 的样本数量, 代表类别数。为构建不同的不平衡场景,设计了如表5所示的样本比例。表5 不平衡比率 在不平衡分类实验中,采用数据集B中的500个真实正常样本和数据集C中每类故障的5个真实故障样本作为训练集。每类故障的生成样本数量从0逐步增加至495,使不平衡比从100:1逐渐降低至1:1。数据集A中的所有数据均用作分类网络的测试集。为进一步验证所提方法处理不平衡样本的有效性,所有实验在相同参数设置下采用统一的诊断网络(WDCNN:Wide Deep Convolutional Neural Network)(Zhang et al., 2017)。4.5.2. 极端不平衡情景的基准首先,我们在极端不平衡的100:1场景下评估无任何增强时的基线诊断性能,以建立参考基准。如表6(CWRU数据集)和表7(HFHP数据集)所示,所有模型的诊断准确率仅徘徊在62%左右,表明严重的类别不平衡导致故障识别能力显著下降。表6 在CWRU数据集上的基线诊断准确率( 100:1 ) 表7 在HFHP数据集上的基线诊断准确率( 100:1 ) 4.5.3. 不同不平衡比例下的对比实验在本研究中,对比模型包括SMOTE、VAE、WGAN-GP以及动力学模型。动力学模型采用与文献中相同的仿真参数求解微分方程。接下来,我们在最具挑战性的不平衡水平(100:1)下评估生成样本的质量,因为高保真数据生成是有效增强的基础。为此,采用MMD 和RMSE 指标定量测量合成样本与真实样本之间的分布相似度和波形保真度。如图13(a)所示,所提模型在CWRU数据集的全部九类故障中始终取得最小的MMD值,表明生成样本的分布与真实数据最为接近,从而展示了捕捉底层数据分布的优越能力。从图13(b)可观察到类似现象,所提模型同样记录了最低的RMSE分数,进一步证实生成样本与原始信号最为相似。在HFHP数据集上观察到可比拟的趋势:如图14所示,PIAE-DT 同样获得最低的MMD和RMSE值,验证了其在不同数据集上的优异泛化能力,并突出了合成样本的高保真度。 图13 生成样本在CWRU数据集上的MMD和RMSE得分 图14 生成样本在HFHP数据集上的MMD和RMSE得分在上述展示的高质量数据生成能力基础上,我们进一步评估了随着不平衡比从50:1逐步放宽至1:1,样本增强后下游诊断性能的演变情况。如表8和表9所示,所有增强策略均带来准确率的显著提升,证实了合成样本补充对缓解不平衡的积极作用。值得注意的是,所提PIAE-DT 模型在每个不平衡设置下始终优于所有对比方法。特别是当类别分布达到完全平衡(1:1)时,PIAE-DT在CWRU数据集上达到97.6%的峰值准确率,在HFHP数据集上达到99.86%的峰值准确率,充分展示了其通过高保真样本生成缓解数据不平衡并提升诊断性能的卓越能力。表8 在CWRU数据集上不同不平衡比例下的诊断准确率 表9 在HFHP数据集上不同不平衡比例下的诊断准确率 建立轴承故障动力学模型对于开发精确的轴承数字孪生至关重要。该模型能够在真实工况下模拟各种故障模式,从而增强预测性维护能力。通过将轴承故障简化为单自由度非线性模型,我们在保持对广泛轴承数据集适应性的同时,最小化了模型复杂度。在这些令人鼓舞的结果基础上,图15展示了随着不平衡比从50:1逐步放宽至1:1,不同增强方法的诊断准确率提升演变情况。随着类别分布趋于更加平衡,所有方法均表现出逐步增加的性能增益,证实了合成样本补充的积极作用。其中,SMOTE 和VAE 在中等不平衡度下显示出稳定的改进,而WGAN-GP 在相对平衡的场景中产生显著提升。值得注意的是,所提PIAE-DT 在所有设置下始终取得最大的准确率增益,并在CWRU和HFHP数据集的1:1比例下分别达到36.6%和37.1%的峰值改进,从而展示了其通过高保真样本生成缓解数据不平衡并提升诊断性能的卓越能力。 图15 不同增强方法在不同不平衡比下诊断准确率的提升在100:1的高度失衡环境下,所有模型的诊断准确率显著下降至约62%,突显出严重类别不平衡对故障识别的有害影响。然而,利用高保真度的合成样本进行数据增强有效地缓解了这一问题。通过MMD和RMSE的定量评估表明,PIAE-DT生成的样本在分布和波形特性上与真实数据具有最一致性,显示出强大的数据建模能力。随后,在不同的不平衡比例(从50:1到1:1)下进行的诊断实验显示,所有增广策略均提高了准确率,且随着类别分布的逐渐平衡,性能提升也愈加明显。值得注意的是,PIAE-DT始终优于竞争方法,在CWRU数据集上达到峰值准确率97.6%,在HFHP数据集上达到99.86%,并在1:1比例下实现了最大准确率增幅,分别为36.6%和37.1%。这些结果证明了PIAE-DT在缓解数据不平衡和通过高质量样本生成提升故障诊断能力方面的卓越能力。4.5.4. 不同不平衡比下的烧蚀实验如图1所示,本研究开发的轴承数字孪生模型通过改变故障尺寸获取不同类别的缺陷位移数据,并将其嵌入动力学模型中。为进一步阐明所提框架中各结构组件在缓解样本不平衡和提升诊断性能方面的独立贡献,我们通过逐步移除或修改模型的关键模块来进行消融研究。此类研究至关重要,因其使我们能够:(i)定量评估各模块对整体性能的重要性;(ii)验证模型设计的合理性;(iii)为模型的未来开发及实际部署简化提供指导。通过系统比较不同消融配置在各种不平衡比下的诊断准确率,我们旨在深入洞察各架构元素的有效性和必要性。为此,构建了五种对比模型:模型1(完整模型)代表原始PIAE-DT(Physics-Informed Auto-Encoder Based on Digital Twin:基于数字孪生的物理信息自编码器)框架,该框架集成了物理信息(PI:Physics-Informed)模块和自编码器(AE:Autoencoder)模块。模型2(w/o PI)移除PI模块,仅保留AE,以评估物理信息融入对样本生成保真度和诊断性能的贡献。模型3(w/o AE)舍弃AE模块而保留PI,从而检验AE在信号重构和特征保持中的作用。模型4(AE → CNN)将AE的全连接结构替换为卷积神经网络(CNN:Convolutional Neural Network),以研究局部感受野建模对生成性能的影响。最后,模型5(AE → RNN)将AE替换为循环神经网络(RNN:Recurrent Neural Network),以探索序列建模能力是否更适合振动信号生成。在后续实验中,对这五种模型在50:1至1:1的不同不平衡比下进行评估,从而对所提故障诊断框架中各组件的功能性和有效性进行全面分析。在消融研究中,我们首先在最严重的不平衡场景(100:1)下使用定量指标MMD 和RMSE 评估生成样本的质量。如图16和图17所示,模型5展现出最高的生成质量,其次是模型4,而模型1表现中等,模型3和模型2相对较差。这些结果表明,将全连接AE 结构替换为RNN(模型5)或CNN(模型4),由于其更强的时序动力学和局部特征模式建模能力,能够相对于原始架构(模型1)提升生成样本的保真度。 图16 生成样本在CWRU数据集上的MMD和RMSE得分 图17 生成样本在HFHP数据集上的MMD和RMSE得分然而,应当注意的是,模型4和模型5极低的MMD/RMSE分数可能源于对有限少数类故障样本的过拟合,这并不一定转化为下游诊断任务中泛化能力的提升。相比之下,模型1在生成保真度与泛化能力之间取得了更为平衡的权衡,这对于实际数据增强至关重要。诊断性能结果将在下文呈现以进一步支持这一观察(图18)。基于上述生成质量的观察,我们进一步检验这些差异是否能在 varying 不平衡比下转化为下游诊断性能的改进。五种模型在CWRU和HFHP数据集上的分类准确率分别汇总于表10和表11。 图18 不同增强方法在不同不平衡比下诊断准确率的提升表10 在CWRU数据集上不同不平衡比例下的诊断准确率 表11 在HFHP数据集上不同不平衡比例下的诊断准确率 如表所示,模型1在两个数据集的大多数不平衡比下始终提供卓越的诊断准确率,特别是当类别分布趋于相对平衡时(例如,CWRU数据集上2:1和1:1的准确率达到93.7%/97.6%,HFHP数据集上达到96.00%/99.86%)。尽管模型4和模型5在极端不平衡或中等不平衡场景下偶尔取得略优的性能(例如,CWRU数据集的50:1和HFHP数据集的10:1),但其诊断准确率随比例变化波动更为显著,表明稳定性和泛化能力较弱。相比之下,移除 PI 模块或 AE 模块的模型2和模型3,在所有设置下均显示出诊断性能的明显下降,突出了所提架构中两个组件的必要性。这些结果证实,在类别不平衡条件下,生成与诊断之间的平衡权衡,而非合成样本的绝对保真度,是有效性能提升的关键。所提模型1很好地实现了这一平衡,从而带来总体更优且更稳定的诊断结果。4.5.5. 模型结构与超参数分析在极端类别不平衡和有限样本量条件下,模型性能对训练超参数和网络架构高度敏感。系统性实验结果表明,批量大小、网络深度、损失系数配置和学习率均对识别准确率产生决定性影响,各因素均呈现"适度最优"模式。这些发现凸显了精心选择架构和训练设置以确保此类挑战性场景下稳定性和泛化能力的重要性。具体而言(见图19),关于批量大小,将其从1增加至5带来性能的逐步提升,在批量大小为5时达到最优。在此设置下,每个训练批次涵盖每类所有5个可用样本,从而实现更具代表性的梯度更新。然而,当批量大小进一步增加(≥10)时,性能显著恶化,表明小批量训练更有利于泛化。关于网络深度,从1层扩展至3–4层显著改善性能,表明适度深度增强特征提取能力;尽管如此,将深度增加至5层或更多导致性能下降,这可能是由于小样本条件下过拟合和梯度传播困难所致。对于损失系数策略,自适应方案(Method1)取得最佳结果,因为损失权重的动态调整有效平衡了训练过程中不同项的贡献。相比之下,移除正则化项(Method2)使性能退化,凸显其对稳定性和泛化能力的重要性,而固定系数(Method3)产生最差结果,表明缺乏灵活性阻碍学习。最后,学习率(learning rate)实验揭示出明显的先升后降趋势:当学习率从0.0001增加至0.0005时性能改善,但提升至0.001或更高时性能急剧下降。这表明过大的学习率导致不稳定收敛或发散,而过小的学习率则导致欠优化;在收敛速度与稳定性之间取得平衡,0.0005成为最优选择。 图19 超参数配置的烧蚀研究。考察( a )批次大小,( b )网络深度,( c )损失系数策略,( d )学习率对模型性能的影响综上所述,在小样本和高度不平衡条件下,模型训练应遵循"适度最优"原则。小批量大小(例如,5)、适度网络深度(3–4层)、带正则化的自适应损失系数机制以及中等学习率(0.0005)共同提供最优越的性能和泛化能力。这些结果不仅确定了关键因素的最优配置范围,还为类似问题设置下的模型设计与优化提供了有价值的指导。4.5.6. 可视化分析为进一步评估所提模型的有效性,采用t分布随机邻域嵌入(t-SNE:t-distributed Stochastic Neighbor Embedding)对100:1不平衡条件下诊断分类器的隐藏层和输出层特征进行可视化。如图20所示,所有网络的隐藏层特征分布显示,故障类型2(绿色)、5(黄色)、3(粉色)和1(橙色)倾向于紧密聚类,表明这些类别相对难以区分。尽管如此,所提模型(图20(f))展现出比对比网络(图20(a)–(e))明显更清晰的聚类边界,后者的特征分布严重重叠。尽管各模型生成的样本相对于无增强基线(图20(a))均提供一定改善,但基于数字孪生的物理信息自编码器产生的合成数据实现了显著更丰富且更具可分性的表示。 图20 1:1比例尺下各种生成方法的T - SNE图类似地,图21可视化了分类器的输出层特征。在无增强情况下(图21(a)),大多数故障类型未能清晰界定,证实了严重不平衡导致诊断可分性较差。尽管模型2–5(图21(b)–(e))在一定程度上改善了聚类效果,但故障类型5(黄色)和4(紫色)仍难以区分,可能是由于生成的样本过于相似所致。相比之下,所提模型(图21(f))在所有故障类别上形成了分离良好、紧凑的聚类,表明基于数字孪生的物理信息自编码器不仅提升了诊断准确率,还通过提供高保真、高判别性的合成数据增强了特征提取质量。 图21 1:1比例尺下各种生成方法的T - SNE图5 结论本研究开发了一种基于数字孪生的物理信息自编码器,用于增强不平衡样本条件下的轴承故障诊断。通过将无量纲物理信息模块嵌入自编码器框架,该方法识别出具有明确物理意义的动力学模型参数,从而提升了可解释性。利用这些参数的概率分布映射,在数字孪生空间中生成多样且动力学一致的故障数据,并通过重构振动信号验证了增强样本的物理合理性。在公开数据集和私有数据集上的实验表明,所提方法在不平衡条件下分别达到了97.60%和99.86%的诊断准确率,优于现有增强方法,显示出提升轴承故障诊断可靠性的巨大潜力。在两个数据集上,所提方法均改善了诊断性能,在解决类别不平衡方面效果最为显著。增强信号与实测特征高度吻合,支持了该方法在不同条件下的可靠性和适用性。这些改进在少数类故障中尤为明显,表明物理引导的约束有助于保持关键动力学特征,并增强严重不平衡条件下分类器的鲁棒性。展望未来,轴承故障诊断有望朝着更先进的、物理引导的神经网络架构发展,将数据驱动方法的适应性与物理建模的可解释性相结合。随着数字孪生技术在工业监测中的日益普及,未来研究将把时间卷积网络、Transformer或其他高效特征提取器融入基于数字孪生的物理信息自编码器,并开发更精细的轴承动力学模型,以更好地捕捉复杂的运行行为并提升生成故障数据的准确性。当前网络结构虽然有效,但限制了更高保真度信号重构的能力,且其性能主要在故障特征清晰明确的条件下得到验证。在低保真度数字孪生或噪声更强的环境中,诊断性能可能会略有下降。基于先进架构与精细动力学模型融合的前景,该框架将得到改进,并可能具备应用于实时监测和零样本故障诊断的潜力,同时也有望部署于标注故障数据稀缺或不可用的环境中。通过进一步改进,该方法还可能具备在变化及前所未见的条件下进行测试的能力,以帮助确保鲁棒性并拓宽其在实际工业场景中的适用性。 编辑:赵栓栓校核:李正平、陈凯歌、曹希铭、赵学功、白亮、任超、海洋、陈宇航、Kira、Tina、王金、赵诚、肖鑫鑫、张优该文资料搜集自网络,仅用作学术分享,不做商业用途,若侵权,后台联系小编进行删除来源:故障诊断与python学习

未登录
还没有评论
课程
培训
服务
行家
VIP会员 学习计划 福利任务
下载APP
联系我们
帮助与反馈