大语言模型遇上知识图谱,工业故障诊断迎来新范式!这篇2026年新鲜出炉的文章,系统梳理了LLM+KG融合技术的最新进展,从理论框架到实践案例,揭秘如何让AI既"聪明"又"靠谱"。
本期推荐的这篇是特文特大学电气工程、数学与计算机科学学院万·巴尔马维·穆罕 默德·拉扎克的文章,本文系统综述了大语言模型(LLMs:Large Language Models)与知识图谱(KGs:Knowledge Graphs)融合技术在工业故障诊断中的应用,基于PRISMA框架分析了2017-2025年间37篇文献。研究识别出两种核心范式:LLMs增强KGs(自动化提取故障实体关系,解决传统知识抽取成本高、主观性强的问题)和KGs增强LLMs/图检索增强生成(GraphRAG:Graph Retrieval-Augmented Generation)(通过结构化因果路径抑制大语言模型幻觉,提升推理可解释性)。当前研究主要集中于旋转机械、钢铁制造和数控机床领域,微调的BERT模型在知识提取任务中可达98.76%的F1分数,GraphRAG系统在故障诊断生成任务中实现92.3%准确率和5.3%的低幻觉率。然而,领域覆盖单一、多语言支持不足(仅中英文)、缺乏可解释性可视化界面等问题仍显著存在。未来研究需向多模态数据融合、多语言扩展、智能体诊断及开源模型私有化部署方向演进,这对数字孪生场景中的实时知识推理、跨系统故障溯源及人机协同维护决策具有重要参考价值。
由于文章篇幅过长,小编将分两次为大家翻译介绍这篇论文,第一篇推文涵盖研究背景与方法论,系统阐述大语言模型与知识图谱融合的技术动因、PRISMA文献筛选流程及"设置-本体-抽取-检索-生成"五层分析框架,呈现2017-2025年技术演进脉络与37项实证研究的核心发现。具体包括:识别LLMs增强KGs与KGs增强LLMs/GraphRAG两大范式,揭示BERT模型在知识提取中达98.76% F1分数、GraphRAG系统实现92.3%准确率与5.3%低幻觉率的性能突破,为工业故障诊断的智能化转型奠定方法论基础。
论文题目: How can the integration of AI large language models and knowledge graph enhance fault diagnosis? A systematic literature review
论文期刊:Applied Soft Computing
Doi:https://doi.org/10.1016/j.asoc.2026.114908
a University of Twente, Faculty of Electrical Engineering, Mathematics, and Computer Science, AE Enschede, 7500, Netherlands
b University of Twente, Faculty of Behavioural, Management and Social Sciences, Department of High-Tech Business and Entrepreneurship, AE Enschede, 7500, Netherlands
c University of Münster, Chair of Information Systems & Supply Chain Management, Münster, Germany
1 引言
2 理论背景
3 研究方法
3.1 框架参考与检索策略
3.2 文献筛选流程
3.3 数据收集过程
3.4 数据综合
4 研究结果
4.1 现有故障诊断的挑战
4.2 KG-LLM融合概念框架
4.3 应用场景分析与数据集
4.4 本体论
4.5 知识提取
4.6 KG增强LLM(GraphRAG)流程:索引、检索与生成
4.7 评估与基准测试
5 实践启示
6 研究缺口分析
6.1 应用场景(工业机械背景)
6.2 数据集与语言
6.3 知识提取
6.4 评估方法
6.5 可解释性/可视化
6.6 未来研究方向
7 结论
在工业场景中,机械的维护与故障排查对于确保生产平稳可靠、同时使制造商能够高效满足客户需求至关重要。一方面,特定的预防性维护活动在全年例行开展;另一方面,预测性维护则在潜在故障发生前执行[1]。当错误或故障发生时,工程师与操作人员需对故障机械进行故障排查以恢复其功能。在某些行业中,数小时的停机时间或许尚可容忍;然而,在电力生产等关键行业中,即便数分钟的停机也可能导致企业蒙受数百万美元的损失[2]。因此,一套高效的维护与故障排查系统对于实现各行业最小化停机时间与运营连续性而言不可或缺。
故障诊断是指识别系统内部物理故障因子的过程,涵盖类型、位置、严重程度及发生时机等要素[3]。部分研究者亦将故障排查纳入故障诊断的范畴[4–7]。已识别的故障需依据设备制造商的规范方法或工程师针对同类问题的既往经验进行修复。其目标在于恢复设备的正常状态,使生产运营得以再度平稳进行。
故障诊断通常被划分为基于模型的方法、基于信号的方法以及基于知识的方法[8]。这些类别亦可依据其在执行故障诊断时所采用的信息来源加以区分。基于模型的方法将系统的数学或物理模型与其实际行为进行比对[8,9];当实际行为偏离预期时,即可识别故障。基于信号的故障诊断作为下一类别,更具数据驱动特性,采用历史数据(如传感器数据)[8–10];该技术运用信号处理以检测故障,或采用机器学习技术基于既往历史数据预测失效。基于知识的方法作为另一分类,利用专家知识并基于规则进行推理[8,10];该技术降低了对数据的需求以执行故障诊断,同时规避了前述技术所需复杂建模可能引发的误差。此外,借助规则与本体等结构化知识进行外推,还可识别新型故障[10]。
基于知识的故障诊断技术采用结构化知识表示对专家知识进行建模。知识图谱是组织故障信息的有效方式,因其能够表征故障症状、根本原因、失效模式及纠正措施之间以复杂方式关联的关系[11,12]。在工业场景中,此类知识可源自故障排查手册、专家经验、维护记录及其他非结构化数据源[5,13]。然而,获取并处理这些数据以构建知识图谱面临重大挑战。
从工业数据构建知识图谱面临诸多问题。尽管工业现场存在大量结构化与非结构化数据,制造商对这些数据的利用仍显不足。此外,制造设施呈现出促成其动态数据生成的特定特征;这意味着用于抽取知识图谱的模型必须具备处理动态数据的能力。最后,工业场景的多样性——如炼铁、能源生产及自动化制造——使得难以找到适用于所有这些应用的单一模型。目前,面向工业的大多数知识图谱均适配于针对其特定功能的专用模型,例如面向工业机械的故障诊断或面向高炉的自愈控制[14]。
大型语言模型的最新进展已展现出为知识图谱进行自动化知识抽取的潜力。海量非结构化工业数据——如技术手册与维护日志——可由LLMs处理;进而从中抽取相关实体与关系以填充知识图谱。LLMs能够利用其上下文理解与自然语言处理能力,提升知识图谱构建的准确性与效率,从而加速知识图谱构建过程并提高其精度。
大型语言模型在构建工业知识图谱方面虽具潜力,但仍面临诸多挑战。首先,在通用语料库上训练的LLMs可能难以理解行业特定术语,需在专门数据集上进行微调[15]。此外,确保抽取信息的正确性与可解释性仍是问题,因为LLMs可能引入错误或幻觉,从而损害故障诊断的可靠性[16]。最后,将LLM抽取的知识添加至结构化知识图谱需经过严格的验证步骤,以确保其与真实世界中设备的运行机理及工业过程的演进趋势保持一致。
本研究旨在评估大型语言模型与知识图谱的融合如何改进工业领域的故障诊断流程。指导本研究的研究问题如下:
主要研究问题:
大型语言模型与知识图谱的融合如何增强制造业中的故障诊断流程?
子研究问题:
1.现有故障诊断存在哪些挑战,以及如何缓解这些挑战?
2.如何利用LLMs与KGs有效整合并管理来自多样化数据源的故障诊断数据?
3.何种LLMs与KGs的模型及配置能够为故障诊断提供最准确且高效的结果?
大型语言模型与知识图谱的组合近来备受关注,源于这两项技术的互补特性。LLMs擅长自然语言理解与生成,而KGs提供结构化且显式的知识,可增强LLM的性能与可解释性[17]。尽管这两项技术的独特优势已得到充分确立,但其在工业故障诊断中的协同趋势日益显著。本综述围绕这一协同的两种范式展开[18]:第一种为LLM增强型知识图谱,旨在解决知识形式化的难题;第二种为KG增强型LLM,如GraphRAG,旨在解决LLM推理与因果追溯的基础问题——二者对故障诊断均至关重要。通过以这两种范式评估文献,本综述审视了近期将LLMs提供的自然语言灵活性与KGs的结构化表示相结合、面向工业故障诊断应用的架构。
研究人员采用LLM增强型知识图谱范式[18],以克服工业场景中人工知识图谱抽取的主观性与高成本问题。LLM的自然语言理解能力可自动化地从工业文本数据中抽取实体与关系,潜在降低传统基于知识的故障诊断中知识图谱抽取的人工需求[19]。另一方面,KG增强型LLM(特别是采用图检索增强生成或GraphRAG架构)被引入以抵消通用LLM固有的幻觉问题。这一架构方法将故障维护的结构化且可验证的领域知识融入推理过程。与标准RAG检索孤立文本片段作为上下文不同,GraphRAG遍历实体间的多跳链接,并支持检索知识的逻辑链式推理,从而产生更具连贯性且上下文丰富的响应[20]。这一架构对于分析因果链尤为有用——而因果链正是识别复杂机械故障的关键所在。类似地,图21可视化了分类器的输出层特征。在无增强情况下(图21(a)),大多数故障类型未能清晰界定,证实了严重不平衡导致诊断可分性较差。
3.1 框架参考与检索策略
本系统性文献综述遵循PRISMA 2020报告规范[21],以确保透明性与可重复性。选择PRISMA的理据在于其在研究人员中的广泛认可,作为开展系统性文献综述的工具。采用PRISMA的结构化方法与本研究的性质相契合——本研究涵盖制造、人工智能及语义学等多个跨学科领域。采用这一结构化方法可确保研究实施方式的透明性,从而提升其可重复性并最小化偏倚。
本研究选择 Scopus¹ 与 Web of Science² 作为系统性文献综述的数据库。选择这两个数据库的原因在于其广泛的科学文献库及其覆盖本研究所针对多学科领域研究的能力。对各数据库的检索日期为2025年11月22日。本研究界定了包含与大型语言模型、知识图谱及故障诊断相关关键词的检索词。为确保检索过程的全面性,本研究利用ChatGPT³作为头脑风暴辅助工具,以识别源自研究问题的核心关键词的同义词及等效含义。此外,本研究采用布尔逻辑运算符OR,并将其与AND及通配符("*")结合,以查找将LLM应用于故障诊断、将KG应用于故障诊断,或将LLM与KG同时应用于故障诊断的研究。检索词如下:
检索式包含"本体",因其为知识图谱提供模式或结构。故障诊断知识图谱依赖于精确定义的本体以表征实体间的关系;因此,理解基于本体的故障诊断对于开发有效的故障诊断知识图谱至关重要。
为了简化分析过程,应用了合格标准,包括纳入和排除标准,以确保只有与研究问题直接相关的记录被纳入研究。表1给出了合格标准。
表1 资格标准
关于纳入标准(见表1),本研究纳入会议论文,原因在于知识图谱和/或大型语言模型仍为相对新颖的技术;因此,纳入会议论文可增加捕获相关研究的可能性——即便其未以与期刊论文相同的方式接受同行评审。此外,对于期刊论文,本研究从2015年起始,以展示研究领域如何从使用"本体"演进至2019年"知识图谱"一词在故障诊断领域的首次出现。相较之下,本研究从2020年起开始检索会议论文,以识别尚未在同行评审期刊上发表的最新研究。
3.2 文献筛选流程
与纯粹数据驱动的生成模型相比——后者虽能丰富少数类样本,但往往缺乏物理在识别阶段,从两个数据库中删除了242条重复记录。本研究使用EndNote⁴作为自动化工具,基于标题、作者及DOI号检测重复数据。根据PRISMA规范,这些记录在筛选阶段被归类为报告,涵盖期刊论文、预印本、会议摘要、研究注册条目、学位论文、未发表手稿、政府报告及其他相关文献[21]。继而通过将报告与先前指定的合格性标准进行比对,继续筛选流程。
如表1所示的标准所示,我们开始排除基于原因1的报告,原因1包括2020年以前的会议程序和2015年以前的文章,结果删除了221篇报告。接下来,我们排除了基于原因2的报告,其中包括与工业机械或制造业无关的研究。为了确定相关性,我们在标题和摘要中搜索关键短语,如"生产","工厂","装配","设备","机械"和"制造"。该步骤导致510篇论文被排除。此外,我们根据原因3删除了12篇报告,因为这些报告不是用英文撰写的。 然后,我们排除了Reason 4下的报告,这是研究,虽然与更广泛的主题有关,但并不直接有助于回答我们的主要研究问题。这导致193篇报道被排除在外。在此之后,我们尝试检索涉及下载的报告。我们能够下载所有的报告,最终纳入与我们的系统文献综述相关的研究共37篇。
图1 PRISMA 2020流程图说明了研究选择的过程。该图详细介绍了从Scopus和Web of Science数据库中识别出1217条记录,去除242个重复,以及随后根据预定的资格标准筛选出975篇报告。由于缺乏工业机械背景等原因,排除了938篇报告,最终共有37篇研究被纳入最终的系统文献综述。*表明被人类和自动化工具排除的记录。
3.3 数据收集过程
在本小节中,本研究明确了在开展出版物全文阅读时专门关注的定性数据与文献计量数据;继而综合并分析这些数据,以回应所有子研究主题。数据及其定义详见表A.9(定性数据)与表A.10(文献计量数据)。定性数据的最后三项(索引构建、知识检索及知识生成)并非适用于所有研究。本研究专门针对采用GraphRAG的研究分析这三项技术——在此类研究中,知识图谱通过结构化并检索相关知识以支持推理与生成,从而增强大型语言模型[22]。
表A.9 从选定论文中提取的定性数据
3.4 数据综合
综上所述,基于概率动力学参数构建数据驱动的数字孪生空间,不仅保持了振动信号的物理真实性,还增强了多样性与泛化能力,为稳健的样本生成及下游模型训练奠定了基础。对于定性数据——特别是关于现有故障诊断方法的挑战方面——本研究采用Gioia方法[23],因其为定性研究提供了系统化且适应性的方法论路径,尤其适用于新概念与新理论从原始数据中涌现的归纳式定性研究。本研究采用包含三个阶段的归纳式编码方法。该流程始于数据收集与编码,终于数据结构化与可视化。数据收集与编码流程始于一阶编码(受访者中心术语),即从每项研究中提取关键陈述;继而采用二阶编码(研究者中心主题),将一阶术语组织为更宽泛的主题与概念;第三步为聚合维度(高层次主题),即将二阶主题聚类为更高层次的理论维度。
时间和期刊分布将基于来自 Scopus 和 Web of Science 的文献计量数据。我们使用条形图来描绘年度分布,并通过表格识别期刊和会议以及所发表论文的数量。接下来,对于主题分析,我们根据每篇文档中的重要词汇进行词频统计。
本系统性文献综述(SLR)将研究发现组织为两个主要部分:文献计量图景与基于GraphRAG的故障诊断技术的定性分析。文献计量数据的综合汇总——包括期刊与会议分布(表B.11)、时序发表趋势(图C.4)及关键词主题聚类(图D.5)——详见附录A,以提供关于研究领域演进的背景信息。以下各小节优先呈现定性发现:首先阐述当前文献中识别的挑战,继而展开知识图谱-大型语言模型集成诊断系统的概念框架。
图 C.4 所选文献的时间分布(2017-2025),按研究重点分类。
该图显示了技术从传统本体和知识图谱(KG:Knowledge Graph)框架向最近占主导地位的集成 LLM-KG(GraphRAG)解决方案的发展,后者涵盖了整个 2025 年的研究群体
图 D.5 所选研究中关键词频率的词云
综上所述,合成信号在保留关键故障相关特征的同时,提升了平滑性和一致性,展示了所提方法在生成用于下游任务的高保真度和可靠故障数据方面的能力。正如图2中的Gioia方法综合所揭示的那样,故障诊断方法在不同的范式中面临着重大的限制。基于模型和基于规则的故障诊断通常依赖于人为消耗,使得难以扩展[6,24]、不一致[25],并且在诊断不熟悉的故障时容易失败[26]。此外,这些范式在推理和推理方面也遇到挑战,例如需要手动规则构建[27]、处理机器内部的复杂组件[25]以及解决规则定义和不确定性[4]。此外,数据驱动的方法受到数据质量和数据复杂性问题的困扰,如碎片[28]、知识稀疏[26]和噪声污染[13],这影响了故障诊断的准确性。此外,对高质量故障数据的要求使得这些方法变得昂贵[29],大规模监控系统的异构性使数据集成复杂化[30]。
图2 使用Gioia方法进行现有故障诊断的挑战
大语言模型与知识图谱的融合构建了一种协同框架,其中一项技术的优势可直接弥补另一项技术的固有缺陷以及替代诊断范式的局限性。知识图谱虽具备高度准确性,但传统上因高昂的人工成本和专业化知识需求而难以扩展[19],存在语义不一致问题[31],且在处理有限数据时推理能力薄弱[19],致使其无法有效实现故障诊断。大语言模型凭借其自然语言处理能力,可自动从非结构化工业文本中提取实体与关系,显著降低知识图谱构建的成本与时间,从而缓解上述局限。另一方面,大语言模型常受"幻觉"现象[5]困扰,且其推理过程缺乏透明度[19],导致在工业应用中难以获得信任。知识图谱通过提供结构化、可验证的"单一事实来源",将大语言模型的推理锚定于可靠的因果路径,从而解决这些缺陷。这种相互增强机制使自然语言的灵活性得以与结构化数据的事实准确性相结合,为工程师提供了兼具可解释性且能够处理复杂大规模工业数据的故障诊断系统。
4.3 应用场景分析与数据集
4.4 本体论
本体对于故障诊断系统中的知识结构化至关重要,因其为知识抽取、表示与推理提供了模式框架。如表3所示,我们在入选研究中识别出两种应用于故障诊断的主要本体技术。
第一种为故障中心本体,其核心在于围绕故障及其关联实体组织知识,涵盖故障症状、成因、措施及位置等要素。例如,文献[45]将其本体划分为故障名称、症状、成因、措施及位置等类别,并建立"导致""被缓解于""隶属于"等关系。尽管部分此类本体涉及系统部件(如故障位置),但其主要目标在于捕获故障与其特征之间的关联关系。该本体适用于诊断系统无需系统级表示的场景。
设备/系统中心本体则提供更为系统化的系统分解,从子系统、部件到单个零件等多个层级进行归类,并明确其与故障的关联关系。文献[4]提出了一种面向数控系统故障诊断的本体,将知识从系统层级(如西门子808D)至特定子系统、部件及零件进行层次化组织,并将该系统本体与故障描述、根本原因、可观测症状及推荐解决方案相联结。该本体最适用于复杂系统,在此类系统中单个部件故障可能影响其他子系统,因而需要层次化的系统表示以实现高效的故障追踪。
4.5 知识提取
如表4所示,基于大语言模型的方法利用预训练大语言模型从非结构化文本语料库中抽取实体。文献[45]使用ChatGPT进行命名实体识别(NER:Named Entity Recognition)、关系抽取(RE:Relation Extraction)及因果关系抽取(CRE:Causal Relation Extraction),选取三个代表性数据样本供ChatGPT执行上下文学习,并构建故障诊断领域中的适当实体与关系。文献[29]提出了一种层次化BERT模型,包含向量编码层、基于二分类层的实体识别层以及基于神经网络的关系分类层。为保障知识图谱构建的一致性,文献[41]采用基于BERT的联合模型实现实体与关系的同步抽取。最后,文献[26]提出了ROMGCJE模型(ROMGCJE:Relation-Oriented Model for Joint Extraction of Entities and Relations,面向关系的实体与关系联合抽取模型),该模型运用BERT与深度学习方法同时抽取实体与关系。通过该方法,实体及其上下文关系得以以维持知识图谱开发所需结构依赖性的方式进行表示。
深度学习方法采用多种神经网络架构以提升实体与关系抽取性能。文献[25]使用BiLSTM-CRF模型(BiLSTM-CRF:Bidirectional Long Short-Term Memory-Conditional Random Field,双向长短期记忆-条件随机场)识别实体边界,并采用TransE(TransE:Translating Embeddings for Modeling Multi-relational Data,用于多关系数据建模的翻译嵌入)进行实体对齐,以避免知识图谱中实体间的歧义。文献[28]运用卷积循环神经网络(CRNN:Convolutional Recurrent Neural Network)与联结主义时序分类(CTC:Connectionist Temporal Classification)算法进行知识构建。这些方法使得从大规模多样化数据集中以更为可靠且可扩展的方式抽取知识成为可能。
基于规则的方法运用组织化且逻辑化的规则进行知识抽取。文献[31]采用主谓宾(SVO:Subject-Verb-Object)框架下的谓词逻辑分析识别故障要素。文献[52]运用基于Prolog的规则推理抽取故障成因,并采用模糊逻辑推理处理故障诊断中的不确定性。另一方面,基于语义与本体的抽取方法(如文献[46])利用预定义分类体系进行语义标注,将非结构化数据转换为适用于知识图谱的格式。最后,文献[27]提出了语义映射策略,该技术将缺陷识别信号(如滚动轴承的CGHMM)与基于本体论的知识库联系起来。
混合方法通过将本体与大语言模型相结合以改进实体与关系抽取。文献[14]将命名实体识别与本体相结合以抽取领域特定的故障数据。Chen与Wang[36]提出了一种融合BERT、ChatGPT及ECE-Net的多模态方法,用于实体抽取、关系识别及故障模式识别。最后,文献[6]采用带指针标注的BERT-WWM模型实现知识融合自动化,将抽取内容整合为结构化知识图谱。大语言模型与本体的结合提升了知识抽取效果,原因在于大语言模型能够处理非结构化数据,而结构化的本体框架则提供一致性、可解释性及领域特定准确性。
4.6 KG增强LLM(GraphRAG)流程:索引、检索与生成
入选研究中的11篇文献展示了知识图谱如何通过提供结构化领域知识以提升大语言模型性能。该融合通过知识图谱中相互关联的实体最小化幻觉现象并增强推理能力,从而改进大语言模型在故障诊断中的表现。本小节考察这些文献如何运用索引、知识检索与知识生成技术,重点阐述知识图谱对大语言模型能力的增强作用。
表5展示了入选研究采用的不同索引技术。故障诊断索引领域的一个趋势是采用混合模型,融合图数据库与向量存储。在该架构中,基于图的索引聚焦于关系三元组(节点与边)以实现多跳因果追踪,而向量索引则聚焦于语义相似性以处理自然语言查询。多数文献采用图数据库技术(如Neo4j图数据库)存储三元组的语义网络。除图数据库外,诸多先进系统还利用额外的索引方法,包括用于管理文本与多模态数据的向量存储。该索引技术实现了超越精确关键词匹配的语义匹配[43]。FAISS等库用于存储BGE-M3等模型的向量嵌入。文献[40]提出了一种扩展方案,包含多模态数据的索引,其通过低秩多模态策略等融合策略整合文本、视觉与数值数据的超节点融合,随后采用BGE-M3、ViT及BERT进行编码,展示了一种将各类工业数据直接纳入索引的技术。
上述各类索引策略均存在不同权衡。基于图的索引因其可解释性及执行多跳因果追踪的能力而备受青睐,该特性在运用所定义本体进行故障诊断时具有高度相关性。然而,该方法产生刚性且缺乏语义灵活性,使得处理自然语言或未与图中 特定结构化实体关联的非结构化查询时索引面临挑战。另一方面,融合基于图的索引与向量索引的混合索引通过提供用于逻辑推理的图索引与用于语义检索的向量数据库,解决了上述问题。Neo4j等现代图数据库已提供原生向量索引,将向量存储为节点属性,简化了实现复杂度,无需采用独立的数据库技术存储向量[53]。
依据检索流程的复杂程度,研究中所识别的知识检索技术可分为三种不同方法:单轮检索(Single-Round Retrieval)、混合单遍检索(Hybrid-Single-Pass Retrieval)与多阶段/迭代检索(Multi-Stage/Iterative Retrieval),如表6所示。
单轮检索是最直接的方法,系统基于用户查询直接检索相关三元组或子图,并立即将检索所得节点传递至大语言模型进行答案生成。文献[6,7]提供了示例,其中从查询中提取的实体直接用于单步检索相关节点。
混合单遍检索是一种略为复杂的方法,系统在单轮检索阶段依次执行基于向量与基于图的语义搜索以检索节点。在文献[34]中,系统计算查询与目标节点间的余弦相似度,随后使用Cypher(Cypher:Neo4j图数据库查询语言)从Neo4j数据库查询周围因果链路(故障成因)。
最后,多阶段/迭代检索是一个动态过程,系统依据诊断需求执行顺序检索操作。该技术的示例包括文献[33]所采用的方法,其通过动态优化知识图谱内部路径的遍历方向以促进多轮交互,或将复杂查询分解为较小子问题以实现更精确检索的方法[5]。
比较这三种策略时,在运行效率与语义深度之间存在权衡。多阶段/迭代检索通过多步知识获取提升检索精度与深度,但以增加延迟及多次交互与决策带来的向量嵌入成本为代价。类似地,混合单遍检索因其多样化的上下文获取来源而提供更精确且相关的检索,但同样具有较高的延迟与嵌入成本。相反,单轮检索虽提供更快的响应时间,但当查询以不同语言表达同一实体时面临检索精度挑战。
知识生成依据大语言模型在处理检索信息与结构化最终输出中的角色进行分类,如表7所示。
第一类为完整答案生成,大语言模型主要负责将所有检索信息(包括实时数据与结构化知识图谱路径)整合为增强上下文[43],随后运用提示工程为用户提供自然语言响应。部分研究对大语言模型进行微调或前缀调优以改进上下文回答[5,7]。
第二类为智能体生成,大语言模型的角色从单纯的叙述者转变为积极决策的智能体。该技术不仅生成文本,还生成可执行的诊断动作(如"检查传感器X"),通常需要人在回路交互[50]。
最后一类为部分/结构化转换,为大语言模型提供最为有限的角色,主要作为标准化工具。其核心功能在于将原始非结构化输入文本(如故障症状)转换为标准化输出(如"故障模式"与"故障位置")[45]。输出为结构化数据,而非完整的自然语言叙述性答案。
三种方法之间的根本权衡在于决定优先保障输出完整性还是速度或大语言模型角色的实用性。完整答案生成通过向用户提供详细且叙述性的解释确保最高程度的完整性。然而,该方法通常较慢,因整合复杂输入并生成详细文本需要更多计算资源。另一方面,部分/结构化转换通过将大语言模型的任务限制为基本数据转换(例如从故障症状到故障模式)以最大化速度,使过程更快且更可预测,但以牺牲更广泛的解释为代价。最后,智能体生成包含有助于管理诊断过程的中间活动,但并不立即产生全面且明确的诊断。
4.7 评估与基准测试
表8总结了入选文献所采用的多种评估方法,用以评价故障诊断方法中各类技术的有效性。知识抽取的大多数技术采用标准的基于机器学习的分类任务指标进行评估,如准确率、精确率、召回率及F1分数。这些指标常用于评估从文本语料库中进行实体与关系抽取的效果,以及基于图嵌入技术的有效性。例如,文献[5]采用精确率、召回率及F1分数评估其所采用的命名实体识别(NER:Named Entity Recognition)技术。其他研究如文献[45],通过损失与准确率将所提出的嵌入模型与其他基线嵌入模型进行对比,以验证其诊断准确率的提升。
表8 选文评价方法
在采用知识图谱与本体的部分故障诊断应用中,评估通常包含定性与定量相结合的评价。为确认所提出模型的适用性,常采用案例研究与实际应用演示等定性技术。文献[30]等研究采用专家验证及本体验证工具OOOPS!,从结构、功能及可用性分析三个维度进行评估。此外,基于相似度的方法如SimRank算法(文献[4])被用于量化故障成因与现象之间的关联。
基于大语言模型及混合模型采用多种评估方法以提供全面评价。文献[5]结合人工定性评估(多名评估者评分并取平均响应)与基于大语言模型生成评分的自动化定量评估,从准确率、信息量、流畅度及逻辑性四个维度进行评价。文献[7]采用定性评估,将所提出模型(联合知识增强模型)与未调整的ChatGLM-6B及Ernie进行对比。部分混合方法如文献[45],将嵌入模型评估与所提出故障排查方法同CausalKG-ALBERT(同一研究者的早期研究)的知识推荐方法准确率对比相结合。通过定性与定量方法的融合,这些研究确保了对所提出故障诊断技术的完整评估。
4.7.1. 知识提取准确性和效率
提取精度被认为是最高的,RoBERTa-wwm-bilstm-mha-crf[38]为98.76%F1,CFRTE模型[29]为98.00%F1,这是由于在特定领域的语料库上微调变压器模型。然而,这需要对计算资源进行大量投入以完成微调,并需妥善整理标注训练数据。在此情况下,实现如此高的准确率需要对数据标注及技术复杂性进行重大投入。另一方面,对于更难处理的特定数据类型,模型复杂性与性能之间存在权衡。以文献[39]为例,由于工业文本中复杂且重叠的嵌套实体抽取挑战,其在嵌套命名实体识别(NER:Named Entity Recognition)任务中获得的F1分数略低,为81.11%。该任务本质上比扁平NER更具挑战性,尤其在处理稀缺的工业数据时。
Huang与Song[32]所采用的方法在资源效率和提取精度之间进行了权衡,但得出了另一个相反的发现。尽管他们的模糊F1相对较低,为49.8%,但他们能够消除注释和微调的非常昂贵和人力劳动,这使他们获得了优越的部署成本综合分数(0.5482)。他们的方法更强调通过快速工程进行快速和经济的部署,而不是在知识提取基准上实现最佳结果。关于提取和管理的另一个观点是定性评估,由[34]执行,他们对提取的知识三元组实现了95.73%的高语义准确率。然而,这一高分是在与故障维护专家进行统计比较后获得的,这表明人类领域经验对于知识提取的可靠性是必要的。附录表F.14中提供了这些提取方法及其各自指标的全面概述。
表F.14 知识提取和知识生成方法及其报告指标的比较
首先为在实现知识生成高准确率的同时降低幻觉现象,架构设计有时必须复杂化,并需权衡准确率与效率之间的关系。文献[43]采用多阶段检索增强生成(RAG:Retrieval-Augmented Generation)架构,在知识生成中取得优异指标(准确率92.3%,幻觉率5.3%),其原因在于融合了向量检索与图检索,并结合结构化知识图谱因果路径与实时数据。为了展示他们的技术,KG因果路径提供了一个结构化的推理路径,例如“故障→症状→原因→维护”,该路径以从矢量数据库中检索到的数据和实时数据为基础。由此,该架构防止大语言模型在信息缺失时尝试猜测解决方案。该阶段的计算效率通过高吞吐量策略实现,如vLLM框架与量化技术。从其工作可见,该架构在吞吐量方面具有效率;采用vLLM框架与量化使系统处理查询的速度较标准配置提升3.2倍。
另一项值得提及的高准确率知识生成技术来自文献[33]。其采用高度特定且复杂的编码器,即CRCGAT编码器中取得优异性能。该技术成功识别长因果链,产生良好的知识生成指标(故障诊断准确率87%,F1分数80%)。然而,该架构的复杂性导致高资源开销的权衡,因所提出的编码器模型需要更长的训练时间(每轮次7.6秒)及峰值GPU显存使用(11.2 GB),显著高于采用简单图注意力模型作为基线的情况。文献[7]亦展示了知识准确性的高分,其生成答案的准 确率达98.5%,该结果通过真实工业场景测试获得。然而,其未详细阐述答案正确性的测量方法,使得该技术如何产生如此高准确率尚待进一步论证。这些生成模型的技术配置与报告效率分数详见附录表F.14。
编辑:赵栓栓
校核:李正平、陈凯歌、曹希铭、赵学功、白亮、任超、海洋、陈宇航、Kira、Tina、王金、赵诚、肖鑫鑫、张优
该文资料搜集自网络,仅用作学术分享,不做商业用途,若侵权,后台联系小编进行删除
来源:故障诊断与python学习