大语言模型遇上知识图谱,工业故障诊断迎来新范式!这篇2026年新鲜出炉的文章,系统梳理了LLM+KG融合技术的最新进展,从理论框架到实践案例,揭秘如何让AI既"聪明"又"靠谱"。
本期推荐的这篇是特文特大学电气工程、数学与计算机科学学院万·巴尔马维·穆罕 默德·拉扎克的文章,本文系统综述了大语言模型(LLMs:Large Language Models)与知识图谱(KGs:Knowledge Graphs)融合技术在工业故障诊断中的应用,基于PRISMA框架分析了2017-2025年间37篇文献。研究识别出两种核心范式:LLMs增强KGs(自动化提取故障实体关系,解决传统知识抽取成本高、主观性强的问题)和KGs增强LLMs/图检索增强生成(GraphRAG:Graph Retrieval-Augmented Generation)(通过结构化因果路径抑制大语言模型幻觉,提升推理可解释性)。当前研究主要集中于旋转机械、钢铁制造和数控机床领域,微调的BERT模型在知识提取任务中可达98.76%的F1分数,GraphRAG系统在故障诊断生成任务中实现92.3%准确率和5.3%的低幻觉率。然而,领域覆盖单一、多语言支持不足(仅中英文)、缺乏可解释性可视化界面等问题仍显著存在。未来研究需向多模态数据融合、多语言扩展、智能体诊断及开源模型私有化部署方向演进,这对数字孪生场景中的实时知识推理、跨系统故障溯源及人机协同维护决策具有重要参考价值。
由于文章篇幅过长,小编将分两次为大家翻译介绍这篇论文,第一篇推文涵盖研究背景与方法论,系统阐述大语言模型与知识图谱融合的技术动因、PRIS MA文献筛选流程及"设置-本体-抽取-检索-生成"五层分析框架,呈现2017-2025年技术演进脉络与37项实证研究的核心发现。具体包括:识别LLMs增强KGs与KGs增强LLMs/GraphRAG两大范式,揭示BERT模型在知识提取中达98.76% F1分数、GraphRAG系统实现92.3%准确率与5.3%低幻觉率的性能突破,为工业故障诊断的智能化转型奠定方法论基础。
本篇推文聚焦讨论与结论,深入剖析领域覆盖单一(过度集中于旋转机械与钢铁制造)、多语种支持不足(仅中英文,缺乏荷兰语等小语种方案)、可解释性缺失(无交互式推理可视化)等关键研究缺口,并前瞻性地提出五项未来方向:跨设备主知识图谱架构、多语言嵌入模型本地化、智能体增强人机闭环验证、开源模型私有化部署保障数据主 权,以及多模态数据融合(振动图谱等)。这些方向为数字孪生场景下的实时故障镜像与跨物理-信息空间因果追溯提供方法论启示,推动诊断系统从"事后响应"向"预测性知识工程"跃迁。
文章质量很高。本文配套思维导图&论文精华速览,已同步至小红书:(ID:故障诊断与python学习),需要的小伙伴可以自取💡~
论文链接:通过点击最左下角的阅读原文进行在线阅读及下载。
论文题目: How can the integration of AI large language models and knowledge graph enhance fault diagnosis? A systematic literature review
论文期刊:Applied Soft Computing
Doi:https://doi.org/10.1016/j.asoc.2026.114908
a University of Twente, Faculty of Electrical Engineering, Mathematics, and Computer Science, AE Enschede, 7500, Netherlands
b University of Twente, Faculty of Behavioural, Management and Social Sciences, Department of High-Tech Business and Entrepreneurship, AE Enschede, 7500, Netherlands
c University of Münster, Chair of Information Systems & Supply Chain Management, Münster, Germany
1 引言
2 理论背景
3 研究方法
3.1 框架参考与检索策略
3.2 文献筛选流程
3.3 数据收集过程
3.4 数据综合
4 研究结果
4.1 现有故障诊断的挑战
4.2 KG-LLM融合概念框架
4.3 应用场景分析与数据集
4.4 本体论
4.5 知识提取
4.6 KG增强LLM(GraphRAG)流程:索引、检索与生成
4.7 评估与基准测试
5 实践启示
6 研究缺口分析
6.1 应用场景(工业机械背景)
6.2 数据集与语言
6.3 知识提取
6.4 评估方法
6.5 可解释性/可视化
6.6 未来研究方向
7 结论
大语言模型与知识图谱融合框架在2025年的实际应用为工业维护带来了巨大效益。以桥式起重机作业为例,此类系统实现了"人机协同故障排查",当操作人员报告"异常噪声"时,系统引导其完成多个检查阶段,直至定位内部转子的特定错位故障[34]。在数控机床维护[7]中,该系统使操作人员能够通过交互式对话解决复杂电气故障,如IPM模块故障。在此场景下,系统将大模型的推理锚定于子图划分的知识库,提供高准确率诊断路径,其性能可超越具有两年经验的人类工程师。此外,在工业机器人[39]领域,大语言模型助力识别"嵌套实体",如机械臂中 特定重叠部件,使维护管理人员能够安排高度细粒度的维修,即便缺乏标注训练数据。这些示例展示了系统如何有效吸收并复用资深员工的专业隐性知识,使初级工程师能够执行专家级诊断,同时降低昂贵的生产停机风险。
本系统综述识别出大语言模型与知识图谱融合应用于工业故障诊断领域的若干研究空白。这些局限性凸显了当前系统在以下关键方面的不足:行业特定应用有限、多语言灵活性不足、知识抽取技术、评估方法及可解释性。弥补这些空白对于推进基于GraphRAG的故障诊断发展、确保其在多样化制造环境中的适用性,以及提升其准确率与可解释性至关重要。
6.1 应用场景(工业机械背景)
多数入选的知识图谱-大语言模型故障诊断研究集中于钢铁制造、数控设备及旋转机械(表2)。近年来,特别是截至2025年,部分文献已涵盖盾构机与工业机器人等细分行业。然而,尚无研究涉及更为专业化的行业,如陶瓷或金刚石加工,这些行业具有独特的故障模式与制造工艺。因此,未来研究应考虑构建专门针对这些探索不足领域的GraphRAG框架。该框架应融合领域特定知识图谱与大语言模型,以改进对专业化机械故障的推理,从而在陶瓷与金刚石加工中实现准确且具备上下文感知能力的故障排查。
此外,该领域的大多数研究仅孤立地分析单一机型。然而,在实际生产环境中,单个工厂通常在同一车间(有时甚至跨多个地点)运行多台设备。这需要一种单一策略,能够在无需独立GraphRAG(GraphRAG:Graph Retrieval-Augmented Generation,图检索增强生成)系统的前提下处理广泛的设备类型。一种潜在的解决方案是构建一个"主"知识图谱,为每台设备包含不同的子图(或子本体)。该方法在封装所有知识于单一图谱的同时,保持每台设备独特属性的清晰性,从而便于在工业配置变更时添加或移除设备。
6.2 数据集与语言
多数入选研究使用英文与中文数据集(表E.13),对非英文或多语言场景(如荷兰语)的研究甚少。因此,一个有趣的研究方向是将现有GraphRAG流程扩展至多语言或荷兰语特定嵌入(例如文献[55]的mBERT、文献[56]的XLM-R或文献[57]的gpt2s mall-dutch-embeddings)。亦可考虑自动翻译阶段,如将荷兰语日志转换为英文——若该语言更适用于当前知识抽取方法。此过程可使用DeepL或Google Translate等工具实现。然而,此类翻译需谨慎处理领域特定术语,以确保知识图谱中语义的正确性。
单语言与多语言方法之间的抉择取决于用户的特定运营与语言需求。尽管尚无文献明确讨论该决策过程,但以用户为中心的系统设计研究(如文献[58])表明,系统所采用语言的选择取决于终端用户的偏好及运营语境。若用户与专家以荷兰语交流且希望生成荷兰语回答,则多语言或基于荷兰语的流程可最小化数据损失。反之,若英语适用于内部运营,则将所有日志翻译为英语可能简化后续阶段(如实体抽取或检索)。无论何种情况,基于真实荷兰语故障诊断数据开发多语言模型可能带来更高的检索准确率与上下文相关性。这些语言决策最终由制造现场的首选运营模式(荷兰语 vs. 英语)及可靠的跨语言自然语言处理资源的可用性所决定。
6.3 知识提取
多数综述文献采用基于大语言模型或微调大语言模型的方法进行实体与关系抽取,通常针对英文或中文数据集优化。将这些方法直接应用于荷兰语文本,尤其是包含特殊工业术语的维护日志,可能需要额外适配。一种方法是在抽取前将非英文日志翻译为英文。另一种方案是采用荷兰语或多语言大语言模型嵌入,该方法在保留关键语言细微差别的同时消除潜在翻译问题。在标注领域示例上训练的微调荷兰语模型,对于抽取维护日志中的细微词汇可能尤为有益。
无论采用何种方法,工业机械的领域特定性——尤其是陶瓷或金刚石加工等细分领域的领域特定性——凸显了定制本体与人工标注在构建坚实知识库中的重要性。无论通过单语言还是双语框架,保持术语一致性对于避免最终知识图谱中的歧义及确保与实际维护问题的恰当对齐至关重要。
6.4 评估方法
尽管入选研究已涵盖多数评估技术,但额外评估技术如文献[59]的精确匹配(EM:Exact Match)、文献[60]的BERTScore及文献[61]的GPT-4平均排序可提供更深层次的洞察。EM计算与真实值完全匹配的预测比例,对于评估故障诊断中的结构化输出具有重要价值。BERTScore评估生成文本与参考文本之间的语义相似度,可用于评估大语言模型生成的故障解释。GPT-4平均排序将模型回复与人类评分排序进行比较,为评估故障诊断解释的连贯性与可靠性提供了一种方法。
在采用多语言大语言模型构建GraphRAG的场景下,研究人员尚未探究多语言情境的评估流程。文献[62]开发的某些评估方法值得深入研究。该框架包含一种名为跨语言自动评估的方法,用于检验多语言大语言模型。该方法利用名为Hercule的跨语言评估大语言模型,通过将多语言回复与现成可用的英文参考答案进行对比来评分。其采用一组新的多语言人工标注指令测试集,无需每种目标语言单独准备参考答案,即可实现完整的基准测试及与人类判断的对齐。
6.5 可解释性/可视化
入选文献均未涉及可解释性/可解释性问题。此外,多数系统缺乏推理链的交互式可视化界面,而该界面对于非专业用户理解答案背后的推理至关重要,在高风险场景中尤为重要。未来研究可能开发一种方法,通过使大语言模型自动以人类可读的说明引用检索所得子图或路径,从而弥合故障诊断中的解释鸿沟。这将使工程师与操作人员更好地理解故障诊断背后的推理。此外,采用基于图的故障传播路径等可视化方法可提升可解释性,并促进工业场景中更广泛的人机协作。这可能包括将生成的文本依据与小型子图截图相结合,使工程师能够快速理解推理流程。
此外,标准可解释人工智能(XAI:Explainable AI)方法如LIME与SHAP在此情境下亦值得探索。若干研究将LIME/SHAP的核心思想适配或扩展至图神经网络(GNN:Graph Neural Network)或基于图的任务,如文献[63]的GNNExplainer与文献[64]的GraphLIME。探索这些技术在GraphRAG应用中的价值具有重要意义。
6.6 未来研究方向
未来研究方向应转向基于智能体的抽取与推理。这涉及开发包含人类参与的自主循环,其中基于大语言模型的智能体不仅执行实体抽取或答案生成,而且由人类担任抽取与生成输出的验证者,以持续改进输出质量。此外,工业界对数据隐私与安全存在迫切需求,这要求从专有闭源模型向微调开源大语言模型过渡。这一转变确保敏感的维护日志与专有的机器规格参数留存于工厂防火墙之内,同时保持通用模型的高推理性能。
另一关键前沿在于跨模态数据与全生命周期知识管理的融合。未来框架应同时摄取实时传感器流、技术图纸及高频振动图谱,以提供超越纯文本的上下文感知抽取[33,65]。这推动了从孤立故障诊断向整体生命周期管理的重大转变,其中故障数据被反馈至"知识驱动工程设计"流程,以塑造下一代工业设备的创制。
本系统综述聚焦于大语言模型与知识图谱融合以提升工业场景故障诊断潜力的研究。通过分析37篇文献,包括2025年发表的11篇重要峰值论文,本研究揭示了大语言模型与知识图谱融合用于故障诊断已从边缘实验概念发展为显著研究趋势。尽管当前研究在知识抽取、检索与推理方面取得进展,但重大空白仍未填补。现有研究主要集中于特定行业,如钢铁制造与数控设备,而对陶瓷或金刚石加工等其他高价值行业关注甚微。此外,多语言故障诊断,尤其是非英文及中文语言场景,尚处于探索不足状态,限制了现有方法在多样化工业环境中的适用性。
方法论层面,知识抽取策略显著依赖微调大语言模型进行实体与关系抽取,但将这些模型适配至领域特定语言仍存在挑战。类似地,评估方法主要依赖准确率、精确率、召回率及F1分数,但仍有空间引入更先进的评估技术,如精确匹配(EM:Exact Match)、BERTScore及跨语言大语言模型评估,以提供对模型性能与可解释性的更深层次洞察。此外,可解释性仍是重大难题,因多数系统未提供故障诊断的人类可读解释,致使工程师与操作人员难以接纳系统逻辑。
回答研究问题
另一项值得提及的高准确率知识生成技术来自文献[33]。其采用高度特定且复杂的编码器,即CRCGAT编码器中取得优异性能。该技术成功识别长因果链,产生良好的知识生成指标(故障诊断准确率87%,F1分数80%)。然而,该架构的复杂性导致高资源开销的权衡,因所提出的编码器模型需要更长的训练时间(每轮次7.6秒)及峰值GPU显存使用(11.2 GB),显著高于采用简单图注意力模型作为基线的情况。文献[7]亦展示了知识准确性的高分,其生成答案的 准确率达98.5%,该结果通过真实工业场景测试获得。然而,其未详细阐述答案正确性的测量方法,使得该技术如何产生如此高准确率尚待进一步论证。这些生成模型的技术配置与报告效率分数详见附录表F.14。
子研究问题1(挑战与缓解措施):
从综述文献来看,不同故障诊断方法面临不同挑战。基于模型与基于规则的故障诊断依赖人类经验,导致其难以扩展、有时不可靠且无法有效诊断未知缺陷。此外,其在推理与推断方面面临障碍,包括人工构建、复杂机器部件及规则定义不确定性。另一方面,数据驱动技术在数据质量与复杂性方面存在挑战,包括碎片化、知识稀疏性及噪声污染,这些因素可能影响故障诊断准确率。获取高质量故障数据成本高昂,且大规模监控系统难以集成。
采用知识图谱与本体的故障诊断需要人工知识抽取,存在语义不一致问题,且在知识有限情况下推理能力不足,阻碍其正确诊断故障的能力。然而,基于大语言模型的故障诊断存在幻觉与可解释性等局限,使其在工业应用中面临挑战。融合知识图谱与大语言模型可通过提供结构化实体以减少大语言模型的幻觉现象,并利用自然语言处理能力辅助准确抽取知识,从而弥合上述差距。
子研究问题2(异构数据源融合):
研究结果表明,研究人员采用多种流程以融合用于故障诊断的异构数据(例如维护日志、网络爬取数据及手册)。大语言模型可将非结构化文本(手册、日志)转换为实体-关系对,而知识图谱存储这些新抽取的知识。因此,维护良好的知识图谱成为"单一事实来源",使用户能够利用大语言模型就故障症状、设备类型及推荐措施等进行推理与交互。
子研究问题3(技术的准确性与效率):
知识抽取的准确性与效率:
综述表明,微调BERT系列模型取得最优抽取性能,最高指标达RoBERTa-wwm-bilstm-mha-crf [38]的F1分数98.76%及CFRTE模型[29]的F1分数98%。尽管这些基于Transformer的模型可准确抽取故障实体,其准确率高度依赖微调所需的领域特定标注数据集的大量成本,这在资源效率方面形成权衡。相反,提示工程作为一种替代方案,以更具资源效率的方式出现。虽然其产生的模糊F1分数较低,但可显著降低人工成本与数据标注成本[32]。
知识生成的准确性与效率:通过融合大语言模型与知识图谱进行故障诊断,知识生成的准确率显著提升,其通过结构化知识图谱为大语言模型推理提供锚定以缓解幻觉现象。文献[43]报告了92.3%的生成准确率与5.3%的低幻觉率,该结果通过融合多阶段检索与结构化推理路径实现。另一高性能架构来自文献[33],其包含真实世界测试场景,报告准确率达98.5%,并采用高度特定的CRCGAT编码器进行根本原因分析,取得87%的诊断得分。这些发现表明,通过知识图谱提供"单一事实来源"可防止大语言模型在信息缺失时猜测解决方案。然而,如此高的生成准确率需在资源效率方面进行权衡,如CRCGAT架构所示,其需要更长的训练时间(每轮次7.6秒)及大量GPU显存使用(11.2 GB)。这些因素可能对资源受限的真实工业场景部署构成挑战。
附录A.收集过程中的数据及其定义
表A.9 从选定论文中提取的定性数据
附录B.期刊和会议分发
表B.11总结了入选研究中期刊与会议论文的分布情况。统计数据显示期刊论文略多于会议论文(19篇 vs. 18篇),表明尽管面向故障诊断的GraphRAG仍是相对新兴的研究主题,但其正日益发展为高影响力、经同行评审的期刊文献。此外,入选研究涵盖广泛的学科领域,包括工程学、机器人学、信息技术、控制系统、信号处理、自动化及工业信息学。这一广泛分布意味着GraphRAG在众多工业与技术领域具有实用价值,并非仅为人工智能或信息技术相关概念。来自多元背景的研究人员参与其中,彰显了该领域强劲的跨学科协作态势。
此外,若干研究发表于知名IEEE Transactions期刊,包括《IEEE仪器与测量汇刊》[26]、《IEEE工业信息学汇刊》[7]及《IEEE可靠性汇刊》[19]。值得注意的是,近期2025年的新增文献凸显了《先进工程信息学》作为该研究的关键期刊,为最终入选增添数篇重要论文。这强化了这些出版物在面向故障诊断的GraphRAG研究中的地位,使其成为该领域学者的重要资源。此外,若干研究在具有行业聚焦的会议上发表,如全球可靠性与故障预测与健康管理(PHM:Prognostics and Health Management)会议、IEEE自动化科学与工程国际会议(CASE:IEEE International Conference on Automation Science and Engineering)、IEEE新兴技术与工厂自动化国际会议(ETFA:IEEE International Conference on Emerging Technologies and Factory Automation),以及近期2025年的ICBASE和ICETIS等会议。这表明GraphRAG对于制造与工程领域真实故障诊断具有重要意义,因这些会议凸显了工业应用价值。
附录C.所选研究的时间分布
图C.4展示了37篇入选研究的时间分布及主题类别,凸显了研究主题随时间的演进。早期研究(2017-2019年)主要聚焦于基于本体的故障诊断,其利用结构化知识表示与基于规则的推理辅助故障诊断。向基于知识图谱技术的过渡始于2020年前后,反映了利用图结构更动态地描述故障的研究兴趣日益增长。图数据库技术(如Neo4j)的进步以及工业图结构数据可获取性的提升可能是这一转变的主要驱动力。尽管本体为知识图谱中的数据提供模式,知识图谱却使得领域特定信息的编码与检索能够以更具适应性和可扩展性的方式实现。
图 C.4 所选文献的时间分布(2017-2025),按研究重点分类。
大语言模型在故障诊断中的融合出现于2021年之后,研究自2023年起显著增长。其原因在于大语言模型能力的近期进展,包括BERT[66]及OpenAI的GPT模型,这些模型在知识抽取与自然语言理解方面展现出优异性能。尤为值得注意的是,面向工业故障诊断的融合知识图谱与大语言模型解决方案(GraphRAG:Graph Retrieval-Augmented Generation)研究于2024年快速增长,并于2025年达到峰值(11篇论文),构成本综述中单一年份最大规模的论文群。这一趋势表明知识图谱与大语言模型在故障诊断领域的强劲融合。多数出版物集中于2023年与2025年发表的事实表明,基于GraphRAG的故障诊断是一个新兴但快速增长的研究领域,使其成为学术界与工业界共同关注的重要方向。
附录D.关键词分布
图D.5词云中的关键词分布识别了基于GraphRAG的故障诊断研究中的主要主题。"知识图谱"与"故障诊断"作为最常用的术语,表明该主题主要聚焦于结构化知识表示与诊断推理。此外,"设备"、"压缩机"及"机床"等指代工业机械的词汇暗示了其在制造业中的强应用导向。值得关注的是,"大语言模型"虽存在但相对较小,表明相较于传统基于知识图谱的方法,其在故障诊断研究中的应用更为新近。这一动态特征意味着尽管大语言模型日益普及,但其在工业故障诊断中的应用仍处于初级阶段,未来可能需要更多研究。
图 D.5 所选研究中关键词频率的词云
附录E.数据集和语言
附录F.知识提取与生成及其指标得分
表F.14 知识提取和知识生成方法及其报告指标的比较

编辑:赵栓栓
校核:李正平、陈凯歌、曹希铭、赵学功、白亮、任超、海洋、陈宇航、Kira、Tina、王金、赵诚、肖鑫鑫、张优
该文资料搜集自网络,仅用作学术分享,不做商业用途,若侵权,后台联系小编进行删除