在智能制造与工业4.0的浪潮下,设备故障诊断正从经验驱动迈向知识驱动。本文《Large language model assisted fine-grained knowledge graph construction for robotic fault diagnosis》前瞻性地提出了一种基于大语言模型(LLM)的精细化知识图谱构建方法,为解决工业领域数据稀缺、实体嵌套复杂等核心痛点提供了创新方案。作者巧妙融合了模板生成、数据增强与“FilNER”过滤算法,有效缓解了长尾分布问题,显著提升了模型对关键故障实体的识别能力。该研究不仅推动了机器人故障诊断的智能化进程,更构建了系统化、标准化的知识库框架,为实现设备预测性维护和生产连续稳定运行奠定了坚实基础。其方法论对其他工业场景的知识图谱构建亦具重要参考价值,连接了AI技术与工业实践。
论文题目:Large language model assisted fine-grained knowledge graph construction for robotic fault diagnosis
论文日期:2025
论文链接:
https://doi.org/10.1016/j.aei.2025.103134
作者:Xingming Liao (a,b), Chong Chen (a,b)*, Zhuowei Wang (a,b) , Ying Liu (c), Tao Wang (a,d), Lianglun Cheng (a,b)
机构:
a: Guangdong Provincial Key Laboratory of Cyber-Physical System, Guangdong University of Technology, Guangzhou 510006, China
b: School of Computer Science and Technology, Guangdong University of Technology, Guangzhou 510006, China
c: Department of Mechanical Engineering, School of Engineering, Cardiff University, Cardiff CF24 3AA, UK
d: School of Automation, Guangdong University of Technology, Guangzhou 510006, China
作者简介:
陈翀,2021年3月博士毕业于英国卡迪夫大学,2021年4月加入广东工业大学信息物理融合系统重点实验室开展博士后研究工作。2023年11月通过广东工业大学青年百人计划入职。长期从事智能制造相关方面研究,主要研究方向为工业大数据、设备预测性维护、工业知识自动化和深度学习等。累计发表SCI/EI论文40余篇,主持国家自然科学基金青年基金1项,参与国家重点研发计划项目、国家自然科学基金广东省联合基金重点项目等项目。(https://cs.gdut.edu.cn/info/2241/4403.htm)
摘要
1 引言
2 文献综述
2.1 大型语言模型研究
2.2 领域知识图谱构建的最新进展
2.3 简要总结
3 方法
3.1 大语言模型辅助本体构建
3.2 工业嵌套标签分类模板
3.3 工业嵌套数据增强
3.3.1 微调ANLM
3.3.2 嵌套式工业数据生成
3.4 大语言模型辅助的非银样本召回
4 实验设置
4.1 数据预处理
4.2 评估指标
4.3.实施细节
5 实验结果与讨论
5.1 消融实验
5.2 与主流算法的基准测试实验
5.2.1 大语言模型辅助本体构建任务
5.2.2 大型语言模型辅助非银样本召回任务
5.3 实验结果对比
5.4 讨论
6结论
随着工业机器人在制造业中的快速普及,维持运营效率所需的先进维护技术需求变得至关重要。故障诊断知识图谱(KG)因其能关联工业机器人故障相关的多源数据,捕捉不同故障事件间的多层次语义关联而不可或缺。然而,由于维护文本中嵌套实体的固有复杂性以及标注工业数据的严重匮乏,构建和应用细粒度故障诊断KG面临重大挑战。本研究提出一种大型语言模型(LLM)辅助的数据增强方法,该方法可处理维护语料库中的复杂嵌套实体,并构建更细粒度的故障诊断KG。首先,通过LLM辅助的工业嵌套命名实体识别(assInNNER)构建细粒度本体。随后设计工业嵌套标签分类模板(INCT),使嵌套实体能够用于工业嵌套语言模型(ANLM)数据增强方法中的注意力图感知关键词选择。 ANLM 可有效提升模型在语料匮乏时的嵌套实体提取性能。接着引入置信度过滤机制(CFM)对生成数据进行评估筛选,同时再次调用assInNNER召回负样本语料库以进一步提升性能。基于多源语料库的实验研究表明,与现有算法相比,我们的方法在少样本设置中分别实现了5%、10%和25%数据集的平均F1分数提升8.25%、3.31%和1.96%。
关键词:知识图谱;大型语言模型;故障诊断;工业机器人
第四次工业革命已成为工业系统未来发展的关键转折点。工业4.0通过整合先进制造技术、信息通信技术,致力于实现智能化、自动化和高度互联的生产流程[1]。这场革命性变革显著提升了制造业设备运维领域对知识服务的需求。传统制造体系中,设备维护主要依赖经验与人工操作,导致故障诊断与维修效率低下。这种情况极易引发生产中断和资源浪费,尤其在大规模制造环境中更为明显。近期物联网、大数据分析和人工智能等技术的突破,使得设备状态实时监测、故障预测和预防性维护成为可能,显著提升了设备可靠性和生产效率[2,3]。然而,要有效应用这些技术,必须建立系统化、标准化的知识库。作为工业资产管理的关键环节,故障诊断需要精准定位故障部件的位置和健康状态,从而实现快速排查与维护。当前面临的挑战在于:高质量的领域特定数据资源匮乏,且难以提取嵌套实体等精细知识——这些对于精准诊断故障和制定维护计划至关重要[4]。因此,当前的研究重点是工业资产的智能故障诊断,以满足知识服务的需求。具体而言,需要建立一个系统化、标准化的知识库,以确保设备的安全稳定运行。
在制造业领域,知识服务的精准度至关重要[5,6]。知识图谱(KG)通过将海量数据转化为结构化、可操作的知识,已成为提升知识服务准确性的关键工具。它通过将数据组织成易于理解且可操作的形式,为智能决策和自动化操作提供支持。然而,知识图谱在故障诊断中的应用尚未获得足够重视。如前所述,构建高质量知识图谱面临诸多挑战,包括本体定义困难和细粒度知识(如嵌套实体)提取难题。精心构建的知识图谱能显著提升故障诊断能力,通过识别故障模式、预测潜在故障并优化维护计划,最终实现更高效、更有效的故障管理。在构建精准知识图谱时,本体构建过度依赖专家经验[7]。专家知识存在局限性和主观性,不同专家的观点差异可能使本体构建过程复杂化。与此同时,由于技术隐私问题的担忧,工业企业不愿共享故障诊断语料库资源,这阻碍了更先进知识图谱(KG)的发展。此外,现有语料库大多包含大量复杂的嵌套实体且样本分布不均,使得命名实体识别(NER)任务极具挑战性。这些挑战严重阻碍了知识图谱的构建,进而影响故障诊断后的维护计划调度和根本原因判定。
大型语言模型(LLM)在各类自然语言处理(NLP)任务中的卓越表现,已引发业界广泛关注。在制造业知识服务领域,LLM展现出显著潜力。近期研究日益聚焦于将LLM与知识图谱(KG)相结合,以提升故障诊断与维护规划的精准度和效率。传统本体构建方法高度依赖专家知识,而LLM能从领域特定文本中自动生成初步本体结构,从而降低对专家的依赖,提升知识图谱构建的效率与覆盖范围[8]。在领域知识图谱的本体构建中,传统方法因过度依赖专家经验而存在主观性和局限性。相比之下,LLM能通过分析领域特定文本数据自动生成初步本体结构,既减少对专家知识的依赖,又显著提升本体构建的效率与覆盖范围。通过设计特定提示语,语言模型(LLM)能够更精准地识别相关实体。然而在工业故障诊断领域,数据稀缺与信息特异性限制了大语言模型(LLM)仅凭有限文本和提示语发挥全部潜力的能力。这凸显出需要创新方法来提升LLM在知识图谱构建中的表现,特别是在应对工业故障诊断场景中数据稀缺与细粒度实体提取的双重挑战时。
命名实体识别(NER)在知识图谱(KG)构建中扮演着关键角色。尽管监督学习方法已被应用于识别复杂名词短语实体[9],但领域特定语料库的匮乏以及获取大规模标注数据集的挑战,严重制约了NER模型的性能表现,特别是在机器人故障诊断等专业领域。数据增强技术通过在不改变标注标签的前提下对训练样本进行转换,为资源有限的问题提供了可行解决方案[10]。这些技术能在资源匮乏场景中显著提升NER性能,从而为故障诊断提供更精准全面的知识图谱构建[11-13]。此外,机器人故障诊断语料库包含大量嵌套实体。准确识别这些嵌套实体不仅能提升知识图谱的精确性和完整性,还能优化相关领域的应用效果。然而,当前研究主要聚焦于平面NER任务并已取得显著进展。相比之下,针对任务驱动型研究相对匮乏,特别是在语料库稀缺的场景中。这一研究空白限制了嵌套实体识别技术在机器人故障诊断领域的进一步应用与发展。因此,在机器人故障诊断领域,由于高质量语料库的稀缺性以及这些语料库中存在大量嵌套实体,构建细粒度且高质量的知识图谱面临以下挑战:(1)如何通过构建更精确的本体论并改进细粒度实体抽取技术,来提升工业嵌套命名实体识别任务中的知识图谱质量?(2)如何解决故障诊断知识图谱构建中嵌套命名实体识别任务的数据稀缺问题?解决这两个挑战对于提升故障诊断知识图谱的质量至关重要。
在本研究中,我们提出了一种基于大语言模型辅助负样本召回的数据增强方法,旨在有效识别语料资源匮乏的嵌套命名实体识别任务。该方法的核心目标是确保后续知识图谱的精准构建。本研究的主要贡献体现在三个方面:(1)提出工业嵌套命名实体识别大语言模型辅助方法(assInNNER),通过构建嵌套概念将实例划分为更细粒度的单元。(2)针对数据稀疏性问题,我们为工业嵌套语言模型(ANLM)设计了注意力图感知关键词选择方法。鉴于传统数据增强方法难以直接应用于嵌套命名实体识别任务,我们开发了工业嵌套标签分类模板(INCT)来应对这一挑战。(3)为优化生成数据质量,在后处理阶段引入置信度过滤机制(CFM)进行高质量数据筛选,并采用assInNNER召回负样本语料库,从而进一步提升性能。基于真实工业语料库的实验研究证明,本方法较现有技术具有显著优势。本文后续章节结构如下:第2节综述大语言模型最新研究进展及知识图谱构建技术突破;第3节详细阐述研究方法论。第4节阐述实验装置,第5节展示并讨论实验结果,最后第6节总结全文。
近年来,大语言模型(LLM)的发展已获得广泛关注。以OpenAI的GPT系列和Google的Gemini为代表,大语言模型(LLM)凭借深度学习技术和海量训练数据,展现出卓越的自然语言处理能力[16-18]。它能从多元数据源中提取关键信息,并将其整合到统一的知识库中,这对制造业中常见的异构数据整合尤为重要。凭借强大的语义理解能力,LLM可解析复杂的技术术语和行业行话,通过自动化数据处理大幅减少人工干预需求,从而显著提升数据处理的效率与准确性。
在制造业领域,知识图谱(KG)通过结构化和语义化手段将海量数据转化为可理解且具有操作价值的知识,从而支持智能决策和自动化运营。同时,为确保知识图谱的准确性、一致性和可扩展性,必须构建能够清晰描述各类实体及其属性的本体。传统方法依赖领域专家的手动操作,不仅耗时费力,还难以保持一致性。例如,刘等人[14]通过提取BIM数据,为轻钢结构建筑行业构建了人工设计的建筑产品本体。牛等人[15]提出了一种构建建筑合同语义领域本体的方法:他们从合同定义中提取本体模型,以通用根概念类别作为初始分类,并通过分析合同条款文本内容来识别相关概念。
通过语言模型(LLM),可以从大量论文和文档中自动提取领域概念及其关联关系,从而辅助本体构建。这不仅大幅减轻了人工工作量,还实现了持续学习与知识更新。随着新信息的涌现,本体还能不断扩展优化,确保知识图谱(KG)的时效性和前沿性。制造业领域,尤其是工业领域,存在大量复杂实体。要构建符合工业故障诊断高精度要求的精准知识图谱,必须进行更细粒度的知识提取。指令遵循型LLM的出现,为解决工业领域数据稀缺和样本分布不均的挑战提供了潜在解决方案。然而,当处理工业问题时,LLM可能产生无意义结果,在复杂推理任务中表现欠佳[16,17]。因此,仅依赖LLM进行工业应用尚不可靠。
此外,大型语言模型(LLM)在更精细的知识图谱下游任务——嵌入式命名实体识别(NER)中的应用关键,在于设计知识增强型提示优化方案。周等人[18]提出的通用命名实体识别方法,通过任务导向的指令调优技术,将ChatGPT精简为更高效的小型模型,实现了跨领域、跨实体类型的通用命名实体识别。蒋等人[19]开发了基于预训练语言模型的文本增强型开放知识图谱补全方法。钟等人[20]探索了人机协作生成高质量多样化文本数据集的方案,通过人工标注(如标签替换)可提升准确率,同时平衡数据多样性与准确性之间的权衡。胡等人[21]提出的知识提示调优方法,将领域知识与人类专业知识融入文本分类提示中。通过整合LLM的强项与领域知识,特别是在故障诊断等复杂任务中,能够显著提升工业领域应用的性能与可靠性。
将大语言模型(LLM)引入制造业知识服务领域,不仅能有效解决传统方法面临的挑战,还能显著提升知识图谱(KG)构建的效率与准确性,为制造业的知识管理与应用奠定坚实基础。此外,LLM强大的上下文理解能力和深度语义处理能力,在处理复杂嵌套实体时展现出巨大潜力。但需注意的是,LLM生成的无意义结果无法达到优质标准。综上所述,在行业特定领域知识的指导下,我们不仅运用大语言模型(LLM)辅助本体构建并生成更精准的知识图谱(KG),还通过深度整合故障诊断事件的专业知识与LLM,实现数据增强后错误样本的召回,从而优化无意义结果的处理流程。
领域特定知识图谱(KG)在工业领域发挥着关键作用,通过提供情境感知和主动响应服务,显著提升流程效率并优化生产效能。知识图谱使工业系统能够理解并适应当前工作环境及变化需求,从而提供更具针对性的服务,增强企业竞争力。在构建精准、一致且可扩展的知识图谱时,本体论的构建尤为重要。陈等人[22]提出了一种利用远程监督技术提取关系的工业知识图谱构建方法。他们设计了基于片段的卷积神经网络进行远程监督关系提取,并通过结合句子级注意力机制与强化学习策略处理噪声数据,实现了工业知识图谱的高效构建。沈等人[23]则提出了一种基于知识图谱的动态知识建模与整合方法。他们开发了一种基于本体的知识建模方法用于服装定制,并提出了一种双向集成的知识图谱构建方法,从而在整个服装定制生产过程中实现动态知识整合。
鉴于工业故障诊断事件描述的复杂嵌套实体和数据稀缺等特性,命名实体识别(NER)成为构建更精准工业制造领域知识图谱的关键步骤。作为信息抽取领域的基础任务[24],NER旨在定位实体提及并将其标注为特定实体类型(如人物、地点和组织)。根据待提取实体是否包含细粒度嵌套提及[25],NER可分为平面NER和嵌套NER。平面NER早期研究主要基于规则方法,研究者通过预定义规则识别文本中的实体。该领域代表性进展由Collins等人[26]提出,他们采用迭代学习方法,通过预设种子规则集适应不同语料库和实体类型。随着机器学习技术发展,特征工程成为NER研究的核心。条件随机场(CRF)能计算给定观测序列下所有输出序列的联合概率,被广泛应用于NER任务。在此基础上,神经网络模型的引入为NER带来新突破。Huang等人[27]融合了 CRF 和长短期记忆(LSTM)网络的优势,提出双向 LSTM - CRF 模型,显著提升了NER性能。近年来,基于深度学习的NER方法取得了显著进展。例如,邱等人[28]和朱等人[29]采用基于跨度的方法,通过在标记层面上进行序列标注,再将标注结果转化为实体预测。另一方面,索拉布等人[30]直接对潜在跨度进行分类。这些方法在不同程度上提升了实体识别的准确性。在持续探索中,部分研究将命名实体识别任务框架化为序列到集 合或阅读理解预测任务[31,32]。此外,在基于自回归生成的命名实体识别方法[33,34]中,作者通过将结构化实体线性化并采用序列到序列语言模型进行解码,为命名实体识别任务提供了新视角。
在通用领域嵌套命名实体识别(NER)领域,实体常存在重叠且需标注多重标签。近年来,相关方法不断涌现。林等人[35]提出锚定区域网络,通过建模和利用主驱动短语结构来检测嵌套实体。嵌套NER方法主要分为三类:序列到序列方法、集 合预测方法[36]以及基于跨度的方法。严等人[37]将命名实体识别(NER)视为实体跨度的序列生成问题,采用基于BART的Seq2Seq模型[38],结合统一框架中的指针网络来解决大多数NER问题。Tan等研究者[31]提出了一种用于预测实体集 合的非自回归解码器,将命名实体识别(NER)定义为实体集 合预测任务。然而,部分多粒度特征未能被充分整合,且在其他特定领域的识别性能尚未得到充分评估。在信息抽取领域,现有工程解决方案大多聚焦于平面式NER。考虑到上下文特征与标签的多样性,领域特定的嵌套式NER仍需进一步探索。在桥梁领域,李等人[39]提出了一种词典增强型机器阅读理解NER神经模型,用于从中文桥梁检测文本中提取平面式和嵌套式实体。该模型通过结合预训练BERT模型与双词嵌入,显著提升了领域特定词汇的识别能力。
该方法通过在桥梁检测报告中嵌套特征,为桥梁管理中的自动信息提取提供了有效方案。与此同时,许多方法采用生物医学领域的语料库(如GENIA和JNLPBA)进行评估。沈等人[40]提出了一种基于扩散模型的命名实体识别方法——扩散神经网络(DiffusionNER)。该方法将实体边界视为数据样本,在正向扩散过程中逐步添加高斯噪声,并在反向扩散过程中逐步恢复原始实体边界,从而从噪声片段中生成实体。该方法在生物医学领域数据集上取得了优异性能。迄今为止,针对领域特定嵌套命名实体识别任务提出的神经网络方法仍寥寥无几,这凸显了该领域进一步研究的必要性。
随着计算能力的提升和大型数据集的可用性,神经网络已取得最先进的研究成果。许多自然语言处理和计算机视觉研究。这些研究通常需要大量平衡的训练样本。然而,在工业领域,数据样本往往稀缺、不平衡或两者兼有。因此,数据增强可用于克服样本量不足和比例失衡的问题[41]。在增材制造应用中,数据增强已被用于解决资源数据集不足的问题,并取得了显著成功[42]。类似地,小数据集在其他领域也很常见,例如医学影像,数据增强也被利用[43]。通过有效增加小数据集,过拟合的影响可能被降低,从而获得更好的模型性能[44]。此外,数据增强能有效解决复杂的命名实体识别任务。Ghosh等人[45]提出了一种基于条件生成的新型数据增强方法,以解决低资源复杂命名实体识别中的数据稀缺问题。该方法采用条件生成技术创建合成数据,当标注数据有限时,可有效提升模型训练效果与性能表现。
综上所述,知识图谱与机器人故障诊断的深度融合,为制造业运营管理注入了强劲动力,显著提升了效率并优化了生产效能。然而,构建精准的工业知识图谱仍面临诸多挑战。在机器人故障诊断领域,作为知识图谱本体构建的关键环节,命名实体识别(NER)在处理复杂嵌套实体和数据稀缺问题时仍显力不从心。尽管近年来提出了多种嵌套式NER方法,但针对制造业数据集(这类数据通常较为匮乏)的应用仍需深入研究。此外,虽然数据增强技术能有效解决样本量不足和分布不均的问题,但其直接应用于嵌套式NER任务时仍存在局限性。
故障诊断知识库的构建主要依赖于从操作手册、维护日志和技术文章等多渠道收集的语料库。现有研究显示,针对特定行业场景构建领域专用知识图谱往往存在规模受限、专业性强等挑战。由于技术隐私问题,工业企业相关资源通常较为匮乏且分布不均。此外,现有语料库普遍包含复杂的嵌套实体,这进一步制约了故障诊断知识库的构建。虽然数据增强技术为解决语料库稀缺与分布失衡问题提供了潜在解决方案,但现有方法多应用于平面命名实体识别任务,针对嵌套命名实体识别任务的应用研究仍显不足。更值得注意的是,语料库中嵌套实体的稀缺性、分布失衡及复杂性加剧了数据增强的难度,导致增强型正样本语料库数量不足。因此,构建故障诊断知识图谱(KG)面临四大挑战:(1)专家知识的有限性和主观性,这不仅使本体构建过程复杂化、耗时更长,还会影响本体的完整性和准确性;(2)标注数据集不足导致模型训练与验证困难,直接影响嵌套式命名实体识别(NER)模型的性能;(3)现有数据增强方法可能不适用于嵌套式NER任务;(4)维护语料库中数据样本分布失衡,增加了模型训练的复杂度并影响模型性能。因此,亟需开发一种既能解决嵌套式NER问题,又能提升语料库数量与质量的数据增强方法。该方法将助力精准构建工业故障诊断知识图谱,为工业故障诊断领域提供更高质量的知识服务支持。
本文提出的方案概述如图1所示,主要分为五个阶段。首先,通过LLM辅助本体构建技术,从技术文档中提取关键概念,以降低人工标注成本并实现更精细的本体构建。其次,针对数据增强方法难以应用于嵌套式命名实体识别任务的局限,我们提出INCT,通过结合标签与标记,使模型能够学习并感知标签的范围及其对标记的贡献。第三,引入ANLM技术对工业嵌套数据进行增强,生成多样化且均衡的训练样本,有效增加样本数量,克服数据稀缺问题,缓解长尾分布现象,从而提升嵌套式命名实体识别的性能。同时,引入置信度过滤机制(CFM)对生成样本进行语义流畅性评估与筛选,确保数据质量。最终,该模块从非Silver数据集中恢复高质量样本,从而提升样本质量并提高复杂嵌套实体的识别准确性。
图1. 机器人故障诊断知识图谱中assInNNER与数据增强的概述
随着工业系统日益复杂化和自动化,传统故障诊断方法已难以满足实际需求。作为形式化知识表示的本体论,能够提供统一的语义模型,促进不同系统间的信息共享与互操作性。然而传统本体构建高度依赖专家经验,而专家知识具有局限性和主观性,制造领域专家间的观点分歧往往给本体构建带来挑战。语言模型在自然语言处理中的成功应用,为本体构建提供了新思路。本文提出一种名为assInNNER的本体构建方法,该方法包含以下三个步骤:
概念提取 首先,从工业故障诊断领域的文献、技术文档和操作日志中筛选并清洗与质量相关的语料数据。利用专家知识作为指令提示,大语言模型(LLM)能自动从预处理文本中提取父级和子级概念,并建立标准化指南。例如,通过GPT-4模型解析大规模工业诊断论文,提取“设备”、“子设备”、“组件”、“零件”和“故障检测”等常见概念。随后对初始提取的概念进行过滤和优化,去除冗余信息和噪声,确保每个概念的准确性和相关性。
语义关系 在确定关键概念后,通过定义这些概念之间的语义关系来构建有组织的知识网络。同时,利用大语言模型(LLM)分析领域文献,自动识别并提取概念间的关联。例如,确定“电机”与“设备”的关系为继承关系(is-a),“故障类型”与“故障原因”为因果关系(cause-of),“设备”与“属性”为拥有关系(has-attribute)。最后,通过专家评审和数据验证确保所定义的关系准确且符合实际。
层次结构构建 在明确概念及其关联关系后,需将其组织成层级结构以构建完整的本体框架。通过继承关系将概念排列成树状层级结构,例如从宏观到微观的层级关系可表示为“故障”“设备故障”“电机故障”。将各类关联关系整合到该层级结构中,形成多层级、多关联的知识网络。在本体框架内定义必要的语义规则与约束条件,确保体系的完整性和一致性。
通过遵循上述详细设计步骤,可系统构建适用于工业故障诊断的本体论。这确保了概念和关系的准确性和完整性,使知识图谱能够更有效地表示和管理工业故障诊断中的复杂知识。
基于我们前期的研究成果[46],我们引入了INCT并用其构建新模板。模板构建主要分为四个步骤:关键词筛选:针对训练语料库中的每个句子,首先识别非命名实体(non-NE)标记。若某个非NE词与句子中的命名实体(NE)具有最强的上下文依赖关系,则将其视为关键词。通过从基于Transformer的命名实体模型中提取的注意力图,我们测量了NE与非NE词之间的上下文依赖度。为计算句子中每个标记对其他标记的总注意力得分,需将句子BERT网络中所有头层( )的注意力得分相加。不同层级的头层捕捉不同的语言特征,通过取最后四层的注意力得分平均值,确保关键词筛选时能综合考虑语义、句法等多种语言关系。作为增强鲁棒性的额外预处理步骤,标点符号、停用词及其他非实体词会被排除在前 的 词元之外,以获得最终关键词。选择性掩码: 在选定句子中前 的 词元作为关键词后,剩余有 个非实体关键词词元和 个实体词元。在模板创建过程中,所有不属于 的非NE标记均被替换为掩码标记,并移除连续的掩码标记。标记序列线性化: 在获得初始模板后,执行标记序列线性化以在微调和增强生成过程中显式考虑标签信息。在每个实体标记前后添加标签标记,并将其视为句子的正常上下文。动态掩码: 在标记序列线性化后,模板会进行进一步的掩码处理,即在每次训练和生成迭代中动态掩码 个关键词中的小部分。首先,从高斯分布 中采样动态掩码率 ,其中高斯方差 设为 。然后,根据掩码率 从句子中的 个关键词中随机采样标记,并用掩码标记替换,随后移除连续的掩码标记。通过结合标记和标签,模型可以学习跨度感知的标签,并考虑标签对标记的不同贡献。通过该模板,我们仅需遍历一次即可获取具有跨度的嵌套标签,有效解决了数据增强中嵌套命名实体识别的问题。预训练的BERT-base模型将每个字符转换为嵌入表示,为后续注意力机制提取关键词奠定基础。对于嵌套词汇而言,词汇本身的标签是关键决定因素。此外,由于标签间的关联性,结合标记与标签至关重要,这使得模型能够学习跨度感知的标签,并考量标签对标记的不同贡献。通过结合关键词选择与选择性掩码技术,可获得包含实体、关键词和掩码标记的句子。在获取初始模板后,执行嵌套标记序列线性化处理,以便在微调和增强生成过程中显式考虑标签信息。嵌套标记标记被添加在每个实体标记前后,并作为句子中的常规上下文处理。此外,每个命名实体(NE)前后标注的标记词为由多个标记词组成的命名实体提供了边界监督。
ANLM在新颖的文本重构任务上进行微调,该任务使用受损的文本模板,模型通过这些模板学习还原原始文本。从受损文本进行文本重构是预训练语言模型(PLMs)如BART和BERT的常见去噪任务。本研究将其作为微调目标,通过采用选择性掩码策略生成模板,从而与现有预训练目标形成区别。
针对文本重构任务的微调,我们使用ANLM生成合成数据进行数据增强。在训练数据集的每个句子中,模板构建流程会进行 轮随机句子破坏以获取模板,随后通过微调后的ANLM模型生成总计 个增强训练样本。此外,为提升多样性,在自回归生成过程中会从前 个最可能词中随机抽取下一个词,并通过束搜索选择最可能的序列。
FilNER: 由于工业数据集中存在严重的长尾分布问题——每个句子都包含特定词汇(例如标记为“EQUI”的“motor”标记),数据增强过程往往会加剧这一问题。在此过程中生成的句子可能导致模型过度拟合此类标签,从而影响嵌套实体的识别。在对训练数据集进行 轮增强时,我们提出使用FilNER这一新型模板过滤算法,可辅助 ANLM 生成具有新语境及句中多个名词性主语(NE)的句子。提出的FilNER算法通过根据特定标记的存在来调整增强阈值来解决这个问题。更具体地说,在模板创建过程的嵌套标记序列线性化步骤中,当处理训练集中任意给定句子 的模板时,会对 的标记进行迭代。如果发现特定标记,则降低该句子的增强阈值;而对于不包含特定标记的句子,则提高阈值。此外,还会检索另一个语义相似句子 的模板,并将两个模板拼接后传递给ANLM。图2(a)展示了使用FilNER生成的句子示例。需要注意的是,FilNER仅在生成步骤中应用,而非在微调过程中。此外,FilNER并非在所有轮次 中都适用。相反,概率 是从高斯分布 中采样的,只有当 超过设定阈值 时才应用混频器。
图2. 工业嵌套语言模型中基于注意力图的关键字选择示例
长尾修剪: 如前所述,为避免生成数据出现严重的长尾分布问题,我们对句子 应用长尾分布修剪来确定增强阈值。为评估阈值变化,系统会遍历句子 的词元,检测是否存在特定词元。若存在此类词元,则将增强阈值调低(设为2);反之则调高(设为4)。该阈值代表句子被增强的次数。
句子融合: 如前所述,为从训练集中检索 ,会从与 语义相似度最高的前 个句子中随机抽取 句子。为计算训练集中每个句子的语义相似度,首先从多语言句子BERT中提取每个句子的嵌入向量 。随后采用以下方法计算语义相似度:
其中 表示两个嵌入向量之间的余弦相似度, , 分别代表上述句子 和 。此外, ,其中 , 表示训练集的规模。
作为后处理步骤,增强后的数据会被输入到经过微调的ANLM模型中进行评估和过滤。随后将预测标签与原始句子的真实标签进行比对,生成两个子集:“银”样本和“非银”样本。“银”样本指预测标签与增强样本真实标签一致的样本,表明模型识别正确;反之,“非银”样本则是预测标签与真实标签不匹配的样本。但需注意,部分“银”样本可能包含标签匹配但伪对数似然值(pll)较低的句子,这表明其句式结构或语义内容不够连贯。为解决这一问题,我们引入CFM(语义流畅性过滤器)基于语义流畅性对增强数据进行筛选,该方法以pll值作为评估生成句子质量的标准。CFM确保仅保留语义流畅性高且与原始数据一致的句子。我们通过CFM创建了两个高置信度数据集:“高置信度银源”数据集和“高置信度非银源”数据集,如图2(b)所示。这些数据集是通过过滤掉低置信度或结构不良的句子而形成,仅保 留那些在标注置信度和语义连贯性方面均表现优异的句子。这些经过过滤的高置信度样本随后与原始训练集 合并,从而为嵌套的命名实体识别任务扩充数据集。通过采用包含数据生成 ANLM 和CFM过滤机制的质量控制的这种数据增强流程,我们确保增强后的数据在数量和质量上均得到保障。
在数据增强过程中,识别和增强简单实体相对容易,但增强复杂嵌套实体时会遇到挑战,这可能导致错误。复杂嵌套实体的增强错误通常不会导致整个实体被完全误标,而是源于嵌套实体内特定标记的误标,这可归因于少数资源限制。为解决这一问题,assInNNER设计了借助大语言模型(LLM)辅助召回非银样本的方案,其灵感源自教师指导学生时观察到的教学模式。该模块整合了辅助引导模板,利用LLM从非银数据集中召回高质量样本。其目标是在数据增强过程中为复杂嵌套实体的标记提供辅助,从而提升标记精度。
学生样本 在教师指导下,学生已具备一定的先验知识,但这些知识可能存在错误或不完整。他们需要通过定期考试来获取正确知识并验证学习成果。我们将原始数据与银样本进行关联,构建出所谓的“正确知识样本”。学生必须从正确知识开始学习,才能为后续考试做好准备。因此,我们将“正确知识样本”归类为学生学习过程中的样本数据。
教师样本 考虑到教师在引导和引导学生学习正确知识方面的作用,我们以非银样作为教师样本,通过批改学生考试试卷的形式来纠正错误。
本研究采用机器人故障诊断事件描述数据集作为语料库,数据来源包括操作日志、书籍和文章等多种材料。由于工业机器人运维领域缺乏标准化的嵌套命名实体识别(NER)语料库,我们扩展了先前研究提出的命名实体数据集来评估模型性能,原始数据包含900个原始句子。这些句子被进一步划分为三部分:训练集包含630个句子,验证集和测试集各包含135个句子。
根据上述详细标注策略,我们从语料库中人工标注了900个句子。嵌套实体标注采用经典BIO模式及第4.2节所述的标注策略。为降低随机抽样导致的性能波动,我们采用7折交叉验证策略,按7:1.5:1.5比例将数据集划分为训练集、验证集和测试集,最终获得七组数据。在构建小样本数据集时,为确保验证集和测试集保持不变并进一步降低个体差异,从训练集中抽取五个不同样本,分别形成5%(约32个句子)、10%(约64个句子)和25%(约160个句子)规模的数据集,分别命名为“5%混杂”、“10%混杂”和“25%混杂”。该语料库包含20种实体类型。最终处理后的数据用于ANLM建模。
为评估扁平化命名实体识别(NER)与嵌套式NER系统的性能,采用标准评估指标如精确率(Precision)、召回率(Recall)及F1分数(F1Score)。这些指标的计算公式如下:
其中TP为真阳性,FP为假阳性,FN为假阴性。精确率 表示正确提取的实体占总提取实体的百分比。召回率是正确提取的实体占应提取实体总数的百分比。F1分数 是精确率与召回率的加权调和平均值。
4.3.实施细节
在实验设置中,我们通过调整ANLM-assInNNER模型的参数,使其在工业故障诊断领域达到最佳性能,具体参数如表1所示。在预训练阶段,我们选用BERT-base-uncased模型,其最优参数配置为:批量大小32、学习率2e-05、训练周期45。同时将生成注意力模块的掩码率设为0.3。ANLM组件采用mBART-large-50模型,训练周期50、批量大小8。CFM组件中的银样与非银样阈值分别设为0.7和0.8。我们还与现有多种方法进行详细对比,证明所提模型能以更精细的方式构建嵌套概念,突破直接将嵌套命名实体识别应用于数据增强方法的局限,为工业应用提供更精准的故障诊断解决方案。所有实验均在搭载NVIDIARTXA6000GPU的PyTorch平台上进行,以验证模型在预测和诊断工业故障方面的有效性。
表1 ANLM-assInNNER的最优参数组合
由于工业机器人领域缺乏标准化的嵌套命名实体识别(NER)语料库,我们扩展了先前研究中提出的命名实体数据集以评估模型性能。训练集通过7折交叉验证实验中的五次随机抽样构建。该方法的主要目的是降低数据变异对实验结果的影响,并避免结果的随机性。此外,为了更清晰地展示实验过程中语料库规模与实体数量的变化,我们选取了一组结果接近平均值的实验进行详细讨论。详细的对比数据分布见表2。
表2 原始数量与增补数量的比较
为探究不同组件对模型性能的影响,我们基于不同混淆数据进行了消融实验。图3的结果充分展示了各关键组件对模型性能的重要性。具体而言,当移除ANLM时,嵌套命名实体识别F1分数相对于预训练语言模型分别下降了12.85%(5%)、7.41%(10%)和2.38%(25%),这表明在资源有限条件下,ANLM能有效提升模型性能。此外,我们移除了LLM辅助的非银样本召回功能,使模型仅从增强的正样本中学习,忽略了负样本中丰富的嵌套实体。结果表明,嵌套命名实体识别F1分数在5%、10%和25%的样本比例下分别下降了2.03%、0.61和1.7%。值得注意的是,模型仅需三次迭代便在无辅助召回的情况下实现收敛,这充分证明了LLM辅助召回对性能的显著提升作用。
图3. 增强数据“Mixup5%”、“Mixup10%”和“Mixup25%”中不同算法的对比
通过任务规划与有效模型利用,assInNNER为大语言模型(LLM)赋予更广泛的能力。本研究通过详细案例分析评估了assInNNER在该领域的应用,如图4所示,该研究首先通过分析现有知识图谱中的概念及其关联关系,验证了知识图谱识别与信息提取的效能。随后,通过将详细的工业运营知识与复杂嵌套知识进行协同整合,assInNNER使本体构建过程更加全面精准。图4的案例生动展现了该方法在优化和扩展本体结构方面的显著效果。嵌套概念的引入使得构建更精细详实的本体和知识图谱成为可能。通过构建更完善的本体和知识图谱,为后续增强任务提供了更丰富准确的数据源。这种结构化知识不仅提升了数据的质量与多样性,还确保了增强任务所需样本的准确性和相关性,从而有效推动模型的持续优化升级。
图4. 使用assInNNER在两个任务中生成故障诊断嵌套实体问题知识的示例
为解决负样本中包含大量部分错误但流畅且标注丰富的句子问题,assInNNER通过任务规划组织学生模块与教师模块之间的协作。如图5和图6所示,我们通过实验分析评估了assInNNER在负样本召回场景下的有效性。图5展示了assInNNER学生模块在多轮对话场景中学习嵌套知识的能力。用户将复杂请求分解为多个步骤,并通过多次交互实现最终目标。我们发现assInNNER能在任务规划阶段通过对话上下文管理追踪用户请求的上下文状态。此外,assInNNER的学生模块展现出学习嵌套实体知识的能力,在整个学习过程中持续进行推理与结论生成。这种优化显著提升了 ANLM 的整体性能和稳定性。在小样本场景下,数据增强往往会加剧不平衡问题——过度增加易于识别的扁平实体类别,同时给长尾分布较重的标注实体增加标签。而本方案通过召回负样本并增加正样本多样性(包括复杂嵌套实体)来缓解这一问题。同时,该方法丰富了增强数据的多样性,减少了增强迭代次数(N从5次减少至3次),从而进一步提升了嵌套命名实体识别任务的准确性和可靠性。
图5. 使用assInNNER进行嵌套实体知识学习的学生任务示例
图6. 使用assInNNER进行嵌套实体标签审查的教师任务示例
图6展示了“批改作业”功能的运作流程:当用户提出批改作业请求时,系统首先通过师生协作流程对输入句子进行分析。教师模块会解析句子中的嵌套信息并进行归纳总结,随后向用户呈现详尽的批改说明,最终根据用户要求的格式输出正确文本。
该系统通过任务规划机制有效应对大量标注准确但存在部分错误的负面样本,这种协作模式显著提升了处理效率。在多轮对话场景中,学生模块展现出强大的知识嵌套学习能力,将复杂任务拆解为多个交互步骤,最终达成目标。与此同时,教师模块持续分析句子中的嵌套信息,提供全面细致的批改建议,并以用户指定格式生成正确文本作为反馈。
通过结合assInNNER的本体论优化与负样本召回操作,我们在表3中展示了 ANLM-assInNNER模型在嵌套命名实体识别数据集上的表现,并与近年来在该领域表现优异的基线模型进行对比。如表3所示,在不同低资源设置(5%、10%和25%)下,我们的模型均展现出强劲竞争力,超越了现有最先进模型。具体而言,在低资源设置下仅使用5%和10%语料库进行训练时, ANLM-assInNNER模型分别获得64.89%和70.43%的F1分数,显著高于相同设置下的基线模型。相较于次优基线模型Binder,我们的模型在这两种低资源设置下分别提升了8.25%和3.31%。在使用25%语料库的数据集上,我们的模型优势更为明显,较基线模型提升了1.96%的性能。总体而言,实验结果表明:ANLM-assInNNER模型通过本体论细化和负样本召回机制,能更精准地捕捉嵌套实体的层级结构;同时借助自回归数据合成技术有效提升模型泛化能力,最终在低资源工业维护语料库的嵌套命名实体识别任务中取得最佳识别效果。
表3 嵌套NER任务的实验结果
在构建工业故障诊断知识图谱时,知识获取者的认知偏差或主观观念可能导致某些信息的遗漏或误读。这些偏差可能源于数据采集不完整、标注者的主观判断以及领域专家的局限性。虽然利用大语言模型(LLM)构建知识图谱可以通过大规模学习获取更广泛、更全面的知识库来部分缓解这些问题,但在本体构建的初始阶段,仍存在偏见或误读的潜在风险。大语言模型虽然可以提供更客观的参考依据,但其实际效果仍取决于训练数据的质量与代表性。此外,大语言模型(LLM)可能难以完全捕捉高度专业且复杂的领域知识,特别是在信息匮乏或涉及专业术语、依赖上下文的场景中。构建故障诊断知识图谱后,关键任务是实现更精细的命名实体识别(NER),以提升模型识别嵌套实体的能力。消融实验表明,在资源有限的条件下,ANLM模型和assInNNER都能有效提升嵌套NER任务的性能。在7折交叉验证测试中,ANLM展现出优势,尤其在“5%”和“10%”样本比例设置下表现突出。具体而言,当语料库设置为“5%”和“10%”时,经过五次迭代后,模型性能分别提升12.85%和7.41%,这充分证明了ANLM的有效性。
在低资源环境下,经过三次迭代优化,通过召回ANLM生成的负样本,assInNNER在“5%”、“10%”和“25%”三种场景下的性能分别提升了6.71%、1.48%和1.9%,充分展现了其提升模型性能的潜力。但需注意的是,这些方法的效果仍受限于训练数据质量,以及数据集多样性不足或过度增强可能引发的过拟合问题。例如在“25%”场景中,性能提升幅度较小,这可能源于增强过程中生成的样本过多,导致过拟合和长尾分布等问题。因此,尽管所提方法展现出潜力,但仍需进一步优化以全面应对这些挑战。当综合评估时,F1分数分别提升了19.61%、9.32%和4.28%,显著优于其他算法。这一改进充分证明了ANLM-在“25%”测试场景中,性能提升效果较为有限,这可能源于增强过程中生成的样本量过大,加剧了长尾分布问题并导致模型过拟合。虽然我们提出的算法通过引入数据增强和大语言模型辅助召回操作来处理低资源工业维护语料库,并展现出更优的建模性能,但这些方法仍存在局限性。特别是在样本占比较高的场景(如“25%”语料库)中,过拟合问题凸显出需要进一步优化以防止模型性能下降,并确保实际应用中的鲁棒性。此外,算法性能可能因具体领域特征而异,其在其他工业故障领域的可扩展性仍需深入研究。
本研究提出的ANLM-assInNNER算法能够在故障诊断中更准确识别复杂的嵌套实体,有助于提升工业故障诊断中信息结构的捕捉能力。然而,本研究未考虑嵌套关系这一故障诊断的另一重要维度。关系抽取对于理解故障诊断中实体间的关系至关重要,而对这些关系的忽视限制了构建知识图谱的整体全面性。未来工作中,我们将探索在低资源条件下嵌套实体与关系的重叠性,以实现更优的联合抽取性能。此外,通过整合更多元化的数据源并探索多模态集成,可扩展知识图谱的覆盖范围,从而提升其整体准确性和实用性。同时,还需开展更精细的故障诊断知识图谱研究。本研究构建的知识图谱基于多源语料库,而工业环境中采集的传感器数据、历史维护记录等序列数据,同样蕴含着丰富的工业资产故障诊断隐性知识。随着工业资产维护需求持续增长,如何在现实工业场景中有效应用重叠与嵌套事件提取任务,仍需深入研究。尽管现有方法展现出应用潜力,但现实工业环境具有高度动态性和情境依赖性,可能带来数据波动、噪声干扰及领域特定复杂性等新挑战。未来研究应着重提升这些方法的鲁棒性和泛化能力,以有效应对工业环境中的复杂性。
本研究提出了一种创新方法,通过利用大语言模型(LLM)构建用于机器人故障诊断的细粒度知识图谱。该方法解决了工业语料库中标注数据稀缺和嵌套实体复杂性等关键挑战。我们通过优化本体论并借助LLM提取更精细的概念,对现有机器人故障诊断知识图谱进行增强。为应对数据可用性限制,我们引入工业INCT并开发ANLM来扩充训练数据。此外,我们采用CFM有效过滤高质量数据用于语料库构建,并应用assInNNER召回非银样本。这些综合策略显著提升了嵌套命名实体识别任务的性能,尤其在标注数据有限的场景中表现突出。实验结果验证了我们提出的ANLM-assInNNER方法的有效性。在数据稀缺的低资源环境下,我们的方法始终优于现有基准算法。具体而言,该方法在Mixup5%(32个句子)数据集上取得了64.89%的F1分数,70.在混合比例10%(64个句子)和25%(160个句子)的场景中,准确率分别为43%和81.11%。这些结果凸显了将大语言模型辅助本体构建与数据增强相结合,在解决工业维护语料库挑战方面的潜力。本研究为工业环境故障诊断的细粒度知识图谱构建提供了重要启示。所提出的方法不仅提升了训练数据的数量和质量,还增强了模型识别复杂嵌套实体的能力。此外,通过该方法构建的细粒度知识图谱提供了更详尽全面的知识库,这对支持工程师在故障诊断过程中做出精准及时的决策至关重要。综上所述,本研究证明大语言模型结合新型数据增强技术,能有效应对工业故障诊断中的资源匮乏挑战。这项研究为知识图谱构建的进一步发展奠定了基础,并为未来开发更智能、更自动化的维护系统指明了方向。未来工作将重点改进整合更多样化数据源的方法,并提升该方法在更广泛工业应用中的可扩展性。