首页/文章/ 详情

2区Top综述||如何融合人工智能大语言模型与知识图谱以增强故障诊断?一项系统性文献综述(下)

3月前浏览609

大语言模型遇上知识图谱,工业故障诊断迎来新范式!这篇2026年新鲜出炉的文章,系统梳理了LLM+KG融合技术的最新进展,从理论框架到实践案例,揭秘如何让AI既"聪明"又"靠谱"。  

本期推荐的这篇特文特大学电气工程、数学与计算机科学学院万·巴尔马维·穆罕 默德·拉扎克的文章本文系统综述了大语言模型(LLMs:Large Language Models)知识图谱(KGs:Knowledge Graphs)融合技术在工业故障诊断中的应用,基于PRISMA框架分析了2017-2025年间37篇文献。研究识别出两种核心范式:LLMs增强KGs(自动化提取故障实体关系,解决传统知识抽取成本高、主观性强的问题)KGs增强LLMs/图检索增强生成(GraphRAG:Graph Retrieval-Augmented Generation)(通过结构化因果路径抑制大语言模型幻觉,提升推理可解释性)。当前研究主要集中于旋转机械、钢铁制造和数控机床领域,微调的BERT模型在知识提取任务中可达98.76%的F1分数GraphRAG系统在故障诊断生成任务中实现92.3%准确率和5.3%的低幻觉率。然而,领域覆盖单一、多语言支持不足(仅中英文)、缺乏可解释性可视化界面等问题仍显著存在。未来研究需向多模态数据融合、多语言扩展、智能体诊断及开源模型私有化部署方向演进这对数字孪生场景中的实时知识推理、跨系统故障溯源及人机协同维护决策具有重要参考价值  

由于文章篇幅过长,小编将分两次为大家翻译介绍这篇论文,第一篇推文涵盖研究背景与方法论,系统阐述大语言模型知识图谱融合的技术动因PRIS MA文献筛选流程"设置-本体-抽取-检索-生成"五层分析框架,呈现2017-2025年技术演进脉络37项实证研究核心发现。具体包括:识别LLMs增强KGsKGs增强LLMs/GraphRAG两大范式,揭示BERT模型在知识提取中达98.76% F1分数GraphRAG系统实现92.3%准确率5.3%低幻觉率能突,为工业故障诊断的智能化转型奠定方法论基础  

本篇推文聚焦讨论与结论,深入剖析领域覆盖单一(过度集中于旋转机械与钢铁制造)、多语种支持不足(仅中英文,缺乏荷兰语等小语种方案)、可解释性缺失(无交互式推理可视化)等关键研究缺口,并前瞻性地提出五项未来方向跨设备主知识图谱架构多语言嵌入模型本地化智能体增强人机闭环验证开源模型私有化部署保障数据主 权,以及多模态数据融合(振动图谱等)。这些方向为数字孪生场景下的实时故障镜像跨物理-信息空间因果追溯提供方法论启示,推动诊断系统从"事后响应""预测性知识工程"跃迁。  

文章质量很高。本文配套思维导图&论文精华速览,已同步至小红书:(ID:故障诊断与python学习),需要的小伙伴可以自取💡~      

论文链接:通过点击最左下角的阅读原文进行在线阅读及下载。  

论文基本信息

论文题目: How can the integration of AI large language models and knowledge graph enhance fault diagnosis? A systematic literature review

论文期刊:Applied Soft Computing

Doihttps://doi.org/10.1016/j.asoc.2026.114908

作者:  Wan Barmawi Muhammad Razaq a,Hao Chen Marcos R. Machado b , Maosheng GaoJoão Luiz Rebelo Moreira a
 
论文时间: 2026年1  
机构:   

University of Twente, Faculty of Electrical Engineering, Mathematics, and Computer Science, AE Enschede, 7500, Netherlands

 b University of Twente, Faculty of Behavioural, Management and Social Sciences, Department of High-Tech Business and Entrepreneurship, AE Enschede, 7500, Netherlands

University of Münster, Chair of Information Systems & Supply Chain Management, Münster, Germany

摘要

大型语言模型知识图谱的融合代表了工业场景下故障诊断改进的新兴途径。传统故障诊断方法——包括基于模型的方法基于信号的方法以及基于规则的方法——在管理复杂数据、适应新型故障以及确保推理准确性方面面临持续性挑战。本系统性文献综述评估了37项相关研究,以审视LLMsKGs的协同作用如何缓解上述局限。综述识别出两种主要范式:LLM增强型知识图谱,其自动化地从非结构化工业文本中提取实体关系;以及知识图谱增强型LLM,其将模型推理锚定于结构化因果路径以降低幻觉现象。尽管这两项技术的集成应用正成为增长性研究趋势——尤以2025年发表的11篇论文为峰值——该领域仍处于早期发展阶段。当前研究高度集中于旋转机械钢铁制造计算机数控(CNC:Computer Numerical Control)设备,在行业覆盖广度多语言支持(除英语与汉语外)以及高级评估指标方面存在显著缺口。此外,诸多现有系统缺乏工程师在高风险环境解释推理路径所必需的可解释性。本研究建议,未来研究应着力于:将诊断框架扩展至专业化工业领域、改进领域特定适配机制,并通过交互式可视化结构化推理提升可解释性
关键词故障诊断大型语言模型知识图谱GraphRAG实体与关系抽取

目录

1 引言

理论背景

研究方法

   3.1 框架参考与检索策略

   3.2 文献筛选流程

   3.3 数据收集过程

   3.4 数据综合

研究结果

   4.1 现有故障诊断的挑战

   4.2 KG-LLM融合概念框架

   4.3 应用场景分析与数据集

   4.4 本体论

   4.5 知识提取

   4.6 KG增强LLM(GraphRAG)流程:索引、检索与生成

   4.7 评估与基准测试

5 实践启示

研究缺口分析

   6.1 应用场景(工业机械背景

   6.2 数据集与语言

   6.3 知识提取

   6.4 评估方法

   6.5 可解释性/可视化

   6.6 未来研究方向

7 结论


注:小编能力有限,如有翻译不恰之处,请多多指正~
     若想进一步拜读完整版,请下载原论文进行细读。

5 实践启示

大语言模型与知识图谱融合框架在2025年的实际应用为工业维护带来了巨大效益。以桥式起重机作业为例,此类系统实现了"人机协同故障排查",当操作人员报告"异常噪声"时,系统引导其完成多个检查阶段,直至定位内部转子的特定错位故障[34]。在数控机床维护[7]中,该系统使操作人员能够通过交互式对话解决复杂电气故障,如IPM模块故障。在此场景下,系统将大模型的推理锚定于子图划分的知识库,提供高准确率诊断路径,其性能可超越具有两年经验的人类工程师。此外,在工业机器人[39]领域,大语言模型助力识别"嵌套实体",如机械臂中 特定重叠部件,使维护管理人员能够安排高度细粒度的维修,即便缺乏标注训练数据。这些示例展示了系统如何有效吸收并复用资深员工的专业隐性知识,使初级工程师能够执行专家级诊断,同时降低昂贵的生产停机风险。

6 研究缺口分析

本系统综述识别出大语言模型与知识图谱融合应用于工业故障诊断领域的若干研究空白。这些局限性凸显了当前系统在以下关键方面的不足:行业特定应用有限、多语言灵活性不足、知识抽取技术、评估方法及可解释性。弥补这些空白对于推进基于GraphRAG的故障诊断发展、确保其在多样化制造环境中的适用性,以及提升其准确率与可解释性至关重要。

6.1 应用场景(工业机械背景

多数入选的知识图谱-大语言模型故障诊断研究集中于钢铁制造、数控设备及旋转机械(表2)。近年来,特别是截至2025年,部分文献已涵盖盾构机与工业机器人等细分行业。然而,尚无研究涉及更为专业化的行业,如陶瓷或金刚石加工,这些行业具有独特的故障模式与制造工艺。因此,未来研究应考虑构建专门针对这些探索不足领域的GraphRAG框架。该框架应融合领域特定知识图谱与大语言模型,以改进对专业化机械故障的推理,从而在陶瓷与金刚石加工中实现准确且具备上下文感知能力的故障排查。

表 2  部分研究中故障诊断的工业应用          
         

此外,该领域的大多数研究仅孤立地分析单一机型。然而,在实际生产环境中,单个工厂通常在同一车间(有时甚至跨多个地点)运行多台设备。这需要一种单一策略,能够在无需独立GraphRAG(GraphRAG:Graph Retrieval-Augmented Generation,图检索增强生成)系统的前提下处理广泛的设备类型。一种潜在的解决方案是构建一个"主"知识图谱,为每台设备包含不同的子图(或子本体)。该方法在封装所有知识于单一图谱的同时,保持每台设备独特属性的清晰性,从而便于在工业配置变更时添加或移除设备。

6.2 数据集与语言

多数入选研究使用英文与中文数据集(表E.13),对非英文或多语言场景(如荷兰语)的研究甚少。因此,一个有趣的研究方向是将现有GraphRAG流程扩展至多语言或荷兰语特定嵌入(例如文献[55]的mBERT、文献[56]的XLM-R或文献[57]的gpt2s mall-dutch-embeddings)。亦可考虑自动翻译阶段,如将荷兰语日志转换为英文——若该语言更适用于当前知识抽取方法。此过程可使用DeepL或Google Translate等工具实现。然而,此类翻译需谨慎处理领域特定术语,以确保知识图谱中语义的正确性。

表E.13  选定研究数据集中使用的语言          
   

单语言与多语言方法之间的抉择取决于用户的特定运营与语言需求。尽管尚无文献明确讨论该决策过程,但以用户为中心的系统设计研究(如文献[58])表明,系统所采用语言的选择取决于终端用户的偏好及运营语境。若用户与专家以荷兰语交流且希望生成荷兰语回答,则多语言或基于荷兰语的流程可最小化数据损失。反之,若英语适用于内部运营,则将所有日志翻译为英语可能简化后续阶段(如实体抽取或检索)。无论何种情况,基于真实荷兰语故障诊断数据开发多语言模型可能带来更高的检索准确率与上下文相关性。这些语言决策最终由制造现场的首选运营模式(荷兰语 vs. 英语)及可靠的跨语言自然语言处理资源的可用性所决定。

6.3 知识提取

多数综述文献采用基于大语言模型或微调大语言模型的方法进行实体与关系抽取,通常针对英文或中文数据集优化。将这些方法直接应用于荷兰语文本,尤其是包含特殊工业术语的维护日志,可能需要额外适配。一种方法是在抽取前将非英文日志翻译为英文。另一种方案是采用荷兰语或多语言大语言模型嵌入,该方法在保留关键语言细微差别的同时消除潜在翻译问题。在标注领域示例上训练的微调荷兰语模型,对于抽取维护日志中的细微词汇可能尤为有益。

无论采用何种方法,工业机械的领域特定性——尤其是陶瓷或金刚石加工等细分领域的领域特定性——凸显了定制本体与人工标注在构建坚实知识库中的重要性。无论通过单语言还是双语框架,保持术语一致性对于避免最终知识图谱中的歧义及确保与实际维护问题的恰当对齐至关重要。

6.4 评估方法

尽管入选研究已涵盖多数评估技术,但额外评估技术如文献[59]的精确匹配(EM:Exact Match)、文献[60]的BERTScore及文献[61]的GPT-4平均排序可提供更深层次的洞察。EM计算与真实值完全匹配的预测比例,对于评估故障诊断中的结构化输出具有重要价值。BERTScore评估生成文本与参考文本之间的语义相似度,可用于评估大语言模型生成的故障解释。GPT-4平均排序将模型回复与人类评分排序进行比较,为评估故障诊断解释的连贯性与可靠性提供了一种方法。

在采用多语言大语言模型构建GraphRAG的场景下,研究人员尚未探究多语言情境的评估流程。文献[62]开发的某些评估方法值得深入研究。该框架包含一种名为跨语言自动评估的方法,用于检验多语言大语言模型。该方法利用名为Hercule的跨语言评估大语言模型,通过将多语言回复与现成可用的英文参考答案进行对比来评分。其采用一组新的多语言人工标注指令测试集,无需每种目标语言单独准备参考答案,即可实现完整的基准测试及与人类判断的对齐。

6.5 可解释性/可视化

入选文献均未涉及可解释性/可解释性问题。此外,多数系统缺乏推理链的交互式可视化界面,而该界面对于非专业用户理解答案背后的推理至关重要,在高风险场景中尤为重要。未来研究可能开发一种方法,通过使大语言模型自动以人类可读的说明引用检索所得子图或路径,从而弥合故障诊断中的解释鸿沟。这将使工程师与操作人员更好地理解故障诊断背后的推理。此外,采用基于图的故障传播路径等可视化方法可提升可解释性,并促进工业场景中更广泛的人机协作。这可能包括将生成的文本依据与小型子图截图相结合,使工程师能够快速理解推理流程。

此外,标准可解释人工智能(XAI:Explainable AI)方法如LIME与SHAP在此情境下亦值得探索。若干研究将LIME/SHAP的核心思想适配或扩展至图神经网络(GNN:Graph Neural Network)或基于图的任务,如文献[63]的GNNExplainer与文献[64]的GraphLIME。探索这些技术在GraphRAG应用中的价值具有重要意义。

6.6 未来研究方向

未来研究方向应转向基于智能体的抽取与推理。这涉及开发包含人类参与的自主循环,其中基于大语言模型的智能体不仅执行实体抽取或答案生成,而且由人类担任抽取与生成输出的验证者,以持续改进输出质量。此外,工业界对数据隐私与安全存在迫切需求,这要求从专有闭源模型向微调开源大语言模型过渡。这一转变确保敏感的维护日志与专有的机器规格参数留存于工厂防火墙之内,同时保持通用模型的高推理性能。

另一关键前沿在于跨模态数据与全生命周期知识管理的融合。未来框架应同时摄取实时传感器流、技术图纸及高频振动图谱,以提供超越纯文本的上下文感知抽取[33,65]。这推动了从孤立故障诊断向整体生命周期管理的重大转变,其中故障数据被反馈至"知识驱动工程设计"流程,以塑造下一代工业设备的创制。

7 结论

本系统综述聚焦于大语言模型与知识图谱融合以提升工业场景故障诊断潜力的研究。通过分析37篇文献,包括2025年发表的11篇重要峰值论文,本研究揭示了大语言模型与知识图谱融合用于故障诊断已从边缘实验概念发展为显著研究趋势。尽管当前研究在知识抽取、检索与推理方面取得进展,但重大空白仍未填补。现有研究主要集中于特定行业,如钢铁制造与数控设备,而对陶瓷或金刚石加工等其他高价值行业关注甚微。此外,多语言故障诊断,尤其是非英文及中文语言场景,尚处于探索不足状态,限制了现有方法在多样化工业环境中的适用性。

方法论层面,知识抽取策略显著依赖微调大语言模型进行实体与关系抽取,但将这些模型适配至领域特定语言仍存在挑战。类似地,评估方法主要依赖准确率、精确率、召回率及F1分数,但仍有空间引入更先进的评估技术,如精确匹配(EM:Exact Match)、BERTScore及跨语言大语言模型评估,以提供对模型性能与可解释性的更深层次洞察。此外,可解释性仍是重大难题,因多数系统未提供故障诊断的人类可读解释,致使工程师与操作人员难以接纳系统逻辑。

回答研究问题

另一项值得提及的高准确率知识生成技术来自文献[33]。其采用高度特定且复杂的编码器,即CRCGAT编码器中取得优异性能。该技术成功识别长因果链,产生良好的知识生成指标(故障诊断准确率87%,F1分数80%)。然而,该架构的复杂性导致高资源开销的权衡,因所提出的编码器模型需要更长的训练时间(每轮次7.6秒)及峰值GPU显存使用(11.2 GB),显著高于采用简单图注意力模型作为基线的情况。文献[7]亦展示了知识准确性的高分,其生成答案的 准确率达98.5%,该结果通过真实工业场景测试获得。然而,其未详细阐述答案正确性的测量方法,使得该技术如何产生如此高准确率尚待进一步论证。这些生成模型的技术配置与报告效率分数详见附录表F.14。

子研究问题1(挑战与缓解措施):

从综述文献来看,不同故障诊断方法面临不同挑战。基于模型与基于规则的故障诊断依赖人类经验,导致其难以扩展、有时不可靠且无法有效诊断未知缺陷。此外,其在推理与推断方面面临障碍,包括人工构建、复杂机器部件及规则定义不确定性。另一方面,数据驱动技术在数据质量与复杂性方面存在挑战,包括碎片化、知识稀疏性及噪声污染,这些因素可能影响故障诊断准确率。获取高质量故障数据成本高昂,且大规模监控系统难以集成。

采用知识图谱与本体的故障诊断需要人工知识抽取,存在语义不一致问题,且在知识有限情况下推理能力不足,阻碍其正确诊断故障的能力。然而,基于大语言模型的故障诊断存在幻觉与可解释性等局限,使其在工业应用中面临挑战。融合知识图谱与大语言模型可通过提供结构化实体以减少大语言模型的幻觉现象,并利用自然语言处理能力辅助准确抽取知识,从而弥合上述差距。

子研究问题2(异构数据源融合):

研究结果表明,研究人员采用多种流程以融合用于故障诊断的异构数据(例如维护日志、网络爬取数据及手册)。大语言模型可将非结构化文本(手册、日志)转换为实体-关系对,而知识图谱存储这些新抽取的知识。因此,维护良好的知识图谱成为"单一事实来源",使用户能够利用大语言模型就故障症状、设备类型及推荐措施等进行推理与交互。

子研究问题3(技术的准确性与效率):

知识抽取的准确性与效率:

综述表明,微调BERT系列模型取得最优抽取性能,最高指标达RoBERTa-wwm-bilstm-mha-crf [38]的F1分数98.76%及CFRTE模型[29]的F1分数98%。尽管这些基于Transformer的模型可准确抽取故障实体,其准确率高度依赖微调所需的领域特定标注数据集的大量成本,这在资源效率方面形成权衡。相反,提示工程作为一种替代方案,以更具资源效率的方式出现。虽然其产生的模糊F1分数较低,但可显著降低人工成本与数据标注成本[32]。

知识生成的准确性与效率:通过融合大语言模型与知识图谱进行故障诊断,知识生成的准确率显著提升,其通过结构化知识图谱为大语言模型推理提供锚定以缓解幻觉现象。文献[43]报告了92.3%的生成准确率与5.3%的低幻觉率,该结果通过融合多阶段检索与结构化推理路径实现。另一高性能架构来自文献[33],其包含真实世界测试场景,报告准确率达98.5%,并采用高度特定的CRCGAT编码器进行根本原因分析,取得87%的诊断得分。这些发现表明,通过知识图谱提供"单一事实来源"可防止大语言模型在信息缺失时猜测解决方案。然而,如此高的生成准确率需在资源效率方面进行权衡,如CRCGAT架构所示,其需要更长的训练时间(每轮次7.6秒)及大量GPU显存使用(11.2 GB)。这些因素可能对资源受限的真实工业场景部署构成挑战。

附录

附录A.收集过程中的数据及其定义

表A.9 从选定论文中提取的定性数据

           
表 A.10  所选论文的计量数据                
               

附录B.期刊和会议分发

表B.11总结了入选研究中期刊与会议论文的分布情况。统计数据显示期刊论文略多于会议论文(19篇 vs. 18篇),表明尽管面向故障诊断的GraphRAG仍是相对新兴的研究主题,但其正日益发展为高影响力、经同行评审的期刊文献。此外,入选研究涵盖广泛的学科领域,包括工程学、机器人学、信息技术、控制系统、信号处理、自动化及工业信息学。这一广泛分布意味着GraphRAG在众多工业与技术领域具有实用价值,并非仅为人工智能或信息技术相关概念。来自多元背景的研究人员参与其中,彰显了该领域强劲的跨学科协作态势。

表 B.11  期刊和会议分布            
           

此外,若干研究发表于知名IEEE Transactions期刊,包括《IEEE仪器与测量汇刊》[26]、《IEEE工业信息学汇刊》[7]及《IEEE可靠性汇刊》[19]。值得注意的是,近期2025年的新增文献凸显了《先进工程信息学》作为该研究的关键期刊,为最终入选增添数篇重要论文。这强化了这些出版物在面向故障诊断的GraphRAG研究中的地位,使其成为该领域学者的重要资源。此外,若干研究在具有行业聚焦的会议上发表,如全球可靠性与故障预测与健康管理(PHM:Prognostics and Health Management)会议、IEEE自动化科学与工程国际会议(CASE:IEEE International Conference on Automation Science and Engineering)、IEEE新兴技术与工厂自动化国际会议(ETFA:IEEE International Conference on Emerging Technologies and Factory Automation),以及近期2025年的ICBASE和ICETIS等会议。这表明GraphRAG对于制造与工程领域真实故障诊断具有重要意义,因这些会议凸显了工业应用价值。

附录C.所选研究的时间分布

图C.4展示了37篇入选研究的时间分布及主题类别,凸显了研究主题随时间的演进。早期研究(2017-2019年)主要聚焦于基于本体的故障诊断,其利用结构化知识表示与基于规则的推理辅助故障诊断。向基于知识图谱技术的过渡始于2020年前后,反映了利用图结构更动态地描述故障的研究兴趣日益增长。图数据库技术(如Neo4j)的进步以及工业图结构数据可获取性的提升可能是这一转变的主要驱动力。尽管本体为知识图谱中的数据提供模式,知识图谱却使得领域特定信息的编码与检索能够以更具适应性和可扩展性的方式实现。

           

图 C.4 所选文献的时间分布(2017-2025),按研究重点分类。

大语言模型在故障诊断中的融合出现于2021年之后,研究自2023年起显著增长。其原因在于大语言模型能力的近期进展,包括BERT[66]及OpenAI的GPT模型,这些模型在知识抽取与自然语言理解方面展现出优异性能。尤为值得注意的是,面向工业故障诊断的融合知识图谱与大语言模型解决方案(GraphRAG:Graph Retrieval-Augmented Generation)研究于2024年快速增长,并于2025年达到峰值(11篇论文),构成本综述中单一年份最大规模的论文群。这一趋势表明知识图谱与大语言模型在故障诊断领域的强劲融合。多数出版物集中于2023年与2025年发表的事实表明,基于GraphRAG的故障诊断是一个新兴但快速增长的研究领域,使其成为学术界与工业界共同关注的重要方向。

附录D.关键词分布

图D.5词云中的关键词分布识别了基于GraphRAG的故障诊断研究中的主要主题。"知识图谱"与"故障诊断"作为最常用的术语,表明该主题主要聚焦于结构化知识表示与诊断推理。此外,"设备"、"压缩机"及"机床"等指代工业机械的词汇暗示了其在制造业中的强应用导向。值得关注的是,"大语言模型"虽存在但相对较小,表明相较于传统基于知识图谱的方法,其在故障诊断研究中的应用更为新近。这一动态特征意味着尽管大语言模型日益普及,但其在工业故障诊断中的应用仍处于初级阶段,未来可能需要更多研究。

             

图 D.5 所选研究中关键词频率的词云

附录E.数据集和语言

表E.12 选定研究中使用的数据集              
           
表E.13  选定研究数据集中使用的语言            
         

附录F.知识提取与生成及其指标得分

表F.14 知识提取和知识生成方法及其报告指标的比较

编辑:赵栓栓

校核:李正平、陈凯歌曹希铭、赵学功、白亮、任超、海洋、陈宇航、Kira、Tina、王金、赵诚、肖鑫鑫、张优

该文资料搜集自网络,仅用作学术分享,不做商业用途,若侵权,后台联系小编进行删除



来源:故障诊断与python学习
ACTSystemMarc振动旋转机械通用航空ANSAUG海洋理论电机化机机器人知识工程数字孪生控制工厂人工智能数控
著作权归作者所有,欢迎分享,未经许可,不得转载
首次发布时间:2026-05-21
最近编辑:3月前
故障诊断与python学习
硕士 签名征集中
获赞 87粉丝 152文章 327课程 0
点赞
收藏
作者推荐

GADF驱动的KAN-Swin Transformer双分支网络用于航空轴承故障诊断

针对航空轴承诊断中微弱故障特征淹没和极端工况变化的关键挑战,本研究提出了一种GADF驱动的KAN-Swin Transformer双分支网络用于航空轴承故障诊断,供大家参考学习。论文基本信息论文题目:Beyond CNN or Transformer Alone: A GADF-powered Dual-branch Network with KAN-Swin Transformer for Fault Diagnosis of Aerospace Bearing论文期刊:IEEE Transactions on Automation Science and Engineering (T-ASE)论文日期:2025论文链接:10.1109/TASE.2025.3640120作者:Liubing Hu[a], Jinghong Tian[a], Zhilin Dong[a], Lingli Cui (Member, IEEE)[b], and Chengri Lang[a]机构:a:School of Engineering, Zhejiang Normal University, Jinhua 321004 China.b:Key Laboratory of Advanced Manufacturing Technology, Beijing University of Technology, Beijing, 100124, China . 作者简介:田景红,浙江师范大学副教授,硕士生导师,主要从事智能制造、工业互联网、供应链管理相关的教学与研究工作。熟悉数字化工厂相关运营管理理论、数字化智能化相关解决方案,有完整的信息化项目分析、设计、开发及实施经验。目前主持浙江省重点研发计划项目1项,完成横向项目十余项,发表论文二十余篇。董治麟,现为浙江师范大学装备状态监测与智能维护技术研究所核心成员,硕士生导师,中共党员,中国计算机学会会员,中国振动工程学会会员,中国自动化学会制造自动化专业委员会会员,英国皇家物理学会会员,Robot Learning期刊青年编委,2025年中国振动工程学会动态信号分析学术会议大会主题报告人,永康市土丁五金制品股份有限公司科技副总,第四届“成泰共好”奖教金获得者,2025年留学基金委青年骨干教师出国研修项目获得者。学术研究方面,主持/参与项目共计12项,发表论文共计32篇,其中第一或者通讯作者发表26篇,ESI高被引论文4篇,总被引次数600余次;授权国际发明专利6项,国内发明专利5项,国内实用新型专利20余项,计算机软件著作权5项。积极投入科研活动,先后成为40余家期刊审稿人,被IOP出版社授予“IOP Trusted Reviewer Status”荣誉。研究方向:结构设计与运动仿真,机理建模与运动控制,信号分解与时频分析,健康特征指标构建,度量学习与深度学习,异常检测与系统辨识,状态监测与故障诊断,状态估计与寿命预测,可靠性设计与安全评估。胡刘兵,浙江师范大学工学院机械工程在读研究生,研究方向为故障诊断和计算机视觉,聚焦深度学习在工业运维中的应用。目录摘要1 引言2 基础理论 2.1 格拉姆角差场 2.2 CNN-Swin Transformer 2.3 全局注意力机制3 所提方法 3.1 所开发的KAN-Swin Transformer模块 3.2 基于KAN-Swin Transformer的双分支网络 3.3 航空轴承故障诊断流程图4 实验验证与对比分析 4.1 数据集描述 4.2 所提方法的实验结果 4.3 模型性能评估指标 4.4 消融实验 4.5 KAN模块超参数敏感性分析 4.6 双分支特征互补性的定量分析 4.7 与其他先进方法的对比分析 4.8 计算效率分析 4.9 噪声条件下的鲁棒性分析 4.10 不平衡数据集性能评估 4.11 跨域泛化分析5 结论摘要针对航空轴承诊断中微弱故障特征淹没和极端工况变化的关键挑战,本研究提出了一种GADF驱动的KAN-Swin Transformer双分支网络用于航空轴承故障诊断。首先,通过格拉姆角差场(GADF)将一维振动信号编码为二维时频图像,利用极坐标映射保留时间依赖关系和频谱动态特性,同时解决了传统时频分析方法对噪声敏感的限制。随后,通过用B样条基函数替代传统多层感知机,开发了KAN-Swin Transformer模块,通过动态网格调整策略增强非线性映射能力,在降低参数复杂度的同时有效提升了对瞬态冲击和周期性模式的建模能力。此外,提出了一种双分支并行架构:KAN-Swin Transformer分支通过分层窗口注意力机制提取局部结构特征,而CNN-GAM分支通过多尺度卷积与通道-空间注意力融合增强全局纹理感知。最后,结合跨模态特征拼接与自适应池化实现全局-局部特征的协同优化,显著增强了复杂噪声环境下故障模式的可区分性。所开发的方法在两个不同的航空轴承数据集上进行了测试,分类精度达到了100%。同时,通过消融实验验证了包括KAN、Swin Transformer和CNN-GAM在内的模块集成的协同效应,显示出相比基线模型在跨转速工况识别率方面的提升,并确认了该框架对噪声和变载荷条件的鲁棒性。通过协同集成机制融合与注意力架构,所提出的框架为航空轴承智能健康监测提供了可靠解决方案,在轻量化边缘部署和跨域迁移学习方面具有潜在应用价值。关键词:KAN,故障诊断,Swin Transformer,GAM,航空轴承1 引言随着智能制造的不断发展,设备健康管理作为核心组成部分受到了广泛关注,特别是在航空航天领域。轴承作为传动系统的关键部件,在确保设备正常运行方面发挥着至关重要的作用。航空轴承在高速旋转和复杂载荷条件下运行,其故障不仅可能导致设备停机,还可能引发安全事故。因此,这些轴承的健康状况对机械的安全正常运行至关重要。然而,由于其内部结构的复杂性和外部干扰,航空轴承的健康状态诊断是一项巨大挑战。因此,提高复杂环境下故障诊断精度已成为紧迫的研究挑战,吸引了众多研究者关注此问题。近年来,出现了各种传统故障诊断方法,主要依赖于时域、频域和时频域信号处理技术。然而,在实际工程应用中,这些方法的诊断效果往往受噪声干扰和工况变化的限制。为解决这些局限性,基于深度学习的方法逐渐成为研究热点。深度学习模型,如卷积神经网络(CNN)、生成对抗网络(GAN)和Transformer,在图像特征提取和故障模式识别方面展现出强大能力。例如,Zhang等人提出了基于深度卷积神经网络的故障诊断方法,显著提高了旋转机械故障的识别精度和抗噪性。Guo等人通过将迁移学习与深度CNN相结合实现了跨域故障诊断。Wang和Li利用GAN进行故障样本增强和特征提取,以解决小样本学习挑战。此外,Chen将改进的时频分析方法与CNN相结合,实现了滚动轴承故障的精细化诊断。Transformer和注意力机制也成为提高故障诊断精度的重要工具。Fu等人提出了具有分层窗口设计和窗口移位策略的Swin Transformer,展示了其在图像分类和故障诊断中的优异性能。Wu等人综述了深度学习在机械故障诊断中的应用,讨论了注意力机制在提取关键故障特征方面的优势。此外,许多研究还将传统信号处理方法与深度学习模型相结合,如使用小波变换或经验模态分解进行预处理,然后将数据输入CNN或其他深度模型进行故障诊断。然而,它们往往面临单通道信号信息不足的问题。针对此问题,一些研究采用格拉姆角差场(GADF)或递归图等技术将时间序列数据转换为图像,然后通过CNN进行特征提取。此外,多传感器数据融合技术增强了复杂工况下的诊断鲁棒性。为克服传统局部特征提取模型的局限性,研究者引入全局注意力机制以全面捕获信号中的隐式全局信息。同时,为更有效地捕获信号中的潜在时空特征,研究者探索通过GADF等成像方法将一维振动信号转换为二维图像,结合视觉Transformer模型(如Swin Transformer)进行特征提取,实现对复杂故障模式的准确诊断。在航空应用中,该方法对提高轴承故障诊断精度具有重要意义。除基于Transformer的模型外,还提出了一系列其他先进的数据驱动方法以应对日益复杂的工业诊断任务。例如,胶囊网络因其能够对特征的层次和空间关系进行建模而受到关注。为增强模型在不同工况下的泛化能力,研究者提出了深度对抗胶囊网络(DACN),引入对抗训练机制学习域不变特征,在跨域诊断任务中表现出色。此外,传感器感知胶囊网络(SACN)专注于融合多传感器数据进行剩余使用寿命(RUL)预测,通过胶囊dropout进行不确定性量化,实现对预测和不确定性的可解释归因,从而增强预后系统的鲁棒性和可信度。另一方面,多尺度网络成为从复杂振动信号中提取更丰富故障信息的研究热点。例如,多尺度跨通道注意力网络利用不同尺寸的并行卷积核捕获各种频率和时间尺度的特征,结合注意力机制放大关键特征的权重,有效提高了微弱故障的识别能力。类似地,级联多感受野学习网络(DC-CMLN)等新架构引入了结构化方法,集成级联多感受野学习模块、多尺度特征聚合和自适应滤波,分层提取多级和多感受野特征。该设计使模型能够逐步细化特征表示,增强其在非平稳工况下辨别细微故障特征的能力。为进一步推进该领域发展,研究者探索了专门架构以应对轴承故障诊断中固有的特定挑战。例如,Chen等人提出了一种抗噪模型,集成多尺度空间-通道重构卷积(ScConv)与混合注意力机制和四元数Transformer,通过在四元数域处理信号,展示了增强的特征提取和抗噪能力。同时,针对最优网络设计的挑战,另一项研究引入了层次灰狼优化器(HGWO)自动调整灵活残差神经网络的结构,利用并行注意力模块改进噪声和变载荷条件下的特征选择。类似地,为克服在不同工况或机器间迁移模型时遇到的显著域偏移问题,开发了三重域对抗神经网络。该方法利用三重分类器和自适应反向传播系数对齐源域和目标域的边缘分布和条件分布,从而提高模型的可迁移性和泛化能力。这些研究凸显了增强抗噪性、自动化架构设计和提高跨域适应性的关键趋势。然而,尽管这些方法在一定程度上提高了故障诊断的精度和鲁棒性,但它们在航空轴承中的应用仍面临若干挑战。首先,许多现有模型在噪声干扰和变工况下缺乏有效的特征表示能力,导致故障特征不明显或难以区分,从而影响诊断精度。同时,虽然CNN和Transformer等方法已应用于该问题,但它们在复杂环境中的性能仍然有限。其次,现有局部特征提取模型在捕获信号内全局结构依赖关系方面不足,阻碍了对隐式信息的全面理解。为克服这些局限性,本研究提出了一种GADF驱动的KAN-Swin Transformer双分支网络用于航空轴承故障诊断,以进一步提高多工况和高噪声环境下航空轴承中不明显的故障特征。该方法在以下方面具有独特优势:a) KAN模块与Swin Transformer模块(KAN-Swin Transformer)相结合,增强模型捕获关键信息的能力,克服传统局部信息提取的不足;b) 采用GADF方法将一维振动信号转换为二维图像,使KAN-Swin Transformer模型能够全面发挥其在多尺度特征提取方面的优势;c) 将全局注意力机制纳入KAN-Swin Transformer框架,进一步提高模型在复杂工况下捕获全局特征的能力,从而增强诊断鲁棒性。本文内容组织如下:第2节详细阐述GADF、CNN-Swin Transformer和GAM的理论基础;第3节介绍所提出的基于GADF驱动的KAN-Swin Transformer双分支网络故障诊断模型;第4节通过两个实验数据集上的诊断精度评估验证所提方法的有效性;第5节给出结论与展望。2 基础理论本节主要介绍GADF、CNN-Swin Transformer和GAM的理论基础,分别为智能诊断提供时频图信息提取、局部信息特征分层提取和全局特征提取的基础支持。2.1 格拉姆角差场将一维振动信号转换为同时包含时间和频率信息的二维时频图像,能够更全面地表示信号特征,揭示频率成分随时间的动态变化。格拉姆角场(GAF)是一种有效实现一维信号转换为二维数据矩阵的算法,它集成坐标变换和格拉姆矩阵,便于一维数据向二维数据的转换。该技术允许提取反映时域和频域动态变化的特征,同时保留信号的时间依赖性,从而有效捕获一维数据中固有的特征信息。GAF包含两种变体:GADF(格拉姆角差场)和GASF(格拉姆角和场)。其中,GADF相比GASF展现出更优的分类性能。因此,本研究采用GADF方法进行图像编码转换。GADF的实现过程如下:根据公式(1),将一维数据序列X中的值缩放到[-1,1]或[0,1]范围:转换为极坐标时,归一化数据序列由公式(2)描述:其中, 表示在极坐标中映射的角度,表示数据点的时间戳编码,N 是调节极坐标径向范围的常数因子,是从时间戳映射的半径。通过公式(3)中的角差公式,分析不同时间间隔的时间相关性,最终生成结果图像。该过程的可视化演示如图1所示。振动信号本质上是一维时间序列数据。因此,直接使用视觉模型(如CNN或Transformer)提取时空特征存在挑战。为解决此问题,广泛采用信号成像方法(如GADF)将一维信号转换为二维图像,同时保留信号的动态时间特性和频率特征。生成的GADF矩阵构成编码原始信号时间相关性和动态频率变化的二维图像。与传统时频方法(如频谱图或小波变换)相比,GADF保留全局结构信息并降低对噪声的敏感性,使其更适合基于深度学习的特征提取。图1 不同条件下轴承振动信号的GADF变换:(a)健康状态(周期性均匀性);(b)轻微内环故障(局部畸变);(c)严重内环故障(非线性模式);(d)外环故障(谐波集群)。2.2 CNN-Swin TransformerSwin Transformer是一种分层视觉Transformer,通过引入基于窗口移位的自注意力机制,在计算效率和全局特征建模能力之间取得平衡。与标准Transformer中的全局注意力计算不同,Swin Transformer将输入图像划分为不重叠的窗口(如4×4图像块),并在每个窗口内执行自注意力计算。为实现跨窗口信息交互,采用"窗口移位"策略在不同层次间交替使用常规窗口和移位窗口配置。对于故障诊断任务,Swin Transformer与CNN(CNN-ST)相结合,同时利用局部归纳偏置和全局上下文建模能力。输入的GADF图像首先通过卷积层提取低级特征(如边缘和纹理),随后Swin Transformer模块通过多头自注意力和窗口移位操作逐步捕获分层特征。这种混合架构集成了CNN的空间敏感性和Transformer的长程依赖建模能力,增强了复杂故障模式下的判别特征学习。a) 整体结构Transformer架构最初为自然语言处理(NLP)中的序列建模而开发,在各类NLP基准测试中展现出突破性性能。基于此成功,Dosovitskiy等人率先将Transformer原理应用于计算机视觉,提出了视觉Transformer(ViT),通过将图像块作为序列token处理,在ImageNet分类上取得了竞争性性能。然而,全局自注意力机制固有的二次计算复杂性对高分辨率视觉数据的可扩展性构成挑战。为缓解这一计算约束同时保留全局建模能力,Liu等人提出了Swin Transformer,引入了两项主要技术创新。首先,Swin Transformer融入了受卷积神经网络(CNN)启发的分层多尺度架构,建立了金字塔形特征表示结构。该设计用局部窗口注意力替代全局自注意力,自注意力操作被限制在不重叠的局部窗口(如7×7块)内。窗口策略可降低计算复杂度,实现对百万像素级图像的高效处理。其次,为促进跨窗口特征交互而不牺牲计算效率,架构在连续Transformer块之间实现了移位窗口分区方法。该机制通过连续的降采样阶段系统地扩展网络的有效感受野,逐步将局部特征集成到全局上下文中。Swin Transformer是一种通用主干网络,其分层设计与CNN相似,包含四个阶段。图2展示了Swin Transformer网络的整体框架。如图2所示,输入图像首先通过块分区划分为不重叠的块,随后进行线性嵌入以调整通道数。除阶段1外,每个后续阶段采用块合并降低特征图分辨率,其中2×2相邻块在第一个块合并层中拼接。各阶段的输出分辨率分别为H/4×W/4、H/8×W/8、H/16×W/16和H/32×W/32,特征图分辨率与典型CNN相同。因此,该架构使现有方法中的主干网络能够被重新用于各种视觉任务。图2 Swin transformer结构b) Swin Transformer块为实现有效建模,最初的改进之一是将图像划分为不重叠窗口(基于窗口的多头自注意力,W-MSA),并在局部窗口内计算自注意力以实现线性计算复杂度。虽然该方法降低了计算复杂度,但缺乏不同窗口之间的连接。为解决此局限性,引入移位窗口分区(SW-MSA)。通过应用移位窗口分区策略,可以建立非重叠窗口之间的关系,并显著扩展感受野。Swin Transformer块的具体框图如图3所示。通过使用图3所示的移位窗口划分方法,两个连续的Swin Transformer块的计算如公式(4):其中,和分别表示块中(S)W-MSA模块和MLP模块的特征输出。W-MSA和SW-MSA分别是常规层和滑动窗口多头自注意力层。在计算自注意力时,Swin Transformer为每个头引入相对位置偏置,如公式(5)所示。其中, 、和分别对应查询矩阵、键矩阵和值矩阵。参数表示查询向量的维度,表示可学习的相对位置偏置矩阵。图3 Swin Transformer模块2.3 全局注意力机制卷积神经网络(CNN)以其局部连接和权重共享机制为特征,已成为计算机视觉的基础架构,在特征提取和分层表示学习方面表现出色。注意力机制与CNN的集成通过自适应特征重新校准进一步增强了其判别能力。虽然大量实证证据证实了注意力增强CNN在图像分类基准测试中的有效性,但现有实现仍存在关键局限性。早期的通道注意力框架如SENet采用全局平均池化生成通道统计信息,但面临两个主要约束:(1)由于空间压缩过于简化,对任务无关特征的抑制不足;(2)计算开销随空间分辨率二次增长。后续改进如CBAM通过顺序的通道-空间压缩引入双注意力路径。然而,这种串行处理造成信息瓶颈,根据理论分析损失了38%的跨维度相关性。并行架构如BAM试图通过独立注意力分支解决此问题,但忽视了通道和空间域之间的固有几何关系,导致参数效率次优。然而,GAM模型增强了空间和通道维度之间的交互,能够跨三个维度捕获关键特征信息。图4展示了GAM模块的结构。 图4 GAM模块结构图GAM旨在通过集成通道注意力和空间注意力子模块的双分支架构优化神经网络性能。通道注意力分支采用参数高效的多层感知机(MLP),具有顺序的压缩-扩展层,其中通过线性投影进行维度降低,结合非线性激活(ReLU)建立通道间依赖关系。这种分层变换通过放大语义显著通道同时抑制冗余信息,实现判别性特征重新校准。互补地,空间注意力子模块利用包含两个7×7卷积层(穿插批归一化)的卷积范式。该配置通过局部感受野处理系统建模特征图上的位置关系,从而增强对关键空间模式的敏感性。两个子模块通过残差连接保持与输入张量的维度一致性,确保联合优化期间稳定的梯度传播。双注意力组件的协同操作通过顺序的通道-空间重新校准实现全面特征细化。具体而言,通道加权优先处理判别性特征图,随后的空间掩码强调激活通道内的任务相关区域。这种分层注意力传播建立跨维度特征相互依赖性,有效将全局上下文线索聚合到紧凑的注意力图中。注意力机制通过强调关键特征和抑制无关信息显著改善模型性能。GAM进一步集成通道注意力模块和空间注意力模块:通道注意力:对于特征图,通道注意力权重通过全局平均池化(GAP)和多层感知机(MLP)计算,计算过程如公式(6):其中,σ 表示Sigmoid函数,GAP表示全局平均池化。空间注意力:空间注意力权重通过通道池化特征拼接和卷积层生成,如公式(7):最终输出特征通过输入特征与注意力权重的逐元素相乘获得,计算过程如公式(8):GAM使模型能够自适应地关注信息丰富的通道和显著的空间区域,增强噪声和变工况下的鲁棒性。3 所提方法在本节中,提出基于KAN模块的改进Swin Transformer(KAN-Swin Transformer),以在通过GADF进行时频信息特征提取的基础上增强故障诊断性能。随后,通过集成GADF和GAM引入新颖的模型框架。最后,提出基于GADF驱动的KAN-Swin Transformer双分支网络的航空轴承故障智能监测方法。3.1 所开发的KAN-Swin Transformer模块传统Swin Transformer模型通过基于窗口的多头自注意力(W-MSA)和移位窗口机制实现图像特征的全局建模。然而,其多层感知机(MLP)模块仍存在两个关键问题:a) MLP的全连接结构导致参数数量随特征维度二次增长,在训练数据有限时容易过拟合;b) 固定激活函数的线性组合限制了模型的非线性表示能力。为解决这些局限性,本节基于Kolmogorov-Arnold定理提出改进的KAN-Swin Transformer模块。通过用可学习的B样条基函数替代传统MLP,构建了更具表达力的非线性映射结构。根据Kolmogorov-Arnold定理,任何多元连续函数可分解为有限个一元函数的嵌套叠加,该定理可由公式(9)表示:其中,表示外层函数,表示内层一元函数。受此启发,Liu等人提出将基函数参数化为B样条曲线,如公式(10):其中,是基本样条函数,是可训练系数。通过将函数分解过程显式建模为神经网络层,形成Kolmogorov-Arnold网络(KAN)。在KAN中,每层定义为,p 和q 的值由层的输入和输出维度确定。KAN的结构如图5所示。在图5中,有n 个输入特征。输入层首先将这些特征引入隐藏层。对于每个输入,通过m 个内函数映射:,其中,m 是隐藏层节点数。隐藏层通过对输入特征应用样条函数生成中间表示,然后传递到输出层。隐藏层输出通过外函数组合产生最终输出:,其中,和通常采用样条函数。图5 KAN网络结构图图6 KAN-Swin Transformer模块结构图在标准Swin Transformer块中,MLP模块负责对自注意力输出的特征进行非线性变换。然而,所提出的KAN-Swin Transformer模块将其替换为KAN结构。在标准Swin Transformer块的基础上,KAN-Swin Transformer模块通过引入Kolmogorov-Arnold网络(KAN)重构前馈层,形成双残差级联结构,如图6所示。其数学表述可分为两个特征变换阶段:窗口自注意力变换:保留原始窗口自注意力机制。输出特征通过LayerNorm归一化后输入KAN层,该过程由公式(11)表示:其中,表示基于窗口的多头自注意力,表示LayerNorm操作,是输入特征(B 为批量大小,为空间位置数,d 为特征维度)。KAN前馈变换:该过程由公式(12)表示,其中传统MLP被替换为两阶段KAN结构:其中,KAN(⋅) 表示改进的Kolmogorov-Arnold网络层。对于输入,单个KAN层输出的第个元素由公式(13)计算:其中,是连接第个输入到第个输出的边上可学习的激活函数。该函数分解为B样条分量和基函数分量,如公式(14)定义:其中,是输入张量的第个元素。是阶数为的第个B样条基函数,定义在个节点的网格上。是可学习的B样条系数,这些系数的集 合形成张量 。是固定的基激活函数(如SiLU)。是基函数的可学习权重,这些权重的集 合形成矩阵。所提出的KAN模块由两个这样的KAN层堆叠而成,整体输出由公式(15)表示:窗口自注意力输出通过跳跃连接与输入相加以保留原始特征信息。KAN层输出与相加形成级联残差结构。窗口自注意力捕获空间局部相关性,而KAN层通过基函数组合建模全局频域特征以实现互补效果。与原始Swin Transformer相比,双残差结构有效增强梯度传播,缓解深层网络的退化问题。在KAN网络中,引入动态网格调整策略以基于输入特征分布优化样条节点,计算过程如公式(16):其中,表示均匀网格,表示基于特征分位数计算的自适应网格,是混合系数。结合动态网格更新机制,残差连接结构确保有效的梯度反向传播,缓解深度网络训练中的梯度消失问题。与传统MLP的参数复杂度相比,KAN通过局部化B样条基函数将参数复杂度降低至。与标准Swin Transformer中MLP块使用的4倍维度扩展策略以增强线性可分性不同,本研究中的KAN模块采用(800→64→800)的瓶颈架构。该设计的基本原理是,KAN的非线性表达能力主要源于其边上可学习的B样条激活函数,而非高维投影。每个B样条函数本身是一个强大的非线性逼近器。因此,瓶颈结构在显著降低参数数量的同时,迫使网络学习更紧凑且信息丰富的中间表示,从而在不牺牲性能的情况下提高参数效率。此外,为解决训练过程中激活分布的动态性问题,采用动态网格调整策略。B样条函数定义在有界域上,固定网格可能无法覆盖激活的演化范围。如公式(16)所示,该策略基于输入特征的分位数自适应更新网格节点,确保B样条在数据最密集区域进行细粒度建模。混合系数α 用于平滑此更新过程,增强训练稳定性。3.2 基于KAN-Swin Transformer的双分支网络所提出模型的整体架构如图7所示,包括GADF预处理模块和KAN-Swin Transformer与CNN-GAM的双分支网络。GADF通过格拉姆角差场将一维振动信号转换为二维时频图像,以捕获信号的周期性和瞬态冲击特性。KAN-Swin Transformer与GAM模型采用双分支并行架构,其中KAN-Swin Transformer分支通过分层窗口注意力提取局部纹理特征,而CNN-GAM分支通过多尺度卷积和全局注意力机制增强空间表示能力。因此,两个分支的特征经过跨模态融合以实现高精度的故障分类。完整模型结构如图7所示,各层的详细参数配置见表1。 图7 带有KAN-Swin Transformer的双分支网络结构表1 所提模型各层参数a) 时频特征编码GADF模块通过格拉姆角差场将一维振动信号转换为二维时频图像。对于采样信号,GADF通过极坐标映射构建格拉姆矩阵,生成224×224尺寸的RGB图像。该过程将信号的时间依赖性计算转换为空间纹理特征,其中图像对角线表征时间序列的自相关,非对角元素用于表示跨时间步的相位关系,有效保留了信号的联合时频特性。b) 双分支特征提取模型采用双分支并行架构进行多尺度特征提取:(1) KAN-Swin Transformer作为主干网络:KAN-Swin Transformer的窗口注意力机制通过7×7局部窗口内的4头注意力计算空间相关性。同时,采用三阶B样条基函数,节点位置根据特征分布动态调整以实现动态KAN层。核心创新在于用KAN模块替代传统MLP层,通过自适应网格调整增强非线性拟合能力。(2) CNN-GAM分支:构建深度卷积网络,每层集成GAM模块。该模块采用双注意力机制:通道注意力通过全连接层学习通道权重,空间注意力通过7×7卷积核(空间金字塔池化)生成空间掩码,最终实现双重特征增强。c) 多模态特征融合来自KAN-Swin Transformer的局部特征和来自CNN-GAM的全局特征通过通道拼接融合为联合特征。自适应平均池化压缩空间维度同时保留最具判别性的通道响应。最终故障状态分类通过全连接层实现,采用交叉熵损失作为损失函数。该设计集成了KAN-Swin Transformer的长程依赖建模能力与CNN的局部特征提取优势,通过注意力驱动的特征增强提高复杂工况下的分类鲁棒性。3.3 航空轴承故障诊断流程图在上述部分,详细介绍了所提模型的理论。本节将所提方法应用于航空轴承故障诊断。基于所提模型的诊断流程图如图8所示,主要步骤如下:步骤1:信号采集与GADF图像生成通过通道传感器采集不同健康状态下轴承的振动信号。将原始时间序列数据分窗构建训练集和测试集。每个信号窗口通过GADF方法转换为二维图像,通过极坐标变换保留时间相关性特征。生成的GADF图像(尺寸224×224)进行归一化并以RGB格式存储为数据集,随后按7:2:1的比例划分为训练集、验证集和测试集。图8 航空轴承故障诊断流程图步骤2:混合特征提取与所提模型训练将训练样本的GADF图像输入KAN-Swin Transformer和GAM架构进行拼接特征学习。模型通过双分支并行路径处理样本:KAN-Swin Transformer分支:在此过程中,通过移位窗口自注意力机制捕获局部空间依赖性,4×4不重叠图像块由分层结构处理,传统MLP被替换为KAN进行分类,使用动态B样条网格优化非线性特征映射,共同生成多尺度特征。CNN-GAM分支:通过堆叠Conv2D、ReLU和GAM注意力层的CNN主干网络提取全局纹理特征,其中GAM机制通过拼接通道注意力和空间注意力增强可区分特征。来自KAN-Swin Transformer分支的分层特征和来自CNN-GAM分支的高维全局特征通过通道拼接和自适应平均池化进行跨模态融合。步骤3:故障诊断与验证将测试样本的GADF图像输入训练好的模型进行健康状态识别。结合KAN-Swin Transformer的结构感知能力和CNN-GAM分支的纹理敏感性,KAN-Swin Transformer与GAM框架通过多级特征融合机制实现故障特征的协同提取。4 实验验证与对比分析在本节中,使用两个数据集验证所提方法的有效性。后续小节简要介绍每个数据集。所有实验在单台设备上进行,详细硬件规格列于表2。训练集、验证集和测试集按7:2:1划分。使用AdamW优化器,固定学习率3×10−4 ,交叉熵损失,批量大小32,训练100个epoch。所有实验在固定随机种子下运行以保证确定性和可重复性。表2 实验设备参数信息4.1 数据集描述1) 数据集A:哈尔滨工业大学航空轴承数据集哈尔滨工业大学航空轴承试验台如图9所示。该试验台主要由三部分组成:电机驱动系统、改装航空发动机和润滑系统。轴间轴承测试装置如图9(A)所示。在改装航空发动机中,拆除了原航空发动机原型机的转子叶片、燃烧室和部分辅助机匣,保留其核心部件——双转子结构,如图9(B)所示,包括低压(LP)压气机、高压(HP)压气机、低压涡轮和高压涡轮。双转子结构的关键部件包括机匣、轴间轴承和五个支承轴承。轴间轴承如图9(C)所示。如图9(B)所示,在轴间轴承中引入了三种人工故障。传感器1和2采集位移数据,传感器3、4、5和6采集加速度数据,如图9(A)所示。所有传感器以25,000Hz的采样频率工作。加速度计安装在航空发动机机匣上,因此故障特征在传递过程中发生畸变,连接结构的碰撞噪声也混入信号中。与传统轴承试验台数据相比,采集的振动信号更为复杂,对有效提取和识别故障特征构成挑战。此外,低压压气机(1000–5000r/min)和高压压气机(1200–6000r/min)的不同运行转速进一步增加了轴间轴承故障诊断的难度。 图9 航空发动机轴间轴承试验台该轴承数据集包含三种故障状态和一种健康状态。轴承状态分别为:(A1)正常;(A2)外圈故障,尺寸0.5mm×0.5mm;(A3)轻微内圈故障,尺寸0.5mm×0.5mm;(A4)严重内圈故障,尺寸0.5mm×0.1mm。对于每种运行状态,从加速度计数据中选取2,500个不重叠样本构成数据集。每个样本以2,048个采样点进行分段。每个状态的样本按7:2:1划分为训练集、验证集和测试集。详情汇总于表3。表3 哈尔滨工业大学数据集故障类型和数据划分2) 数据集B:都灵理工大学航空发动机轴承数据集都灵理工大学轴承试验台概览如图10所示。该试验台主要由高速主轴和由主轴驱动的副轴组成,如图10(A)所示。主轴轴承固定在高刚性单支撑上,安装在大型钢底板上。实验数据通过位于图10(B)中A1和A2点的三轴加速度计采集,测量轴承支承和主轴三个空间方向的加速度。具体而言,从故障轴承B1的支承和轴承B2的支承采集加速度数据。加速度计为三轴IEPE型,频率范围1–12,000Hz(幅度±5%,相位±10°),标称谐振频率55kHz,标称灵敏度1mV/ms⁻²。实验中使用的滚子轴承如图10(C)所示。B1和B3位置滚子轴承的外圈由相同的轴承座支承,内圈连接到设计转速高达35,000rpm的短空心轴上。本研究实验在51.2kHz采样频率和100Hz轴速(6,000rpm)无载荷条件下采集数据。数据集包含三种健康状态:内圈故障、滚子故障和正常。内圈故障和滚子故障各进一步细分为三个严重等级,共七种状态。每种故障类型包含六个通道的加速度数据,每通道512,000个数据点。对于每种运行工况,选取250个样本构成数据集。数据集B的划分方法与数据集A一致,详见表4。图10试验台(A)总体视图 (B)两个加速度计的地方 (C)带有三个滚珠轴承的轴表4 都灵理工大学数据集故障类型和数据划分4.2 所提方法的实验结果所提方法在两个数据集上取得了不错的结果。本部分将详细阐述该方法的诊断结果分析和T-SNE可视化分析。1) 基于所提方法框架的诊断结果为严格评估所提模型的泛化能力和统计可靠性,采用10折分层交叉验证协议替代基于单次运行的评估。该协议确保每个样本恰好被用于测试一次,从而提供全面且无偏的性能评估。模型在两个数据集上表现出卓越的诊断性能。在数据集A上,达到99.80%±0.14%的平均精度。在更具挑战性的数据集B上,其特征为类别更多且每类样本更少,模型达到了98.06%±1.02%的高平均精度。这些结果及其他综合指标详见表5。高平均精度验证了模型的有效性,而低标准差突显了其在不同数据划分下的稳定性和鲁棒性。为进一步剖析模型的类别特定性能,通过累积所有10个测试折的预测生成聚合混淆矩阵(图11)。对于数据集A(图11a),模型展现出近乎完美的分类。极小的非对角元素显示,仅在极少数情况下模型将轻微内圈故障(A3)与严重内圈故障(A4)混淆。这证明了模型对故障严重度细微变化的高敏感性,这是预后能力的关键。对于数据集B(图11b),模型同样表现出色,成功区分了细粒度的故障类型和尺寸,如内圈故障(B1、B2、B3)和滚子故障(B4、B5、B6)。表5 所提模型在数据集A和B上的综合性能指标(10折交叉验证)图11所提模型在10折交叉验证下的聚合混淆矩阵。(a)数据集A的结果。(b)数据集B的结果。2) T-SNE可视化结果分析为进一步研究所提双分支网络在不同数据集上的内在特征学习机制,采用t-SNE可视化在三个关键阶段提取的特征:局部分支、全局分支和最终输出层。结果如图12所示。可视化揭示了清晰、渐进的特征学习过程。如图12(a)和(d)所示,KAN-Swin Transformer分支提取的局部特征表现出显著的类别重叠。这一结果与我们的设计预期一致,因为该分支旨在捕获GADF图像内的基本细粒度模式。这些特征原语类似于字母表中的字母;它们在孤立状态下缺乏完整的语义含义,可在多种故障类型间共享,因此本身不具备高度的类别判别性。相比之下,CNN-GAM分支提取的全局特征(如图12(b)和(e)所示)展现出显著改善的类别可分离性。这是因为CNN分支具有更大的感受野,并通过GAM模块增强,擅长识别宏观模式和周期性。例如,外圈故障的特征谐波簇表现为明显的重复纹理,这提供了与特定故障条件强相关的上下文线索,导致初始聚类的形成。最令人信服的结果如图12(c)和(f)所示,展示了特征融合后最终输出logits的分布。对于两个数据集,所有样本形成异常紧凑的类内簇,类间间隔大。从部分重叠到完全分离的戏剧性进展为双分支架构的协同效应提供了强有力的证据。模型学会在全局特征提供的上下文中解释局部原语。例如,反复出现在全局周期模式(全局特征)中的瞬态冲击(局部特征)共同形成指向特定故障类型和严重度的高度判别性"证据链"。最终,这种局部细节和全局视角的智能集成构建了高度鲁棒且可分离的最终特征表示,直观解释了模型出色的分类性能。图12 T-SNE视觉化显示与所提模型相对应的提取特征,分别对应于数据集A和B。(a)数据集A的局部特征,(b)数据集A的全局特征,(c)数据集A的输出层,(d)数据集B的局部特征,(e)数据集B的全局特征,(f)数据集B的输出层4.3 模型性能评估指标F1分数、G-mean和精度是用于评估所提模型性能的指标。F1分数是精确率和召回率的调和平均值,用于量化分类器的精确率和召回率能力。G-mean试图在保持各类别精度平衡的同时最大化每个类别的精度。对于多分类任务,它定义为召回率和特异性的乘积的平方根。F1分数、G-mean和精度的计算过程如公式所示:其中,表示类别i 的真阳性样本数;表示类别i 中正确分类的阴性样本数;表示类别i 中误分类的阳性样本数;表示类别i 中误分类的阴性样本数。当灵敏度和特异性越高时,G-mean越大。F1分数用于分析阳性样本的分类率。这些评估指标的值越大,对应分类性能越好。4.4 消融实验为进一步检验KAN、Swin Transformer和CNN-GAM模块在所提模型框架中的贡献,本小节进行消融实验。具体消融配置如下:1、 CNN-Transformer:无额外模块的基线Transformer模型,作为对比基准。2、 CNN-Swin Transformer:仅 incorporated Swin Transformer模块,评估其多尺度特征提取能力。3、 KAN-Swin Transformer:组合KAN和Swin Transformer模块,移除CNN-GAM模块,评估将KAN集成到Swin Transformer中的性能提升。4、 CNN-GAM:仅保留CNN-GAM模块,移除KAN和Swin Transformer,观察其对特征提取和模型性能的贡献。5、 Swin Transformer-GAM:组合Swin Transformer和CNN-GAM模块,排除KAN,评估其交互影响。6、 所提方法:通过GADF将一维信号转换为二维时频图像,集成KAN、Swin Transformer和CNN-GAM模块,测试其协同效应。两个数据集上的消融结果如表6所示,列出了两个数据集上的各种指标。首先,所提方法在所有指标上持续优于所有其他方法,证明了其优越性。其次,与Swin Transformer-GAM相比,由于KAN结构在分类决策过程中引入的推理能力,所提方法实现了识别率的显著提升。表6 两个数据集下的不同指标 两个数据集上的消融结果如图13所示。通过消融实验观察到,KAN-Swin Transformer模块和CNN-GAM双分支架构的联合设计显著增强了模型性能。在KAN-Swin Transformer模块中,标准Swin Transformer的MLP层被基于B样条的KAN替代,通过动态激活函数调整和自适应网格机制增强对高频瞬态冲击特征的非线性建模能力。与传统Swin Transformer达到97.5%的精度相比,KAN-Swin Transformer在数据集A上达到98.10%的精度并减少了参数数量,验证了其效率和参数有效性。性能突破通过建立全局和局部特征互补性的双分支架构实现。在KAN-Swin Transformer分支中,通过移位窗口注意力机制捕获GADF图像中的长程依赖(如与格拉姆矩阵对角元素相关的周期性外圈故障模式)。同时,CNN-GAM分支旨在通过卷积空间注意力放大瞬态局部纹理(如数据集B中的滚子故障冲击),并通过通道注意力抑制噪声主导频段。这些互补特征通过通道拼接进行融合,使全局结构感知和局部判别模式能够协同集成。因此,所提框架在两个数据集上均达到100%的诊断精度,显著优于单模块配置。图13在数据集A和B下,六种不同诊断模型的准确率精确率和F1分数比较4.5 KAN模块超参数敏感性分析为确保所提模型的鲁棒性和可重复性,并为超参数选择提供明确依据,对Kolmogorov-Arnold网络(KAN)模块的关键参数进行敏感性分析。该分析涉及其实际应用的两个关键方面:有限B样条函数引入的逼近误差和动态网格调整策略的经验依据。1) B样条网格尺寸敏感性KAN的理论基础假设无限精细的函数分解,而实现采用有限数量的B样条基函数。该逼近的精细度由网格尺寸超参数控制,直接影响模型捕获复杂故障特征和避免逼近误差的能力。为量化此效应,通过系统改变网格尺寸同时保持所有其他训练参数不变进行消融研究。模型在网格尺寸为[3,5,8,10]下训练和评估。结果汇总于表7。表7 网格尺寸超参数的敏感性分析分析表明,随着网格尺寸从3增加到5,模型性能显著提升,总体精度从0.9743上升至0.9992。这表明更精细的网格使KAN层能够更准确地逼近与故障数据相关的底层非线性函数,从而降低逼近误差。然而,进一步将网格尺寸增加到8和10导致性能显著下降。这种退化归因于模型复杂度的增加,在给定有限训练数据集的情况下,可能导致过拟合。因此,选择网格尺寸为5,以达到该故障诊断任务中逼近精度与模型泛化的最优平衡。2) 混合系数依据动态网格调整策略如公式(16)所述,采用混合系数α 平衡数据自适应网格和均匀网格的影响。为验证α 的选择并评估其对该故障诊断应用的影响,进行了第二项消融研究。基于最优网格尺寸5,评估模型在α 值为[0.0, 0.02, 0.05, 0.1, 0.2]下的性能。α 值0.0对应纯数据自适应网格。表8呈现的结果表明,虽然纯自适应网格(0.0)表现良好,但引入小的均匀分量(0.02)进一步提升性能至峰值。这表明均匀分量充当正则化器,改善模型对测试集中未见数据分布的泛化能力。随着α 超过此最优点,性能逐渐下降,表明过于均匀的网格在捕获故障数据的特定非均匀分布方面效果较差。表8 混合系数α 的敏感性分析该经验分析为选择0.02提供了坚实依据,该值也与原始KAN实现中的建议一致。这些发现证实所选超参数针对该任务进行了良好调优,确保高性能和方法论严谨性。4.6 双分支特征互补性的定量分析为验证双分支架构的核心假设——即KAN-Swin Transformer和CNN-GAM分支学习互补而非冗余的特征——采用中心核对齐(CKA)定量评估其特征表示的相似性。CKA通过计算两个特征空间Gram矩阵的归一化Hilbert-Schmidt独立性准则(HSIC)来衡量特征空间之间的相似性。其分数范围为0(完全不相似)到1(相同表示),较低值表示较强的互补性。在数据集A和数据集B的测试集上进行此分析。过程如下:对于每个输入样本,在拼接层之前提取KAN-Swin Transformer分支(FKAN−SwinTransformer )和CNN-GAM分支(FCNN−GAM )的输出特征张量。然后计算这两个展平特征矩阵之间的线性CKA相似性分数。分析得出数据集A的线性CKA相似性分数为0.304,数据集B为0.275。这些低分数显著接近0而非1,表明两个分支学习的特征表示相似度很低。该结果定量证实了假设:KAN-Swin Transformer分支和CNN-GAM分支确实捕获了不同且互补的信息。因此,简单的拼接特征融合方法被证明是集成这两组不同特征的有效方法,它们协同贡献了模型鲁棒且高精度的诊断能力。4.7 与其他先进方法的对比分析数据集B上的综合对比分析(详细结果见表9)证明了所提GADF驱动双分支网络的优越性能,达到98.06%的平均精度,以及高精确率、召回率和F1分数——超越所有其他评估模型。虽然基于CNN的架构如ResNet-50、EfficientNet和ConvNet,以及无卷积的MLP-Mixer展现出强大的诊断能力,精度范围为96.52%至97.15%,但其性能表明在捕获GADF图像中保留的长程依赖方面存在潜在局限性。类似地,Vision Transformer与CNN相比展现出竞争性但略低的结果,可能是由于其在建模细粒度局部模式方面的样本效率有限。CNN-Transformer混合模型改进了标准ViT,证实了结合局部和全局特征的价值。表9 不同模型在数据集B上的性能对比4.8 计算效率分析为阐明设计选择的实际意义,特别是在双分支架构背景下参数减少的说法,对模型的计算效率进行了定量分析。将所提模型与标准Swin-Tiny基线进行对比,后者作为典型高性能Transformer架构的参考。对比聚焦于三个关键指标:可训练参数总数(Parameters)、以Giga浮点运算衡量的计算复杂度(GFLOPs)和单样本推理延迟。所有测试在NVIDIA RTX 4090 GPU上进行以确保评估环境一致。表10 模型计算效率对比表10揭示的关键设计权衡表明,虽然所提模型实现了显著的40.8%参数减少,总参数仅16.27M(相比Swin-Tiny基线的27.50M),但这种效率以计算需求增加为代价。参数减少是直接用更高效的KAN模块替代标准MLP块的结果,使模型在存储方面更轻量化。然而,同时通过两个网络处理图像的双分支并行架构固有地增加了计算工作量。因此,所提模型的计算负载(8.39 GFLOPs)和推理延迟(18.75ms)约为单分支Swin-Tiny的两倍。所提模型的优势源于其集成的双分支设计,利用互补优势:首先,KAN-Swin Transformer分支通过窗口注意力和参数高效非线性建模有效捕获多尺度局部特征和瞬态特性;同时,CNN-GAM分支通过强调显著谐波结构同时抑制噪声,专门感知全局纹理和周期模式。最后,这两个路径的协同融合将局部细节与全局上下文信息集成,形成判别性特征表示,显著增强诊断精度,特别是在区分细微故障类型和严重度方面。总之,所提架构故意以更高计算成本换取更低参数数量。这使模型在存储或内存容量为主要约束的边缘设备部署方面具有特殊优势。然而,更高延迟对需要在计算受限硬件上进行实时推理的应用构成挑战。因此,边缘部署的可行性取决于目标应用的具体约束。4.9 噪声条件下的鲁棒性分析为严格验证模型在复杂噪声环境中的恢复能力,使用相同的10折交叉验证协议进行全面鲁棒性分析。对于每折,模型在干净训练数据上训练。随后,将相应测试集的一维振动信号叠加加性高斯白噪声,创建信噪比(SNR)为4dB、2dB、0dB、-2dB和-4dB的测试集。然后在这些噪声测试集上评估训练好的模型性能。表11 不同信噪比下的模型精度以均值±标准差形式报告的聚合结果汇总于表11。所提模型展现出显著的鲁棒性。随着噪声水平增加,性能优雅地退化。对于数据集A,即使在4dB的SNR下,平均精度仍高达99.20%±0.35%。在最严重的-4dB噪声条件下,模型仍保持97.10%±0.85%的可观精度。这一趋势证实了模型在显著噪声干扰下保持高性能的能力。这种优越的抗噪性源于双分支架构的协同作用。GADF变换有效保留核心信号模式,同时将噪声扩散为结构性较弱的图像纹理。KAN-Swin Transformer分支鲁棒地捕获局部结构依赖,而CNN-GAM分支利用注意力抑制噪声并放大显著全局模式。这种协作机制确保模型能够可靠地区分故障特征与背景噪声,验证了其适用于实际航空应用。4.10 不平衡数据集性能评估为评估所提框架对类别不平衡的鲁棒性——实际故障诊断中的常见挑战——从数据集B构建了一个不平衡子集。虽然原始数据集是平衡的,通过欠采样若干故障类别模拟更真实的场景。具体而言,类别B0、B1和B4保留100%样本量(多数类),类别B2和B5减少至50%(少数类),类别B3和B6减少至20%(稀有类)。然后使用10折分层交叉验证协议在该不平衡数据集上评估模型。为确保在倾斜分布下的公平评估,报告宏平均指标,无论样本量大小给予每个类别同等权重。聚合结果汇总于表12。表12 数据集B不平衡子集上的性能表12的结果明确证明了模型对类别不平衡的卓越恢复能力。尽管若干类别的样本量显著减少,模型仍达到96.91%的平均精度。更重要的是,宏平均召回率和F1分数均超过95%,表明模型不仅在多数类上表现出色,在稀有类上同样表现优异。这种鲁棒性归因于双分支架构的协同特征学习。KAN-Swin Transformer和CNN-GAM分支擅长提取高度判别性和泛化性特征,使模型即使从有限数量的训练样本中也能识别独特的故障模式。这证实了所提模型适用于实际工业应用中平衡数据罕见的情况。4.11 跨域泛化分析为严格评估模型在变工况下的泛化能力——这对航空等实际部署领域至关重要——使用凯斯西储大学(CWRU)轴承数据集进行了一系列跨域实验。实验旨在模拟预训练模型部署在具有不同运行参数环境时遇到的"域偏移"现象。利用CWRU数据集中的四种不同载荷条件(HP)构建四种具有挑战性的跨域诊断任务(表13)。每项任务涉及10类分类问题(正常,加上3种故障类型各3种严重等级)。与先前实验一致,原始1D时间序列信号被分段并使用格拉姆角差场(GADF)技术转换为224×224图像作为模型输入。表13 CWRU跨域诊断任务定义所提模型在四项跨域任务上的诊断性能汇总于表14。结果报告为五次独立运行的均值和标准差,以确保统计可靠性。表14 CWRU数据集上的跨域诊断性能结果明确表明,如预期,当面临域偏移时模型精度相比单域场景下的近乎完美分数有所下降。然而,模型展现出显著的恢复能力。即使在最具挑战性的任务T2(1HP→3HP)和T4(0HP→3HP)中,代表载荷和组合载荷/转速的显著变化,模型仍保持远高于90%的精度。随着源域和目标域之间差异的增加,性能优雅地退化,而非灾难性失效,这突显了模型固有的鲁棒性。模型强大的跨域泛化性能可直接归因于其独特的双分支架构:KAN-Swin Transformer分支提取局部域不变特征,而CNN-GAM分支自适应地建模全局上下文。它们的融合使模型在域偏移下仍能保持鲁棒性能,确认了其在变化运行条件下的实际潜力。五 结论针对航空轴承诊断中微弱故障特征和复杂工况的挑战,本文提出了GADF驱动的KAN-Swin Transformer诊断框架,集成多模态特征增强和注意力机制,提高了航空轴承故障数据集的故障识别率。a) KAN-Swin Transformer模块的创新:用可学习的B样条基函数的KAN替代传统MLP,将KAN集成到Swin Transformer中。结合动态网格调整策略,增强非线性表示能力同时减少参数数量。双残差级联结构有效建模局部空间依赖和全局频域特征,实现轻微与严重内圈故障的准确区分。b) GADF时频特征编码的优势:通过GADF极坐标变换将瞬态冲击和周期特性编码为判别性纹理模式。结合KAN-Swin Transformer双分支网络,在变速条件下实现多样故障的100%识别率。c) KAN-Swin Transformer双分支网络的协同效应:通过跨模态特征拼接和自适应池化,结合KAN-Swin Transformer的局部结构感知与CNN-GAM的全局纹理敏感性。在两个航空轴承数据集上达到100%的分类精度,显著优于基线方法。虽然所提方法在两个航空轴承数据集上取得了优异性能,但仍存在若干局限值得未来工作进一步研究:计算复杂度和边缘部署可行性:设计的关键方面涉及参数数量和计算负载之间的权衡。虽然用KAN模块替代标准MLP显著减少了Swin Transformer分支的参数,使总模型大小降至16.27M参数(相比标准Swin-Tiny的27.50M),但双分支并行架构固有地增加了计算需求。分析显示模型需要8.39 GFLOPs,推理延迟为18.75ms,高于Swin-Tiny基线的4.37 GFLOPs和8.54ms延迟。这对航空应用中常见的资源受限嵌入式系统或边缘设备的实时部署构成挑战。未来工作将专注于模型轻量化技术——如知识蒸馏、结构化网络剪枝和量化——以开发在保持高精度的同时满足机载计算严格预算的高效模型版本。数据多样性和真实世界条件泛化:本研究的验证基于两个实验室数据集。尽管我们在CWRU数据集上的跨域实验证明了模型对可变负载的鲁棒性,但真实的航空环境具有更复杂的多因素同时变化(如转速、负载和温度),这些因素会导致显著的域偏移。此外,现有数据集缺乏执行“留一轴承验证”协议所需的元数据,而该协议是评估模型对全新部件泛化能力的一种可靠方法。未来的研究应优先在更多样化、真实的现场数据以及按单个部件明确标注的数据集上验证模型性能,以便严格评估其在部件层面的泛化能力。同时,探索先进的迁移学习和域适应方法对于缩小实验室训练模型与实际现场应用之间的差距也至关重要。扩展到多源数据融合:本研究仅利用振动信号进行故障诊断。在实际的航空健康监测中,融合多源信息(例如温度、声发射和油液分析数据)可以通过提供更全面的设备健康状态视图,显著提升诊断的准确性和可靠性。未来一个很有前景的研究方向是将我们的双分支框架扩展为多模态架构,使其能够有效整合这些异构数据流,从而构建一个更鲁棒、更全面的诊断系统。编辑:李正平校核:陈凯歌、赵栓栓、曹希铭、赵学功、白亮、任超、陈宇航、Tina、王金、Kira、赵诚、肖鑫鑫、张优该文资料搜集自网络,仅用作学术分享,不做商业用途,若侵权,后台联系小编进行删除来源:故障诊断与python学习

未登录
还没有评论
课程
培训
服务
行家
VIP会员 学习计划 福利任务
下载APP
联系我们
帮助与反馈