首页/文章/ 详情

论文学习 | 融合大语言模型的工业物联网数字孪生:面向传统设备与智能工厂设备

21天前浏览382

本期推荐论文提出了一种面向传统设备与智能工厂设备的工业物联网(Industrial Internet of Things, IIoT)数字孪生系统,并将多 Agent 大语言模型(Large Language Models, LLM)框架集成到数字孪生环境中。该框架通过 MTConnectManufacturing Technology Connect,制造技术互联)协议采集传统机床部件、智能设备以及建筑环境传感器的实时数据,并利用监督 Agent、机器专家 Agent、数据可视化 Agent 和故障诊断与控制 Agent 协同完成查询分类、实时数据解释、专家知识检索、故障诊断和远程控制。论文进一步将 LLM 与数字孪生、人工智能(Artificial Intelligence, AI)虚拟头像和语音交互结合,使操作人员能够通过自然语言查询设备状态、获取诊断建议并调整设备参数。实验结果表明,该系统能够以较低延迟融合传统设备与智能设备数据,并在三维打印(Three-Dimensional Printing, 3D Printing)故障诊断与控制场景中有效改善打印质量,为面向智能制造的人机协作、故障诊断和数字孪生增强提供了可落地的 Agent 化解决方案。

论文基本信息

论文题目:IIoT-enabled digital twin for legacy and smart factory machines with LLM integration

论文日期:2025

论文期刊:Journal of Manufacturing Systems

论文链接https://doi.org/10.1016/j.jmsy.2025.03.022

作者:Anuj GautamManish Raj AryalSourabh DeshpandeShailesh PadalkarMikhail NikolaenkoMing TangSam Anand

作者单位:

1、Center for Global Design and Manufacturing, Siemens Simulation Technology Center, Department of Mechanical & Materials Engineering, University of Cincinnati, Cincinnati, OH, USA

2、Smart Manufacturing Lab, UC Digital Futures, University of Cincinnati, Cincinnati, OH, USA

3、eXtended Reality Lab, UC Digital Futures, University of Cincinnati, Cincinnati, OH, USA

目录

摘要

1. 引言

2. 相关工作

3. 方法

    3.1 实时数据采集与标准化

        3.1.1 传统设备与智能设备数据采集

        3.1.2 用于数据标准化与流式传输的 MTConnect 协议

    3.2  Agent LLM 框架开发

        3.2.1 监督 Agent

            3.2.1.1 合成数据集创建

            3.2.1.2 通过微调进行模型优化

        3.2.2 可视化 Agent

        3.2.3 机器专家 Agent

        3.2.4 故障诊断 Agent

    3.3 数字孪生环境开发

        3.3.1 系统设计与架构

        3.3.2 渲染与用户交互

    3.4 面向人机交互的人工智能驱动头像

    3.5 双向通信与远程机器控制

        3.5.1 命令库与函数映射

        3.5.2 动态函数选择

4. 结果

    4.1 数据采集

    4.2 监督 Agent 性能

    4.3  Agent LLM 框架

        4.3.1 可视化 Agent

        4.3.2 机器专家 Agent

        4.3.3 故障诊断与机器控制 Agent(案例研究:Ultimaker S5

    4.4 数字孪生与头像交互

    4.5 计算成本与可扩展性

5. 结论与未来工作

摘要

近年来,大语言模型(Large Language Models, LLM)的发展显著改变了自然数据解释、翻译和用户培训等领域。然而,当 LLM 被用于辅助实时、上下文敏感的机器数据分析时,仍然存在明显不足。本文提出了一种多 Agent LLM 框架,该框架能够通过工业物联网(Industrial Internet of Things, IIoT)平台访问并解释实时数据和历史数据,从而支持基于证据的推理。

实时数据通过 MTConnect 数据流协议采集自多类传统设备部件(例如七段数码显示器、拨动开关和旋钮)、智能设备(例如三维打印(Three-Dimensional Printing, 3D Printing)设备)以及建筑环境数据源(例如声音传感器和温度测量设备)。进一步地,本文开发了由四类专用 Agent 组成的多 Agent LLM 框架,包括监督 Agent、机器专家 Agent、数据可视化 Agent 和故障诊断 Agent,用于处理特定制造任务。

随后,该 LLM 框架被集成到数字孪生中,以实现非结构化数据的实时可视化。本文还探讨了基于 LLM 的数字孪生如何通过虚拟头像充当实时虚拟专家,从而减少对传统手册或主管经验的依赖。为了展示该框架的功能和有效性,本文给出了一个包含传统设备部件和现代机器的案例研究。结果表明,LLM 在数字孪生环境中辅助解释和推断实时机器数据具有实际应用价值。

关键词大语言模型;工业物联网;数字孪生;多 Agent 框架;检索增强生成。

I. 引言

信息物理系统(Cyber-Physical Systems, CPS)、物联网(Internet of Things, IoT)和云计算的引入,为工业 4.0 中更智能、更互联的制造环境奠定了基础。工业物联网是工业 4.0/5.0 的关键支柱之一,它通过数字孪生实现更高效的连接和更顺畅的交互。数字孪生是物理模型的虚拟表示,能够支持制造运行过程的实时监测、仿真和优化。它们在利用来自传感器和机器的实时 IoT 数据来优化生产、减少停机时间并提高整体效率方面发挥着关键作用。通过支持实时监测、误差预测和加工过程的自适应控制,数字孪生显著增强了制造运行能力。Fu 等人的近期研究强调了数字孪生在处理加工误差方面的关键作用,因为这些误差会影响产品质量、降低效率,并在制造环境中带来安全风险。

尽管数字孪生能够处理、分析和仿真实时数据,但它们往往忽视非结构化书面数据的重要性,例如机器手册和历史故障日志,而这些数据能够为决策提供额外上下文和指导。智能制造中的一个挑战是,访问和解释机器手册、历史故障记录以及操作文档非常耗时,而这些资料又常常是获得可执行洞察的必要来源。操作人员和工程师通常需要翻阅繁杂文档来排查故障、优化流程并做出知情决策,这会延迟生产。因此,在解释 IIoT 数据和非结构化数据时,专家反馈对于提供有价值的机器数据洞察至关重要。

本文提出了一种集成在数字孪生中的、基于大语言模型(LLM)的多 Agent 框架,该框架能够提供与机器相关的上下文感知专业知识和建议。LLM 是经过训练、能够理解和分析文本的强大语言工具,因此适合在制造环境中用自然语言解释大量非结构化信息。将 LLM 集成到数字孪生中,可以在不额外依赖专家的情况下提供专家分析、预测和可执行建议,从而节省时间和资源。

LLM 能够处理此类信息,并提供传统数据分析技术不易发现的相关洞察。传统上,LLM 仅在静态和历史数据集上训练,因此在数据不断变化的实时车间运行场景中难以直接适应。对于此类领域特定用例,LLM 通常需要通过微调进行动态更新。然而,每当数据更新时都重新微调模型既耗时、计算成本又高,也不现实。为解决这些挑战,本文引入了一个基于检索增强生成(Retrieval-Augmented Generation, RAG)的多 Agent LLM 框架,并将其微调到机器特定信息。RAG 是一种在用户查询和系统提示之外,从外部知识源补充相关上下文的方法。与依赖静态预训练的传统 LLM 不同,RAG 通过实时检索提升上下文准确性,并通过提供最新信息减少幻觉。

 1 展示了本文提出的 RAG 框架概览。该框架能够通过相似度搜索检索机器特定数据,例如维护记录和运行信息,确保 LLM 生成的洞察与最新机器状态精确对齐。


图 1:检索增强生成框架概览

RAG 对非结构化数据的检索还进一步得到传统设备和智能设备数据集成的支持,而这种集成基于 MTConnect 协议实现。MTConnect 是一种开源通信协议,旨在从多类工业设备中高效采集数据。图 2 展示了本文提出的 IIoT  LLM 框架的集成方式。来自传统设备和智能设备的数据通过 MTConnect 协议进行标准化,并发送到 Web 服务器。随后,LLM 处理并解释这些 IIoT 数据和非结构化数据。相关信息被叠加到数字孪生模型上,并结合 AI 驱动头像,从而实现自然语言交互和实时机器调整。

 2:传统设备、智能设备、数字孪生与 LLM Agent 的集成概览

本文框架的创新性包括:将实时机器数据和建筑环境传感数据集成到统一的 MTConnect 流式平台;开发用于上下文敏感信息处理的多 Agent LLM 架构;并将其可视化到数字孪生中,以增强用户交互。本文结构安排如下:第 2 节综述 IIoTLLM 和数字孪生相关研究;第 3 节描述所提出的多 Agent LLM 框架及其在数字孪生中的集成;第节给出案例研究并讨论结果;第 5 节总结结论并提出未来研究方向

II. 相关工作

IIoT 是智能制造的关键组成部分,涉及工业机器的实时数据采集、监测和分析,可用于预测性维护、生产过程优化和运行效率提升。Kliestik 等人指出,IIoT 有潜力通过促进信息在生产各阶段之间高效流动来变革制造业,从而改善决策并减少停机时间。类似地,Chhotaray 等人强调了 IIoT 在构建互联制造生态系统中的作用,这类生态系统由数据驱动洞察支撑,能够显著改善运行表现。

尽管 IIoT 已取得进展,但将老旧传统设备与现代智能设备集成仍然是一个重要挑战。在制造环境中,超过 70% 的设备属于传统设备。多数传统设备缺乏连接能力和智能化能力,因此成为实现完全一体化智能制造环境的障碍。本文作者团队的 Deshpande 等人以及 Durigan 等人的研究已经探讨了如何通过传感器和连接方案改造传统设备,使其成为 IIoT 生态系统的一部分。Deshpande 等人进一步扩展了该工作,重点研究数据通信、实时分析以及利用增强现实和人在环反馈实现过程反馈。然而,这些工作尚未从整体角度研究 LLM 与数字孪生的集成,以实现实时机器数据解释。

数字孪生通过创建物理资产、过程和系统的虚拟表示,进一步拓展了智能制造边界。这类虚拟模型支持实时监测、仿真和优化,为预测性维护和运行效率提升创造机会。Siddharth 等人展示了数字孪生如何成为提升制造过程可见性和控制能力的有效方法,从而支持更好的决策和主动维护策略。然而,这些系统通常缺乏能够利用实时和历史机器数据来指导用户理解机器或过程信息的智能聊天机器人或头像。LLM 的自然语言理解能力可以在这一场景中用于上下文决策、机器信息获取和任务自动化。

LLM 的自然语言理解和生成能力为多类任务中的人机交互提供了先进手段。生成式预训练 TransformerGenerative Pre-trained Transformer, GPT)系列中的 GPT-4  LLM 已被用于开发聊天机器人和虚拟助手。Jeon 等人开发了 ChatCNC,这是一种会话式机器监测框架,利用实时 RAG  LLM 增强与计算机数控(Computer Numerical Control, CNC)机器的自然语言交互。Xu 等人提出了一种集成 LLM 的生成式协同设计框架,将混合现实(Mixed Reality, MR)和生成式人工智能结合起来,以改善协作者之间的沟通并简化协同工作流程。此外,LLM 解释非结构化数据并生成人类可读文本的能力,使其成为制造环境中决策和任务自动化的有力工具。近期,Zheng 等人和 Jia 等人将 LLM 应用于工业场景,展示了其在故障诊断、任务分配和数据解释方面的潜力。Wang 等人开发了一种由 LLM 驱动的视觉与语言协作机器人导航系统,该系统允许协作机器人以更自然、上下文感知的方式解释人类指令,并根据操作人员反馈动态调整任务执行策略。然而,将 LLM  IIoT 和数字孪生结合,用于异常检测、故障分析和实时监测,仍然是一个新兴研究方向。

IIoT、数字孪生和 LLM 的组合为解决制造环境中传统设备与智能设备数据集成问题提供了有前景的路径。该框架能够实现实时数据可视化、机器专家支持和故障诊断,从而缩小传统系统与智能系统之间的差距。制造领域中 LLM 与数字孪生集成的研究仍处于相对早期阶段。已有初步研究显示出显著优势。例如,Eigner  Händler 以及 Da Silva  Cardoso 指出,由 LLM 驱动的机器人能够提供上下文反馈,并改善决策制定和运行效率。类似地,Grandi 等人研究了 LLM 在产品设计过程中用于材料选择的情况,通过评估其与专家建议的一致性并识别 LLM 与人类专家选择之间的差异来验证其作用。Sun 等人提出了一种由 LLM 驱动的多 Agent 框架,能够动态分析高维传感器数据,提高制造环境中的适应性、可追溯性和决策准确性。Leng 等人强调,未来研究应重点提升这些集成系统的互操作性、可扩展性和鲁棒性,以增强工业环境中的决策、自动化和人机协作。

III. 方法

     本节描述本文的方法:如何利用多 Agent LLM 框架和面向人机交互的 AI 驱动头像,将来自传统设备和现代机器的数据集成到数字孪生环境中。
3.1 实时数据采集与标准化

为了从传统设备和智能设备中高效采集数据,所提出的框架依赖标准化协议,以保证不同机器之间的兼容性和无缝数据集成。本节讨论从传统设备和智能设备采集数据的方法,以及如何使用 MTConnect 对数据进行标准化和流式传输,以供进一步分析。

 3:基于 MTConnect 的数据采集与流式传输概览

3.1.1 传统设备与智能设备数据采集

本文采用双重数据采集方法,从传统设备和现代智能设备中提取机器传感器数据。图 3 展示了数据采集涉及的组件。对于传统设备,本文方法建立在作者团队此前基于计算机视觉工具包(Computer Vision Toolkit, CVT)的模拟面板研究基础上。该模拟面板通过开源计算机视觉库(Open Source Computer Vision Library, OpenCV)中的图像处理算法,将拨动开关、旋钮、光学字符识别(Optical Character Recognition, OCR)显示器、仪表以及七段数码显示器中的数据数字化。用于演示的模拟面板是团队内部制作的面板,用于表示这些部件,并复 制工厂车间中常见的传统设备。

此外,为采集建筑环境数据,例如声音和空气质量传感器数据,作者使用制造商提供的定制软件界面来提取运行数据。这些传感器没有独立应用程序编程接口(Application Programming Interface, API),而是依赖通用串行总线(Universal Serial Bus, USB)连接。作者开发了一个基于 Python 的脚本,用于自动从软件界面捕获图像帧,重点识别并提取特定感兴趣区域(Region of Interest, ROI)。随后,捕获的图像通过 OpenCV 进行处理,从显示指标中提取相关数据。其他环境传感器的数据,例如温度传感器和光照传感器(Lux Meter),则通过独立 API 采集,并集成到 MTConnect 中。

对于智能设备,本文应用了多种数据采集方法来提取传感器数据。例如,对于 Ultimaker S5 这类基于熔融沉积成型(Fused Deposition Modeling, FDM)的 3D 打印机,作者使用表述性状态转移应用程序编程接口(Representational State Transfer Application Programming Interface, RESTful API)直接提取关键实时参数,并将其集成到 IIoT 框架中。对于 Stratasys F170 3D 打印机,数据通过指定互联网协议(Internet Protocol, IP)地址以MTConnect 格式访问。作者开发了一个 Python 脚本,利用基于超文本传输协议(HyperText Transfer Protocol, HTTP)的 requests 库向打印机的 MTConnect 端点发送 GET 请求。

3.1.2 传统设备与智能设备数据采集

本文采用 MTConnect 协议对来自传统设备和智能设备的数据进行流式传输。MTConnect 提供标准化结构,可将原始数据转换为统一的可扩展标记语言(Extensible Markup Language, XML)格式。图 4 展示了 MTConnect 框架中的通信流程,说明客户端、Agent、适配器和设备之间的交互以及数据流架构。整个过程从客户端向 Agent 请求数据开始。随后,Agent 轮询适配器,适配器再连接设备以收集所需数据。设备响应后,适配器将原始设备数据转换为符合 MTConnect 标准的 XML 格式。格式化后的数据随后提供给客户端进一步使用。之后,数据被输入多 Agent LLM 框架,为用户提供自然语言反馈。

 

4MTConnect据检索序列工作流

3.2 多 Agent LLM 框架开发  

所提出的多 Agent LLM 框架包含多个专用 Agent,这些 Agent 协同工作,用于处理用户输入、分析实时数据并提供运行洞察。核心 Agent 包括监督 Agent、可视化 Agent、机器专家 Agent 以及故障诊断与控制 Agent。每个 Agent 在构建模块化、高效的 IIoT 数据管理系统中承担特定角色。监督 Agent 作为中央协调器,根据用户输入将任务分配给其他 Agent。可视化 Agent 负责通过可视化图表和解释性摘要表示数据。机器专家 Agent 使用 RAG 从外部数据源动态检索相关信息,从而增强回答上下文。故障诊断与控制 Agent 负责以交互方式排查机器故障。该 Agent 利用实时数据和用户输入,迭代缩小潜在故障原因范围,并推荐纠正措施。图 5 对整体架构进行了全面概述,展示了 Agent 之间的关系、数据流以及系统中的任务分配方式。

 

 5:多 Agent LLM 框架概

3.2.1 监督 Agent

监督 Agent 负责处理用户查询并将任务分配给合适的 Agent。作为框架的大脑,该 Agent 确保每个专用子 Agent 根据用户提示,在其预定范围内有效运行。收到用户查询后,监督 Agent 首先根据预定义类别对输入性质进行分类,例如可视化、故障诊断或通用机器专业知识。

3.2.1.1 合成数据集创建

开发有效监督 Agent 的一个关键挑战,是训练模型对多样化用户输入进行分类并适当地委派任务。为解决这一问题,本文创建了一个专门面向分类需求的合成数据集。该合成文本数据集通过将相关文档输入 ChatGPT,并用少量示例引导模型生成真实风格输入而得到。该半自动过程产生了多样化的带标签样本,用于训练监督 Agent。标签包括“Visualization”,“Ultimaker”,

“Stratasys”,“Mockpanel”“Error”等类别。例如,与生成数据可视化表示有关的问题被标记为“Visualization”;而与机器故障排查有关的问题,则根据具体机器类型归类,例如 Ultimaker 3D 打印机相关问题被归为“Ultimaker”

3.2.1.2 通过微调进行模型优化

 3.2.1.1 节生成的合成数据集被用作训练数据,用于微调 GPT-4o-mini。该数据集经过精心构建,包含制造应用中典型的多种用户查询和场景,使模型能够有效学习并分类不同意图。在微调过程中,80% 的数据用于训练,20% 的数据保留用于验证。这保证模型能够较好地泛化到未见样本,同时避免过拟合。

训练数据包含领域特定知识。许多工业环境依赖专有文档,例如专门的机器手册、维护日志和校准记录,而这些文档并不公开。例如,作者团队内部开发的 Mockpanel 代表一种传统设备,其用户手册并不公开。因此,该手册不会被任何公开大语言模型用于训练,这意味着通用模型无法提供关于该特定机器的有效回答。通过微调将这类专门知识集成到 LLM 中,并结合 RAG 等技术,系统在回答这些机器相关查询时能够提供更准确、更具上下文感知能力的结果。

除基于数据集的优化之外,本文还采用提示词工程作为微调的互补策略。尽管微调带来了性能提升,但由于制造查询复杂且 token 处理存在固有限制,微调并不总是足以保证模型达到最佳表现。因此,每个用户查询都需要经过精心设计的提示词,其中包含详细指令和上下文信息,以在推理过程中引导模型决策。论文附录 A 给出了用于改进微调模型的系统提示词,该提示词用于分类用户查询并将其分配给相应 Agent。系统提示词在每个提示中嵌入了有限数量的相关描述,以帮助强化模型进行准确分类的能力。

3.2.2 可视化 Agent

可视化 Agent 被开发用于管理数字孪生中的实时数据可视化。该 Agent 基于 MTConnect 协议流式传输的实时 IIoT 数据,动态生成静态图表和图形,以可视化来自传统设备和智能设备的数据。Microsoft 的语言交互式数据分析(Language-Interactive Data Analysis, LIDA)库提供了渲染基本图表和绘图的基础功能。然而,该库在解释或总结这些可视化结果所隐含的意义方面存在固有限制。为弥合这一差距,本文实现了一个额外的总结层,利用 GPT-4o 使 LLM 能够分析视觉趋势并提取有意义的洞察。

 6 展示了与总结 Agent 集成的可视化 Agent 概览。该图说明原始数据如何流经可视化流水线,并最终转换为视觉输出和文本摘要。基于 GPT-4o 的附加层接收图表和绘图,并生成自然语言摘要。这些摘要为其他 Agent 提供来自数据可视化的关键洞察。

 

 6:集成总结机器人的可视化 Agent 概览

3.2.3 机器专家 Agent

机器专家 Agent 是多 Agent LLM 框架的关键组成部分,用于处理复杂用户查询。它能够从结构化知识库中动态检索并综合基于文本和图像的信息。通过采用 RAG 方法,该 Agent 将上下文相关数据结合起来,为用户输入提供专家级指导。图 7 展示了机器专家 Agent 将视觉数据(基于图像描述的数据)与 RAG 文本数据相结合的工作流程。

该过程从用户查询(步骤 1A  1B)以及存储在向量数据库中的知识库开始。随后,查询被转换为称为嵌入的数值表示,使机器能够解释和处理文本或图像。接着,系统执行余弦相似度搜索(步骤 2A  2B),以检索相关文本和图像元数据。本文使用余弦相似度,是因为它衡量的是用户查询嵌入与外部知识源嵌入之间的角度而非幅值,更关注语义意义而非文本长度。然后,检索到的上下文被用于通过 LLM 生成回答,同时检索相关图像(步骤 3A  3B)。最后,生成的图像和文本回答被返回给用户(步骤 4A  4B)。

 

 7:基于 RAG 的机器专家 Agent 概览

为识别最适合处理复杂查询的语言模型,本文对标准 LLM 架构进行了测试,包括 GPT-4o miniMistral7B)、Llama 3.1405B)和 Mixtral 8x22B每个模型都被集成到 RAG 框架中,并基于一组性能指标进行评估。本文考虑两类评估指标:准确率和基于大语言模型的评估(LLM-Eval)分数。准确率用于具有可验证答案的问题,例如机器尺寸或重量,这便于与已知值直接比较。对于主观和开放式查询,例如描述操作步骤,LLM-Eval 分数则基于 GPT-4o  Gemini 等更大语言模型的评估计算,其前提是假设更大模型在生成回答方面通常优于较小模型。

3.2.4 故障诊断 Agent

故障诊断 Agent 被开发用于在 IIoT 支持的数字孪生中对传统设备和智能设备进行实时故障诊断。该目标通过持续观察实时传感器数据、查询结构化知识库,并将这些信息与用户输入相结合来诊断机器故障实现。该 Agent 在多 Agent LLM 框架中动态工作,利用微调后的 LLM 和领域特定知识执行诊断。

 8 展示了故障诊断 Agent 的整体工作流程,从基于实时传感器数据的初始故障检测,到通过多轮迭代生成故障原因和纠正措施建议。该图体现了一个闭环过程,即实时数据、用户反馈和诊断知识被结合起来生成推荐。流程从通过 MTConnect 获取实时 IIoT 数据开始,该协议以相同格式流式传输不同机器的温度、压力和运行状态等实时机器参数。如果用户发现异常,可以向 Agent 提出查询或报告问题。随后,Agent 访问故障数据库,该数据库包括历史故障日志、机器手册和诊断决策树。LLM 还使用带注释的数据集进行微调,这些数据集包含常见故障场景、错误代码和机器特定诊断数据。结合实时传感器输入后,该训练使模型能够针对可能的故障原因生成上下文准确的诊断结果。

随后,Agent 向用户展示问题的潜在原因,并给出相应纠正措施。用户可以通过提供额外上下文信息或验证系统给出的建议,进一步细化 Agent 的诊断。Agent 会重新评估实时数据,并在可能解决方案之间迭代,以找到根本原因。它还允许实时执行纠正措施。例如,当检测到由于 3D 打印机热床温度过高而产生过热问题时,系统可以提出运行参数调整建议。系统还支持通过自然语言命令即时修改机器参数,这一点在第 3.5 节中有更详细说明。

 

 8:故障诊断 Agent 工作流概览

3.3 数字孪生环境开发

为了展示 IIoT  LLM 的有效性,作者开发了智能制造实验室的数字孪生。图 9 展示了开发阶段,从创建初始计算机辅助设计(Computer-Aided Design, CAD)模型,到添加机器,再到在 Unreal Engine 中应用真实材料。该数字孪生集成了传统设备和智能设备数据。

 

 9:智能制造实验室数字孪生复 制方法

3.3.1 系统设计与架构

首先,作者基于物理实验室空间的详细 CAD 模型创建了数字孪生模型。在设计 3D 模型时,考虑了机器布置和基础设施布局等关键建筑要素。Siemens NX 被用于开发实验室中所有智能制造设备和传统制造设备的 3D 模型,包括 Ultimaker S5  Stratasys F170 3D 打印机,以及用于复 制传统设备部件的 Mockpanel

3.3.2 渲染与用户交互

在这一步中,CAD 模型被导入 Unreal Engine,并应用材料和表面属性以获得真实视觉表示。Unreal Engine 的材料库被用于为各种模型元素分配准确的物理属性,包括金属、塑料和反光表面。该过程通过 C++ 脚本和 Unreal Engine 插件实现,从而创建了高保真的数字孪生环境,使其在外观和尺度上接近真实实验室。

此外,作者开发了自定义 C++ 脚本,用于管理孪生系统的数据处理和运行时数据更新。该系统能够以最小延迟处理双向通信。第 3.5 节将更详细说明这一双向通信功能。为了提供交互体验,数字孪生模型与由多 Agent LLM 框架驱动的自然语言界面集成,使操作人员能够通过语音命令或文本输入与系统交互,以检查机器状态、调整机器设置或请求诊断信息。系统通过数字孪生中的视觉更新和机器调整向用户提供即时反馈。

3.4 面向人机交互的人工智能驱动头像

本文在数字孪生环境中集成了 AI 驱动头像,以辅助用户进行语音交互。图 10 展示了数字孪生中 AI 驱动头像交互的工作流程,说明从初始用户语音输入到最终语音响应的逐步过程。交互从数字孪生麦克风捕获音频输入开始,随后使用 OpenAI 开发的先进语音识别模型 Whisper AI 对其进行处理。Whisper AI 将音频准确转录为文本,以理解语音命令。转录文本被发送到第 3.2 节所述的 LLM,并通过 LLM Agent 进一步处理。随后,LLM 生成文本回答,并借助 OpenAI 的文本转语音(Text-to-Speech, TTS)功能将其转换回语音。通过这种方式,头像能够以音频到音频的交互形式提供语音回答。数字孪生环境中的 AI 驱动头像是 MetaHuman 头像,提供视觉上真实且高度细节化的人物模型。该头像以静态模式作为人机交互的主要界面。

 

 10:数字孪生系统中 AI 驱动头像交互流程

3.5 双向通信与远程机器控制

在数字孪生框架中,远程机器控制通过控制 Agent 实现。该 Agent 经过训练,能够通过调用预定义函数来执行机器操作。这些函数代表不同机器动作,控制 Agent 根据用户输入动态选择并执行合适函数。图 11 展示了基于命令库的机器控制 Agent 工作流程。

 

 11:机器控制命令处理工作流

3.5.1 命令库与函数映射

作者创建了一个命令库,其中包含预定义的机器控制函数,每个函数对应特定机器操作。每个函数都被设计为修改特定机器参数。控制 Agent 使用该命令库进行训练,将用户命令映射到库中的合适函数。该 Agent 已经过微调,能够理解自然语言命令并将其与相关函数调用关联起来。

为进一步增强这一过程,领域特定知识被加入训练集。例如,许多工业机器都有特定于公司流程的操作手册和校准指南。通过嵌入这些领域知识,控制 Agent 能够更好地确定应推送到数字孪生物理模型中的最优参数。这确保所建议的命令不仅在语法上正确,而且根据专有机器文档,在运行层面也是最优的。

3.5.2 动态函数选择

如第 3.5.1 节所述,控制 Agent 可以根据用户意图选择并调用正确函数。这一能力使系统能够解释自然语言命令,并无缝执行对应的机器控制函数。例如,当操作人员发出命令时,Agent 会解释该指令,从命令库中检索相关函数,并执行该函数,而不要求操作人员手动指定函数或参数。

 FDM 3D 打印机为例,如果操作人员发出将打印头位置改为 (10, 15, 20)”的命令,Agent 会识别该命令对应函数change_head_position(x,y,z)它会用给定坐标替换占位符,形成函数调用change_head_position(10,15,20)。这种动态函数选择使系统能够处理多种机器控制任务,而无需操作人员手动指定函数或参数。Agent 解释命令、从库中检索相关函数并执行。函数执行后,机器会向数字孪生发送实时反馈,确认请求动作已完成。这种由命令库和训练后控制 Agent 驱动的控制方法,使数字孪生环境中的机器操作更灵活、更实时,并提升运行效率和用户交互体验。

在这一过程中,融入领域特定洞察非常关键。虽然预训练 LLM 可能基于通用知识提出看似合理的参数值,但本文系统通过微调并集成专有信息,确保控制命令反映物理机器的实际运行要求和最优性能标准。这种集成弥合了数字孪生仿真环境与物理世界之间的差距,使系统无需现场干预即可实现精确远程控制。

IV. 结果

4.1 数据采集

数据采集系统有效地将传统设备和智能设备集成到数字孪生中,建立了统一、低延迟的数据流。为采集建筑环境传感器数据,系统部署了一套非侵入式摄像头设置(图 12a),直接从传感器显示屏捕获包含关键运行数据的感兴趣区域。利用基于 OpenCV 的算法,系统从这些视觉输入中提取颗粒物和二氧化碳水平等关键指标(图 12a)。对于 Mockpanel 中的传统设备部件,作者使用团队开发的计算机视觉工具包采集数据(图 12b)。随后,来自建筑环境传感器和 Mockpanel 的原始提取数据通过 MTConnect 协议进行标准化。完整采集和处理周期的平均延迟约为 1.3 秒,可满足接近实时的运行监测需求。相比之下,来自现代智能设备的数据,包括 Ultimaker S5(图 12c)和 Stratasys F170,则直接通过RESTful API  MTConnect 端点访问,从而进一步简化了采集流程。

 12:来自传统设备和智能设备的数据采集

4.2 监督 Agent 性能

本文在多个 LLM 模型上评估了监督 Agent 的任务分配性能,重点关注查询分类指标,包括精确率、召回率、F1 分数和准确率。如图 13 所示,微调过程(第 3.2.1.2 节)显著提升了模型性能,各项指标相较基础版本均有明显改善。微调后的 GPT-4o mini 在所有指标上获得最高分,尤其在精确率和准确率方面表现突出,显示出其在准确分类并委派多样化用户查询方面的鲁棒性。该模型达到接近最优水平,准确率和 F1 分数分别为 82%  92%,表明其能够可靠处理从数据可视化请求到复杂故障排查任务的广泛查询。这种高水平表现反映了监督 Agent 在数字孪生环境中管理任务分类的有效性,能够确保用户查询被准确路由到专用 Agent

 13GPT-3.5  GPT-4o mini 基础版本与微调版本在查询分类中的监督 Agent 性能对比

4.3 多 Agent LLM 框架

4.3.1 可视化 Agent

可视化 Agent  IIoT 数据生成实时、上下文感知的可视化结果,使操作人员能够快速解释环境和运行条件。在该示例中,Agent 创建了一个饼图,用于展示声音传感器捕获的声音水平,并将其分为低、中、高三个不同等级。图 14 显示,低声音水平占 42.1%,中等声音水平占 26.3%,高声音水平占 31.6%

总结层在图表旁提供了文本解释,说明颜色编码的声音等级并总结数据分布。这种即时视觉反馈使操作人员能够快速评估传感器数据和环境条件,并做出知情决策。

 14:声音水平按高、中、低分类的饼图及文本摘要

4.3.2 机器专家 Agent

机器专家 Agent 使用 RAG 方法进行评估,评估重点是其处理复杂查询并提供专家级回答的能力。为此,本文采用两类评估:针对客观问题的数值准确率,以及针对主观、上下文相关任务的 LLM-Eval 分数。该评估方法遵循 Huang 等人的思路,即使用参数规模更大的 LLM 作为评估器,对较小模型生成的回答进行评估。对于准确率评估,作者向模型提出客观问题,例如“Ultimaker S5 的成型体积有多大?以及“Ultimaker S5 的尺寸是多少?这类问题可以直接、客观地评估模型检索并提供精确信息的能力。对于需要更深层上下文理解的主观任务,则由 GPT-4o  Gemini 评估生成回答的质量和相关性。

本文使用多个语言模型评估机器专家 Agent,以确定最适合在数字孪生环境中提供专家级回答的模型。表 1 展示了各模型的性能,包括 GPT-4o miniMistral7B)、Llama 3.1405B)和 Mixtral 8x22B。为评估鲁棒性,每组实验使用相同问题池重复五次,确保观察到的变化主要来自模型自身随机性,而不是测试数据差异。Llama 3.1 的准确率最高,为 0.916 ± 0.038GPT-4o mini 紧随其后,准确率为0.903 ± 0.036。此外,GPT-4o mini 在主观评估中表现更好,其 LLM-Eval 分数分别为 0.922 ± 0.047 0.925 ± 0.020(分别由 GPT-4o  Gemini 评估),显示出其提供上下文相关回答的强大能力。基于多个指标上稳定且鲁棒的结果,本文选择 GPT-4o mini 作为机器专家 Agent

 1:机器专 Agent(基于 RAG)中不同语言模型的性能指标

4.3.3 故障诊断与机器控制 Agent(案例研究:Ultimaker S5

为评估故障诊断与机器控制 Agent 的有效性,作者使用 Ultimaker S5 3D 打印机构建了一个受控实验。实验评估了该 Agent 诊断和解决 FDM 3D 打印中两个常见问题的能力:首层附着失败和表面粗糙。为测试目的,作者故意设置了错误打印参数,从而能够系统评估 Agent 基于实时数据识别并纠正这些问题的表现。

首层附着不良问题通过将热床温度设为 45 °C 引入,该温度低于聚乳酸(Polylactic Acid, PLA)的最佳值。确保首层正确附着对于任何 3D 打印的成功都非常关键,因为首层构成整个结构的基础。Agent 分析打印机实时数据后,识别出热床温度不合适,并建议将其升至 60 °C,这是 PLA 确保良好附着的标准温度。确认调整后,打印质量显著改善。

 15 展示了故障诊断 Agent 的有效性,比较了 LLM 干预前后 3D 打印件质量的变化。图 15a 在同一零件中展示对比:“Before LLM”部分存在表面缺陷和不一致,而相邻的“After LLM”部分在实时错误纠正后质量显著提升。图 15b 显示,由于每层固有几何误差,正在打印的零件中仍然可能存在缺陷。在这种情况下,理想方案是暂停打印,并根据 LLM 建议的设计值重新开始。图 15c 显示在 LLM 反馈后完全重新打印的零件,初始错误已经消除。该结果表明,故障诊断 Agent 能够在生产早期发现问题并采取措施,从而提升打印质量并减少材料消耗。

 15:故障诊断与机器控制Agent 解决 Ultimaker S5 打印问题:(a)数字孪生中 LLM Agent 的界面通信;(b)基于 LLM 的实时 IIoT 数据改变对 3D 打印的影响;(c)基于 LLM  IIoT 数据改变对 3D 打印的影响

4.4 数字孪生与头像交互

本文评估了数字孪生系统展示来自智能设备和传统设备实时数据的能力,具体包括 Stratasys F170  Ultimaker S5 3D 打印机,以及包含传统机器数据的模拟面板。选择这些机器是为了测试系统处理多样化设备类型的能力,展示其跨现代技术和旧有技术的灵活性与兼容性,这对于集成制造环境至关重要。系统允许操作人员以 1  2 秒延迟在不同机器数据集之间切换,从而在单一界面中高效监测多台机器。

 16 展示了 Ultimaker S5  Stratasys F170 的数据叠加到数字孪生模型上的效果,包括热床和挤出机温度、打印机状态以及关键部件位置等实时指标。数字孪生还集成了带有 LLM 聊天机器人的头像,用于自然语言交互。该头像能够检索实时机器数据,并通过语音命令准确回答用户查询。例如,当用户询问 Ultimaker S5 当前状态时,头像能够立即检索并报告相关运行参数。图中还展示了聊天界面,记录会话历史并显示传统模拟面板的数据叠加。这一设置允许操作人员与机器数据交互、接收反馈并控制运行,从而增强数字孪生中的用户参与度。

 16:数字孪生环境中的实时数据叠加与头像

4.5 计算成本与可扩展性

除性能指标外,本文还评估了系统计算成本。GPT-4o-mini 的价格为每 100 万输入 token 0.150 美元、每 100 万输出 token 0.600 美元。在实验中,30 个查询的总成本为 0.12 美元,每个查询约包含 450 个输入 token,并产生约 3000 个输出 token。这意味着,对于相似长度的输出,约 1 美元可处理约 250 个查询。此外,音频处理成本(使用 OpenAI  Whisper 和文本转语音模型)为每 100 万字符 15.00 美元,本文样例查询成本约为 0.22 美元。在硬件方面,作者在配备 RTX 3070 图形处理器(Graphics Processing Unit, GPU)的标准桌面计算机上运行数字孪生模型。

V. 结论与未来工作

本文提出了面向工厂环境的多 Agent LLM 框架与数字孪生模型集成方案。该系统旨在提升运行效率,集成来自传统设备和智能设备的实时数据,并通过自然语言界面实现无缝监测、故障诊断和机器控制。由 LLM 聊天机器人支持的交互式头像允许操作人员使用语音和文本命令与机器交互,从而增强用户参与度。系统成功解决了常见 3D 打印问题,例如首层附着和表面粗糙,这表明该系统具有简化和优化制造过程的潜力。

在未来研究中,扩展系统与更广泛工厂机床的接口能力,例如 CNC 机床和机械臂,将提高其在多样化制造环境中的灵活性。另一个关键探索方向是将机器学习(Machine Learning, ML)模型与 LLM 集成,从而实现更高级的诊断和预测性维护。此外,作者正在研究处理涉及多个 Agent 的复合查询的策略。关于监督 Agent 的早期工作显示出良好前景,该 Agent 能够分解复杂查询并协调多个 Agent。进一步地,未来工作还可以集成虚拟现实(Virtual Reality, VR),以提供沉浸式、实时的数字孪生可视化,并支持对机器参数进行交互式调整。


编辑:肖鑫鑫
校核:李正平、陈凯歌、赵栓栓、曹希铭、赵学功、白亮、任超、海洋、陈宇航、Tina、王金、赵诚、Kira、张优
该文资料搜集自网络,仅用作学术分享,不做商业用途,若侵权,后台联系小编进行删除
来源:故障诊断与python学习
ACTMechanicalOpticalSystem光学通用航空建筑UG通信云计算海洋电机材料数字孪生控制工厂渲染人工智能数控
著作权归作者所有,欢迎分享,未经许可,不得转载
首次发布时间:2026-08-04
最近编辑:21天前
故障诊断与python学习
硕士 签名征集中
获赞 87粉丝 152文章 327课程 0
点赞
收藏
作者推荐

一种基于Transformer的新型局部增强通道自注意力机制在工业剩余使用寿命预测中的应用

本期给大家推荐一种基于Transformer的新型局部增强通道自注意力机制在工业剩余使用寿命预测中的应用。在预测性维护领域,剩余使用寿命预测是保障复杂工业机械可靠性与安全性的核心技术。然而,现有基于循环神经网络、卷积神经网络或自注意力机制的方法,往往难以同时兼顾全局长期依赖、局部上下文信息与多传感器空间相关性。为突破这一瓶颈,本文提出一种基于Transformer的新型局部增强通道自注意力模型——LECformer。该方法不仅通过Transformer架构高效捕获长期依赖,更设计了独特的局部增强通道自注意力机制,能够自适应提取局部与全局特征,并动态加权不同通道的重要性。在多个涡扇发动机和轴承数据集上的实验表明,LECformer显著超越了当前最先进的RUL预测方法。论文基本信息论文题目:A novel local enhanced channel self-attention based on Transformer for industrial remaining useful life prediction 论文期刊:Engineering Applications of Artificial IntelligenceDoi:https://doi.org/10.1016/j.engappai.2024.109815作者:Zhizheng Zhang (a), Wen Song (a*), Qiong Wu (b), Wenxu Sun (a*), Qiqiang Li (a), Lei Jia (a) 论文时间:2025年 机构:(a) Institute of Marine Science and Technology, Shandong University, Qingdao, 266237, China (b) MetaReal (Beijing) Technologies Co., Ltd, Beijing, 100043, China作者简介:宋文,海洋研究院副教授,入选山东大学青年学者未来计划,IEEE Senior Member。本硕毕业于山东大学控制科学与工程学院,博士毕业于新加坡南洋理工大学计算机科学与工程学院。长期从事深度学习、强化学习、组合优化、时间序列预测等方面的研究,主要研究方向为数据与智能驱动的优化决策技术。主持国家自然科学基金青年/面上、山东省自然科学基金、中国商飞技术研发等项目,以第一/通讯作者发表高水平SCI/EI论文30余篇,包括TNNLS、TII、TKDE等中科院1区/CCF-A类期刊论文,ICML、NeurIPS、ICLR、AAAI等CCF-A类/顶级人工智能会议论文,谷歌学术引用4400余次,H-index 32。ESI高被引论文3篇,热点论文1篇。获中科院1区Top期刊IEEE Transactions on Industrial Informatics杰出论文奖(2024年度唯一获奖论文)。任NeurIPS、ICLR、AAAI、IJCAI、KDD等顶级会议的Area Chair/SPC/PC,以及TPAMI、TNNLS、TCYB等十余个高水平SCI期刊的审稿人。(摘自山东大学教师主页) 通讯作者邮箱:wensong@email.sdu.edu.cn; sunwenxu@sdu.edu.cn 摘要剩余使用寿命(Remaining Useful Life, RUL)预测是预测性维护(Predictive Maintenance, PdM)的基础技术,对保障复杂工业机械的可靠性与安全性至关重要。近年来,循环神经网络(Recurrent Neural Network, RNN)、卷积神经网络(Convolutional Neural Network, CNN)与自注意力(Self-Attention, SA)等先进深度学习架构已广泛应用于RUL预测,但现有方法仍难以同时处理序列单元的全局长期依赖、局部上下文信息以及工业多传感器的空间相关性。本文提出一种基于Transformer的局部增强通道自注意力模型(Local Enhanced Channel Self-Attention based on Transformer, LECformer),一种新型深度学习 RUL 预测方法以解决上述问题。相较于基于RNN/CNN的方法,LECformer通过Transformer架构能更高效地捕获长期依赖。此外,LECformer 提出一种新型局部增强通道自注意力(Local Enhanced Channel Self-Attention, LECSA)机制,替代原生Transformer的传统自注意力,可自适应提取长期依赖与局部上下文信息,同时动态加权不同通道的重要性以提升预测性能。本文采用两个广泛使用的涡扇发动机数据集与一个轴承数据集验证所提方法的有效性。实验结果表明,LECformer显著优于当前最优的RUL预测方法。关键词:剩余寿命预测;预测性维护;人工智能;深度学习;Transformer;自注意力 目录1 引言2 相关工作3 方法3.1 所提LECformer架构概述3.2 LECformer的输入层3.3 LECformer的编码层3.4 LECformer的输出层3.5 相较传统Transformer自注意力的优势4 案例研究1:基于C-MAPSS与N-CMAPSS数据集的实验4.1 数据集描述4.2 实验设置4.3 实验分析5 案例研究2:基于FEMTO轴承数据集的实验5.1 数据集描述5.2 实验设置5.3 LECformer预测结果分析5.4 与当前最优方法对比6 讨论7 结论1 引言预测性维护(Predictive Maintenance, PdM)在现代工业系统中至关重要,相较于传统预防性维护策略,其不仅能提升设备可靠性,还可降低维护成本(Zhang等,2024)。通过分析与挖掘状态监测(Condition Monitoring, CM)数据,PdM可持续评估设备健康状态,支持主动决策。PdM的核心技术是剩余使用寿命(Remaining Useful Life, RUL)预测,可帮助维护人员预判设备状态,为生产与维护规划做出合理决策(Elsheikh,2023)。然而,工业机械数据的高复杂性与高维度性,使得精准RUL预测仍具挑战。因此,开发有效的RUL预测模型对PdM至关重要,尤其在处理大型工业机械CM数据中的复杂模式方面。近年来,深度学习技术在RUL预测中展现出巨大潜力,其可从原始多传感器数据中自动提取高维特征,减少对人工特征工程的依赖。常见的深度学习架构,如循环神经网络(Recurrent Neural Network, RNNs)(Huang等,2019)、卷积神经网络(Convolutional Neural Network, CNNs)(Kobayashi与Alam,2024),擅长处理时序数据,已广泛应用于RUL预测。RNN变体包括长短期记忆网络(Long Short-Term Memory, LSTM)(Yang等,2023)与门控循环单元(Gated Recurrent Unit, GRU)(Liu等,2020b),以捕获时序依赖著称;而CNNs则通过卷积操作擅长提取局部特征。近期,Transformer模型(Vaswani等,2017)凭借其自注意力(Self-Attention, SA)机制被引入RUL预测领域。该机制使Transformer能基于特定时间步相关性分配权重,更高效地捕获长期依赖,相较传统RNN与CNN方法实现性能提升。深度学习RUL预测方法的目标是从采集的多传感器数据中提取设备退化特征。受现代大型设备复杂性影响,采集的CM数据中不仅存在复杂的全局与局部时序关系,还存在不同传感器序列间的空间相关性。尽管取得上述进展,面向复杂工业应用的有效RUL预测仍需同时考虑以下方面:(1)长期依赖建模:如何提取不同序列单元的长期时序关系。从序列数据中提取长期依赖与时序关系对精准RUL预测至关重要。(2)局部上下文特征提取:如何在捕获长期依赖信息的同时充分利用局部上下文信息。不同局部区域的退化特征对最终RUL预测同样重要。(3)多传感器空间相关性学习:有效学习多传感器时序数据的空间相关特征,可显著提升模型的特征学习能力。融合多通道相关信息对精准RUL预测至关重要。然而,现有深度学习RUL预测方法难以同时解决上述问题:基于RNN/CNN方法的局限性:基于RNN与CNN的方法及其变体(Huang 等,2019;Kong等,2019;Ding等,2022)难以从序列数据中提取长期时序关系。RNN采用串行处理数据,易出现信息丢失与梯度消失/爆炸问题。CNN受限于局部感受野,需增加网络深度才能捕获长距离依赖,效率低下且无法有效建模全局时序相关性。传统Transformer的局限性:尽管原生Transformer(Vaswani等,2017)的自注意力机制在建模长期依赖方面表现优异,但在学习细粒度局部特征方面能力较弱。在RUL预测中,局部区域的波动对预测精度影响显著。传统自注意力机制(Ren等,2022;Ma等,2021;Liu等,2022)执行逐点点积计算,可能忽略重要局部信息。忽略多传感器空间相关性:RUL预测中的多传感器时序数据间存在复杂的非线性空间关系。但多数现有基于自注意力的方法(Zhang等,2022,2023)聚焦于建模时序依赖,未考虑不同传感器间的空间相关性,限制了方法有效性。值得注意的是,Peng等(2023)的研究采用滞后量化解决切换系统的输入到状态镇定问题,凸显了有效传感器与执行器管理的重要性。类似地,Song 等(2024)的研究探索了持续驻留时间切换下的状态估计,强调了复杂系统动态中鲁棒测量策略的重要性。这些方法体现了当代RUL预测中融合时序与空间维度的研究方向。本文围绕上述三个关键点开展相关研究。为解决上述问题,本文提出一种基于Transformer的新型局部增强通道自注意力模型(Local Enhanced Channel Self-Attention based on Transformer, LECformer)用于RUL预测。本研究的主要贡献如下:提出局部增强通道自注意力(Local Enhanced Channel Self-Attention, LECSA)机制:LECformer采用LECSA替代传统自注意力机制,结合线性投影与卷积操作的优势,使模型能有效捕获长期依赖与局部上下文信息。LECSA 在保留全局时序关系建模能力的同时,增强了模型提取局部退化特征的能力。融合通道自注意力(Channel Self-Attention, CSA):LECSA融入CSA以动态捕获不同传感器通道间的空间相关性,使模型能自适应加权不同通道的重要性,提升多传感器数据的特征融合效果。全面评估与消融实验:本文在广泛使用的涡扇发动机数据集与轴承数据集上开展大量实验,验证LECformer的有效性。结果表明,LECformer显著优于现有当前最优RUL预测方法。学习到的注意力权重可视化进一步证实了所提方法的特征提取能力提升。综上,LECformer通过同时建模长期依赖、提取局部上下文特征、捕获多传感器空间相关性,有效解决了现有方法的局限性,提升了复杂工业应用中的RUL预测性能。本文组织结构如下:第2节简要介绍当前相关工作与存在问题;第3节阐述所提LECformer方法与计算流程;第4节介绍涡扇发动机实验;第5节展示轴承数据集实验;第6节讨论所提LECformer;第7节总结全文。2 相关工作得益于高效的序列建模能力,RNNs、CNNs及其变体近期成为深度学习RUL预测领域的主流架构。Hu等(2021)提出一种基于双向RNN的方法,旨在提取RUL预测的退化特征。类似地,为解决RNN模型崩溃问题,Huang等(2019)提出双向LSTM模型,提升传统RNN变体的稳定性与精度。Li等(2018)提出一种基于深度CNN的新型方法用于涡扇发动机RUL预测,通过堆叠多层CNN层提取深度特征信息。Kong等(2019)开发了一种融合LSTM与CNN架构的混合RUL预测方法,利用空间与时序特征提升预测精度。但上述现有方法存在固有局限性。基于RNN/CNN的方法难以捕获序列数据中的长期依赖(Vaswani等,2017;Zhang等,2022;Liu等,2020a)。具体而言,RNN在长序列中易遗忘关键信息,且存在梯度消失或爆炸问题。CNN受限于局部感受野,需增加网络深度才能有效建模全局信息,计算量大且效率低。完全依赖自注意力机制处理整个序列的Transformer架构(Vaswani等,2017)的提出,为序列建模提供了更高效的方法。多项研究尝试将RNNs或CNNs与Transformer结合用于RUL预测。Wang等(2024)提出一种基于注意力机制的改进深度残差网络用于变速箱故障诊断,增强特定区域的特征提取以提升模型性能。Liu等(2022)提出一种融合CNNs与Transformer的方法,更好地结合全局与局部退化特征用于RUL预测。Wang等(2021)提出一种融合时序CNN(Temporal CNN, TCNN)与Transformer编码器的RUL预测方法,提升全局特征提取能力。此外,Liang等(2023)提出一种结合图神经网络与注意力机制的预测方法,提升时空特征提取能力。此外,多项研究提出纯基于Transformer的方法用于RUL预测。Ma等(2021)提出一种基于Transformer的预测方法,规避RNN/CNN模块的局限性,有效捕获长期依赖。Zhang等(2022)开发了一种基于Transformer的双视角自注意力机制用于RUL预测,采用两个独立编码器进行特征提取。Ren等(2022)提出一种时序张量辅助多尺度 Transformer方法,无需任何RNN/CNN模块即可捕获时序模式。此外,新型 Transformer 结构被提出用于提取时序预测与计算机视觉任务的相关特征。Liu等(2023)提出逆 Transformer(iTransformer),在反转维度上应用注意力与前馈网络以捕获时序预测中的相关性。Xu等(2022)提出一种用于弱监督语义分割的多类别标记Transformer,采用多个类别标记学习不同标记间的交互。尽管上述预测方法取得进展,仍存在以下挑战:RNN/CNN模块的固有局限性:堆叠RNNs或CNNs与自注意力模块的方法难以克服RNN/CNN架构的固有缺陷,捕获长期依赖与建模全局信息的局限性在混合模型中依然存在。传统自注意力在局部特征提取中的低效性:Transformer中传统的线性点积自注意力机制可能无法有效提取局部区域的退化信息,而这对RUL预测至关重要。标准自注意力的逐点操作可能忽略重要局部特征。现有基于Transformer的预测方法在特征提取中通常未同时考虑全局长期依赖、局部上下文信息与多通道空间相关性。忽略这些方面会降低特征表示质量,进而降低RUL模型的预测性能。为弥补上述差距,本文针对上述方向展开研究,提出新型LECformer使模型更适配工业RUL预测任务。通过解决上述挑战,LECformer旨在提升RUL预测任务中的特征表示与预测性能。本文通过大量实验评估所提方法的有效性,实验结果证实其在工业应用中的有效性。下文将详细介绍LECformer的具体细节。3 方法本节详细介绍所提用于RUL预测的LECformer架构设计。首先概述LECformer架构,随后深入阐述其核心组件,包括创新的LECSA机制与CSA机制。本文旨在阐明LECformer如何通过捕获全局长期依赖、局部上下文信息与多通道空间相关性高效处理多传感器时序数据,进而提升时序预测与状态监测等应用的预测精度。3.1 所提LECformer架构概述LECformer架构如图1所示。LECformer采用基于Transformer的框架,包含三个主要组件:输入层、编码层与输出层。与传统基于RNN/CNN的方法不同,LECformer利用Transformer的能力建模序列元素间无论距离远近的长期依赖。此外,通过引入LECSA机制,LECformer改进传统自注意力机制,有效融合长期依赖与局部上下文特征及多通道重要性,解决现有方法的局限性。LECformer工作流程如下:(1)输入嵌入与位置编码:输入层对多传感器数据进行嵌入并添加位置信息以保留序列顺序。(2)LECSA特征提取:编码层应用LECSA机制提取综合特征,捕获全局与局部依赖及空间相关性。(3)RUL预测:输出层处理提取的特征以预测RUL。下文将详细阐述上述各子结构的具体细节。 图1 所提LECformer的架构3.2 LECformer的输入层如图1所示,采集的多传感器时序数据为 ,其中 表示时间步, 表示传感器数量。输入层主要执行两个功能: (1)嵌入:将输入数据投影至高维空间以捕获更复杂的特征表示。 (2)位置编码:融入位置信息使模型能识别序列元素的顺序。 嵌入过程通过线性投影将输入数据 从原始维度 映射至高维 ,公式如下: 其中 是可学习的嵌入权重矩阵, 是投影后的输入。由于Transformer架构不像RNN那样具备固有序列处理能力,本文融入位置编码为模型提供每个时间步在序列中的位置信息。存在多种位置编码方法,本文采用Vaswani等(2017)的位置编码方式,公式如下: 其中 是时间步的位置索引(取值0至 ), 是维度索引(取值0至 )。位置编码矩阵 通过上述公式生成。序列中每个位置 都有唯一编码,为模型提供元素相对与绝对位置信息。编码层的最终输入通过将位置编码与投影输入相加得到: 其中 将作为编码层的输入。该相加操作使模型在处理输入数据时保留位置信息。通过将位置编码直接融入输入嵌入,LECformer能以位置感知的方式关注序列元素,这对时序顺序至关重要的RUL预测等任务至关重要。3.3 LECformer的编码层LECformer的编码层经过精心设计,增强模型捕获与处理全局长期依赖、局部上下文信息与多通道空间相关性的能力,这些均对精准RUL预测至关重要。如图1所示,编码层包含两个主要子层:LECSA机制与前馈网络(Feed Forward Networks, FFN)。每个子层后均连接残差连接与层归一化,统称为Add & Norm。这些机制有助于缓解深度神经网络训练中的梯度消失等问题,加速模型收敛。编码层可堆叠 层以提取深度退化特征。下文将详细阐述编码层的工作流程。LECSA机制是LECformer编码层的核心,相较标准Transformer使用的传统SA机制实现重大改进。LECSA将卷积操作与线性投影融合,并融入CSA机制以有效建模多传感器通道间的空间相关性。该融合使LECformer能同时捕获全局依赖、增强局部特征提取、建模通道间关系,进而解决基于RNN/CNN方法与传统Transformer的固有局限性。 是LECSA的输入,其基于缩放点积自注意力。传统自注意力中,通过线性映射生成查询(query, )、键(key, )与值(value, )矩阵, 通过点积计算与每个 对的相关性。与SA相比,LECSA通过融合线性投影与卷积操作改进此过程(如图2所示),有效捕获长期依赖的同时增强局部细粒度特征学习能力。首先,通过结合线性投影与卷积从 生成 、 与 ,公式如下: 其中 表示线性投影的可学习参数。 、 与 、 分别表示第 个卷积核的权重矩阵与偏置,其中0<f<c, 表示卷积核数量, 表示卷积核大小。通过该方式, 处理序列中每个点的信息。 与 包含发动机运行过程中的局部变化特征信息。为保证输入输出维度一致,本文对Conv2d操作执行零填充。从图3可观察到,不同传感器的时序数据间存在复杂的空间相关性。高维特征图的每个通道可视为空间关系的表示,不同空间表示相互关联。 图2 传统SA与所提LECSA的对比 图3 所提通道自注意力机制本文设计中,通过卷积操作生成的 与 不仅包含局部区域的退化信息,还包含多通道的空间特征关系。因此,为更好提取不同通道的相关性,本文设计新型CSA机制探索通道间交互。其可使模型自适应对不同通道特征图分配不同注意力,更好地表示 与 以实现最终RUL预测。CSA机制工作流程如图1所示。CSA机制首先将输入 重塑为 ,计算 与其转置的点积(除以 缩放)。随后沿通道方向应用softmax函数得到不同通道的权重信息,公式如下: 其中 表示不同通道间的权重。最后,通过CSA加权的不同通道信息计算为 与 的乘积,公式如下: 其中 。不同颜色的通道表示带不同权重的多传感器序列空间关系。将 重塑为 ,并通过Conv2d输出最终提取的空间关系表示,公式如下: 其中 ,将被重塑为 作为CSA的输出。通过该方式,将 与 输入CSA得到 与 ,公式如下: 其中 与 包含发动机退化的局部变化特征及不同传感器间的空间相关特征,有效提升模型的特征表示能力。随后,对 矩阵中的每个元素,通过 与 的点积计算当前位置与其他局部区域的注意力分数,确定与局部区域的相关性。沿时序维度应用softmax函数得到不同局部区域相对于当前位置的权重,公式如下: 其中 表示学习到的当前位置与局部区域的注意力权重。最后,LECSA的输出计算为 与 的乘积,公式如下: 其中 是LECSA的输出,与输入 维度相同。此外,LECformer融合多头机制,可更全面地分析数据,大幅提升特征提取能力。多头LECSA过程如下: 其中 是多头LECSA的输出, 表示线性投影矩阵参数, 是头数, 。3.4 LECformer的输出层LECformer中,编码层可统一堆叠 层,使模型获取深度特征。提取的这些特征将作为输出层的输入,用于预测RUL。输出层结构包含展平层与两个全连接层(Fully Connected Network, FCN)。这些层内的计算过程如下: 其中 是RUL预测结果,ReLU是激活函数, 与 是可学习参数矩阵。随后,将进行实验分析,以评估LECformer的核心组件及其整体性能。3.5 相较传统Transformer自注意力的优势(1)增强局部特征提取:Transformer中的传统自注意力机制主要通过计算序列中所有位置对的注意力分数捕获全局依赖,但可能忽略对精准建模RUL预测中细粒度退化模式至关重要的局部上下文信息。通过融入卷积操作,LECSA显式捕获局部模式与变化,增强模型学习细节局部特征的能力。(2)建模多通道空间相关性:RUL预测通常涉及来自多个传感器的数据,每个传感器捕获系统状态的不同方面。传统Transformer独立处理每个特征维度,可能忽略不同传感器通道间复杂的空间相关性。LECSA中的CSA机制通过计算跨通道注意力权重有效建模这些空间关系,使模型能动态强调更具信息性的通道,提升特征融合效果。(3)高效捕获长期依赖:尽管Transformer通过自注意力机制天生具备建模长期依赖的能力,结合卷积操作可确保高效捕获全局与局部依赖。该双重能力使LECformer优于传统Transformer,尤其在RUL预测这类需理解整体趋势与局部异常的任务中。4 案例研究1:基于C-MAPSS与N-CMAPSS数据集的实验4.1 数据集描述4.1.1 C-MAPSS数据集商用模块化航空推进系统仿真(Commercial Modular Aero-Propulsion System Simulation, C-MAPSS)(Saxena等,2008)数据集是RUL预测方法性能验证中最常用的数据集之一,根据不同运行条件与故障模式分为FD001–FD004四个子数据集。C-MAPSS数据集的相关细节见Saxena等(2008)。相较于FD001与FD003数据集,FD002与FD004数据集的运行环境更复杂,使RUL预测更具挑战性。每个子数据集均包含训练集与测试集,目标是在训练集上训练模型,预测测试集中每个发动机的RUL。在监测的21个传感器中,7个传感器(编号 1、5、6、10、16、18、19)数值恒定,对预测结果无影响,因此从序列分析中剔除这些传感器的数据。RUL定义为发动机发生故障前的剩余运行周期数。值得注意的是,发动机在出现故障前通常经历稳定运行阶段。为与其他方法标准化对比(Song等,2020;Li等,2018),本研究将最大RUL值设为 125,超过该值则认为发动机进入退化阶段。4.1.2 N-CMAPSS数据集N-CMAPSS(Arias Chao等,2021)数据集更详细精准地描述运行条件,贴近涡扇发动机的实际退化过程。因此,N-CMAPSS对RUL预测任务提出更大挑战,是评估RUL预测方法泛化性与鲁棒性的理想基准。本文选取N-CMAPSS数据集中的DS02子数据集评估所提LECformer的性能。DS02子数据集包含来自不同涡扇发动机的数百万条退化轨迹,每个发动机具有独特初始条件,详情见表1。实验中,按照Ren等(2023)的建议,以0.001Hz的速率对DS02进行下采样。DS02数据集中采集的多传感器数据包括14个实测传感器信号、2个虚拟传感器信号与4个场景描述符,具体细节见Arias Chao等(2021)。表1 N-CMAPSS中DS02数据集的描述 重要的是,C-MAPSS与N-CMAPSS数据集包含各类噪声与异常值,模拟实际运行条件。这些干扰可能来自传感器误差、环境因素与意外运行异常,在实际场景中频繁发生。此类噪声与异常值的存在是对所提模型的关键测试,考验RUL预测的鲁棒性与可靠性。通过在该数据集上训练与评估模型,可有效评估模型过滤无关数据、在干扰因素下保持精准预测的能力。这使C-MAPSS与N-CMAPSS数据集在展示模型处理非理想实际数据的适应性与鲁棒性方面极具价值。4.2 实验设置4.2.1 数据预处理输入数据为多传感器时序数据,每个数据具有不同单位与尺度,可能增加模型训练难度。为解决该问题,本文采用最小-最大归一化(min–max normalization)(Ding等,2022)预处理采集的数据 。第 个传感器的时序数据记为 ,归一化公式如下: 其中 与 分别表示 中的最大值与最小值。该归一化过程确保采集数据的数值缩放至0到1区间。随后,本文采用滑动时间窗(Zhang等,2022)方法处理归一化后的多传感器数据,该方法常用于时序数据分割。滑动时间窗的操作如图4所示。滑动时间窗大小记为 ,滑动步长固定为1。当前时间窗内的最后一个时间步指定为RUL标签,其计算方式如下: 其中 表示发动机故障的周期数, 表示当前周期数。 图4 滑动时间窗的操作过程4.2.2 评估指标本研究采用三个关键评估指标确定所提方法的有效性。第一个是广泛使用的均方根误差(Root Mean Square Error, RMSE)函数,另外两个是评分(Score)与修正评分(Score )函数(Saxena与Goebel,2008)。与RMSE不同,Score函数对预测RUL超过实际RUL的情况施加更严重的惩罚,这符合实际中延迟预测可能导致更严重后果的情况,公式如下: 其中 表示样本总数, 与 分别是预测与实际RUL值。为抵消不同划分方式的差异(Ren等,2023;Tian等,2023),本文N-CMAPSS数据集定义 。实验中,RMSE、Score与 数值越低,表示预测精度与性能越好。4.2.3 实验设置训练阶段采用 Adam 优化器,总训练轮次(epoch)设为 150。为降低过拟合风险,采用早停策略,耐心值设为 20 个轮次。训练数据集按20%验证集、80%实际训练集划分。批大小设为256,损失函数采用均方误差(Mean Square Error, MSE)函数。FD001与FD003数据集的学习率设为0.001;FD002、FD004与DS02数据集的学习率设为0.0005。全连接层采用dropout技术,丢弃率为0.3。通过网格搜索确定LECformer结构的最优配置,如表2所示。为更好验证LECformer的泛化性能,本文在C-MAPSS数据集上确定LECformer的模型参数,并将相同结构参数应用于N-CMAPSS实验。为降低随机性影响,所有实验重复十次,计算平均性能作为最终实验结果。表2 LECformer的实验参数设置 4.3 实验分析本节全面分析LECformer的各方面性能,包括滑动时间窗大小的影响、核心组件分析、与其他方法的对比分析。此外,提供学习到的注意力权重可视化,深入理解模型的决策过程,突出预测RUL中 特定特征的重要性。通过详细分析,本文旨在凸显LECformer框架的优势与潜在改进方向,为预测性维护技术的未来发展奠定基础。4.3.1 滑动时间窗大小的影响选择合适的滑动时间窗大小对实验至关重要。时间窗过大可能包含无关信息,降低预测速度;时间窗过小可能导致模型缺乏多传感器时序数据的有用信息,降低预测性能。为验证该参数的影响,本文在四个数据集上采用不同窗大小开展实验,结果如图5所示。可观察到,FD001与FD003数据集在w=40时RMSE与Score值最小,FD002与FD004数据集在w=70时数值最小。该观察结果与C-MAPSS数据集的分析一致,即FD002与FD004发动机的RUL预测比FD001与FD003更困难。因此,更大的窗大小更有利,可包含更多退化信息。据此,DS02数据集的窗大小设为70,与FD002与FD004设置一致。后续实验将采用该选定窗大小。 图5 不同滑动时间窗大小下LECformer的性能4.3.2 LECformer的预测性能分析为更全面分析所提LECformer的预测能力,从 FD001–FD004 数据集的测试集中随机选取一台发动机,预测其全生命周期运行至故障过程的 RUL。同时,为验证所提深度架构的有效性,将LECformer与三种代表性深度网络架构对比,包括基于深度 LSTM 的架构(双向LSTM(BiLSTM)(Wang等,2018))、基于深度CNN(DeepCNN,DCNN)的架构(Li等,2018)与基于深度Transformer的架构(双视角自注意力 Transformer(DAST)(Zhang等,2022))。如图6所示,实验结果表明,与其他方法相比,LECformer更贴近发动机实际RUL轨迹。此外,尽管复杂故障模式与运行条件使FD002与FD004发动机预测更具挑战性,LECformer仍保持良好的预测精度。此外,DS02测试集上发动机单元11、14、15的预测结果如图7所示。可看出,尽管模型结构基于C-MAPSS数据集选定,LECformer在DS02数据集上仍展现出优异的预测结果,验证了其出色的泛化性能。实际应用中,维护人员可根据实时预测RUL制定更合理的维护计划。 图6 FD001-FD004上的预测结果 图7 DS02上的发动机单元11、14和15的预测结果4.3.3 与当前最优方法对比为全面评估所提LECformer的性能,本文在相同案例研究中将其与多种当前最优 RUL 预测方法基准测试。对比方法包括纯基于RNN/CNN的方法(DCNN(Li等,2018)、BiLSTM(Wang等,2018)与混合CNN-W(Wen等,2023));此外,还考虑融合RNN/CNN与注意力机制的方法,包括分布式注意力时序卷积网络(DA-TCN)(Song等,2020)、注意力门控CNN(AGCNN)(Liu等,2020a)与双注意力 Transformer(DA-Transformer)(Liu等,2022);对比分析还包括纯基于 Transformer 自注意力机制的方法,即多尺度集成深度自注意力网络(MSIDSN)(Zhao等,2023)、距离自注意力网络(DSAN)(Xia等,2022)、DAST(Zhang 等人,2022)、动态长度 Transformer(DLformer)(Ren 等人,2023)、集成多头双稀疏自注意力网络(DSSN)(Zhang等,2023)与遗传算法优化Transformer(GA-Transformer)(Mo与Iacca,2023)。不同模型的选择可全面评估LECformer的相对性能,为其在 RUL 预测中的有效性提供有价值参考。表3与表4展示C-MAPSS数据集与DS02数据集的性能对比实验结果。显然,与其他方法相比,LECformer展现出最佳预测性能,尤其在具有挑战性的FD002与FD004数据集上。这表明LECformer能更好应对复杂环境下的预测任务。值得注意的是,LECformer在Score指标上提升更显著,体现其在实际应用中的优势。与基于RNN/CNN框架的预测方法相比,LECformer采用Transformer架构提升捕获序列单元间长期依赖信息的能力。与传统基于自注意力的方法相比,LECformer提出新型LECSA机制替代自注意力,可自适应融合局部上下文信息与全局依赖及多传感器空间相关特征,提升模型预测性能。综上,上述结果与讨论表明,所提LECformer具备出色的多传感器时序数据建模能力。表3 C-MAPSS数据集上与先进方法的对比结果 表4 DS02数据集上的对比结果 4.3.4 与Transformer变体对比本节开展多项实验,将所提LECformer与三种时序领域代表性Transformer变体(Wu等,2020;Kitaev等,2020;Zhou等,2021)的性能对比。由于这些Transformer 变体最初为时序预测设计,而非直接应用于RUL预测,本文将其核心组件用于特征提取任务。提取的特征随后通过LECformer的统一输出层处理,得到最终RUL预测。该方式可在RUL预测特定场景下重点对比 Transformer变体的特征提取效率,凸显LECformer在提升预测精度方面的独特 贡献。深度Transformer(Deep Transformer)(Wu等,2020)采用传统自注意力架构;Reformer(Kitaev 等,2020)采用局部敏感哈希自注意力替代传统自注意力;Informer(Zhou等,2021)采用概率稀疏自注意力与蒸馏操作。实验设置与LECformer保持一致。C-MAPSS与N-CMAPSS数据集的实验结果如表5所示,表明LECformer具有更优的预测性能。不同基于Transformer 变体在DS02数据集上的预测结果如图7所示。从结果可观察到,LECformer的预测误差显著小于其他几种基于Transformer的方法。与其他自注意力变体相比,LECSA在同时从多传感器数据中提取长期依赖、局部上下文信息与空间相关特征方面表现更出色。因此,LECformer在RUL预测任务中表现更优。表5 和Transformer变体的对比结果 4.3.5 LECformer消融实验为验证所提LECformer核心组件的有效性,本文开展消融实验,包括LECformer、无局部增强的LECformer(LECformer w/o Local)、无CSA的LECformer(LECformer w/o CSA)、采用自注意力机制的传统Transformer。无局部增强或CSA的LECformer分别表示LECformer中不使用局部增强或CSA。传统Transformer与LECformer的区别在于采用传统自注意力机制。消融实验结果如表6所示。显然,在对比模型架构中,LECformer的RMSE与Score值最低,表明预测性能最优。可看出,移除局部增强或CSA后,预测性能显著下降,说明发动机的局部上下文特征与不同传感器间的空间相关特征对RUL预测同样具有重要价值。此外,LECformer的预测性能显著优于传统Transformer,表明所提LECSA机制相较于传统自注意力机制在RUL预测中更有效。传统Transformer架构采用点积注意力逐点计算每个时间步的相关性,更易受噪声与异常值影响。同时,LECformer中的LECSA机制可直接替代传统Transformer中的自注意力机制,展现出良好的实用性。表6 消融实验结果 4.3.6 模型复杂度与预测效率分析为更好分析所提方法的效率,本文对比多种代表性深度预测方法,包括基于Transformer的架构(深度Transformer(Wu等,2020)、DA-Transformer(Liu 等,2022)与DSSN(Zhang等,2023))、基于RNN的架构与基于CNN的架构(DCNN(Li等,2018))。结果如表7所示。DCNN 的复杂度主要由卷积操作决定,复杂度为 ,其中n是序列长度(输入标记数量), 是特征向量维度, 是卷积核大小。BiLSTM的复杂度主要由时序处理单元决定,复杂度为 ,其中 是隐藏状态维度。深度Transformer(Wu等,2020)的复杂度为 ,主要来自自注意力机制,导致序列的二次复杂度。DSSN(Zhang等,2023)的复杂度为 ,采用稀疏特征向量生成方法降低复杂度。DA-Transformer(Liu等,2022)与LECformer的复杂度为 ,其中 是通道数。通常,最大复杂度为 。可看出,LECformer额外引入与序列长度线性相关的计算复杂度,不会导致模型过度复杂增长。同时,LECformer融入卷积操作与CSA机制,提升模型捕获局部与多通道信息的能力,使RUL预测性能更优。 此外,本文还对比不同深度预测模型的预测时间。实验在相同实验条件下执行,以C-MAPSS的FD001数据集为例。预测时间结果如表7所示。从结果可看出,LECformer在GPU上对全部100台发动机的预测时间为0.057秒,即单台发动机预测时间为0.57毫秒。尽管LECformer单台发动机的预测时间相较传统Transformer有所增加,但可满足 RUL 预测的实时需求。表7 模型复杂度和预测效率的对比 4.3.7 学习到的LECSA权重可视化所提LECformer不仅能有效提取序列单元间的长期依赖,还能增强模型学习局部细粒度特征的能力。此外,其内部CSA机制可动态建模不同通道间的空间相关关系。为更好分析该特性,以FD001数据集的发动机单元34为例,可视化最后一个运行周期中LECSA与CSA组件学习到的注意力权重。学习到的注意力权重分布如图8所示,颜色越深表示权重值越高、相关性越强。LECSA中学习到的全局与局部注意力权重分布如图 8(a)所示,第i行第j列表示第i个时间步与第j个局部区域的相关程度。显著的是,可观察到LECSA机制使输入位置可与任意局部区域相关,无需考虑它们之间的距离。此外,某些颜色更深、有时位于远离当前位置的局部区域表明,LECformer具备有效识别长距离依赖信息的能力。图 8(b)中,不同颜色表示不同通道间的空间相关性。高维特征的每个通道映射可视为不同传感器间空间关联的表示。可看出,LECformer能动态提取空间相关特征,自适应关注通道信息,显著提升特征表示与模型预测性能。 图8 学习到的注意力权重可视化5 案例研究2:基于FEMTO轴承数据集的实验5.1 FEMTO轴承数据集描述为验证所提LECformer在实际设备中的有效性,采用FEMTO轴承数据集开展实验验证,该数据集源自加速退化PRONOSTIA平台(Nectoux等,2012),如图9所示。PRONOSTIA平台旨在真实反映轴承全生命周期的渐进退化过程。该数据集包含三种不同运行条件下17个轴承的运行至故障振动信号数据,详情见表 8。振动信号采样频率为25.6kHz,每10秒采集2560个数据点。本研究采用所有运行条件的训练数据训练LECformer,预测测试集中所有轴承的RUL。特别地,仅采用水平振动信号进行分析。这是因为水平振动信号比垂直振动信号包含更多与RUL预测相关的信息(Ren 等,2022)。 图9 用于轴承加速退化的PRONOSTIA平台表8 轴承数据集描述 5.2 实验设置5.2.1 轴承振动信号处理本节仅对原始振动信号采用快速傅里叶变换(Fast Fourier Transform, FFT)获取频谱特征信息,不采用复杂信号处理方法。随后,按频率范围求和能量得到一组频域特征。频率范围设为64,得到20个频域特征。经FFT变换后的振动信号数据采用与案例1相同的数据归一化与滑动时间窗处理。RUL标签归一化至0到1区间,作为轴承健康状态指标。该归一化方案中,0表示故障状态,1表示完全健康、无退化状态。该归一化过程更直观地反映轴承随时间的状态,便于直接应用预测模型评估健康退化与预测即将发生的故障。确定频谱特征与对应RUL标签后,可构建基于LECformer的深度 RUL 预测模型。5.2.2 评估指标采用三个广泛使用的指标评估性能。其中两个是知名的RMSE与平均绝对误差(Mean Absolute Error, MAE),另一个是修正评分 函数(Nectoux等,2012),已被众多研究者采用,定义如下: 其中 表示轴承总数, 与 分别表示每个轴承的实际与预测 RUL。 与C-MAPSS数据集中的 函数(Saxena与Goebel,2008)不同,数值越大表示预测性能越好。5.2.3 超参数设置训练阶段采用 MSE 损失函数与Adam优化器促进网络学习。最大轮次设为100,学习率配置为0.0005。数据按8:2划分为训练集与验证集,采用dropout率0.3降低过拟合风险。通过大量不同窗大小实验,确定滑动时间窗大小为10最优。LECformer的参数配置与C-MAPSS数据集实验一致,如表2所示。5.3 LECformer预测结果分析本节评估所提LECformer用于轴承退化RUL预测的性能。本文开展多项轴承预测实验以展示其有效性。选取三种运行条件下的所有测试轴承,预测其从健康到故障的RUL。采用三种代表性方法对比,包括基于RNN的架构(BiLSTM(Wang等,2018))、基于CNN的架构(DCNN(Li等,2018))与基于Transformer的架构(DAST(Zhang等,2022))。测试数据的RUL预测结果如图10所示。预测结果表明,所提 LECformer 能很好地预测轴承退化趋势。值得注意的是,尽管LECformer的预测值与实际RUL值非常接近,但在真实RUL值附近存在一定波动。这些结果凸显模型有效捕获与预测轴承随时间退化的能力,尽管精度因案例不同略有差异。与其他三种代表性深度预测方法相比,本文LECformer在不同运行条件下均具备良好预测性能,证明其有效捕获不同退化模式的能力。此外,LECformer提供的RUL预测值大多接近或小于真实RUL值。该特性具有优势,因为高估RUL可能比低估带来更严重的后果。实验结果表明,LECformer可很好地应用于从轴承振动信号中提取退化特征信息,执行实时 RUL 预测,在工程领域具有良好应用前景。 图10 不同方法在测试轴承上的预测结果比较5.4 与当前最优方法对比为进一步验证所提LECformer在轴承振动信号上的RUL预测性能,本文在该预测问题上实现不同当前最优方法进行对比。这些预测方法包括:基于RNN/CNN的方法(BiLSTM(Wang等,2018)与 DCNN(Li等,2018))、纯基于Transformer的方法(DAST(Zhang等,2022))与融合RNN/CNN与Transformer的方法(卷积Transformer(CoT)(Ding与Jia,2021)与注意力双向LSTM(A-BiLSTM)(Rathore与Harsha,2022))。预测结果如表9所示。LECformer在大多数轴承上显著优于对比方法,实现最高的平均预测性能。具体而言,LECformer的预测精度大幅提升,与现有当前最优模型相比,平均RMSE降低41.7%,平均MAE降低 33.4%, 指标提升22.2%。值得注意的是,作为预测性能实际衡量指标的 凸显了LECformer的优越性,证明其在该关键方面的显著优势。总体而言,LECformer展现出强大的复杂振动信号建模能力,凸显其在高精度、高可靠预测轴承RUL方面的有效性。6 讨论本研究展示的实验结果全面证实了所提LECformer模型在多个基准数据集(包括C-MAPSS、N-CMAPSS与FEMTO数据集)的RUL预测中具有优越性能。这些结果与本文初始研究目标高度契合,即开发一种新型基于Transformer的架构,能有效捕获全局依赖与局部上下文信息,同时建模多传感器通道间的空间相关性。LECformer在所有评估数据集上始终优于现有当前最优方法。具体而言,在 C-MAPSS 数据集(FD001–FD004)中,与DCNN、BiLSTM 及各类基于Transformer的基线模型相比,LECformer实现最低的RMSE与Score指标。该提升凸显LECformer通过有效融合长期依赖与局部特征提取,精准预测RUL的能力增强。类似地,在N-CMAPSS(DS02)数据集上,LECformer的RMSE与Score指标大幅降低,凸显其在更复杂运行环境中的鲁棒性与泛化能力。消融实验进一步验证LECformer核心组件的有效性。移除LECSA或CSA机制均导致预测性能显著下降,表现为RMSE与Score值升高。此外,学习到的注意力权重可视化表明LECformer能动态优先关注相关时序与空间特征,进而提升预测精度。尽管LECformer因融入卷积操作与CSA机制引入额外计算复杂度,模型仍足够高效以满足实时应用需求。单台发动机约0.57毫秒的预测时间完全符合实时RUL预测的要求。最后,LECformer成功应用于FEMTO轴承数据集(涵盖不同运行条件下的实际轴承退化),证明模型的泛化能力。LECformer在不同轴承与运行设置下保持高预测精度,展现其在多样工业环境中的适应性与有效性。尽管具备优势,LECformer存在一定局限性。因融入卷积操作与注意力机制导致计算复杂度增加,可能对资源受限环境或需实时处理的应用部署带来挑战。此外,模型性能高度依赖大量高质量多传感器数据的可用性,而实际场景中并非总能获取。LECformer在完全新型设备类型或训练数据中未出现的未知故障模式上的泛化能力也存在潜在局限性。未来工作将聚焦于优化模型计算效率,探索数据增强与迁移学习技术提升适应性,改进模型鲁棒性与可解释性,以促进在多样工业环境中的更广泛应用。7 结论深度学习方法因擅长处理多传感器工业时序数据,被广泛应用于RUL预测。但现有模型通常难以同时提取全局与局部特征,无法有效建模多传感器间的空间相关性。为解决上述问题,本文提出LECformer,一种专为工业RUL预测设计的新型基于Transformer的架构。与传统基于RNN/CNN的方法不同,LECformer利用Transformer捕获序列数据中长期依赖的能力。相较于原生Transformer,LECformer采用LECSA机制替代线性逐点点积自注意力,融合线性投影与卷积操作,更好地捕获长期依赖与更精细的局部特征。此外,LECformer中的CSA机制动态优先考虑不同通道的重要性,优化特征融合。本文通过一系列消融实验严格验证LECformer的有效性。在C-MAPSS、N-CMAPSS与FEMTO数据集上的大量实验表明,LECformer始终优于现有当前最优方法,在RUL预测中实现更优精度与可靠性。未来工作将探索将LECformer与迁移学习和数据增强技术融合,进一步提升其在多样RUL预测场景中的适应性与性能。 编辑:陈宇航校核:李正平、陈凯歌、曹希铭、赵学功、白亮、任超、海洋、赵栓栓、Kira、Tina、王金、赵诚、肖鑫鑫、张优该文资料搜集自网络,仅用作学术分享,不做商业用途,若侵权,后台联系小编进行删除来源:故障诊断与python学习

未登录
还没有评论
课程
培训
服务
行家
VIP会员 学习计划 福利任务
下载APP
联系我们
帮助与反馈