首页/文章/ 详情

论文学习||AgentOps:面向LLM智能体系统的运维框架综述(下)

6月前浏览1431

在上期内容论文学习||AgentOps:面向LLM智能体系统的运维框架综述(上)中,我们已梳理了智能体系统的分类、异常现象、运维体系及监控相关内容,本期将聚焦论文下半部分,为大家完整分享前沿综述论文——《AgentOps:面向LLM智能体系统的运维框架综述》(下)。

该研究开创性提出了面向智能体系统的全生命周期运维新范式,在上期界定的智能体内部异常与智能体间异常两大核心类别基础上,进一步深入拆解异常类型,全面覆盖推理、规划、动作、内存、环境、任务规范、安全、通信、信任、涌现行为、终止等11类具体异常。同时,论文构建了包含监控、异常检测、根因分析、修复验证四大环节的AgentOps(智能体系统运维)闭环框架,重点阐述了根因分析的分类体系及异常检测与根因分析的映射关系,并给出了涵盖验证、迭代修复、异常解决的完整解决方案。

相较于传统AIOps方法,AgentOps首次将模型参数、注意力图谱、思维链快照等语义级数据纳入监控体系,有效破解了智能体系统的“黑箱”问题。此外,论文还针对AgentOps在监测、异常检测、根因分析、解决方案四大维度面临的挑战,展望了未来发展方向,最终形成完整结论,为智能体规模化、可靠落地提供了重要支撑。

论文链接:通过点击本文左下角的阅读原文进行在线阅读及下载。     

论文基本信息

论文题目: A Survey on AgentOps: Categorization, Challenges, and Future Directions

论文来源:arXiv

Doi:https://doi.org/10.48550/arXiv.2508.02121

github地址:https://github.com/linafaik08/agentic-investor-brief

作者: Zexin Wang1,*, Jingjing Li1, Quan Zhou1, Haotian Si1, Yuanhao Liu2, Jianhui Li1, Gaogang Xie1, Fei Sun3, Dan Pei4, Changhua Pei1
论文时间: 2025年8月
机构: 

1:Computer Network Information Center, Chinese Academy of Sciences, China  

2:Hangzhou Institute for Advanced Study, University of Chinese Academy of Sciences., China  

3:Institute of Computing Technology, Chinese Academy of Sciences, China  

4:Tsinghua University, China

摘要

随着大语言模型(LLMs)推理能力的持续提升,基于LLM的智能体系统在灵活性和可解释性方面较传统系统更具优势,因而备受关注。然而,尽管智能体系统在学术界和工业界广受研究关注并得到广泛应用,但这类系统与传统系统一样,常会遭遇异常现象。这些异常导致系统不稳定且存在安全隐患,阻碍了其进一步发展。因此,亟需建立一套全面系统的智能体系统运维方法论。遗憾的是,当前关于智能体系统运维的研究尚显匮乏。为填补这一空白,本文开展了智能体系统运维的系统性调研,旨在构建清晰的领域框架、界定核心挑战并推动后续发展。本文首先系统定义智能体系统中的异常现象,将其划分为智能体内部异常与智能体之间异常两大类。随后提出名为"智能体系统运维(AgentOps)"的创新性综合运维框架。本文详细阐释了该框架的四个关键阶段:监控、异常检测、根本原因分析及问题解决,并给出了具体定义。

关键词:人工智能;软件与应用安全;智能体系统,运营

目录

1 引言    

2 智能体系统的分类    

    2.1 智能体系统的定义  

    2.2 智能体分类

3 智能体系统中的异常现象    

    3.1 智能体系统中异常的定义  

    3.2 智能体内部异常  

    3.3 智能体间异常  

4 智能体系统运维    

    4.1 运维演变  

    4.2 传统系统运维与智能体系统运维的区别  

    4.3 结论  

5 监控智能体系统    

    5.1 监测数据示意图  

    5.2 当前监测方法  

    5.3 挑战  

6 异常检测    

    6.1 推理异常  

    6.2 规划异常  

    6.3 动作异常  

    6.4 内存异常  

    6.5 环境异常  

    6.6 任务规范异常  

    6.7 安全异常  

    6.8 通信异常  

    6.9 信任异常  

    6.10 涌现行为异常  

    6.11 终止异常  

7 根本原因分析    

    7.1 代理失败根本原因分类体系  

    7.2 从异常检测到根本原因分析的映射  

8 解决方案    

    8.1 解决方案验证  

    8.2 解析模式:迭代修复与多轮验证  

    8.3 代理系统的异常解决  

9 AgentOps的挑战与未来方向    

    9.1 监测  

    9.2 异常检测  

    9.3 根本原因分析  

    9.4 解决方案  

10 结论

注:小编能力有限,如有翻译不恰之处,请多多指正~若想进一步拜读完整版,请下载原论文进行细读。

6 异常检测

6.1 推理异常

推理异常的检测与缓解方法可根据所用输入信息的类型分为白盒、灰盒和黑盒三类。白盒方法利用令牌序列、每个令牌的相关概率以及模型参数。相比之下,灰盒方法不使用模型参数。最后,黑盒技术仅依赖于令牌序列。

6.1.1 白盒模型

SPALMA[9]提出大型语言模型具备独立评估先前状态准确性的能力。然而即便拥有此能力,大型语言模型仍可能产生幻觉。这是因为大型语言模型本质上是令牌预测器,其在每个步骤中致力于预测概率相对较高的令牌,但未必能确保整个令牌序列具有最高概率。此外,LLM采用概率采样而非直接输出最高概率的词元。因此SPALMA认为,LLM的内部参数在某种程度上能反映幻觉现象。为解决此问题,他们提出基于LLM参数的分类器。该分类器通过涵盖多元主题的大型数据集训练,能够以零样本方式检测幻觉。OPERA[49]提出在推理阶段解决幻觉问题,无需像SPALMA等方法那样引入额外数据或训练模型。其动机源于在自注意力图中观察到的"局部过度信任"现象:特定摘要令牌周围的注意力分数呈现出列状结构,即聚合模式。该模式在长上下文中更易出现,从而增加幻觉概率。为解决此问题,OPERA引入列向量度量识别聚合模式,并设计惩罚机制调整令牌生成概率以降低幻觉概率。此外,该方法提出回溯策略:当根据评分检测到幻觉时,系统将回溯至摘要令牌重新生成序列。诚实模型[108]提出,当问题超出大型语言模型的知识边界时会产生幻觉。该模型着重强调模型的诚实性,认为诚实的模型应坦率回答其掌握的问题,并在缺乏必要知识时谦逊承认。最初定义了进化指标来评估模型是否对超出能力范围的问题作出回应。此外引入"IDK(我不知道)"响应机制,要求模型在遇到知识边界外的问题时必须给出IDK回复。最后探讨了提示工程和监督式微调等技术手段以解决此类异常现象。

6.1.2 灰盒方法

LURE[123]认为,通过在大规模高质量数据上进行大量训练来减少幻觉现象并不可行。因此,该研究提出轻量级解决方案。通过实验与理论分析,其识别出导致幻觉的三大因素:共现关系、不确定性及物体 位置。基于这些因素,LURE利用大型语言模型同时构建幻觉样本与正常样本。据此数据训练的校验器负责在推理阶段检测幻觉并直接修改响应内容。Conformal[79]从保形预测中汲取灵感,提出尽管语言模型的采样空间有限,仍可通过采样与修剪方法获得更优质的响应。具体而言,该方法通过计算令牌序列的logit值来评估采样响应的质量。若响应满足特定停止规则则予以保留,否则予以舍弃。

6.1.3 黑箱

Debate[26]指出,以往缓解幻觉的方法(如自我一致性)通常仅针对单个模型实例。然而,受《心灵社会》启发,Debate 提出不同大型语言模型或智能体可对同一输入提供多元视角。为此,每个实例需被提示阅读并评估其他所有实例的响应,从而更新自身答案。通过迭代优化,该方法旨在获得更精确的解决方案。CoK[62]是一种创新的推理框架,它使大型语言模型能够在回答过程中主动查询多个异构知识源(如维基 百科和数据库),以获取准确的事实信息。这些信息将逐步整合到生成的推理链中,从而降低产生"幻觉"的风险。在知识体系框架内,先前生成的推理链将被复审并修正,进而优化后续推理。这种迭代过程能逐步提升整体响应的实事准确性与逻辑连贯性。

6.2 规划异常

规划异常可根据其发生位置分为单步异常和多步异常。

6.2.1 单步生成

Introspective[63]研究指出,大型语言模型生成的计划方案常存在不切实际或违背常识的问题。为解决此问题,本文提出两种技术方案:首先采用RAG技术召回相似计划方案,辅助生成合理的后续步骤;其次运用符合性预测技术,基于词元概率生成多个高质量答案,并通过人类反馈进一步优化选择。API-bank[59]提出,通过微调大型语言模型(LLMs)可增强其规划能力,从而减少幻觉现象。为此,API-bank 广泛收集了涉及真实 API 调用的对话,构建了训练数据集用于模型训练。该训练显著提升了模型的规划能力。在评估阶段,研究重点分析了被识别为规划幻觉的主要错误,并勾勒出潜在的未来研究方向。

6.2.2 多步骤任务

Toollm[78]指出,尽管先前方法已减少规划幻觉现象,但仍存在若干局限。主要问题在于API库等方法受限于上下文,仅关注单次API调用。然而现实环境中,完成任务往往需要调用多个API并进行多次交互。为解决此问题,Toollm 收集大量API数据,同时生成单工具与多工具指令。此外,该研究提出基于深度优先搜索的决策树模型,用于构建连贯的规划路径。通过这些数据,大型语言模型(LLMs)经过微调后显著提升了工具调用能力。反思机制[88]提出,智能体在多次迭代后可能产生幻觉。为解决此问题,该机制基于外部反馈构建解决方案,使智能体能够回顾先前执行步骤并优化后续轨迹。该反馈可分为三类:简单的二进制环境反馈、针对常见失败情况的预定义启发式策略,以及自我评估(如使用LLM进行二元分类决策或编写单元测试进行编程)。相较于强化学习训练等方法,这种反思机制更为轻量且高效。

6.3 动作异常

由于操作通常通过函数调用和MCP执行,操作异常可分为函数调用异常和MCP异常。

6.3.1 函数调用

在早期阶段,动作执行是通过函数调用实现的。当发生错误时,系统会立即返回错误信息,使得异常检测和缓解相对简单。因此,本节将不对此主题进行深入讨论。

6.3.2  MCP.

AI-Infra-Guard [91] 运用智能体技术检测 MCP 内部潜在风险,包括工具中毒攻击和跑路等常见威胁。异常检测仅是AI-Infra-Guard 在 MCP 中的部分功能,该系统还能对 AI 组件执行安全扫描。MCP Guardian的核心机制是在基于MCP的AI系统中添加一个"安全优先"的中间件层。该层增强了客户端(MCP 客户端)与数据源/工具服务器(MCP 服务器)之间的通信能力,主要包含四个核心组件:身份验证、速率限制、调用信息详细日志记录以及数据包内容深度检测。

6.4 内存异常

由于代理的记忆分为短期记忆和长期记忆,记忆异常可分为短期记忆异常和长期记忆异常。

6.4.1 短期记忆

先前的方法(如旋转位置嵌入 RoPE)在短上下文窗口上训练,却在更长的窗口上进行推理,导致外推能力薄弱。为解决此问题,PI[16]引入了位置插值机制。该方法利用位置编码可为非整数值的特性,通过缩放整个窗口(例如将 4096缩减至 2048)使其适应模型上下文窗口长度的限制。CoA[118]指出,先前用于扩展上下文窗口长度的方法(如微调)容易导致"中间信息丢失"问题。为解决此问题,CoA 提出多智能体协作方案:第一阶段中,不同智能体分别处理输入的不同片段并传递结果给后续智能体;第二阶段由管理智能体整合这些输入以生成最终答案。

6.4.2 长期记忆

ReDeep[89]提出,在 RAG 过程中,外部知识与模型内部参数之间的冲突极易引发幻觉异常。为解决此问题,ReDeep通过计算并处理两项评分来评估幻觉:外部上下文评分与参数化知识评分。通过调节残差流中知识前馈网络(FFNs)与复 制头(Copying Heads)的贡献,该方法有效抑制了幻觉现象。LRP4RAG [44] 采用经典算法——分层相关性传播(LRP),通过在生成器输出逻辑值后执行反向传播 LRP 来获取相关性矩阵。该相关性矩阵随后被输入预训练分类器以检测幻觉。总体而言,RAG 中的幻觉检测与标准幻觉检测具有显著相似性。

6.5 环境异常

环境异常通常体现在环境相关指标的不规则性或日志异常中。因此,传统的基于微服务的监控和异常检测,诸如时间序列异常检测等方法能够有效解决这些问题。因此,本文不再对此进行进一步阐述。

6.6 任务规范异常

如前所述,任务规格不明确极易导致任务失败,但此类异常往往被忽视。传统系统鲜少涉及人类参与,其运行通常聚焦于执行阶段,却未在执行前阶段处理人类配置问题。而在 AgentOps 中,人类作为智能体系统的重要组成部分,其所引发的异常现象已无法被忽视。然而,目前针对该问题的研究尚显不足。尽管部分研究将其视为一种重要的异常类型[11],但鲜有有效解决方案被提出。一种可行方法是采用类似幻觉检测的技术,通过评估大型语言模型对不同提示的潜在状态响应来实现。其原理在于:清晰的提示会降低后续阶段的随机性,而模糊的提示则可能导致更广泛的潜在路径。

6.7 安全异常

安全异常可能严重危及系统安全性,因此催生了多种检测恶意攻击的方法,其中主要采用基于图论的方法。

6.7.1 图论方法

多智能体投票法是处理外部攻击引发的智能体安全异常的常用手段。然而GUARDIAN[121]指出该方法忽视了智能体间的依赖关系。因此其将智能体系统建模为图结构,并采用编码器-解码器框架对整个图进行压缩与重建。通过重建评分识别潜在异常位置。

SentinelAgent [41] 指出,多智能体系统中可能出现多种安全异常,其中多智能体协调风险尤为常见。为应对这一问题,该方案提出三层检测

方法:首先从全局视角出发,随后逐步深入进行更细致的检查。

6.8 通信异常

通信异常的主要成因在于代理系统的持续扩张,导致传输消息量不断攀升。然而其中大量消息实属冗余,过度的冗余信息反而可能引发任务失败。

6.8.1 冗余性

AgentPrune[112]指出,对话内与对话间的交互均可能导致通信冗余,代理会消耗大量标记并进行低效的交流。为解决此问题,AgentPrune 提出将整个智能体系统构造为图结构,并训练基于低秩原理的图掩码。该掩码用于提取并聚焦图中关键部分的通信。AgentPrune既缓解了通信冗余,又提升了通信效率。

G-Designer [113]采用更宏观的视角,主张最优通信拓扑结构会因任务而异。因此,它会生成针对特定任务定制的不同拓扑结构。具体而言,它运用图自编码器对整个智能体系统进行压缩,并重建最优拓扑结构。

6.9 信任异常

信任异常通常涉及评估代理消息的可靠性。一种直接的方法是采用推理异常讨论中的方法来处理此问题。然而,从系统层面的视角审视该问题也能带来新的见解。ATrust[38]强调,随着A2A通信日益普及,评估来自不同源代理的消息可信度变得日益重要。若未能做到这一点,将严重危及任务安全性。然而,该领域仍存在诸多挑战。基于提示工程的方法易产生幻觉,而依赖外部工具的方法则受限于工具质量。ATrust通过六维度注意力图评估可信度:事实准确性、逻辑一致性、相关性、偏见、语言质量及清晰度。

6.10 涌现行为异常

涌现行为异常源于多个智能体间的复杂交互,导致无法归因于任何单一智能体的系统级行为。此类异常具有高度隐蔽性,因为它们可能并未违反任何单个智能体的约束条件,却仍会引发系统层面的不良后果。目前业内尚无有效方法能检测此类异常。

6.11 终止异常

此类异常可能表现为无限循环或过早终止。无限循环通常可通过日志和跟踪记录轻松检测,而过早终止则通常通过监控任务成功率等指标来识别。目前,业内尚无其他前沿且有效的相关研究成果。

7 根本原因分析

随着自主智能体成为关键业务运营的核心组成部分,对其故障进行快速精准的根本原因分析(RCA)已成为保障系统可靠性的核心挑战。与传统软件不同,智能体故障的根本原因分散于基础设施、模型行为和编排逻辑之中,常形成复杂的因果链--某一维度的故障往往会触发其他维度的故障。本节旨在为智能体运维(AgentOps)建立系统化的RCA框架,该框架将明确定义问题空间、建立诊断映射,并提出可执行的应对策略。

7.1 代理失败根本原因分类体系

要有效诊断故障,本文首先需要一套能够准确归因故障源的分类体系。本文提出的分类法并非单纯的学术练习,而是经过精心设计以确保其可操作性,并引导业界聚焦于最具创新性的挑战。其设计基于两大核心动机:

首先,该框架直接契合构建和维护代理系统所涉及的独特技术栈与团队职责。这确保了根本原因分析(RCA)流程的结果并非抽象结论,而是针对相应团队的明确指令——无论是系统问题对应的运维/站点可靠性工程(SRE)团队,模型相关问题对应的机器学习工程团队,还是编排逻辑对应的代理开发团队。这种与实际责任的紧密结合,使该框架具备极高的可操作性。

其次,该分类法在战略上将"旧"问题与"新"问题区分开来。它将系统可靠性这一已充分理解的领域,与"软逻辑"协调这一新兴且至关重要的挑战区分开来。通过这种方式,本文得以利用数十年的现有工程实践。

7.2 从异常检测到根本原因分析的映射

在实践中,根本原因分析(RCA)流程由异常检测(AD)系统的警报触发。异常检测系统回答"发生了什么问题",而根本原因分析则必须探究"为何发生"。为确保本文叙述的连贯性,必须在 AD 部分识别的异常类型与 RCA 框架的根本原因类别之间建立清晰的映射关系。

异常检测框架将异常分为两个层级:单体内部异常(涉及单个智能体的内部认知过程)与跨体异常(涉及智能体与其环境之间的广泛交互)。本文的根因分析框架能够系统性地追溯这些观测到的异常,将其溯源至系统中心维度、模型中心维度或协调中心维度。表 7 展示了这种映射关系,揭示了智能体故障的多维特性。该映射揭示了一个关键洞见:单一的高级异常类型很少仅由单一根本原因引发。例如,AD 系统检测到的推理异常可能源于系统层问题(RAG 提供的错误数据)、模型层问题(核心幻觉)或协调层问题(缺陷提示)。因此,根本原因分析(RCA)流程的作用在于运用下文所述方法论,厘清这些潜在成因并精准定位故障的真正根源。这种结构化方法能避免团队过早将责任归咎于模型——实际问题可能源于数据或提示工程环节。

8 解决方案

8.1 解决方案验证

代理系统运行中最关键的组件之一,是对实施的解决方案进行系统性验证,以确保其在有效纠正检测到的异常的同时,未引入不良副作用。主要评估指标是任务成功率,若解决方案实施后代理的任务成功率持续高于实施前,则该解决方案被视为有效。目前评估该指标主要有两种方法:

人工标注:由人类专家依据详细评分标准评估智能体表现。该方法被视为准确性的黄金标准,能对任务成功与突发行为的微妙之处作出细致判断。然而其资源消耗大,难以有效扩展以实现持续的实时监控。

LLM-as-a-Judge [120]:作为可扩展的替代方案,该方法采用独立的强大大型语言模型(LLM)来评估智能体的表现。该"评判者"LLM 依据预定义的成功标准和评分细则,对智能体的日志和输出进行评估,从而实现任务成功率的快速、大规模自动化评估。

8.2 解析模式:迭代修复与多轮验证

与传统 IT 系统中异常处理通常遵循线性离散的"检测-诊断-修复"工作流不同,处理智能体系统中的异常需要向持续迭代管理转变。在现代智能体系统中,"局部影响"的假设--即修复措施可控且效果可预测--已根本失效。这种失效源于两大核心特性:首先,当智能体由大型语言模型驱动时,其行为本质上具有概率性和非确定性;相同输入在多次试验中未必产生相同输出。其次,系统作为复杂适应性系统运行,其整体行为是无数非确定性智能体局部交互的涌现属性。因此,修复单个智能体的异常并非简单修复,而是对系统平衡的扰动--这种干预将改变所有交互智能体的运行环境。

该挑战的核心在于其引发次级效应和级联行为转变的高度可能性。假设某个智能体被诊断出规划异常,导致其运行效率低于最优水平。运维团队可能通过修改其规划启发式或效用函数进行干预。虽然干预的预期直接效果可能得以实现--例如:随着智能体效率的提升,由此引发的行为改变必然改变智能体间的动态关系,可能导致不可预见的系统性故障。例如,新获得高效能的智能体可能垄断关键共享资源,导致其他智能体资源匮乏,进而引发通信异常与突发性异常--表现为系统瘫痪或资源冲突升级。本质上,解决智能体内部异常时,无意中催生了更复杂的智能体间异常,这种现象难以事先预测。

鉴于这些挑战,异常解决必须是一个循环往复且基于经验的过程。任何修复方案都应视为需要广泛验证的临时假设。干预后系统不会立即修复,需要经过多轮观察周期来监测全局性能与交互模式。这将使新动态得以显现,潜在副作用浮出水面。因此,异常解决成为系统性调优的迭代过程:实施干预→多轮观察系统响应→分析涌现行为→优化修复方案→直至达成稳定的预期状态。

8.3 代理系统的异常解决

为解决复杂智能体系统中的异常现象,本文提出一个清晰可行的框架,将潜在解决方案划分为两大类:系统设计驱动型解决方案与提示优化驱动型解决方案。系统设计驱动型解决方案是基础性的架构模式,通过在系统层面嵌入稳健框架、安全机制和反馈回路,确保安全可靠的运行。这类方案通常由系统架构师和工程师负责。相较之下,提示优化驱动型解决方案聚焦于智能体与其底层语言模型的直接交互,涉及认知流程与交互指令的迭代优化--这属于人工智能与提示工程师的领域。这种分工使团队能更有效地诊断故障根源:究竟源于基础设计缺陷,还是指令逻辑问题。

8.3.1 系统设计驱动的解决方案

这些方案是系统架构的有机组成部分,需要正式的工程设计。它们专注于构建持久的弹性框架,实施预防性安全措施,并建立响应式反馈循环以实现检测与演进。

8.3.2 基于提示优化的决策方案

这些策略侧重于与智能体底层语言模型的直接交互。它们通常在智能体的推理循环中实现,涉及动态生成、优化和评估用于引导智能体思维过程与行动的提示。

9 AgentOps的挑战与未来方向

9.1 监测

在当前的代理系统中,监控面临两大主要挑战。首先,传统监控工具的能力有限--它们主要捕获指标、日志和跟踪数据。如第5节所述,模型数据和检查点数据在代理系统中至关重要,但它们往往超出常规可观测性方法的范围。其次,海量观测数据(尤其是模型相关数据)若管理不当,将带来巨大的内存开销。因此,未来关键发展方向在于构建能够大规模有效观测多样化数据类型,同时确保高效存储与资源利用的监控解决方案。

9.2 异常检测

如第3节所述,当前智能体系统中的异常现象具有多样性特征,这带来了重大挑战:缺乏能够同时识别多种异常类型的统一检测算法。为每种异常类型部署独立的异常检测模型将给在线服务带来巨大开销。因此,关键的未来方向在于探索更轻量高效的算法设计,以统一方式检测更广泛的异常类型--本质上是为代理系统开发全面且可扩展的异常检测框架。

9.3 根本原因分析

如第7节所述,结构化RCA框架虽提供了清晰的诊断路径,但在实践中面临重大挑战:因果归因的模糊性。单个观测到的异常可能源于系统、模型和编排层多重交织的根本原因,导致难以孤立故障的真实根源。若对每个潜在原因分别进行深入分析,将引入显著的诊断延迟和计算开销。因此,关键的发展方向在于构建更自动化高效的因果推断技术,以统一方式解析复杂故障场景--本质上是为智能体系统打造可扩展的智能根本原因分析引擎。

9.4 解决方案

在AgentOps的解决阶段,主要挑战在于由大型语言模型驱动的智能体系统固有的复杂性和不可预测性。与传统IT系统相比,智能体系统的解决方案无法依赖确定性、孤立的修复措施,因为智能体行为具有概率性特征,且存在复杂的自适应交互。解决单个智能体的局部异常往往会引发不可预见的次级效应、级联行为转变及系统性不稳定,需要通过迭代修复和多轮验证来应对。有效的解决机制需要持续监控与优化,综合运用系统级设计(如冗余机制、防护栏、回滚策略和自适应政策)与模型级干预(包括提示优化和自我修正)。这种迭代方法能确保异常真正解决且不产生意外副作用,但持续的观察、验证和系统调优需求显著增加了解决过程的复杂性。      

10 结论

大型语言模型推理能力的持续提升显著加速了智能体系统的发展进程。然而,智能体系统频繁遭遇异常状况,当前尚缺乏有效的运维解决方案。本文提出智能体系统异常的新定义及全面分类体系,将其划分为智能体内部异常与智能体间异常。此外,本文专门针对智能体系统设计了新型运维框架AgentOps,该框架涵盖四大核心组件:监控、异常检测、根本原因分析及问题解决。各组件均经过深入分析与系统归类。本研究整体上深化了对智能体系统的认知与管理,为其更稳健可靠的部署奠定了基础。

编辑:肖鑫鑫

校核:李正平、陈凯歌、曹希铭、赵学功、白亮、任超、海洋、陈宇航、Kira、Tina、王金、赵诚、赵栓栓、张优

该文资料搜集自网络,仅用作学术分享,不做商业用途,若侵权,后台联系小编进行删除



来源:故障诊断与python学习
化学航空ADSpython通信海洋LMS理论电机数字孪生试验人工智能数控InVEST
著作权归作者所有,欢迎分享,未经许可,不得转载
首次发布时间:2026-04-08
最近编辑:6月前
故障诊断与python学习
硕士 签名征集中
获赞 87粉丝 153文章 336课程 0
点赞
收藏
作者推荐

中科院一区Top论文学习|传感器感知胶囊网络:面向可信的多传感器融合剩余使用寿命预测

本期给大家推荐传感器感知胶囊网络:面向可信的多传感器融合剩余使用寿命预测。在工业预测与健康管理领域,基于深度学习与多传感器数据融合的剩余使用寿命预测技术,因能更全面捕捉机械设备的退化过程而备受关注。然而,现有研究多聚焦于预测精度的提升,对模型可信性,尤其是含不确定性感知的预测合理性及可解释性的重视仍显不足。为解决这一问题,最新研究提出了一种名为传感器感知胶囊神经网络(Sensor-aware Capsule Neural Network, SACN)的新型框架,专门面向多传感器融合场景下的RUL预测任务。该框架不仅通过胶囊网络的动态路由机制增强特征表达能力,还研发了一种基于胶囊激活水平的蒙特卡洛丢弃法,用于实现预测结果的不确定性量化。此外,该方法具备多传感器融合解释能力,可将预测结果及其不确定性归因至各传感器的原始特征,揭示输入与输出之间的关联机制。论文基本信息论文题目:Sensor-aware CapsNet: Towards trustworthy multisensory fusion for remaining useful life prediction 论文期刊:Journal of Manufacturing SystemsDoi:https://doi.org/10.1016/j.jmsy.2023.11.009作者:Dongpeng Li (a,b), Jiaxian Chen (a,b), Ruyi Huang *(a,b), Zhuyun Chen (b,c), Weihua Li (b,c) 论文时间: 2024年 机构: a: Shien-Ming Wu School of Intelligent Engineering, South China University of Technology, Guangzhou 511442, China b: Pazhou Lab, Guangdong Artificial Intelligent and Digital Economy Laboratory, Guangzhou 510335, China c: School of Mechanical and Automotive Engineering, South China University of Technology, Guangzhou 510641, China作者简介:黄如意,香港城市大学博士后研究员,他的研究主要聚焦于人工智能方法在工业设备智能故障诊断与预测中的应用,尤其擅长利用深度学习和迁移学习技术处理复合故障诊断问题。(摘自Researchgate) 通讯作者邮箱:huangruyi@scut.edu.cn 摘要基于深度学习技术的多传感器数据驱动型剩余使用寿命(Remaining Useful Life, RUL)预测因能更全面捕捉机械设备的退化过程而愈发受到关注,其预测性能通常也更优。然而,现有研究对提升模型的可信性重视不足,尤其是在含不确定性感知的预测中,模型的合理性与可解释性方面的研究较为欠缺。为解决这一问题,本文提出一种名为传感器感知胶囊神经网络(Sensor-aware Capsule Neural Network, SACN)的新型框架,用于RUL预测中的多传感器融合任务。同时,研发了一种基于胶囊激活水平、结合蒙特卡洛方法的新型丢弃法,实现不确定性量化。此外,该方法还支持多传感器融合解释,能将预测结果和不确定性归因于各传感器的相关特征。在C-MAPSS数据集上的案例研究表明,所提方法的性能优于主流的深度学习方法。具体而言,通过传统精度指标和本文提出的不确定性覆盖分数评估发现,基于胶囊丢弃法的SACN在预测精度和合理性上均优于高斯丢弃法;同时,可通过多传感器融合解释揭示输入特征与最终预测结果之间的关联,量化每个传感器对给定输入的贡献度。关键词:剩余使用寿命预测;可信人工智能;多传感器融合;不确定性量化;胶囊神经网络 目录1 引言2 基础理论2.1 结合期望最大化路由的胶囊网络2.2 多头注意力机制3 方法3.1 问题定义3.2 传感器级注意力封装3.3 基于胶囊的预测3.4 基于胶囊丢弃法的不确定性估计3.5 多传感器融合解释4 实验研究4.1 数据集4.2 数据预处理与实验设置4.3 实验结果4.4 不确定性与解释性分析5 结论与未来展望1 引言故障预测与健康管理(Prognostics and Health Management, PHM)是一种预测性维护技术[1, 2],旨在革新设备维护保障模式,提升机械运行的安全性。其中,剩余使用寿命预测(Remaining Useful Life, RUL)是预测技术中最具挑战性的核心环节[3]。该技术基于传感器监测数据、设备运行环境,亦可结合物理模型或其他信息,预测设备未来的故障发生时间。借助涡轮风扇发动机、齿轮箱等关键工业设备的RUL预测结果,可及时制定设备运行计划和维护方案,从而避免突发事故的发生。RUL预测的研究方法主要分为三类:基于物理模型的方法、数据驱动的方法以及二者的融合方法[4]。基于物理模型的方法需要大量先验知识,对于涡轮风扇发动机这类复杂结构,其模型构建难度大,实际应用可行性较低[5, 6]。而数据驱动的方法则利用监测数据,通过线性或非线性方式捕捉设备固有的退化规律并拟合模型,这类方法对先验知识的需求较少,还可进一步细分为基于随机过程的方法、基于传统机器学习的方法和基于深度学习的方法。基于随机过程的方法将传感器数据拟合成维纳过程、伽马过程、逆高斯过程等随机过程模型,以此估算机械设备的RUL;基于机器学习的方法无需将数据拟合至随机过程模型即可实现RUL估算,但需要进行特征提取与选择,以保证预测性能。过去数十年间,深度学习技术的出现为PHM领域中直接将监测数据映射至最终预测结果提供了可行方案[7, 8],越来越多的研究开始融合压力、温度、振动等多传感器数据来评估设备健康状态。多传感器数据能从多个维度反映设备的退化特征,进而提升预测的准确性[9, 10]。Zhang等[11]通过感知从传感器数据中提取健康指标,并利用长短期记忆网络(Long Short Term Memory, LSTM)追踪设备历史退化规律,实现对未来健康状态的预测;Aydemir等[12]提出了一种异常触发的RUL预测方案,采用软多数投票法实现传感器融合。近年来,部分学者将胶囊网络应用于PHM领域[13, 14]。Andreas等[15]首次将胶囊网络用于RUL预测,取得了当前最优的性能;Li等[16]提出了一种基于胶囊网络的多模态数据融合框架,用于涡轮风扇发动机的RUL估算,该框架按模态提取监测数据特征,并在胶囊层直接实现特征融合,最终依据最后一层胶囊姿态矩阵的欧几里得范数得到模型预测结果。尽管基于深度学习的方法在RUL推断中被证实能实现较高的预测精度,但其 “黑箱” 特性导致的不可解释性,阻碍了该类方法在实际工业场景中的进一步应用。为此,众多学者开展了提升模型可信性的相关研究[17]。提升模型可信性的一种实用方法是实现含不确定性感知的预测,即量化模型对给定输入的不确定性程度[18]。目前已有多种方法可实现特定输入下的不确定性量化,包括蒙特卡洛丢弃法[19]、局部不确定性估计模型[20]、自助法[21]以及上下界估计法[22]等。She等[23]基于自助法提出了双向门控循环单元(Bidirectional Gated Recurrent Unit, BiGRU)方法,获取RUL的置信区间,该方法能有效利用机械设备的历史和未来退化状态。此外,也有研究聚焦于RUL预测的不确定性从部件级向系统级的传播,以及基于不同系统架构的系统可靠性评估[24]。同时,学者们还尝试将领域知识嵌入模型框架,或挖掘与最终预测结果相关的关键特征[25]。例如,Li等[26]将传感器间的关联关系表示为流程图,并转化为嵌入向量进行聚类,利用聚类结果指导传感器数据的排列,提升模型的透明性;Xiong等[27]提出了一种集成物理信息故障模式识别器的RUL预测框架,该框架便于融合与故障相关的特征,实验结果表明,该模型不仅能实现准确的故障模式识别,还具备一定的层级可解释性;Wang等[28]通过事后解释技术解析设备健康状态模型,并将得到的洞察用于指导模型训练。现有文献主要从不确定性量化、嵌入领域知识或挖掘推理依据以提升可解释性这两个独立方面开展研究,构建可信的RUL预测模型,但仍存在一些研究空白亟待填补:(1)现有方法仅能对输出结果进行不确定性量化,无法揭示输入数据中不确定性的来源,在多传感器融合场景中尤为明显,因此无法明确输入的具体部分对预测不确定性的贡献;(2)现有研究极少探讨估算置信区间的合理性,这可能导致得到不合理的含不确定性感知的预测结果。如图1所示,合理性指模型能感知自身对预测值的不确定程度。例如,图1中案例3和案例4的模型均对预测值表现出高置信度,但案例4的预测值与真实值存在显著偏差,该结果缺乏合理性,可能误导决策者制定不当的维护计划。 图1 RUL不确定性量化中的合理性为解决上述问题,本文研发了一种新型的统一框架——传感器感知胶囊网络(Sensor-aware Capsule Neural Network, SACN),用于实现可信的RUL估算,该框架可完成多传感器融合解释,并对预测结果的不确定性进行合理量化。具体而言,本文设计了传感器级注意力封装模块和基于胶囊的预测模块,融合多传感器监测数据以推断RUL值;在模型的训练和测试阶段,执行基于激活水平的胶囊丢弃法,结合先验知识得到更合理的置信区间,并通过提出的不确定性覆盖分数(Uncertainty Coverage Score, UCS)对置信区间的合理性进行对比评估;最后,基于胶囊网络[29]固有的可解释性,并受贝叶斯神经网络[30]解释思路的启发,提出多传感器融合解释方法,将含不确定性感知的预测结果转化为多传感器特征的贡献度和不确定性。本文的主要贡献总结如下: (1)提出SACN,以统一的方式实现可信的RUL推断,将多传感器融合解释与合理的不确定性估计有机结合,输出兼具可解释性和不确定性感知的预测结果。 (2)基于SACN的层级结构,设计了一种结合反向追溯的多传感器融合解释分析方法,揭示各传感器特征的贡献度和不确定性。 (3)考虑预测偏差和评估得到的不确定性,提出UCS这一指标,用于评估RUL值置信区间的合理性。 (4)提出基于胶囊激活值的胶囊丢弃法,实现不确定性估计,该方法在含不确定性感知的RUL预测中,在精度和合理性上均表现出优势。 本文的后续结构安排如下:第2节介绍本文所用的胶囊网络基础理论以及不确定性估计的合理性相关概念;第3节详细阐述所提方法;第4节以涡轮风扇发动机数据集为研究对象开展案例研究;最后,第5节给出研究结论与未来展望。2 基础理论2.1 结合期望最大化路由的胶囊网络胶囊网络最初被提出用于捕捉图像中的空间关联关系,在处理视角变化识别和目标解耦任务时表现出良好的鲁棒性[31]。胶囊网络的建模灵感源于人类的视觉认知机制:人类仅通过一次观察,就能不受视角变化影响识别目标的外观,这是因为人类能为观察到的目标建立坐标系,并将目标的高层特征解耦为底层组成部分。在胶囊网络中,这种部分-整体的关联关系通过多层胶囊进行建模,上层胶囊由下层胶囊通过所谓的“协议路由”过程生成,最后一层胶囊则用于编码观测数据的高级特征,即神经网络通过该层胶囊实现预测。 胶囊网络模型的实现主要分为两个基本步骤:封装和路由。在封装步骤中,先对输入数据进行预处理,生成初级胶囊层;随后,在每一层胶囊中执行路由过程,通过寻找下层胶囊投票结果之间的一致性,生成更高级的胶囊。在介绍具体的过程和算法前,先对胶囊网络的相关符号总结如下: 本文采用期望最大化(ExpectationMaximization, EM)路由作为高层胶囊的推理算法[32]。与上述基本步骤类似,在封装步骤中,分别通过传统卷积操作从先前的特征图中生成姿态矩阵和激活值。在期望最大化路由过程中,通过迭代执行期望最大化算法,将下层胶囊的投票值V聚类为高斯混合分布,以此构建部分-整体的关联关系,每个高斯分布对应一个特定的高层胶囊,下层胶囊的激活值则代表其特征强度。关于期望最大化路由的详细过程,可参考下文总结的算法1[32]。 2.2 多头注意力机制 多头注意力机制最早由文献[33]提出,该机制通过查询向量和一系列键-值向量对生成注意力向量,输出向量则由值向量的加权和得到。加权系数通过查询向量与键向量的缩放点积计算得到;当查询、键、值向量属于同一序列时,该机制被称为自注意力机制。 多头自注意力层首先通过不同的线性投影矩阵,将维度为 的输入矩阵映射为h组矩阵,每组矩阵包含查询矩阵Q、键矩阵K和值矩阵V三个不同矩阵,其中查询矩阵Q和键矩阵K的维度为 ,值矩阵V的维度为 。随后,对h组矩阵分别执行如公式(1)所示的自注意力操作。最后,将自注意力操作得到的h个输出矩阵拼接为维度为 的输出矩阵R,如公式(2)所示。 其中,线性映射矩阵 的维度为 。需要说明的是,注意力分数通过 函数计算得到,这意味着输入元素之间存在竞争关系,只有对模型性能贡献更大的元素会获得更高的注意力分数。3 方法本节首先明确研究问题的数学定义,随后详细阐述所提的SACN,该网络由传感器级注意力封装模块和基于胶囊的预测模块组成,最后进一步说明基于胶囊丢弃法的不确定性量化方法和多传感器融合解释方法。3.1 问题定义本文的研究核心为基于多传感器监测数据的RUL预测问题。具体而言,将数据集表示为D={x(t),y(t)∣t=w,(w+1),...,L},其中x(t)为t时刻处的滑动窗口输入特征(窗口长度设为w),y(t)为t时刻的RUL值,L为设备全生命周期的长度。输入特征可进一步表示为s个传感器监测数据的拼接,即每个滑动窗口输入为一个二维矩阵,形式如下: 神经网络的训练目标为学习非线性映射关系 ,使得预测值 ,从而基于实时监测数据实现RUL的预测。3.2 传感器级注意力封装设计传感器级注意力封装模块,对多传感器输入进行按传感器的独立处理,增强提取到的特征,以实现多传感器监测数据的差异化区分。该封装模块的处理流程如图2底部所示。 图2 所提SACN概览 如图2所示,输入数据的维度为 ,分别代表输入通道数、窗口长度和传感器数量。首先,通过残差卷积块提取每个传感器的高维特征,本文中所有残差卷积核均设计为一维,并沿时间维度滑动。此外,为便于后续分组生成姿态矩阵和激活值,将卷积后特征的时间维度尺寸调整为 ,通道数扩展至 。随后,将传感器数量作为序列长度,将特征输入至多个多头注意力层,同时加入残差连接和层归一化操作,避免梯度消失问题[33]。 为生成初级胶囊,将得到的多源传感器特征分为两个输出分支:一个分支直接将特征分组,生成姿态矩阵;另一个分支通过核大小为 (与姿态矩阵维度一致)的卷积操作,将最后一个维度的尺寸缩小 倍,再分组生成激活值。最后,将生成的姿态矩阵和激活值拼接,得到初级胶囊层。 3.3 基于胶囊的预测本文采用胶囊网络捕捉多传感器间的关联关系,同时实现模型的可解释性分析[14]。在封装阶段得到多传感器初级胶囊后,通过期望最大化路由过程融合各传感器的独立特征,该过程如图2右上部分所示。 在胶囊层之间,下层胶囊通过多次路由迭代生成上层胶囊。首先,将通道数为 的下层胶囊转换为 组,作为生成不同通道上层胶囊的投票值;随后执行期望最大化路由过程,在M步计算分配责任系数,在E步计算姿态矩阵、方差和激活值。 将最后一层胶囊的数量设为1,即特征图的尺寸和通道数均为1。结合期望最大化路由的基本思想,每个上层胶囊可视为其下层胶囊的均值,其激活值反映了下层胶囊的聚类程度。将最后一层胶囊姿态矩阵的欧几里得范数作为模型输出,该范数代表聚类中心到原点的距离,其物理意义为设备的退化程度。3.4 基于胶囊丢弃法的不确定性估计蒙特卡洛丢弃法是一种简便且应用广泛的方法,用于量化大型或复杂神经网络模型预测结果的不确定性,其优化目标本质是最小化近似变分分布与深度高斯过程之间的KL散度[34]。换言之,在模型训练和测试阶段加入丢弃层,从数学角度等价于对网络参数进行变分推理[19]。 为便于阐释胶囊丢弃法,首先介绍如公式(4)所示的高斯丢弃法。高斯丢弃法并非以伯努利分布的方式丢弃神经元,而是从以变分参数 为均值的高斯分布中采样网络权重 ,具体可通过从均值为1、标准差为的高斯分布中采样乘法掩码 实现。其中, 、 、 和 分别代表第 行、第 列、第 行的所有元素和按元素相乘, 为神经元的丢弃概率。 本文中,每一层的胶囊均通过高斯混合建模生成,每个胶囊都带有由输入数据推导得到的固有不确定性,可为蒙特卡洛采样提供先验知识,本文将该方法命名为胶囊丢弃法。对于胶囊的每个姿态矩阵M,其采样过程如公式(5)所示,对姿态矩阵的每个维度从高斯分布中采样,等价于将姿态矩阵与服从 分布的掩码元素 按元素相乘,其中 通过算法1计算得到。实验部分将对比所提胶囊丢弃法与高斯丢弃法的有效性,并定义一个新指标,让评估结果更直观。 3.5 多传感器融合解释本节首先介绍基于胶囊网络固有特性的传感器贡献度解释方法,随后结合基于胶囊丢弃法的不确定性量化方法,详细阐述所提的多传感器融合解释方法。 胶囊网络本身具备通过反向追溯,揭示路由过程中上层胶囊贡献度的能力[14],该过程需要将下层胶囊的贡献度与期望最大化路由中对应的耦合矩阵 相乘(见算法1)。如图3所示,反向追溯从最后一层胶囊开始,结合耦合矩阵和最后一层胶囊的贡献度(特值设为1),得到高层胶囊层对最后一层胶囊的贡献度;通过类似的追溯过程,可得到初级胶囊层的贡献度,将每个通道的贡献度取均值,即为对应传感器的贡献度。 图3 反向追溯以解释各传感器贡献为进一步实现多传感器融合解释,揭示与不确定性相关的传感器贡献度,本文受贝叶斯神经网络解释思路的启发开展研究[30]。在该研究中,Kirill等人提出,可通过聚合蒙特卡洛丢弃法模型所有采样实例的事后解释技术得到的特征归因热力图,实现贝叶斯神经网络的不确定性解释。类似地,本文通过聚合基于胶囊丢弃法的SACN得到的所有传感器贡献度模式,得到与不确定性相关的传感器贡献度,该解释方法即为多传感器融合解释。如图4所示,首先通过蒙特卡洛采样得到N个SACN模型实例,利用这些实例得到N个RUL预测值 ;随后对每个预测结果进行反向追溯,挖掘传感器特征的贡献度;综合所有贡献度模式,可明确多传感器特征中对预测结果贡献最大的部分,以及每个特征对特定预测结果的贡献度不确定性,实验部分将开展进一步分析。 图4 基于胶囊丢弃与多传感器融合解释的不确定性量化4 实验研究4.1 数据集本文选用美国国家航空航天局艾姆斯研究中心提供的商用模块化航空推进系统仿真(Commercial Modular Aero-Propulsion System Simulation, C-MAPSS)数据集开展实验[35],该公共数据集被广泛应用于健康指标构建和RUL预测的相关研究,能实现不同方法性能的公平对比。图5展示了 C-MAPSS 数据集中涡轮风扇发动机的仿真模型结构,该模型包含发动机风扇、低压压缩机(LPC)、高压压缩机(HPC)、燃烧室、风扇轴(N1)、核心轴(N2)、低压涡轮(LPT)、高压涡轮(HPT)和喷管。 图5 发动机的仿真模型结构 C-MAPSS数据集包含4个子数据集,模拟了涡轮风扇发动机在不同运行工况和故障模式下的传感器数据,数据集的详细描述如表1所示。子数据集FD001和FD002模拟高压增压器性能退化故障,其余两个子数据集则模拟高压压气机性能退化和风扇退化两种故障模式;此外,子数据集FD001和FD003的设备运行工况为1种,其余子数据集的运行工况为6种,因此子数据集FD004的预测难度最大。每个子数据集均包含训练集和测试集:训练集记录了发动机从正常状态到完全故障的每个飞行循环的信息,包括运行工况和传感器数据;测试集仅记录了另一组发动机在特定时间的监测数据,并给出对应的RUL值。传感器数据包含21项传感器测量值,运行工况数据包含高度、马赫数和油门杆解算器角度三项发动机运行环境参数。 表1 数据集描述 4.2 数据预处理与实验设置 4.2.1 数据归一化与标签标注 由于各传感器的量纲不一致,会影响不同传感器数据之间的可比性和模型的收敛速度,因此需要将传感器数据归一化至[-1,1]区间,本文采用的最小-最大归一化法在该任务中比Z-score归一化法更有效。具体而言,训练数据的归一化计算如公式(6)所示: 其中, 和 分别为第j个传感器归一化前后的训练数据, 和 为训练数据中第j个传感器在设备全生命周期内的最小值和最大值。 在实际场景中,无法获取测试设备的全生命周期信息,因此测试数据的归一化以训练数据集的最小值和最大值为先验,计算如公式(7)所示: 其中, 和 分别为第j个传感器归一化前后的测试数据。在对输入样本进行标签标注时,采用分段函数:在设备初始故障发生前,RUL标签值保持恒定;进入退化阶段后,标签值呈线性下降。与输入数据的处理方式一致,为便于模型训练,对RUL值进行最小-最大归一化处理。 4.2.2 传感器选择 在选择网络架构超参数前,首先开展探索性数据分析,结果表明,21项传感器测量值中,部分数据始终保持恒定,直观来看不包含有效信息,即这些数据无法反映发动机的退化状态,应予以剔除。本文根据训练数据的方差进行传感器筛选,剔除方差小于 的传感器数据,仅将有价值的传感器数据作为模型输入。 4.2.3 实验设置 神经网络的结构配置如表2所示,列出了每个阶段各层的参数值及对应的输出尺寸;与网络训练相关的其他参数如表3所示。需要说明的是,为提升模型的鲁棒性并减少过拟合,在训练过程中采用添加高斯噪声、随机缩放和随机放大等数据增强手段。表2 网络结构 表3 网络训练的超参数设置 为验证模型预测结果的有效性和准确性,采用两个常用指标进行评估:均方根误差(RootMeanSquareError, RMSE)和评分函数(Score),两个指标的数值越小,代表预测性能越好。RMSE广泛应用于大多数回归任务,计算如公式(8)所示: 其中, 为预测误差。可见,RMSE对迟预测(预测值大于真实值)和早预测(预测值小于真实值)施加相同的惩罚。 与之不同,评分函数通过为迟预测和早预测分配不同的系数,对可能导致设备健康管理滞后的迟预测施加更严厉的惩罚,计算如公式(9)所示: 4.3 实验结果 4.3.1 RUL预测结果 本节展示4个子数据集的RUL预测结果,直观体现模型性能。图6为4个子数据集中,每个测试发动机最后一个记录时间步的RUL预测结果,横轴(发动机编号)按最后一个记录时间的标签值升序排列。可见,子数据集FD001和FD003的大部分预测值与真实值接近,尤其是记录时间周期较晚的发动机;而FD002和FD004的预测性能相对较差,原因是这两个数据集的运行工况数增至6种,增加了退化相关特征的提取难度。 图6 各子数据集最后记录时间步的RUL预测值 此外,图7展示了全生命周期的RUL预测结果,从每个数据集中选取2台生命周期记录相对完整的发动机作为示例。总体而言,所有测试发动机的预测曲线均能通过多源监测数据刻画设备的退化趋势。其中,FD001和FD003中发动机的RUL估计值在设备运行初期基本保持恒定,虽存在局部预测波动,但与分段式的RUL标签一致;尤其是在设备接近使用寿命末期时,模型能准确刻画其整体退化过程,这是因为设备的退化规律在该阶段通常会愈发明显。值得注意的是,模型输出的不确定性在预测值接近真实值时通常较小,而在预测值偏离真实值时较大,这为这类关键任务提供了合理且可靠的预测结果。 图7 各子数据集所选发动机的预测结果 4.3.2 对比分析 为验证所提方法的优越性,选取多种基于C-MAPSS数据集的相关预测方法进行对比,结果如表4所示。首先选取经典的深度学习算法,包括卷积神经网络(ConvolutionalNeuralNetwork,CNN)、BiGRU、LSTM等循环神经网络,以及深度置信网络(DeepBeliefNeuralNetwork,DBN);同时选取融合了不确定性量化技术的预测方法进行对比,包括蒙特卡洛模拟法和自助法。需要说明的是,表中各类算法的量化结果均直接引自其原始文献,避免作者为优化所提方法而产生的偏差。表末列出了所提方法分别在加入和未加入胶囊丢弃法(丢弃概率为 0.5)时的实验结果,即基于胶囊丢弃法的SACN (CapsDrop)和SACN。表中每一列的最小指标值以粗体标出。 表4 在C-MAPSS数据集上与相关预测方法的比较 总体而言,未加入胶囊丢弃法的所提网络在几乎所有子数据集中,两个评估指标均取得最优性能。其中,FD001和FD003的RMSE相较于次优结果,分别提升了13.21%和7.42%;而FD002和FD004的推理性能略优于基于哈密顿蒙特卡洛的卷积神经网络[36],提升幅度分别为2.69%和6.85%。此外,评分函数的结果也呈现出类似的规律。值得注意的是,在丢弃概率p=0.5时,加入胶囊丢弃法的SACN在几乎所有子数据集中的指标值略高,但其在整个训练轮数内的验证损失远低于未加入胶囊丢弃法的模型,稳定性更强。由此可见,所提的SACN在预测精度方面具有有效性。 4.4 不确定性与解释性分析 4.4.1 不同丢弃法的对比分析 本节从预测精度和置信区间合理性两个角度,对比胶囊丢弃法和高斯丢弃法的性能。如表5所示,选取两个子数据集,在不同丢弃概率下,训练并评估基于两种丢弃法的SACN模型。总体而言,基于胶囊丢弃法的不确定性估计性能优于高斯丢弃法,且随着丢弃概率的增大,性能提升的幅度也随之增加。具体在FD001中,即使丢弃概率p达到 0.9,模型的预测精度仍保持在较低的误差水平。 表5 不同丢弃法的精度对比 在合理性分析方面,由于目前尚无公认的不确定性估计评判标准,本文提出UCS这一新指标。首先,结合绝对误差和68%置信区间,按公式(10)计算不确定性覆盖误差θ: 随后,受评分函数思想的启发[37],对处于置信区间内θ<0和置信区间外(θ≥0)的不确定性覆盖误差进行差异化处理,即对正的 施加更严厉的惩罚,对负的 施加较轻的惩罚。据此,按公式(11)定义UCS: 为对比在相同预测精度下,哪种丢弃法能得到更小的UCS(即更合理的预测结果),在每个训练轮数对测试数据集进行评估,得到UCS与RMSE的关系,如图8所示。可见,胶囊丢弃法的指数趋势线均低于高斯丢弃法,表明胶囊丢弃法能实现更合理的不确定性建模。 图8 在训练周期中的测试数据集上UCS和RMSE的表现对比4.4.2 多传感器融合的不确定性解释 根据第3节提出的反向追溯方法,可揭示传感器特征对预测值的贡献度及其相关的不确定性。因此,本节首先通过分析各传感器特征的影响,验证反向追溯方法的有效性,随后深入探究输入特征与预测结果之间的关联关系。 为量化特定传感器特征的影响,在模型推理过程中屏蔽该通道的胶囊,计算预测结果与原始RUL值的绝对偏差。图9和图10分别展示了FD001和FD003中传感器特征的影响,每个子图代表一个阶段(40 个时间周期)的平均影响。其中,横轴和纵轴分别为传感器贡献度和其对预测的影响,散点颜色代表传感器贡献度的不确定性,红线为线性回归拟合线。理想情况下,传感器贡献度与其对预测的影响应呈正相关,图中结果总体符合这一规律,验证了反向追溯方法的有效性。但部分散点虽贡献度较低,却对预测产生较大影响,原因是RUL值通过高维空间中的欧几里得范数计算得到,部分贡献度低的特征可能会导致范数发生显著变化。 图9 传感器特性对RUL预测的影响(FD001中的2台发动机) 图10 传感器特性对RUL预测的影响(FD003中的2台发动机) 为探究输入特征与预测不确定性σ之间的关联,将所有时间周期内最终预测结果的标准差与特定传感器特征的标准差绘制成散点图,如图11所示,同时通过高斯过程回归拟合曲线和置信区间。按贡献度从高到低选取3个传感器特征进行分析,每个子图中的三种颜色分别对应这三个特征(蓝色、橙色、绿色)。每个子图的左侧部分显示,RUL预测的不确定性与传感器贡献度的不确定性呈正相关,且二者能明显区分,原因是模型对推理结果的置信度较高;此外,与具有相同预测不确定性水平的其他特征相比,贡献度更高的传感器特征,其自身的不确定性也更大。随着σ的增大,模型对推理结果的置信度降低,传感器特征之间的差异也愈发模糊。综上,多传感器融合解释结果证实,所提的SACN能在实现优秀RUL预测性能的同时,有效融合含不确定性感知的多传感器数据。 图11 传感器贡献不确定度与预测不确定度的关系5 结论与未来展望本文提出了一种基于多传感器数据驱动的SACN,实现可信的RUL预测。与现有的多传感器融合RUL预测方法相比,该方法取得了具有竞争力的预测精度:在子数据集FD001和FD003中,RMSE分别提升了13.21%和7.42%,而在FD002和FD004中的性能略差。通过传统精度指标和本文提出的UCS评估发现,所提的胶囊丢弃法能在降低预测偏差的同时,实现更合理的不确定性估计。此外,多传感器融合解释方法能揭示输入特征与含置信区间的RUL值之间的关联。但该方法尚未能实现数据层面的归因,即无法揭示监测数据中 特定部件或部分的贡献度。 在未来的研究中,可将专用建模技术引入特征提取模块,使提取的特征能更透明地与监测数据关联;同时,可进一步探索将设备的物理先验知识与胶囊网络深度融合,提升模型在小样本、跨工况场景下的泛化能力;此外,还可开展RUL预测的不确定性从传感器级到系统级的传播研究,为复杂工业系统的预测性维护提供更全面的决策依据。 编辑:陈宇航校核:李正平、陈凯歌、曹希铭、赵学功、白亮、任超、海洋、赵栓栓、Kira、Tina、王金、赵诚、肖鑫鑫、张优该文资料搜集自网络,仅用作学术分享,不做商业用途,若侵权,后台联系小编进行删除来源:故障诊断与python学习

未登录
还没有评论
课程
培训
服务
行家
VIP会员 学习计划 福利任务
下载APP
联系我们
帮助与反馈