首页/文章/ 详情

论文学习||AgentOps:面向LLM智能体系统的运维框架综述(上)

6月前浏览719

随着大模型智能体与AI技术的迅猛发展,智能体正逐步渗透至各行各业,成为人机交互、任务自动化与系统智能化的核心载体。然而,智能体在日益复杂的环境与场景中持续运行,其行为可控性、系统稳定性与长期可靠性也面临全新挑战——智能体的运维及异常检测,逐渐从幕后走向关键地位,成为保障其安全、高效、可持续运行的重要基石。  

本期给大家推荐一篇关于大语言模型智能体运维的前沿综述论文:《AgentOps:面向LLM智能体系统的运维框架综述》,开创性地提出了针对智能体系统的全生命周期运维新范式。

该研究系统定义了智能体系统的异常体系,将其划分为"智能体内部异常"与"智能体间异常"两大核心类别。论文构建了包含监控、异常检测、根因分析、修复验证四大关键阶段的AgentOps(Agent System Operations,智能体系统运维闭环框架,显著提升了智能体系统在不确定性环境下的自愈能力与运行可靠性。相比传统AIOps方法,AgentOps首次将模型参数、注意力图谱、思维链快照等语义级数据纳入监控范畴,有力解决了智能体系统"黑箱"难题。

由于文章篇幅过长,小编将分两次为大家翻译介绍这篇论文。论文链接:通过点击本文左下角阅读原文进行在线阅读及下载。     

论文基本信息

论文题目: A Survey on AgentOps: Categorization, Challenges, and Future Directions

论文来源:arXiv

Doihttps://doi.org/10.48550/arXiv.2508.02121

github地址:https://github.com/linafaik08/agentic-investor-brief

作者: Zexin Wang1,*, Jingjing Li1, Quan Zhou1, Haotian Si1, Yuanhao Liu2, Jianhui Li1, Gaogang Xie1, Fei Sun3, Dan Pei4, Changhua Pei1
论文时间: 2025年8月
机构: 

1Computer Network Information Center, Chinese Academy of Sciences, China  

2Hangzhou Institute for Advanced Study, University of Chinese Academy of Sciences., China  

3Institute of Computing Technology, Chinese Academy of Sciences, China  

4Tsinghua University, China

摘要

随着大语言模型(LLMs)推理能力的持续提升,基于LLM的智能体系统在灵活性和可解释性方面较传统系统更具优势,因而备受关注。然而,尽管智能体系统在学术界和工业界广受研究关注并得到广泛应用,但这类系统与传统系统一样,常会遭遇异常现象。这些异常导致系统不稳定且存在安全隐患,阻碍了其进一步发展。因此,亟需建立一套全面系统的智能体系统运维方法论。遗憾的是,当前关于智能体系统运维的研究尚显匮乏。为填补这一空白,本文开展了智能体系统运维的系统性调研,旨在构建清晰的领域框架、界定核心挑战并推动后续发展。本文首先系统定义智能体系统中的异常现象,将其划分为智能体内部异常与智能体之间异常两大类。随后提出名为"智能体系统运维(AgentOps"的创新性综合运维框架。本文详细阐释了该框架的四个关键阶段:监控、异常检测、根本原因分析及问题解决,并给出了具体定义。

关键词人工智能;软件与应用安全;智能体系统,运营

目录

引言    

智能体系统的分类    

    2.1 智能体系统的定义  

    2.2 智能体分类

智能体系统中的异常现象    

    3.1 智能体系统中异常的定义  

    3.2 智能体内部异常  

    3.3 智能体间异常  

智能体系统运维    

    4.1 运维演变  

    4.2 传统系统运维与智能体系统运维的区别  

    4.3 结论  

监控智能体系统    

    5.1 监测数据示意图  

    5.2 当前监测方法  

    5.3 挑战  

异常检测    

    6.1 推理异常  

    6.2 规划异常  

    6.3 动作异常  

    6.4 内存异常  

    6.5 环境异常  

    6.6 任务规范异常  

    6.7 安全异常  

    6.8 通信异常  

    6.9 信任异常  

    6.10 涌现行为异常  

    6.11 终止异常  

根本原因分析    

    7.1 代理失败根本原因分类体系  

    7.2 从异常检测到根本原因分析的映射  

解决方案    

    8.1 解决方案验证  

    8.2 解析模式:迭代修复与多轮验证  

    8.3 代理系统的异常解决  

9 AgentOps的挑战与未来方向    

    9.1 监测  

    9.2 异常检测  

    9.3 根本原因分析  

    9.4 解决方案  

10 结论

注:小编能力有限,如有翻译不恰之处,请多多指正~若想进一步拜读完整版,请下载原论文进行细读。

1 引言

随着DeepSeek-R1[35]Claude[4]等技术的出现,当前大型语言模型(LLMs)的推理能力正持续增强。基于LLMs构建的智能体系统--尤其是多智能体系统--凭借其强大的认知引擎特性,已具备完成各类复杂任务与社会模拟[60]的能力,当配备多样化工具时[78]表现尤为突出。相较于微服务架构[75]等传统系统,智能体系统能提供更优的自动化水平、增强的可解释性及更强的灵活性。因此,代理系统的研究与工业应用蓬勃发展,越来越多的在线服务[50],例如客户支持和推荐系统,开始采用这些代理系统。

     

智能体系统的异常现象。左侧展示任务执行过程中的异常情况,智能体在整合网络搜索结果时出现幻觉,导致生成错误答案。右侧呈现拍卖角色扮演模拟中的异常现象,对买家1的攻击引发异常高价竞标,最终导致拍卖崩 盘。      

然而,尽管智能体系统应用广泛,其缺陷依然存在。相较于传统微服务系统,智能体系统提供的更高灵活性也带来了更多异常现象。如图1所示,任务执行常因幻觉等问题而失败。在角色扮演场景中,对单个智能体的攻击可能导致整个模拟系统的崩溃。因此,为保障智能体系统的安全稳定并推动其持续发展,高效的运维机制至关重要      

尽管运维技术历经演变--从早期的手动操作到基于规则的方法,再到后来的IT运维人工智能(AIOps),但代理系统与传统系统在根本上存在显著差异。基于大型语言模型(LLM)的智能体行为特征与硬编码传统系统存在根本差异,主要区别包括:(1)智能体系统中出现的异常类型更为多样;(2)智能体系统对可观测性要求远高于传统系统,需重点关注LLM等模块;(3)异常的多样性使得统一方法无法在智能体系统中实现异常检测与根本原因分析。(4)代理系统的故障处置相对复杂且具有挑战性,需要多维度考量与迭代优化。因此传统运维技术难以适用于代理系统,亟需针对该类系统开发定制化的新型运维技术。      

目前,针对智能体系统有效运行维护策略的综合性研究尚显不足。多数研究仍聚焦于智能体系统的孤立方面,而非解决其整体运行挑战。例如,Durante[27]阐述了智能体范式与分类体系;Chakraborty[12]探讨基础模型中的幻觉现象,涵盖其定义与检测法;Deng等人[24]研究多智能体系统安全问题,主要涉及外部恶意攻击,并将威胁划分为执行内安全与交互安全两类;Shi[85]则详细剖析了图形用户界面智能体的安全问题及评估方法。      

为进一步推动智能体系统的发展,本文提出智能体系统运维(AgentOps)的概念--这是专为智能体系统设计的新型运维框架。首先,本文对智能体系统中的异常现象给出了精确定义并提出系统性分类框架,主要将异常分为代理内部异常与代理间异常两类。这两大类涵盖了代理系统生命周期中的执行前、执行中及执行后阶段。此外,借鉴传统运维实践,本文将代理系统的运维流程划分为四个阶段:监控、异常检测、根本原因分析及问题解决。针对每个阶段,本文识别出代理系统中出现的新挑战,并提出详细定义与潜在解决方案。据本文所知,这是首次系统性提出AgentOps概念并规范其各项流程定义的研究。

2 智能体系统的分类

2.1 智能体系统的定义

智能体系统指能够感知环境、自主决策、执行行动并最终完成任务的智能系统。这类系统通常由多个智能体构成,并具备四项核心能力[69]。随着大型语言模型的兴起与发展,当代智能体系统常基于这些模型构建,因其在多模态数据理解与推理方面具备卓越能力,且擅长工具运用。因此,本文主要聚焦于基于大型语言模型的智能体系统运作机制。          

l 、工具调用:基于大型语言模型的智能体系统通过工具调用与环境交互,持续获取观测数据作为反馈。该反馈为自动化推理与决策过程提供参考依据。早期实现中,工具调用通过函数调用完成--针对特定任务编写专用函数,并将函数描述格式化后输入至大型语言模型。然而不同语言模型间的差异导致格式及其他信息需频繁调整。模型上下文协议(MCP[3]通过标准化大型语言模型、外部数据源与工具之间的通信协议从根本上解决了这一问题。MCP的引入既促进了服务提供商开发对应服务API,同时避免了资源浪费。          

2、推理与行动:随着DeepSeek-R1[35]等具备推理能力的LLM出现,大型语言模型的推理能力日益强大,足以支撑基于LLM的智能体系统实现自动化决策并执行各类复杂任务。众多方法通过提示工程有效调用LLM的推理能力来增强智能体系统。例如:Chain-of-Thought[105]采用少样本方法引导LLM逐步推理;ReAct[109]提出"思考先行于行动"的策略;Reflexion[88]则建议在特定周期后对完整推理路径进行反思。          

3、短期与长期记忆:与人类相似,基于大型语言模型的智能体系统因令牌长度限制而具有有限的知识存储能力,因此需要有效的知识管理机制。常见的知识管理范式是将信息划分为短期记忆与长期记忆。短期记忆包含与当前任务密切相关的少量知识和观察结果,通常通过提示工程提供给大型语言模型。长期记忆则包含大量虽与当前任务关联性不强,但可在任务执行特定步骤时调用的知识库。长期记忆通常通过检索增强生成(RAG)和向量数据库进行管理。当需要调用知识时,系统会基于查询向量与知识向量间的相似度进行检索。诸如GraphRAG[28]RAG与向量数据库的创新技术,正持续推动该领域的发展。          

4、智能体通信:尽管多智能体系统日益受到关注,但大量研究表明,在许多场景中,其性能有时并不优于单一智能体。这凸显了智能体通信的关键作用。有效的分工与协作理应带来更优结果。因此,针对大型语言模型(LLM)代理的通信标准与协议已陆续提出,其中包括广为人知的代理间通信(A2A[18]协议。A2A协议引入了代理卡片的概念,用于系统化定义每个代理的能力,同时使客户端代理能够高效管理任务及所有参与代理。

2.2 智能体分类

在基于大型语言模型(LLMs)的智能体系统研究中,可根据参与智能体的数量进行基础分类。如图2所示,智能体系统可分为单智能体系统(SAS)与多智能体系统(MAS)。SAS系统以单个大型语言模型驱动的智能体为核处理单元。

2  智能体系统的分类体系      

这类系统通常应用于以下类型任务:

推理:该智能体通过调用内置知识或上下文线索,执行逻辑或数学推理以及因果推理。例如,AI科学家[67]通过开放式推理过程探索自动化科学发现。      

对话:智能体维持对话状态,解析用户意图,并生成语义连贯的回应。对话任务已超越文本交互范畴,延伸至包含图像、音频和视频的多模态沟通,例如GPT-4o[52]等系统所展示的应用。      

交互:智能体通过信息交换或执行操作,直接与相对简单且可预测的外部环境进行交互。典型代表是WebArena[122],其中智能体与结构化网页界面进行交互。      

相比之下,多智能体系统(MAS)由多个基于大型语言模型(LLM)的智能体在共享环境中协同运作。这些智能体既可相互协作,亦可相互竞争,使得MAS特别适用于处理单智能体系统难以应对的分布式、并发性或战略复杂性问题。典型的MAS应用包括:      

角色扮演与仿真:智能体被赋予特定身份、背景及行为规则,并在预定义框架内以符合角色特性的方式互动。此类仿真可研究由微观层面的交互所引发的宏观层面的涌现现象,例如社会动态、经济系统及疫情传播。典型案例包括模拟地缘政治冲突的WarAgent[48],以及建模宏观经济活动的EconAgent[60]      

合作与协作:多个智能体共享共同或部分一致的目标,并通过任务分解、协商和信息交换来实现这些目标。例如,在ChatDev[77]中,智能体协同参与代码生成和调试工作。      

博弈论互动:在目标可能冲突的情境中,行为主体必须在决策过程中考虑他人的策略。这涉及以下要素:竞争、谈判与激励机制设计,例如拍卖、多方博弈和零和博弈[45]      

值得注意的是,多智能体系统(MAS)能够完成传统智能体系统(SAS)的任务,且通常能提升性能。然而,这需要付出系统复杂性增加、潜在突发故障风险及更高维护成本的代价。因此,在SASMAS之间进行选择时,应基于目标应用领域的具体需求与约束条件[33]

3 智能体系统中的异常现象

3.1 智能体系统中异常的定义

前文指出,各类智能体系统的成功率并不高,表明存在大量阻碍任务任务成功完成的异常情况。根据Who&When[116]的研究,他们认为这些系统中的异常主要发生在任务执行的特定步骤。具体而言,若在某个异常步骤进行干预使其转化为常规步骤,从而确保任务成功完成,则该步骤即可被识别为异常步骤。然而,这一定义相当有限。传统微服务系统通常能长期稳定运行,无需考虑执行前与执行后阶段。相比之下,智能体系统的任务执行与其执行前提示密切相关,而执行后成功完成并不必然意味着未发生异常(例如推理幻觉等仍可能导致错误结果)。因此,如图3所示,本文将智能体系统中的异常定义为:在执行前、执行中或执行后阶段出现的任何导致任务中断或无法有效完成的情况。      

图3 智能体系统中异常的定义

基于上述定义,本文提出了一种针对智能体系统异常的新分类方法。如前所述,智能体系统可分为单智能体系统和多智能体系统。因此,异常既可能发生在单个智能体内部,也可能出现在多智能体交互过程中。这类似于传统服务架构中,异常既可能出现在单个服务的内部流程中,也可能发生在服务间通信过程中。因此,如图4所示,本文将所有异常归类为两类:智能体内部异常与智能体间异常。

4  智能体系统中的异常分类体系

3.2 智能体内部异常    

要完成复杂任务,智能体系统需要多个智能体协同完成不同子任务。智能体执行这些子任务的过程占据了任务执行时间的大部分。在执行子任务期间,智能体必须进行推理与规划,同时通过多种方式与环境交互,这极易导致异常现象的发生。代理系统中最常见的是代理内部异常。      

1、推理异常。智能体利用认知系统进行推理,进而指导后续行动,并为完成复杂任务奠定基础。近年来,众多方法被提出以增强推理能力,包括精细调整方法(如 SFT[104]RLHF[73]Search-R1[53] DeepSeek-R1[35])以及(如CoT[105]Reflexion[88]Self-Consistency[102]CoK[61]StepBack[119]等提示工程技术。尽管这些技术提供了支持,推理过程中仍频繁现异常现象。      

2、规划异常。自主规划与工具调用是智能体系统完成任务的核心功能。然而,受限于当前大型语言模型的概率特性,规划异常不可避免。此类异常通常源于规划阶段出现的幻觉现象。Park[74]指出,幻觉表现为系统在解释待执行操作的不确定性时,错误预测自主系统的可行性。Kwon等人[55]观察到LLM常产生与前期推理相悖的行动方案。Wang[97]Ren等人[82]指出,LLM这类生成式模型极易产出不合逻辑且错误的规划方案。Hu[46]将幻觉定义为与不存在实体(如错误工具或参数)的交互行为。综上所述,规划异常显著影响任务规划阶段,常导致任务失败,因此亟需重点关注。      

3、操作异常。在智能体系统中,初始操作通过函数调用实现。然而,由于接口非标准化和不一致等问题,操作异常容易发生。WANG [98]指出函数调用实践中的挑战,如延迟、API选择错误和系统故障。Wu等人[106]指出函数调用存在"越狱"风险:攻击者可构造特殊请求,诱使LLM调用敏感函数或绕过限制。MCP的出现已实现LLM与工具交互的标准化。然而,MCP并非万能良方;在实际应用中,MCP服务器的配置变更常导致操作异常[91]      

4、记忆异常。如前所述,智能体系统的记忆分为短期记忆与长期记忆。短期记忆指大型语言模型的上下文范围。即便当前大型语言模型的上下文范围不断扩展,仍常无法满足任务需求。因此许多智能体框架采用滑动窗口管理上下文,这可能导致重要初始信息(如任务完成指令)的丢失。即使LLM上下文容量满足任务需求,刘等[65]的研究表明,LLM常会忽略长上下文中段的信息。PI-LLM[95]也证实了LLM在工作记忆方面存在瓶颈。

5、环境异常。随着智能体系统的规模持续扩大,它们消耗了大量资源,尤其当智能体在本地执行资源密集型操作时。这可能导致环境相关的异常,例如资源不足或CPU使用率过高。

3.2 智能间异常    

1、任务规范异常。Cemri等人[11]指出,许多任务层面的失败源于任务定义不清,例如提示语不够明确。Altmann等人[2]强调,当任务定义不完善时,即使每个智能体的个体行为相对合理,也容易导致追逐和阻塞等情况。SentinelAgent[41]指出,当任务描述或提示未能充分涵盖潜在协作模式时,智能体可能偏离目标、形成串通,或出现提示注入等不可预见行为。因此,在执行前阶段评估任务描述的完整性,并在执行阶段进行反馈调整,是至关重要的操作步骤。      

2、安全异常。尽管已开发出A2A[34]ACP[51]等协议来标准化代理之间的通信,但它们仅确保不同代理能使用相同协议进行通信,并未解决协议整体的安全性问题。Frost等人[31]指出,在现实中的智能体系统中,某些智能体可能遭受恶意攻击,导致其频繁发送请求或消息,类似于分布式拒绝服务(DDoS)攻击。He [39]提出针对智能体系统的特定攻击方法(如图5所示),这些攻击既可针对智能体本身,也可针对智能体间的通信。      

   

不同类型的攻击

3、通信异常。正如Bronsdon[10]所强调的,在代理间消息交换过程中常会出现通信异常。这些异常具体表现为消息风暴--由过量消息传递引发,可能导致资源耗尽和延迟增加,最终造成任务失败。AgentPrune[112]同时指出消息冗余问题,强调过量消息并不能提升智能体系统的效率,反而会因冗余导致智能体迷失方向。      

4、信任异常。ATrust[38]指出,大型语言模型(LLM)代理对所有接收到的消息一视同仁。He[40]强调,LLM代理在接受其他代理的消息并将其纳入自身上下文时,既不进行一致性验证,也不考虑这些消息是否可信。然而不同代理的基础模型可能存在差异,加之记忆能力等因素的差别,它们在特定领域的处理能力也可能存在显著差异。例如,代码代理的编程能力明显强于通用型代理。因此不应统一对待不同代理的消息。盲目信任所有代理消息可能导致信息冲突或错误;反之若完全不信任任何代理,系统又将丧失协作能力。代理间的信任问题作为影响协作效率的关键因素,亟待解决。      

5、涌现行为异常。Sanjeev[83]指出,当多个智能体相互作用时,会产生宏观模式或行为,这些模式或行为在单独分析智能体时难以预测或解释,即为涌现行为。布朗斯顿[10]认为,涌现行为异常源于多实体间的复杂交互,由此产生的系统级行为无法归因于任何单一实体。因此,涌现行为异常虽属于相对较少被理解的异常类别,却可能引发严重后果。      

6、终止异常。Cemri[11]与微软[70]均将过早终止异常视为智能体系统中的重要异常类别。Smurfs[14]指出,在单智能体模式下,深度优先搜索决策树(DFSDT)常面临过早终止问题--系统在未完成多步推理时便过快调用终止工具。该问题会严重影响复杂任务的完整性与逻辑一致性。Zhang[116]将过早终止识别为多智能体系统中常见且可精确定位的故障根源。

4 智能体系统运维

本节将深入探讨AgentOps的起源、定义及具体范畴。本文将首先追溯运维的演变历程,该历程自然引出了AgentOps概念。随后,本文将概述AgentOps与传统运维在不同阶段的主要差异,阐明传统运维为何无法应对智能体系统的挑战。最后,将给出AgentOps的精确定义。

4.1 运维演变

如图6所示,运维技术历经时代演进持续进步。从早期的手动运维到后期的基于规则的自动化运维,每个阶段都标志着重大飞跃。机器学习的迅猛发展,尤其是深度学习的突破,进一步推动了运维技术的革新。近年来,大型语言模型(LLM)强大的推理与分析能力催生了越来越多采用LLM智能体实现自动化运维的方法。

         

操作演进历程

        

除了运维技术的演进,运维对象也发生了转变。最初,运维工作仅聚焦于传统软硬件系统,如微服务系统。随着机器学习的快速发展,模型规模日益庞大,训练与推理等过程中故障频发。这催生了管理机器学习模型的各类运维技术--MLOps。近年来,大型语言模型(LLM)代理已能自主完成任务,促使众多服务采用智能体替代传统模式。由此,智能体系统已成为当今行业服务构建的主流方式。然而智能体系统与传统系统存在本质差异:传统系统行为由底层代码决定,具有确定性;而智能体系统基于概率模型构建,其推理与行动具有随机性。因此智能体系统的运维方式与传统系统截然不同,直接套用传统技术并不可行。为此本文提出AgentOps(智能体运维)概念,下文将详细阐述传统系统运维与 AgentOps的区别。

4.2 传统系统运维与智能体系统运维的区别

4.2.1 操作时间线

如图7所示,该行业通常将操作划分为四个阶段:监控、异常检测、根本原因分析和解决。      

l监控:在监控阶段,可观测性工具被部署以尽可能全面地从多维度收集系统运行时数据。这包括指标、日志、追踪等内容,为后续异常检测等流程提供关键支持。      

异常检测:当系统故障发生时,必须利用监控数据及时发现异常。这有助于在短时间内阻止故障进一步蔓延,从而最大限度地降低潜在影响。      

根本原因分析:当系统发生故障时,问题可能通过不同组件的调用而蔓延,导致多个组件触发警报。唯有通过根本原因分析才能找出问题根源,从而实现快速解决。      

解决方案:通过上述流程确定根本原因后,可通过通知站点可靠性工程师(SRE)或采用自动化修复方法解决问题。      

传统系统操作与智能体系统操作的比较

4.2.2 传统系统运维与智能体系统运维的差异

如图7所示,尽管传统系统运维与代理系统运维的时间线相似,但两者在每个阶段都存在显著差异。这正是需要建立全新运维框架--AgentOps的原因。下文将详细阐述这些差异。      

监控:主要差异在于监控数据的类型。基于OpenTelemetry[8]的传统系统运行监控侧重于指标、日志和追踪数据,这些数据反映系统的实际运行状态,可用于系统状态的逆向工程。然而对于代理系统而言,根本区别在于服务由大型语言模型(LLM)代理提供,其本质具有随机性。这要求对LLM代理的相关模块进行额外监控。LLM代理主要由语言模型和代理组件构成。针对语言模型部分,监控需涵盖模型参数、注意力图、令牌对数等相关状态;而代理组件则必须在每个步骤监控检查点(如内存和环境状态)。监控这些代理层级的检查点不仅能更清晰地把握代理系统状态,还便于执行回滚操作--这正是代理系统相较传统系统在可操作性方面的重要优势。      

异常检测:差异主要体现在异常检测的应用时机上。传统系统运维应用于确定性系统时,依赖的数据通常被认为准确可靠,可直接作为异常检测的输入。而智能体系统通过 LLM 智能体生成数据,其正确性无法保证。因此异常检测不仅需验证数据生成的合理性,还需利用这些数据进一步评估系统状态。      

根本原因分析:差异主要体现在定位的对象和粒度层面。传统根本原因分析侧重于识别服务、Pod或环境层面的问题,甚至深入代码层面。而对于代理系统,由于涉及LLM代理,定位可能需要识别代理的具体行为,或在 LLM 处理流程的特定步骤中识别幻觉现象。      

决议:主要差异在于决议过程。在传统系统运行中,一旦明确故障的精确位置和原因,即可通过基于相关领域知识的确定性程序迅速解决问题。而在智能体系统中,由于内在随机性,解决过程具有长期性和复杂性,需要持续测试并可能回滚(利用监测阶段的相关数据),最终才能达到最优状态。例如,若智能体系统异常的根本原因是提示词不合理,则可能需要持续进行提示词优化测试。      

4.3 结论        

基于上述差异,本文将代理化系统运维(AgentOps)定义为涵盖执行前、执行中及执行后阶段的综合运维框架。与传统系统运维类似,AgentOps同样包含四个阶段:监控、异常检测、根本原因分析及问题解决。AgentOps与传统系统运维(如AIOps)的根本差异在于运维主体的本质。这种主体性质的区别导致各阶段呈现显著差异,每个阶段都需要全新的技术解决方案。      

5 监控智能体系统

5.1 监测数据示意图

5.1.1 传统数据

在传统监控数据中,使用OpenTelemetry[8]收集的指标、日志和追踪数据同时存在于微服务系统和代理系统中。然而,如前所述,代理系统中的数据与微服务系统中的数据存在显著差异。传统微服务系统通常侧重于监控系统指标和应用性能监控(APM)指标。然而在融合了LLM智能体的智能体系统中,则引入了与LLM及智能体相关的额外指标,例如LLM延迟和工具调用延迟。此外,由于成本是智能体系统的重要考量因素,还包含了各类成本相关指标,如消耗的令牌数量。在当前垂直行业的智能体系统应用中,RAG技术不可或缺,因此也需要相关的RAG指标。                

关于追踪,如图8所示,微服务追踪通常指通过API 调用实现的服务间交互。这些API调用的参数由用户操作或预定义系统规则决定,因此相对稳定且直观。但在智能体系统中,每个智能体的输入输出及其与工具的交互(包括智能体间调用)往往由大型语言模型生成,引入了高度不确定性。这些不确定性正是追踪数据的核心要素——因此在智能体系统中,追踪不仅涵盖智能体与工具间的关联关系,更包含每个步骤的输入输出。由此可见,追踪数据是智能体系统的关键要素。在日志方面,如图9所示,微服务系统与代理系统具有相当的相似性。微服务系统的日志记录服务整体的行为,而代理系统的日志则捕捉代理的行为。

               

微服务系统与智能体系统的追踪数据对比

               

日志数据示例                

5.1.2 模型数据

随着数据安全问题的日益凸显,越来越多的在线代理系统选择采用本地部署的开源大型语言模型作为推理引擎[36]。若将LLM纯粹视为黑盒模型而忽略其内部状态,本文仅能观察其输入与输出。此类信息极为有限,不足以检测LLM内部发生的异常。因此,越来越多的方法开始将LLM视为白盒模型,旨在从其隐藏层和令牌对数值中收集内部参数[9, 49]                

5.1.3 检查点数据

相较于微服务系统,智能体系统具备更强的控制力,能够通过数据复现任意时刻的系统状态。这为代理系统内的运维工作提供了显著优势。如图10所示,本文可以记录智能体系统在不同时间点会记录包括内存环境等检查点信息。当发生故障时,这些检查点数据使本文能够回滚至先前状态,解决问题并最终获得正确结果。                

10 检查点数据的收集及其在回滚过程中的应用      

5.2 当前监测方法        

基于大型语言模型的智能体系统的可观测性工具也在快速发展。这些工具主要遵循前述收集指标、日志和追踪数据的原则。大多数代理系统可观测性工具集成了追踪、指标、数据集、实验、评估、提示优化及管理等功能。LangDB[56]作为首个完全用Rust开发的可观测性工具,通过路由器优化实现成本控制,具备更高效率和内部集成性。Langfuse[57]支持OpenTelemetry集成,是开源社区中最活跃的可观测性工具。Helicone[42]除观测工具外,还整合缓存管理以降低延迟并节约资源,通过网 关回退等机制保障代理系统的安全性和可扩展性。HoneyHive[43]采用分布式追踪技术,能有效处理多模态系统,支持自定义追踪范围以聚焦特定系统维度。PromptLayer[68]最初为提示优化而设计,现将可观测性作为任务完成的必要组件,涵盖提示排序与评分等功能。TruLens[94]作为 Python 包,可无缝对接LLamaIndex等多种框架,并通过人类反馈高效迭代优化智能体系统。OpenLLMetry[93]遵循OpenTelemetry 标准,兼容各类框架,但缺乏提示优化与评估测试等功能。LangWatch[58] Literal AI[64]作为标准可观测性工具,具备可观测性评估与开发功能,其中LangWatch已集成 MCP 服务器。源自传统深度学习的MLFlow[21]支持在智能体系统中使用自定义指标。DeepEval[20]主要侧重于评估,缺乏可观测性功能;而AgentOps[1]则强调对整个系统的运行监督,同时具备可观测性功能。      

5.3 挑战        

尽管存在众多适用于代理系统的可观测性工具,挑战依然存在。      

海量数据:随着代理系统持续扩展,代理数量不断增加,每个代理都会产生大量数据。当加入模型数据和检查点数据时,这一挑战尤为突出。如此庞大的数据集在采集、存储和分析方面都面临着重大挑战。      

缺乏多样化的监控数据:如前所述,与传统微服务系统相比,智能体系统存在日志、追踪和指标数据不足的问题。      

安全漏洞:智能体程序能够自主调用可能修改内存的工具。若缺乏适当的监控与警报机制,极易导致数据泄露及其他损失。因此,在完善代理程序监控方面仍有很长的路要走。

 

编辑:肖鑫鑫

校核:李正平、陈凯歌曹希铭、赵学功、白亮、任超、海洋、陈宇航、Kira、Tina、王金、赵诚、赵栓栓、张优

该文资料搜集自网络,仅用作学术分享,不做商业用途,若侵权,后台联系小编进行删除


来源:故障诊断与python学习
ACTACPSystem通用航空UGpython通信海洋电机储能数字孪生控制人工智能数控
著作权归作者所有,欢迎分享,未经许可,不得转载
首次发布时间:2026-02-05
最近编辑:6月前
故障诊断与python学习
硕士 签名征集中
获赞 87粉丝 152文章 328课程 0
点赞
收藏
作者推荐

“数字孪生/故障诊断”专题||数字孪生如何落地智能运维?顶刊综述这样总结(上)

本期给大家分享一篇小编近期阅读的1区top综述文章。如果有故障诊断相关方向研究人员希望宣传自己研究成果,欢迎大家在公 众号后台与小编联系投稿,大家一起交流学习。故障诊断是当前工业设备领域的研究热点。 本期推荐的这篇是中国东北大学机械工程与自动化学院三级教授、博士生导师马辉的文章,本文系统综述了数字孪生在旋转机械智能故障诊断与剩余寿命预测中的最新进展:首先梳理了面向轴承、齿轮、转子三大部件的高保真建模方法,对比物理模型、现象学模型与数据驱动模型的优劣,并总结参数更新机制;随后深入剖析维纳过程、深度学习与迁移学习如何借助DT生成的仿真数据解决小样本与域差异难题;最后提出在线诊断、轻量化建模、物理-数据融合、强化学习等七大未来方向,并展望DT在智能制造、核电、智慧城市等跨领域的标准化应用前景。 由于文章篇幅过长,小编将分两次为大家翻译介绍这篇论文。第一篇推文系统梳理了数字孪生在旋转机械智能故障诊断与剩余寿命预测中的建模基础:围绕轴承、齿轮、转子三大核心部件,对比物理模型(集中参数、有限元、刚柔耦合)、现象学模型与数据驱动(高斯过程回归)三类建模路线的原理、优劣与适用场景,并归纳了敏感性分析、贝叶斯更新与生成对抗网络三种参数实时更新机制,为后续诊断任务提供高保真虚拟数据源。 希望对大家的学习有所帮助,文章质量很高同时希望大家可以多多引用。 论文链接:通过点击最左下角的阅读原文进行在线阅读及下载。 论文基本信息论文题目: Digital twin-inspired methods for rotating machinery intelligent fault diagnosis and remaining useful life prediction: A state-of-the-art review and future challenges论文期刊:Mechanical Systems and Signal ProcessingDoi:https://doi.org/10.1016/j.ymssp.2025.112770作者: Hui ma(a), Caizi Fan(b), Yongchao Zhang(c),Qibin Wang(d),Kun Yu(e),Zeyu Ma(f) 论文时间: 2025年 机构: a School of Mechanical Engineering and Automation, Northeastern University, Shenyang, Liaoning 110819, PR Chinab Key Laboratory of Vibration and Control of Aero-Propulsion Systems Ministry of Education of China, Northeastern University, Shenyang, Liaoning 110819, PR Chinac State Key Laboratory of Electromechanical Integrated Manufacturing of High-Performance Electronic Equipments, Xidian University, Xi’an 710071, PR Chinad School of Information and Control Engineering, China University of Mining and Technology, Xuzhou, Jiangsu 221116, PR China作者简介:马辉,男,中共党员,1978年9月出生于河北省安平县,工学博士,东北大学机械工程与自动化学院三级教授、博士生导师。2007年在东北大学获机械设计及理论专业博士学位。(来源:ResearchGate) 摘要数字孪生(DT:Digital Twin)技术正成为旋转机械智能故障诊断(IFD:Intelligent Fault Diagnosis)与剩余寿命预测(RUL:Remaining Useful Life)的关键工具,为工业系统的可靠性与运行效率提供了前所未有的支撑。在能源、制造、航天等行业,DT 通过构建物理实体的虚拟镜像,实现实时监测、精准故障诊断与预测性维护。本文梳理了受 DT 启发的 IFD 与 RUL 预测的最新应用,涵盖虚拟数学模型构建、模型参数更新,以及利用深度学习(DL:Deep Learning)技术贯通虚拟数据与真实数据以服务于 IFD 与 RUL 预测。此外,本文识别并讨论了当前 DT 应用的关键挑战:构建高保真模型、满足实时诊断需求、融合物理与数据驱动模型。展望未来,DT 模型的进阶将依赖多模态数据融合(MDF:Multimodal Data Fusion)技术的集成、轻量级模型优化策略的开发,以及强化学习(RL:Reinforcement Learning)在 IFD 与 RUL 预测中实现自主学习与可解释性提升的应用。本文为 DT 在工业场景中的进一步落地提供了关键洞见。 关键词:数字孪生;物理模型;智能故障诊断;旋转机械;深度学习;剩余寿命 目录1 引言 1.1 数字孪生的定义 1.2 研究动机 1.3 论文组织结构2 受数字孪生启发的建模方法 2.1 建模动机 2.2 轴承系统 2.3 齿轮系统 2.4 转子系统 2.5 小结3 数字孪生模型参数辨识与修正 3.1 参数更新动机 3.2 敏感性分析 3.3 贝叶斯方法 3.4 基于GAN的方法 3.5 其他方法 3.6 小结4 数字孪生驱动的故障诊断与RUL预测 4.1 研究动机 4.2 基于维纳过程的方法 4.3 传统AI方法 4.4 基于迁移学习的方法 4.5 小结5 综挑战与未来展望 5.1 四大挑战 5.2 七大未来方向6 结论注:小编能力有限,如有翻译不恰之处,请多多指正~ 若想进一步拜读完整版,请下载原论文进行细读。 1 引言在“工业 4.0”旗帜下迅猛演进的工业技术,已为制造、能源、航空航天等关键领域引入了重塑行业格局的突破性工具与方法 [1–5]。在这些创新之中,数字孪生技术以其“将真实系统在虚拟环境中镜像、实现物理实体与其数字副本持续交互”的能力而尤为突出。现代机械日益复杂,同时对运营效率提升与停机时间压缩的需求愈发迫切,这加速了 DT 技术在故障诊断与预测性维护领域的落地 [6–9]。随着计算机技术与人工智能(AI:Artificial Intelligence)的进步,智能故障诊断已逐渐受到学术界与工业界的广泛关注 [10–14]。IFD 指的是将人工神经网络(ANN:Artificial Neural Network)、支持向量机(SVM:Support Vector Machine)、深度神经网络(DNN:Deep Neural Network)等机器学习理论应用于装备故障诊断 [15–17]。在判定系统故障的同时,还需进一步利用历史及持续演化的退化规律预测机械设备的剩余寿命,这也是故障预测与健康管理(PHM:Prognostics Health Management)极为重要的一环 [18–23]。1980 年至 2010 年间,传统机器学习方法主要被采用于 IFD;自 2010 年起,研究重心转向基于深度学习的 IFD。除在 IFD 中的应用外,深度信念网络(DBN:Deep Belief Network)、卷积神经网络(CNN:Convolutional Neural Network)与循环神经网络(RNN:Recurrent Neural Network)等基于深度学习的方法亦被广泛用于 RUL 预测 [24–28]。众所周知,深度学习模型需大量数据集以学习并自动识别数据中的潜在模式与关联 [29]。当样本数量不足时,模型常对训练数据过拟合,致使其泛化能力下降。然而,在工程实践中,收集足够数量的故障样本通常需耗费大量人力、财力与时间资源,且某些故障的发生概率往往极低 [30–36]。因此,对于 IFD 与 RUL 预测,故障数据或退化数据的获取面临相同挑战:实际机械设备缺少或几乎没有相关实测数据。随着工业向更智能、更自主的系统演进,对设备健康状态进行监测、对故障进行实时诊断、并主动预测失效已变得不可或缺。DT 技术通过将实时数据与先进计算模型相融合,为关键机械当前及未来的运行状态提供洞察,从而给出强有力的解决方案 [37–39]。DT 技术的核心目标,是构建能够刻画物理实体动态行为的精准虚拟数学模型;该思路直击 IFD 与 RUL 预测中普遍遭遇的数据匮乏难题。物理模型可通过数值仿真为 IFD 与 RUL 预测提供充足数据;然而,现有物理模型对复杂结构仍包含过多假设与简化,只能定性反映系统特征,难以完整复现由载荷及参数退化引起的特性变化。为克服上述局限,DT 技术被提出作为能够镜像物理实体状态的动态仿真手段。通过将物理模型与实时数据、传感器更新及运行历史相融合,DT 技术可对系统行为做出更全面、更精准的表征 [40–42]。本文综述 DT 在旋转机械中的最新应用,聚焦 IFD 与 RUL 预测;同时指出 DT 系统落地面临的关键挑战,并勾勒将塑造这一变革性技术未来发展的研究方向。1.1 数字孪生的定义DT的概念起源于美国国家航空航天局(NASA:National Aeronautics and Space Administration),最早可追溯到 20 世纪 60 年代的阿波罗计划;该计划的核心目标是打造两艘完全相同的航天器——一艘留在地面,被称为“DT”,另一艘发射入轨。通过对 DT 进行仿真与训练,NASA 得以精准监测并映射在轨航天器的运行状态,实现实时决策与任务调整。这一开创性应用为 DT 技术在现代工程与工业场景中的发展奠定了基石 [43]。迄今最广为人知的 数字孪生定义,由 Michael Grieves 教授在其 2014 年发布的白 皮书 [44] 中提出:他将 DT 描述为物理对象或系统的虚拟表征,是其实时数字副本。DT 的概念模型示于图 1,主要包含三部分: 图1 DT概念图1) 物理实体:指真实世界中的物体、系统或资产,如机械设备、工业流程、机器人及其他有形物品;这些实体以其物理属性、行为及运行动力学为特征。2) 虚拟实体:借助先进 DT 技术在虚拟环境中构建的数字表征,涵盖对应物理实体的结构、行为与动态性能;该表征可模拟多种运行场景与交互过程,从而全面理解物理实体在不同工况下的性能。3) 数据连接:通过传感器、物联网设备及其他数据采集手段,从物理实体获取数据并集成;该数据与虚拟实体相连,实现对物理对象的持续监测、仿真与优化。依托实时数据,DT 技术可执行高级分析,实现预测性维护、故障诊断与性能优化。1.2 研究动机以“digital twin”为检索词,基于 Web of Science 数据库统计 2013—2025 年相关论文数量,结果示于图 2。可见 2016 年以前,DT 相关论文均不足 200 篇,此阶段被定义为萌芽期;2016—2020 年发文量小幅上升,被定义为起步期;2020 年后论文数量呈指数级增长,至 2024 年达 10 215 篇,此阶段被定义为快速发展期。综上,随着智能制造、大数据与人工智能的进步,DT 相关研究日益升温 [45–48]。图2 2010 - 2024年数字孪生文献数量目前,DT 技术正在机械状态监测、故障诊断、RUL预测等领域展开初步探索。DT 作为机械部件全生命周期的虚拟镜像,可通过物理实体与虚拟模型的交互,有效反映并评估部件的故障状态与剩余服役寿命,其示意图见图 3。因此,依托 DT 技术,即便故障数据不足,仍可开展机械设备的健康管理。在IFD 领域,精准的机械部件数学模型可有效体现其动态运行特性;通过分析失效机理,可获得部件在多种故障模式下的各类振动响应,并自然获取对应标签信息。然而,受 DT 启发的 IFD 与 RUL 预测方法众多、思路各异,未来发展方向尚不清晰;故有必要以综述形式梳理该领域研究进展,并明确未来研究方向。 图3 基于DT的机械健康管理框架图[ 49 ]1.3 论文组织结构本文系统梳理了近年受 DT 启发的建模方法及人工智能方法在智能故障诊断 IFD 与 RUL 预测中的研究进展。图 4 展示了全文结构:第 2 节聚焦旋转机械中的轴承、齿轮与转子系统,归纳构建其虚拟实体的手段,包括集中参数模型、有限元模型(FEM: Finite Element Model)与唯象模型;第 3 节阐述数学模型参数更新的方法,主要分为参数灵敏度分析、贝叶斯方法与基于 GAN(GAN: Generative Adversarial Network) 的方法;第 4 节重点介绍基于维纳过程及深度学习模型在 DT 驱动的 IFD 与 RUL 预测中的应用;第 5 节给出当前挑战与未来展望;第 6 节总结全文结论。 图4 主要内容之间的关系2 受数字孪生启发的建模方法2.1 建模动机在旋转机械领域,借助 DT 的动态建模正成为研究热点;优质的动态模型是 DT 建模的根基,可为后续虚实交互提供高保真虚拟信号。当前研究主要集中于轴承、齿轮与转子系统。对轴承系统,研究重心为轴承损伤(如内圈、外圈及滚动体损伤)的动态建模,主要关注轴承自身力学特性,而不考虑转子系统影响。对齿轮传动系统,研究重心为裂纹、剥落、磨损、断齿等故障状态下齿轮传动系统的动态建模。对转子系统,当前重心主要为不平衡、不对中、碰摩、机座松动等工况下的转子系统动态建模 [50]。这三类系统所采用的主要建模方法包括:基于物理的模型(如集中参数模型、有限元模型、刚−柔耦合模型)、唯象模型以及数据驱动模型。2.2 轴承系统2.2.1 基于物理的模型2.2.1.1 集中质量模型(LMM:Lumped Mass Model)考虑内圈与轴的水平、垂直振动影响,Qin 等 [51,52]、Cheng 等 [53]、Shi 等 [54,55]、Guo 等 [56]、Xu 等 [57]、He 等 [58] 建立了可模拟外圈故障的2 自由度线性矩阵模型;依据所提模型与实验数据,通过修改故障尺寸即可再现故障演化的全生命周期过程。Li 等人[59]通过将演化过程划分为三个阶段:微观裂纹、中观剥落和宏观缺陷(见图5),建立了具有外圈故障的单个轴承的生命周期二维自由度线性矩阵模型。在此基础上,Li 等人[60]进一步引入刚度减弱因子以模拟不同的退化阶段,构建了陶瓷轴承系统的 2 自由度动力学模型。 图5 每个尺度的断层地形和模拟的断层形状( 2自由度) [ 59 ]Sobie 等 [61] 采用 Siemens LMS Imagine.Lab Amesim 仿真软件建立单轴承 3 自由度动态模型,其中内圈、外圈与滚动体各赋予 1 个自由度,并通过与宽度和深度相关的脉冲力模拟内外圈故障。考虑内外圈水平与垂直振动影响,Xu 等 [62,63]、Dong 等 [64]、Feng 等 [65]、Li 等 [66]、Xie 等 [67]、Pan 等 [68]、Xie 等 [69]、Liu 等 [70]、Hu 等 [71]、Jiang 等 [72] 建立可模拟内圈、外圈与滚动体剥落故障的 4自由度故障轴承集中质量模型。考虑内圈(水平与垂直方向共 2 个自由度)、外圈(2 个自由度)以及单位共振器(1 个自由度)的振动,Zhang 等 [49]、Gao 等 [73]、Li 等 [74]、Qing 等 [75]、Cui 等 [76]、Xiao 等 [77]、Wu 等 [78] 开发了可模拟内圈、外圈及滚子剥落故障的 5 自由度轴承系统集中质量模型(见图 6)。类似地,Liu 等 [79] 建立了包含外圈与内圈剥落故障的单轴承动态模型。Deng 等 [80]、Meng 等 [81]、Ming 等 [82] 提出了 5 自由度滚动轴承动态模型,以综合考虑裂纹演化与剥落退化的行为。 图6 故障轴承系统的线性矩阵模型(5自由度)[49]考虑内圈、外圈及共振器水平与垂直振动影响,Wang 等 [83] 建立了轴承系统的 6 自由度集中质量模型(见图 6),并基于此模型模拟了内圈、外圈及滚子故障下的振动响应。考虑滚动体、保持架以及内、外圈的振动影响,Liu 等 [84] 建立了故障轴承的 12 自由度集中质量模型,并利用该模型获取了内、外圈剥落故障下的仿真数据(见图 7)。 图7 故障轴承系统的线性矩阵模型(12自由度)[84]Yu 等 [85]、Xiao 等 [86] 采用集中质量模型建立了 32 自由度的转子-轴承系统动力学模型(见图 8)。在该模型中,假设左侧轴承存在内圈、外圈和滚珠故障,采用 6 自由度线性矩阵模型来模拟轴承座、内圈和外圈的振动响应。表 1 汇总了不同的轴承动力学建模方法。 图8 转子-轴承系统的线性矩阵模型(16自由度)[86]表1 具有故障的轴承系统的集中质量模型 2.2.1.2 采用壳单元或实体单元的有限元模型(LS-DYNA:Livermore Software Technology Corporation ;ANSYS Twin Builder:ANSYS 公司推出的数字孪生构建平台)Farhat 等 [87] 采用 Timoshenko 梁单元建立了含外圈裂纹的轴承-转子系统动态有限元模型,其中每个节点包含 2 个平动自由度与 1 个扭转自由度;裂纹缺陷区通过增大径向间隙来模拟。滚道裂纹被建模为正弦半波凹坑,当滚动体掠过缺陷区时,通过挠度激励 引入模型(见图 9)。进一步地,该挠度激励被代入瞬时恢复力的求解,对应方程如下:式中, 为理论径向位移; 为第 个滚动体的角位置; 为局部缺陷的起始角位置; 为局部缺陷范围的角度; 为滚动体数量; 为保持架角速度。 图9 轴承滚道缺陷的特征识别[54,88,89]基于ANSYS LS-DYNA软件,张等人[90]建立了包含内外圈及滚珠缺陷的NU205轴承二维有限元模型,其中将缺陷简化为矩形形状,并采用显式动力学方法求解了故障条件下系统的动态响应。Gao 等 [91]、Lou 等 [92]、Huang 等 [93]、Shang 等 [94] 采用 ANSYS构建含内圈、外圈及滚动体故障的单轴承系统三维有限元模型(见图 10),其中 Solid164 单元用于划分三维实体,Shell163 单元用于划分内圈内表面;通过显式动力学方法求解内圈、外圈及滚动球故障下的系统动态响应。Zhao 等 [95] 基于 Hypermesh 与 ANSYS WORKBENCH LS-DYNA 建立 UC205 轴承显式动力学模型,并以 0.30 mm 裂纹缺陷嵌入方式模拟内外圈裂纹故障下的系统振动响应。 图10 单个带故障轴承的三维有限元模型[91]基于Solidworks和ANSYS软件,赵等人[96–98]在考虑多物理场耦合(结构、温度及油膜流场)、磨损、密封等因素的基础上,在ANSYS Twin Builder环境中构建了轴承 DT 模型(见图11)。该模型采用阶次降维技术以提升计算效率[99]。在此基础上,模拟了系统在不同退化阶段下的振动响应。卢和李[100]基于ANSYS Workbench软件,结合温度场影响,建立了滚动轴承的实体有限元模型,以模拟轴承退化过程中振动响应信号。 图11 滚动轴承数字孪生模型[96]2.2.1.3 刚−柔耦合动力学模型(ADAMS:Automatic Dynamic Analysis of Mechanical Systems)基于 ADAMS平台,Ma 等 [101] 建立了基础-轴承-转子系统多体动力学模型,通过部件(基础、轴盘)及系统模态试验对模型进行验证与修正;随后嵌入典型轴承故障,模拟故障工况下的系统振动响应(见图 12)。 图12 5兆瓦带有轴承故障的齿轮箱多体动力学模型[102]基于 SIMPACK 平台,Dibaj 等 [102] 建立了 5 MW 齿轮箱的多体动力学模型;采用 SIMPACK 齿轮副单元与力单元对齿轮和轴承进行建模,并通过改变轴承的轴向或径向刚度来模拟轴承损伤。所建模型分别模拟了健康状态、主轴承轴向损伤、高速轴承径向损伤及低速轴承径向损伤工况下的系统振动响应。就基于物理的动态建模与分析而言,常用软件包括 MATLAB 、ADAMS、ANSYS 与 Abaqus 。MATLAB 主要用于动态系统的数学建模、仿真与控制分析,代码开发灵活,适用于数值计算与数据可视化,但对专业背景与编程能力要求较高;ADAMS 专注多体动力学,适用于机械系统的运动学与动力学分析;ANSYS 主要用于有限元分析,适合结构、流体、热、声等多物理场耦合仿真;Abaqus 则擅长非线性问题、复杂接触及材料行为模拟,如冲击与碰撞分析。2.2.2 现象学模型Liu 等 [103,104]、Peng 等 [105] 与 Zhu 等 [106] 建立了含外圈、内圈及滚动体故障的单轴承唯象模型;通过考虑轴承几何、故障位置与运行转速,可自该唯象模型获得基于故障重复冲击与调制的信号 [106,107]。考虑非平稳工况影响,局部故障轴承的振动信号可用周期性脉冲序列描述;进一步考虑脉冲序列的微小随机波动将影响谐波,导致信号显著随机性,故故障轴承振动信号可由两部分表征:低频微弱谐波分量与主导高频的随机循环平稳分量 [108,109]。Ai 等 [110]、Wang 等 [111] 通过引入故障类别、采样频率、阻尼比、滚动体数量、共振频率等参数,构建了含故障的轴承振动信号唯象模型(亦称振动信号仿真模型)。Zhang 等 [112] 亦建立了相应的轴承信号仿真模型,并展示了时域与频域的典型振动特征(见图 13)。 图13 轴承的现象学模型及典型故障特征[112]为使振动与噪声水平贴近实验数据,Hou 等 [113] 将仿真周期故障脉冲信号与健康状态实测振动信号混合,从而获得被试轴承的仿真振动信号。需指出:通过对单一故障脉冲信号进行周期延拓——延拓周期对应故障特征频率——即可得到周期性故障脉冲。2.2.3 数据驱动模型(高斯过程回归)基于实测轴承故障声发射数据(见图 14),Piltan 等 [114–117] 建立了轴承故障的扩展 ARX-Laguerre 模型,并采用滑模技术生成鲁棒残差信号;经残差信号与阈值处理后,所提模型被证明对变速电机故障诊断兼具鲁棒性与有效性。 图14 故障数据采集实验装置[114]2.3 齿轮系统2.3.1 基于物理的模型2.3.1.1 集中质量模型(LMM:Lumped Mass Model)Wang 等 [118] 建立了故障齿轮传动系统的 6 自由度集中质量模型,为主、从动齿轮各赋予 2 个横向与 1 个扭转自由度;含裂纹或剥落故障的齿轮副啮合刚度通过势能法确定(见图 15)。Li 等 [119]、Meng 等 [81] 进一步构建了故障行星齿轮传动系统的 6-DOF LMM,其中太阳轮考虑 2 个横向与 1 个扭转自由度,行星轮、行星架与齿圈各考虑 1 个扭转自由度;轮齿间啮合刚度以傅里叶级数形式模拟,故障影响则通过刚度损失予以刻画。 图15 带故障齿轮系统的线性多体模型(6自由度)[118]Zhou 等 [120] 建立了风电齿轮传动系统的 8 自由度(8-DOF)集中质量模型,用于模拟不同风速下的振动响应。Bachar 等 [121] 提出了含故障的平行轴齿轮传动系统 14-DOF LMM,其中主、从动齿轮各分配 6 个自由度(3 个平移、2 个旋转及 1 个扭转自由度)(见图 16)[122],电机与负载各分配 1 个扭转自由度;轮齿啮合刚度由势能法确定,并针对从动齿轮 6 种不同断齿程度模拟了振动响应。 图16 带故障的单级行星齿轮系统线性多体模型(14自由度)[121]考虑主/从动齿轮、电机、联轴器、轴系及基础的振动影响,Feng 等 [123] 采用修正 Archard 模型模拟齿面退化对刚度与传动误差的作用,由此建立了含齿面磨损故障的 21 自由度传动系统集中质量模型(见图 17)。 图17 带磨损故障齿轮系统的线性多体模型(21自由度)[123]Zheng 等 [124] 建立了摆线针轮减速器的 26 自由度集中质量模型,其中太阳轮、两根曲轴、两个摆线轮、两个行星轮及输出盘各赋予 2 个横向与 1 个扭转自由度,针轮赋予 2 个横向自由度(见图 18);所建模型对 15 种工况下的系统振动响应进行了仿真。 图18 具有故障的旋转矢量减速器的线性多体模型(26自由度)[124]2.3.1.2 采用壳单元或实体单元的有限元模型(LS-DYNA,ANSYS Twin Builder)就“可解释性如何达成”而言,研究呈现出明显偏好:31 项(93.9%)采用基于 ML 分类器输出计算输入特征相关性排序的方法,无论局部、全局或两者兼具;这一策略的主导地位与 SHAP 这一成熟、模型无关且数学基础坚实的方法被广泛使用[63]直接相关。此外,针对深度学习模型,利用反向传播识别关键输入特征的梯度类方法亦常见。这些趋势表明,尽管可解释性正被积极探索,多数作者仍优先关注特征相关性计算,而非深入挖掘 ML 方法背后的推理机制;他们主要聚焦输入-输出解释,而非直面模型的“黑箱”本质,使得模型的决策过程依旧大体不透明且未被充分探索。Yu 等 [125] 构建了含故障的齿轮-轴-轴承系统动力学有限元模型,其中齿轮副采用集中质量单元模拟,啮合刚度通过傅里叶级数获得,并利用啮合刚度损失模拟不同类型及程度的故障;转子与轴承分别采用两节点 Timoshenko 梁单元及线性弹簧单元模拟;基于该仿真模型,分析了齿面剥落与磨损故障下的系统振动响应。Fan 等 [126] 发展了含故障齿轮传动系统的动态有限元模型,其中齿轮副采用 12 自由度集中质量模型,齿轮啮合采用弹簧-阻尼单元模拟,旋转轴采用 Timoshenko 梁单元离散(见图 19)。 图19 带故障的齿轮-轴-轴承系统有限元模型[125]基于 ANSYS平台,Liu 等 [127] 与 Lou 等 [92,128] 建立了含故障的齿轮-轴-轴承-轴承座系统动态有限元模型,并通过 5 个接触对模拟轴与轴承座之间的接触以及齿轮间的啮合影响;基于该仿真模型,分析了裂纹、剥落、断齿及复合故障下的系统振动响应(见图 20)。 图20 带故障的齿轮-轴-轴承系统有限元模型[127]2.3.1.3 刚柔耦合动力学模型(ADAMS)基于ADAMS多体动力学软件,Xia等人[129–131]建立了单级齿轮传动系统的刚柔耦合动力学模型(见图21),其中齿轮和轴被假设为刚性,齿轮箱被假设为柔性,轴承通过衬套力连接轴与齿轮箱,齿轮啮合通过切向库仑摩擦模型和法向接触力(冲击函数)进行模拟。基于类似的刚柔耦合动力学建模方法,Xia等人[131,132]进一步建立了带齿断裂故障的五速换挡传动系统的动力学模型,并模拟了系统在正常状态及三种不同断齿故障情况下的振动响应。 图21 单级齿轮传动系统的刚柔耦合动力学模型[131,132]基于 ANSYS 有限元平台,Yu 等 [133] 首先建立了行星齿轮传动系统有限元模型,并将其导入 ADAMS 构建系统的刚-柔耦合动力学模型,其中齿轮被假设为柔性体(见图 22)。Llopis-Albert 等 [134] 则利用 Ansys Workbench 进行场建模,而多体运动学与动力学分析在 Adams Machinery 中完成。 图22 带故障行星齿轮系统的刚柔耦合动力学模型[133]Li 等 [138] 构建了螺旋锥齿轮封闭功率流试验台的 DT 模型;通过与 ADAMS 集成,可实时监测系统动态运动状态,并借助 DT 监测系统的用户界面实现动态性能可视化。Zhu 等 [139] 基于 ADAMS 平台建立了行星齿轮传动系统刚-柔耦合动力学模型,考虑太阳轮与行星轮断齿及行星轮点蚀故障;模型中齿圈设为柔性体,其余部件设为刚性体。Koutsoupakis 等 [140,141] 基于 ADAMS 软件构建了含故障(断齿与齿面故障)的两级斜齿轮-行星齿轮传动系统刚-柔耦合动力学模型,其中齿轮副啮合采用 Hertzian 接触力模型模拟,轴承采用具有恒定刚度与阻尼的线性轴套模拟(见图 23)。 图23 带故障的两级斜齿轮与行星齿轮传动系统刚柔耦合动力学模型[141]2.3.2 现象学模型在同时考虑齿轮故障引起的幅值-频率调制效应、工况周期变化(如转速与负载)导致的幅值调制效应,以及时变传递路径带来的幅值调制效应的基础上,Feng 与 Zuo [142] 建立了行星齿轮传动系统的唯象模型(亦称振动信号模型),并给出了局部损伤与分布损伤条件下振动信号的显式表达式。Lei 等 [143] 进一步考虑从齿轮啮合点到固定传感器的全部可能振动传递路径,以及行星轮位置偏差对频谱结构的影响,通过代数方程构建行星齿轮箱振动信号唯象模型,并利用傅里叶级数分析推导了齿圈、行星轮及太阳轮故障时的振动信号频谱结构。随后,相关研究在唯象模型中进一步引入啮合冲击激励 [144] 或局部故障诱发脉冲调制 [145] 的影响,使行星齿轮振动信号唯象模型得到进一步完善。考虑衰减效应及随机齿轮啮合幅值,Zhang 等 [146] 提出一种改进唯象模型,可更合理地表征主频成分与结构振动特性。Peng 等 [147]、Luo 等 [148] 进一步提出改进唯象模型,认为行星齿轮箱振动信号由依次发生的一系列瞬态冲击构成;通过将啮合刚度及相位的参考点设于双齿啮入点,提出修正啮合相位,并从理论上推导刚度曲线上升沿与下降沿的时间表达式。2.4 转子系统Xiang等人[149]利用ANSYS构建了轴的有限元模型。在该有限元模型中,采用了梁单元(BEAM188)、组合单元(COMBINE14)和质量单元(MASS21),并在轴承外侧施加了整体约束。杨等人[150]建立了裂纹盘的单自由度线性多体模型,在该模型中通过移动质量来模拟裂纹引起的不平衡。考虑转子水平和垂直振动,Xiang等人[151]采用与裂纹深度相关的余弦函数模拟呼吸裂纹效应,建立了裂纹转子系统的二维自由度线性多体模型,并模拟了不同裂纹深度下的振动响应。塔哈等人[152]建立了具有4自由度的电磁轴承-转子系统线性多体模型(包含2个横向和2个转动自由度),其中电磁轴承通过弹性恢复力和电磁力进行模拟。考虑转子薄壁截面变厚度以及轴承间隙与轴承内圈波纹度引起的非线性效应,Bobylev 等 [153] 采用 8 自由度梁单元(每节点含 2 个平动与 2 个旋转自由度)建立支承-轴承-转子系统动态有限元模型,其中支承采用质量-弹簧-阻尼元件,轴承采用非线性 Hertzian 接触力模型。Zhu 等 [154] 通过多体动力学仿真将柔性转子与刚性轴承耦合,提出基于物理的振动动态模型。针对试验台上的柔性转子系统,Wang等人[155]采用梁单元构建了该系统的动态有限元模型,用以通过不平衡变化模拟故障演变过程。基于ANSYS软件,Gao等人[156]采用梁单元(Beam188)、集中质量单元(Mass21)和弹簧单元(Combine14)建立了转子系统的动态有限元模型,并模拟了因不平衡、轴线偏差和擦伤冲击引起的振动响应。考虑花键连接、层状膜式联轴器及柔性支撑的影响,Zhu等人[157]利用8节点Timoshenko梁单元和集中质量单元提出了支座-滚动轴承-薄壁转子系统的动态有限元模型,并模拟了自激振动故障、转子裂纹、轴承内外圈故障、支撑松动及联轴器错位故障引起的振动响应(见图24)。 图24 故障转子系统的动态FEM [ 157 ]2.5 小结表 2 汇总了上述不同对象(轴承、齿轮、转子)的建模方法;表 3 给出了这三种建模方法的详细描述及其优缺点总结。综上,基于物理的模型依赖物理理论,适用于物理规律已知的系统,可解释性好,但建模复杂;唯象模型基于经验与现象,适用于内部机理认识不充分的系统,形式简单但缺乏理论支撑;高斯过程回归是一种灵活的数据驱动方法,擅于小样本复杂非线性建模并可处理不确定性,然而计算成本高、可解释性相对较弱。表2 不同建模方法总结 表3 不同建模方法的比较 此外,计算效率是 DT 建模应用中必须优先考量的关键技术指标。对于基于物理的建模方法,随着系统自由度增加以及环境参数(如温度场、压力场、润滑等)被引入,计算复杂度呈指数级增长,仿真时间可能从分钟级延长至小时级;尤其在复杂流体动力学分析场景下,完整数值仿真过程往往需要数天甚至更久才能完成。相比之下,唯象模型基于经验方程与简化控制律,计算复杂度低,通常可在秒级内完成仿真计算。高斯过程回归的计算效率主要受三方面因素影响:模型阶次(由 Laguerre 函数数量决定)、输入-输出变量维度以及优化算法的迭代收敛特性,其典型计算时间仍保持在秒级范围内。因此,在实际工程应用中,建议综合权衡计算效率、物理可解释性与具体应用场景的实时性需求,以选择最优建模策略。3 数字孪生模型参数辨识与修正3.1 参数更新动机实施数字孪生的另一关键步骤,是持续更新 DT 模型,以确保其与物理系统的实时行为及响应保持同步。由于真实系统易受工况与环境影响,物理系统与虚拟模型之间会出现特征分布差异;通过持续更新模型参数,可使 DT 系统更具适应性,能够应对不同场景下的多种情况,并提升系统鲁棒性。为使已构建动力学模型的仿真信号更接近实测信号,更新动力学模型的重要参数至关重要;当前主流方法包括参数灵敏度分析、贝叶斯方法以及基于生成对抗网络(GAN:Generative Adversarial Network)的方法,下文将对此展开详细阐述。3.2 敏感性分析Wang 等 [155] 与 Farhat 等 [87] 提出一种基于参数灵敏度分析的模型更新方案,以提升模型适应性,其流程示于图 25。该方法将模型更新视为优化问题,目标函数为最小化 DT 模型仿真动态响应与物理系统实测实时响应之间的误差,其数学表述如下: 图25 数字孪生更新方案 式中, 为目标函数; 与 分别代表仿真信号与实测信号的关键特征; 为 与 之间的误差; 表示模型中待优化的参数。值得注意的是,更新后的参数值必须保持物理上的合理性与可接受性,因此必须明确设定允许的上限(UL:Upper Limit)与下限(LL:Lower Limit)。LL⩽p⩽UL基于上述分析,Wang 等 [83,118] 与 Zheng 等 [124] 提出一种基于皮尔逊相关系数(PCC:Pearson Correlation Coefficient)的动态模型更新方法,用于更新齿轮啮合刚度与啮合阻尼,其表达式见公式 4。该方法通过比较物理振动信号与仿真振动信号的相关性,并以持续变化的参数迭代求解仿真模型;当 PCC 值超过设定阈值时,即可获得具有适宜模型参数的最终更新聚合参数模型。相关系数大于 0.7 表明仿真信号可有效描述实测信号。He 等 [58] 采用多目标优化方法,以 PCC 指标同时优化频域与时域相似性,对虚拟模型参数进行迭代调整,确保获得最精准的缺陷参数匹配。 式中, 表示实测信号, 表示仿真信号; 代表实测信号的平均值。Liu 等 [127] 提出一种基于余弦相似度的有限元模型更新技术,用于调整齿轮的啮合刚度与啮合阻尼。Lou 等 [92] 与 Gao 等 [91] 引入同样基于余弦相似度的 FEM 更新技术,识别关键接触参数与载荷,如法向惩罚刚度、静摩擦系数、黏性阻尼系数及偏心载荷。Huang 等 [93] 通过与物理系统的数据互联及基于余弦相似度的更新技术进行有限元参数更新,并将阈值设定为 0.6。Xia 等 [129,130] 则依据余弦相似度调整刚-柔耦合动力学模型的接触刚度与力指数。基于余弦相似度的 FEM 更新技术是一种以时域振动响应为基础的更新方法,无需进行模态试验即可完成 FEM 更新,其公式如下: 3.3 贝叶斯方法贝叶斯优化方法是一种基于贝叶斯统计与概率推断原理的全局优化技术。具体而言,贝叶斯优化是一种在目标函数未知情形下用于寻找最优解的优化算法;其核心思想是在搜索空间中选取候选点进行评估,逐步构建目标函数的代理模型,并利用该模型引导下一轮搜索过程。每次选取候选点后,根据实际观测数据与先前模型更新目标函数的概率分布,从而更准确地预测最优解最可能出现的位置。该迭代过程持续进行,使优化算法能够在不确定条件下更高效地探索搜索空间,并推断目标函数的全局最优值。Han 等 [158] 提出一种用于非线性系统的离散贝叶斯更新方法,可对船舶水动力学模型中的关键参数进行动态调整。Xu 等 [159] 引入基于瞬态马尔可夫链蒙特卡洛方法的贝叶斯更新框架,为单桩海上风力机构建所需虚拟模型。Nabiyan 等 [160] 提出面向海上风力机的时域序列贝叶斯有限元模型更新方法,可利用稀疏实测数据同时推断机械模型未知参数(泥面处基础转动刚度)及有效输入力时间尺度。Li 等 [161] 基于动态贝叶斯网络建立通用概率模型用于诊断与预测,并以机翼疲劳裂纹扩展为例阐述方法。Wang 等 [162] 开发动态贝叶斯网络(DBN)推理模型,通过更新模型参数精准预测关键结构疲劳寿命,显著降低模型参数不确定性,从而提升疲劳寿命预测精度。Jiang 等 [163] 引入面向退化参数的贝叶斯方法,可实时更新预测的全寿命疲劳演化过程,为全寿命优化奠定稳健基础。Yu 等 [164] 基于非参数贝叶斯网络构建数字孪生模型,表征健康状态的动态退化过程,并通过改进高斯粒子滤波器与狄利克雷过程混合模型实时更新参数。Song 等 [165] 提出递归贝叶斯推理框架,用于建立海上风力机 DT 模型;该框架采用基于窗口的扩展卡尔曼滤波器,利用稀疏输出测量值同时估计机组有限元模型的动态输入载荷与未知模型参数。3.4 基于GAN的方法生成对抗网络是 Ian Goodfellow 等 [2014] 提出的深度学习(DL:Deep Learning)模型,其结构主要包括生成器网络与判别器,如图 26 所示。生成器的目标是从随机噪声中生成逼真样本;判别器的目标则是区分真实样本与生成器产生的伪造样本。GAN 的核心思想是通过对抗训练使生成器与判别器达到纳什均衡,从而实现数据生成。因此,部分研究人员利用 GAN 进一步细化仿真信号,以减小其与真实信号的分布差异。例如,Gao 等 [156]、Zhu 等 [166] 与 Lou 等 [92,128] 将有限元模型与 GAN 融合,利用 GAN 生成大量统计特性相似的合成故障样本,进一步调整仿真信号,使其特征分布更接近实测信号,同时扩充样本量以提升模型故障分类精度。Xu 等 [63] 提出一种将轴承动态模型与 GAN 相结合的新方法,用于新工况下的智能故障诊断;GAN 负责将仿真数据修正为贴近真实数据的生成数据。 图26 GAN结构尽管本综述具有结构化与全面性,但仍需承认若干局限。首先,综述范围可能受所应用过滤标准的限制:主要因最低引用阈值而排除部分相关或新兴研究,尤其鉴于该研究领域的新颖性。其次,虽然综述通过基于文献提出的分类法对用于工业故障检测与诊断的XAI方法进行了系统分类,但最终对XAI方法的有效性及比较性能提供的洞察有限;该局限主要源于受评论文中缺乏评估框架与基准指标。最后,受评论献中亦普遍缺失终端用户对XAI输出及其传递方式的看法与意见,限制了评估解释在实际工业环境中如何被理解、信任或付诸行动的能力。传统生成对抗网络的训练可能不稳定,有时会导致模式崩溃。生成器与判别器之间的竞争可能在训练过程中引发振荡,使得难以获得收敛模型;并且生成器与判别器之间的对抗训练会在训练过程中产生振荡,导致难以实现模型收敛。Zhu 等 [167]、Song 等 [168]、Liu 等 [70] 与 Shi 等 [55] 采用模型驱动的数值仿真生成粗样本,随后通过CycleGAN的迭代对抗学习,他们自适应地处理粗糙信号以增强细节,使其更接近真实信号。Qin等人[52,75]提出了一种具有平滑循环一致性损失的改进型CycleGAN,用于校正轴承生命周期动态模型生成的模拟信号(见图27)。 图27 基于CycleGAN的模拟信号校正Xia 等 [132] 与 Hu 等 [169] 设计了一种基于 Wasserstein 生成对抗网络并引入梯度惩罚的物理-虚拟数据融合方法,以进一步提升虚拟信号质量。Zhao 等 [96] 将改进的 CycleGAN 与 Wasserstein 距离相结合,用于生成轴承全生命周期信号,进一步增强虚拟数据质量。Cheng 等 [53] 将深度自编码器与 GAN 融合,建立物理空间与虚拟空间之间的映射模型,通过交替更新有效提升仿真数据的真实性。Xu 等 [62] 提出 MAD-GAN ,以弥合仿真数据与真实数据之间的差距;该模型将联合的仿真振动数据与随机噪声转化为修正后的仿真数据。Song 等 [170] 提出一种基于对抗迁移学习的条件生成对抗网络方法,通过将实测位置的数据迁移至未测位置,实现所有可行位置信号的对抗生成。3.4 其他方法Qin 等 [51] 通过将轴承动态模型嵌入逆物理信息神经网络,实现动态模型参数辨识;该方法可在多种运行工况与故障模式下生成高质量轴承故障样本。3.5 小结表 4 汇总了 DT 模型中常用的几种参数更新方法:灵敏度分析是一种评估工具,用于理解参数变化对模型的影响,可在参数更新过程中起辅助作用,但并不直接更新参数;贝叶斯方法直接用于参数更新,基于新数据对参数的后验分布进行更新;基于生成对抗网络的模型主要用于进一步更新与修正仿真模型的数据,以缩小仿真域与实际域之间的差异。表4 总结不同的参数更新方法 编辑:赵栓栓校核:李正平、陈凯歌、曹希铭、赵学功、白亮、任超、海洋、陈宇航、陈莹洁、Tina、王金、赵诚、肖鑫鑫、张优该文资料搜集自网络,仅用作学术分享,不做商业用途,若侵权,后台联系小编进行删除来源:故障诊断与python学习

未登录
还没有评论
课程
培训
服务
行家
VIP会员 学习计划 福利任务
下载APP
联系我们
帮助与反馈