首页/文章/ 详情

中科院一区Top | 基于决策树启发模拟电路分类器的机械信号实时分类与故障诊断方法研究

4月前浏览1082

在数字信号处理器上运行的传统机器学习算法需要进行模拟信号与数字信号之间的转换,这会导致不可避免的延迟和大量的能耗。本文作者研究了一种基于决策树启发的新型模拟电路分类器,用于实时机器信号分类和故障诊断,该方法具有低延迟响应时间和低计算成本等优势,供大家交流讨论。

论文基本信息

论文题目:Real-Time Classification and Fault Diagnosis of Machine Signals via a Novel Decision-Tree-Inspired Analog Circuit Classifier 

论文期刊:Mechanical Systems and Signal Processing

论文日期:2026

论文链接:https://doi.org/10.1016/j.ymssp.2026.114074

作者:Siliang Lu [a], Junyan Zhu [a], Ling Zheng [a], Juncai Song [b], Zhiyong Hu [a], Xiaoxian Wang [c,*], Dong Wang [d]

机构:

a College of Electrical Engineering and Automation, Anhui University, Hefei, Anhui 230601, PR China

b College of Internet, Anhui University, Hefei, Anhui 230601, PR China

c College of Electronics and Information Engineering, Anhui University, Hefei, Anhui 230601, PR China

d Department of Industrial Engineering and Management, School of Mechanical Engineering, Shanghai Jiao Tong University, Shanghai 200240, PR China

作者简介:

朱俊炎,安徽大学电气工程与自动化学院机械专业在读硕士生,在Mechanical Systems and Signal Processing、IEEE Transactions on Instrumentation and Measurement上发表论文,获批国家发明专利,获全国大学智能车竞赛、“西门子杯”中国智能制造挑战赛全国二等奖。

王骁贤,安徽大学光电信息获取与防护技术全国重点实验室副教授、硕士生导师,于2024年获得中国科学技术大学工学博士学位。研究方向包括信息处理、在线检测、智能运维等。主持国家自然科学基金青年项目1项,以第一作者/通信作者发表SCI期刊论文20余篇。

陆思良,安徽大学电气工程与自动化学院教授、博士生导师、副院长,研究方向为机电系统信号处理与智能运维,主持国家自然科学基金4项,国家电网、奇瑞汽车等企业委托开发项目10余项。入选安徽省优青、安徽省青拔、全球前2%顶尖科学家终身榜单,曾获上海市科学技术二等奖、安徽省自然科学二等奖、中国电工技术学会科学技术奖一等奖、基金委工材学部机械工程学科“优秀结题项目”。担任《IEEE Transactions on Instrumentation and Measurement》、《IEEE Sensors Journal》期刊Associate Editor。

王冬,国家特聘青年专家,上海交大机动学院长聘副教授,博导。致力于智能运维与大数据分析研究,成果应用于航天五院、中国核动力、中国船舶、联想、华为、上海核工程、上海电气、西部数据等合作研究中。获中国振动工程学会青年科技奖、中国科技产业化促进会科学技术奖一等奖、中国发明协会“发明创业奖”金奖、上海教学成果一等奖等。担任第九、第十届中国振动工程学会副秘书长、IEEE Sensors Journal数据科学领域主编、JRSE预测与健康管理领域主编、MSSP、IEEE TIM、JDMD和Measurement副主编。指导学生获首届博士生国自然青年学生基础项目、上交“学术之星”提名奖2人、机动学院重点推荐A级科创全国特等奖和一等奖5次、会议Best Paper最佳论文和口头汇报奖5次等。

目录

摘要

1 引言

2 基于模拟电路的决策树分类器设计

    2.1. 使用模拟电路实现的决策树算法

    2.2. 模拟电路分类器的设计

    2.3. 模拟电路分类器的参数优化

3 不同数据集上的实验验证

    3.1 模拟电路分类器的拓扑结构

    3.2 无刷直流电机(BLDCM)轴承数据集

        (1)实验设置及信号预处理

        (2)性能验证

        (3)抗噪性能验证

        (4)分类精度的定量分析

        (5)信号持续时间的影响

    3.3 凯斯西储大学(CWRU)轴承数据集

    3.4 开关磁阻电机(SRM)数据集

    3.5 数据集的关键信息摘要

4 电机故障信号实时分类

    4.1 实验装置

    4.2 实时信号处理的性能验证

    4.3 变速条件下的性能验证

    4.4 验证系统的响应时间和能耗变速条件下的性能验证

    4.5 基于模拟电路的分类器的比较

5 讨论

    5.1 信号类型数量与滤波器数量之间的关系

    5.2 集成电路实时故障诊断和显示

    5.3 滤波器特性对系统输出的影响

    5.4 噪声干扰在实际场景中的影响

6 结论

摘要

在数字信号处理器(Digital Signal Processor, DSP)上运行的传统机器学习算法需要进行模拟信号与数字信号之间的转换,这会导致不可避免的延迟和大量的能耗。本文研究了一种基于决策树的新型模拟电路分类器,用于实时机器信号分类和故障诊断。与传统的基于DSP的故障诊断方法相比,所设计的基于模拟电路的方法具有低延迟响应时间和低计算成本等优势。决策树算法的主要思想被整合到由滤波矩阵和幅值量化模块组成的模拟电路设计中。经过条件判断,传感器输出的模拟信号流经不同的分支通路。这种设计将传统决策树的分层判断机制创新性地转化为模拟电路实现,其中滤波器阵列对应于决策树的子节点,幅值量化模块实现信号分支选择。最终的输出结果是相应叶节点的分类结果,并且这些输出是根据要分类的信号类型进行编码。这种全时域模拟信号处理方法避免了模拟到数字的转换延迟,保持了决策树的可解释性,并且具有低延迟、易于实现和可扩展性的优点,在实时智能机器信号处理、状态监测和故障诊断等领域展现出良好的应用潜力。

关键词:模拟电路分类器、决策树、机器信号处理、故障诊断、滤波矩阵

1 引言

近年来,人工智能(AI)技术发展迅速,其在特征提取和模式识别方面的强大能力在多个领域展现出卓越的表现。借助大规模数据集、先进的算法架构和高性能计算硬件,深度学习不断突破传统算法的局限,成为科学研究和工程创新的重要推动力。然而,这些模型的快速扩展和复杂性增加导致了显著的能耗问题,使计算效率成为现代人工智能系统中的主要瓶颈。目前,深度神经网络的训练和推理所需的计算需求和能耗远远超过了传统电子硬件的能力。这种资源密集型特性不仅限制了模型的可扩展性,也对可持续目标构成挑战。

为解决这一问题,研究人员开始探索物理神经网络(PNNs)作为替代方案。这些日益严峻的挑战重新点燃了对替代硬件平台的兴趣。基于这些非常规计算平台的人工智能硬件统称为PNNs。这些硬件系统利用物理过程,如光学、机械或电子工艺,来执行计算任务,实现更高效、更低功耗的机器学习。PNNs在推理阶段展现出显著优势,充分利用物理系统的固有特性。例如,光学神经网络利用光学器件执行高效的矩阵运算,而机械神经网络则利用物理形变进行计算。这种基于物理过程的计算范式在降低能耗和提升处理速度方面具有巨大潜力。

尽管PNN在信号推断方面具有巨大潜力,但在硬件中直接实现高效且稳定的训练过程仍是一大挑战。当前主流的物理硬件训练方法主要依赖反向传播算法或其变体。该算法需要高度精确的数学建模和数值求解过程,但由于物理系统中常见的非线性、噪声和动态特性,这些过程较为复杂,不仅大幅增加了整体计算时间和能耗,还降低了物理硬件在推理阶段的高效率。这些挑战严重限制了传统培训方法在工业环境中的实际应用。

因此,提出一种能够克服传统训练方法局限、进一步探索实体硬件潜力的新方法至关重要。在此背景下,模拟电路的特性为实现机器学习提供了新的视角。与传统机器学习算法不同,受决策树启发的模拟电路系统可以直接利用电压和电流等物理量来实现分类和决策的能力。该方法不仅将机器学习的核心概念嵌入电路设计中,还实现了硬件层面的特征提取和分类任务。通过这种方法,可以实现振动信号的实时处理,这对于监测和诊断工业关键部件(如轴承故障)尤为重要。通过利用模拟电路的快速响应能力,振动信号可以高效地提取特征并准确分类,从而实现对不同类型轴承故障的实时监测和诊断。

从另一个角度看,电机被广泛应用于工业自动化、精密制造和航空航天行业,而轴承是电机中最重要的部件之一。然而,在长时间运行过程中,电机轴承容易因负载冲击、磨损不均匀和润滑不足等因素而出现故障。这些故障不仅会导致异常振动和电机效率下降,还可能导致设备故障,甚至严重的安全事故和经济损失。因此,实现电机轴承故障的高效、精确实时监测和诊断已成为确保设备稳定运行和延长使用寿命的关键技术。

目前,传统的轴承故障诊断方法主要依赖数字信号处理技术和复杂的算法模型。尽管这些方法能够实现较高的故障诊断准确性,但它们常常存在实时性能较差、高能耗和系统复杂度较高的问题。这些限制不仅增加了实施成本,也限制了其在对时间延迟敏感的工业环境中的适用性。此外,随着监控系统的规模和复杂度不断增长,传统方法相关的计算负担和延迟进一步加剧,使得实现高效且实时的故障诊断变得越来越困难。相比之下,基于模拟电路的故障诊断技术在响应速度快、功耗低和实施成本低方面具有显著优势,并有效避免了传统方法的延迟和高能耗问题。尤其在嵌入式和低功耗场景下,模拟电路故障诊断技术展现出极大的应用潜力。

研究空白、挑战及主要贡献总结如下:

(1)传统故障诊断依赖于模拟信号到数字信号转换,该转换存在固有延迟和高能耗,阻碍满足嵌入式低功耗的需求。受决策树启发的模拟电路分类器完全避免了数字转换,实现了实时信号处理,同时大幅降低了延迟和功耗。

(2)鉴于对模拟电路分类的研究不足,该模拟电路设计了滤波矩阵和均方根值计算模块。重现了传统决策树的节点划分逻辑,分类方法完全基于模拟电路进行信号分类。 所提出的决策树启发模拟电路分类器可以直接处理传感器采集的原始连续振动信号,这在很大程度上满足了工业场景中低功耗嵌入式系统的需求。

研究的其余部分如下。第二节介绍基于模拟电路的决策树分类器原理及模拟电路各模块的功能。第三部分讨论了模拟电路的拓扑图、数据集和实验验证结果。第四节介绍了用于验证实时信号分类实验的实际实验平台。第五节讨论了该方法的可能改进,第六部分总结了全文。

2 基于模拟电路的决策树分类器设计

2.1. 使用模拟电路实现的决策树算法

决策树被应用于各种场景,尤其是在分类任务中。该算法通常使用某些标准,如信息增益、增益比或基尼指数,来为每个分割选择最佳属性。例如,利用信息增益,通过选择信息增益最大的属性进行数据划分,可以逐渐降低数据中的无序程度,从而实现分类预测,如下式:

 
 

其中,    表示数据集D的子集,被属性A的值v划分,Entropy (D)是数据集D的熵(熵越高,数据的不确定性越大;熵越低,数据的纯度越高),如上式所示,    是数据集D中属于    类数据的比例。

与线性判别分析(LDA)分类器和基于规则的电路分类器的模拟电路实现相比,受决策树算法启发的模拟电路分类器具有明显优势。LDA电路在实际中需要高度精确的权重值才能实现正确的分类,这使得确保分类边界的稳定性变得困难。而基于规则的电路则随着规则数量的增加,电路复杂度和调试难度显著增加,且缺乏对信号变化的适应能力。相比之下,受决策树启发的模拟电路分类器执行分层阈值比较,这些比较可以自然地在硬件中实现为多级比较器结构,从而实现可解释性和稳定性之间的平衡。树状结构直观地展示了整个决策过程,使用户能够轻松理解每个决策的基础。具体来说,本研究设计的电路采用了受决策树启发的架构,滤波矩阵作为电路每个子模块中的决策节点。从每个子模输出信号计算出的均方根值对应于特定的分支准则,类似于传统决策树中的基于阈值的决策。

实现受决策树启发的模拟电路系统的关键在于选择合适的模拟组件来替代决策树的子节点,并确定分支路径。如图1所示,设计了一个受决策树启发的模拟电路分类器的示意图。在这些组件中,由于滤波器的特性,同一信号通过具有相同参数的滤波器时,不同工作模式下的输出会有所变化。例如,信号经过低通和高通滤波模式时,输出会有所不同。因此,滤波矩阵电路取代了传统决策树中的子节点。然而,与传统的决策树不同,传统决策树是数字化实现并处理离散数据的,模拟电路处理的是连续信号。在传统决策树中,最佳分段阈值是基于信息增益选择的,而在模拟电路中,通过滤波电路提取物理量之间的关系,如均方根值,以实现信号分类。最终,电路根据信号的有效值关系对信号进行分类。如图1所示,不同类型的故障对应不同的RMS输出,从而实现分类。

图1 受决策树启发的模拟电路分类器示意图

2.2 模拟电路分类器的设计

该电路使用Butterworth滤波器(MAX261, Maxim Inc.)作为滤波电路模块。MAX261 是由Maxim推出的CMOS双二阶通用开关电容有源滤波器,包含两个二阶开关电容有源滤波器和一个自由运算放大器。每个滤波单元由两个级联积分器和一个加法放大器组成,如图2所示,其中HP、LP和BP分别代表高通滤波器、低通滤波器和带通滤波器的输出。SCN指的是开关电容网络。通过反馈控制,每个滤波器的中心频率f0和品质因数Q被调整。其特性与连续时间滤波器极为接近,最大工作频率范围为0.4 Hz至57 MHz。

为了实现理想的二阶状态变量响应,必须确保输入时钟频率与滤波器中心频率比(fCKL/f0)较大。此外,滤波器功能可由微处理器精确控制,带通、低通、高通、带阻和全通滤波器可在无外部元件的情况下构建。滤波器内部包含两个二阶滤波单元,每个滤波器的中心频率、Q值和工作模式可编程设置。该电路采用HP和LP滤波模式。为了控制所有滤波器,该设计在模式3使用MAX261实现LP和HP滤波模式。为了确定滤波器的最优参数,采用基于遗传算法(GA)的优化策略。该算法用于自动搜索能够最小化滤波器输出RMS差值的截止频率。这两种不同滤波模式的模型可以用二阶传递函数来描述。例如,LP滤波模式和HP滤波模式的传递函数G(s)如下所示:

 
 
 

其中,    是直流处的LP输出增益,    是HP增益,    近似为    

图2 二阶滤波器的内部框图

该模拟电路的另一个重要组成部分是RMS计算模块(AD637,Analog Devices, Inc.)。RMS计算模块是一个专门为高精度RMS测量设计的硬件模块。当供电电压为±12V至±15V时,其测量范围可达0 Vrms至7 Vrms,输出电压纹波小于2mV。AD637模块采用了RMS方程的隐式解,克服了简单RMS计算的固有局限。

图3(a)展示了AD637模块的功能实现图,图3(b)展示了AD637模块及其外设电路的示意图。AD637模块分为四个主要部分:绝对值电路、平方电路、滤波电路和缓冲放大器电路。AD637模块的输入电压可以是交流或直流信号,通过有源整流器A1和A2将其转换为单级电流,驱动平方电路。平方电路的输出电流驱动A4,A4与外部平均电容协同形成LP滤波器,而A3则利用该滤波器的放大器输出驱动最终的均方根计算。此外,为了获得更准确的有效值值,AD637模块必须包含两个运算放大器模块:(AD825, Analog Devices, Inc.),作为信号输入端的运算放大器,(OP07CR,Texas Instruments, Inc.),作为输出端的运算放大器,分别负责放大输入和输出信号。

图3(a) AD637模块的功能实现图,以及(b)AD637模块及其外围电路的示意图

由于AD637模块响应时间短,滤波后轴承振动信号的均方根值可以被准确测量。AD637模块实际执行的计算见下式:

 

其中,    是输入连续模拟信号,    是    在均方根计算后输出的连续模拟信号。

除了上述两个模块外,该模拟电路还包括一个微控制器单元(MCU)和一个电源模块。MCU控制不同滤波器的工作模式,无论是LP滤波还是HP滤波器。电源模块为滤波器和AD637模块供电。原始模拟信号的输出经过不同滤波器后,作为AD637模块的输入。经过AD637模块处理后,滤波后的信号会从混沌信号转变为易于观测的均方根值信号作为输出。

2.3 模拟电路分类器的参数优化

在新型模拟电路参数优化中,首先描述参数优化问题。由于模拟电路使用滤波模块的LP和HP滤波模式,确定每种模式的参数成为关键问题。例如,一组包含两种轴承故障的模拟信号,当通过不同参数的滤波器时,会产生不同的输出。同样,这些信号在经过不同工作模式的滤波器后,其输出也会存在差异。然而,如果LP和HP滤波器的参数相同,则总会存在一个参数使得模拟信号经过LP和HP滤波器后的均方根值相等。将实际参数设置为该值,有助于区分各类轴承故障对应的模拟信号分别经过LP与HP滤波器后的均方根值,从而实现信号分类。因此,优化的目标函数表达为下式:

 
 
 

其中,    和    分别是截止频率为    的通过HP滤波器和LP滤波器输出信号S的有效值;S是一个包含n个数据点的信号段。因此,优化的目标函数是    的最小值。滤波器所需的参数是对应于    最接近零位置的频率值。

在参数优化领域,存在多种智能算法,如GA、粒子群体优化、蜂群算法和神经网络算法。对于本文研究的单变量全局优化问题,选择GA作为求解工具,以获得全局最优解。GA是一种受自然选择和生物遗传过程启发的方向性、半随机搜索算法。在全能遗传学中,染色体代表具有独特遗传特征的个体,基因对应一组需要优化的特定参数。为了评估人群中的染色体,GA利用适应度函数为每条染色体分配一个分数,每一代中,优先选择得分较高的染色体进入下一代。经过多代进化,保留的高分染色体将代表优化问题的全局最优解或近似最优解。基于上述目标函数,算法中的适应度函数如下:

 
 

其中,    是信号段,即原始信号被划分为一百个长度相等的信号段,每个信号段有2000个数据点,因此n的值为2000;    是对应不同信号段的截止频率,通过持续调整和优化;最后,得到最接近0的    值,然后对应的    是最佳截止频率。

图4 参数优化和信号流程图

这里用三类示例来说明整个参数优化过程。在本例中,使用了1000、1500和2000赫兹的正弦波以及随机噪声。这三种正弦波和噪声被组合起来作为输入。通过GA,进行第一层优化以获得第一个参数值,如图4所示。第一层优化的结果约为1750Hz。该参数随后用作巴特沃斯HP和LP滤波器的截止频率。

当1000、1500和2000Hz的正弦波通过HP和LP滤波器时,2000Hz的正弦波产生的输出是HP滤波后的均方根值大于LP滤波后的均方根值。相反,1000Hz和1500Hz的正弦波表现出相反的结果,因此对2000Hz的正弦波实现了分类。同样,通过输入1000Hz、1500Hz正弦波和随机噪声,第二层优化利用GA得到第二个参数,如图4所示。第二层优化的结果约为1400Hz。该参数用作巴特沃斯HP和LP滤波器的截止频率,而滤波后1000和1500Hz正弦波的均方根值关系则相反;因此,三种不同的信号都成功被区分。

为避免仅使用正弦信号所带来的潜在偏差,并进一步验证所提出方法在非平稳和非线性振动信号中的适用性,本研究又增加了对三组具有不同故障特征频率的模拟滚动轴承故障信号进行了测试。所采用的信号模型旨在代表具有局部故障的滚动轴承的典型动态行为,其中故障位置与滚动元件之间的周期性接触会产生瞬态脉冲激励,进而激发系统的结构共振响应。对应的数学表述见下式:

 

其中,    和    表示第k次脉冲激发的幅度和时间,    是系统的固有角频率,    是阻尼比,n(t)表示背景噪声。

具体来说,如图5所示,信号1、信号2和信号3的故障特征频率分别设置为100Hz、400Hz和800Hz。系统截止频率会根据这三种信号重新优化,然后利用训练好的系统对非固定和非线性振动信号进行分类。图5右侧面板的结果表明,设计的基于模拟电路的分类方法仍能有效区分不同类型的轴承故障信号,从而验证系统处理不同类型信号的性能。处理实际振动信号的方法性能将在第三节介绍。

图5 系统在处理模拟非固定和非线性振动信号时的性能验证

在所提方法中,GA被用于根据不同机器信号的特性调整滤波器频率。由于故障信号的频谱分布在不同机器间存在差异,需要进行GA重新优化以确保分类准确性。GA优化的核心目标是确定滤波器模块的截止频率    ,而    的最优值直接依赖于故障信号的频谱分布。因此,当电路应用于新机器时,必须再次进行GA优化,以匹配该条件下故障信号的频谱特性,确保滤波模块能够有效区分具有不同特征的信号。

3 不同数据集上的实验验证

3.1 模拟电路分类器的拓扑结构

该电路旨在通过新型模拟电路分类器,利用轴承振动的模拟信号对轴承故障类型进行分类。在此过程中,电路设计尤为重要。真实电路设计与仿真之间存在一定差异。二阶巴特沃斯滤波器在仿真实验中与实际电路中产生的效果不同。巴特沃斯二阶滤波器在实电路中的滤波效应未达到仿真滤波器的性能。为了更好地使仿真与实际电路实验的滤波效果保持一致,对实际的巴特沃斯二阶滤波器进行改进,通过级联的方式提高其阶数,级联后滤波器阶数由二阶提升至四阶。由于实际巴特沃斯滤波器对滤波后的输出信号存在放大作用,实际模拟电路中级联滤波器所产生的实验结果与仿真结果基本相似,仅幅值略有放大,其余效果基本保持一致。

本文以三分类轴承故障类型为例,介绍新型模拟电路的整体工作流程。对轴承故障类型进行分类时,轴承信号需要经过两层滤波器矩阵,对轴承故障类型进行分类时,电路需要通过两层滤波矩阵,每个滤波矩阵由一个HP滤波器和一个LP滤波器组成。每个过滤器还需要级联处理。因此,每个滤波矩阵需要四个MAX261模块。每层的滤波器成对工作,配置相同。因此,当使用MCU控制滤波器工作模式时,除时钟引脚外的所有引脚都可以使用相同的引脚,而时钟引脚则必须分配到不同的引脚,以设定每个滤波矩阵的不同工作参数。

当轴承信号通过滤波矩阵的第一层时,会产生两个输出:一个来自LP滤波器,另一个来自HP滤波器。这两个输出各自分成两条相同的路径:其中一路作为AD637模块的输入,另一路作为加法器的输入。由于经过LP滤波器后的信号会显著削弱高频特征,而经过HP滤波器后的信号则会明显削弱低频特征,因此,滤波矩阵第一层输出的信号必须通过加法器进行叠加,以恢复信号的全频率特性。恢复后的信号将作为滤波矩阵第二层的输入。经过滤波矩阵第二层滤波后的输出被送入AD637模块作为输入。此时,AD637模块的输出为一种近似直线的模拟信号,它表示信号更加直观、易于观察的均方根值。若LP滤波器的输出大于HP滤波器的输出,则编码为 [1, 0];反之,若HP滤波器的输出大于LP滤波器的输出,则编码为 [0, 1],如表1所示。其中,    表示经过LP滤波后由AD637模块输出的有效值,而     表示经过HP滤波后由AD637模块输出的有效值。

表1 编码方法

新型模拟电路的原理图如图6所示。模拟信号进入整体电路,依次经过第一层滤波矩阵、加法器电路、第二层滤波矩阵,最终,第一层滤波矩阵的两个输出以及第二层滤波矩阵的两个输出共同作为AD637模块的输入。AD637模块的四个输出在图中表现为四条近似直线的模拟信号,可以通过示波器进行观察,并根据其幅值之间的关系判断故障类型。

图6 模拟电路分类器原理图:(a)原理图;(b)详细电路接线

图6(b)展示了该新型模拟电路的详细接线图。按照前文给出的器件参数,并注意滤波器级联时的相关设计要求,即可依据图6(b)所示的接线图复现实验系统。

3.2 无刷直流电机(BLDCM)轴承数据集

(1) 实验设置及信号预处理

在本小节中,使用BLDCM的数据集来验证所设计系统的性能。实验装置如图7所示。图7(a)展示了不同故障类型BLDCM的测试平台,包括健康状态。图7(b)展示了三种故障类型。BLDCM及其故障类型的详细参数分别列于表2和表3中。

图7 实验设置:(a)电机轴承振动信号采集系统;(b)外圈故障、内圈故障和健康轴承的说明

表2  BLDCM 参数

表3 BLDCM故障类型

在搭建实际电路之前,首先在计算机上进行了仿真实验。在仿真实验中,所使用的数据集为通过NI数据采集卡采集得到的BLDCM轴承数据集。该数据集包含300万个数据点,采样频率为20 kHz。在本次仿真实验中,选取200,000个数据点用于参数优化,因为仿真过程需要模拟真实的模拟信号。因此,这200,000个数据点必须是连续选取的。在优化之前,需要对数据进行归一化处理,如下式所示,以确保所有信号的数据范围均处于 [0, 1] 区间。随后,通过计算信号的平均值并去除直流分量,可以使信号更加平滑,从而有利于后续的滤波与分析。

 

将200,000个数据点划分为100个片段,每个片段包含2,000个数据点。信号经滤波器后,对每个片段的输出计算其均方根值,因此从这200,000个数据点中可以得到100个RMS值。对于具有相同故障类型的轴承信号,当其通过不同滤波器时,输出的RMS值会有所不同。通过分析这些RMS值之间的关系,可以实现不同信号的分类。

(2) 性能验证

在本实验中,选取BLDCM健康信号、2 mm内圈故障信号以及2 mm外圈故障信号进行分析。仿真实验首先将这三种信号混合为一个复合信号进行优化。通过优化得到的最优截止频率分别为:第一层滤波器2690 Hz,第二层滤波器2400 Hz。实际上,如果滤波器参数设置在最优参数附近的一定范围内,系统仍然可以完成分类任务,如补充材料[34]所示。在确定滤波器的最佳参数后,将三种不同信号分别输入滤波器进行处理。每种信号在经过LP滤波器和HP滤波器后,会得到不同的RMS值关系。图8(a)展示了健康信号通过第一层LP和HP滤波器后的RMS值。其中HP滤波后的RMS值大于LP滤波后的RMS值,因此在编码中表示为 [0, 1]。图8(c)展示了2 mm内圈故障信号,其编码表示为 [1, 0]。 图8(e)展示了2 mm外圈故障信号,其编码同样表示为 [1, 0]。整体编码结果如表4所示。其中,只有健康信号的编码方式与另外两种信号不同。因此,在第一层滤波后即可成功识别健康信号。

表4 不同信号经过全层滤波后的编码值

对于2 mm内圈故障信号和2 mm外圈故障信号,在经过LP和HP滤波后,将两个输出信号进行相加。随后,将合成信号输入到经过优化的滤波器中以获得最佳参数。在为不同滤波器设置最佳参数后,将经过第一层滤波并相加后的内圈2 mm故障信号和外圈2 mm故障信号再次通过滤波器进行处理。该方法 会产生不同的RMS值关系,与第一层滤波的情况类似。图8(b)展示了健康信号通过第二层LP和HP滤波器后的RMS值,其编码为 [0, 1]。图8(d)展示了2 mm内圈故障信号,其编码同样为 [0, 1]。图8(f)展示了2 mm外圈故障信号经过第二层滤波后的结果,其编码为 [1, 0]。整体编码结果同样列于表4中。

图8 (a)第一层和(b)第二层健康轴承信号的滤波矩阵输出;(c)第一层和(d)第二层的内圈故障信号;(e)第一层和(f)第二层外圈故障信号。

(3) 抗噪声性能验证

同时,为了验证系统在工业环境中的稳定性,在 BLDCM 健康信号、外圈故障信号和内圈故障信号的分类系统中加入了一定程度的合成混合噪声。考虑到实际应用场景中可能存在的噪声类型,混合噪声包括高斯白噪声、脉冲噪声和50 Hz工频噪声。其中,高斯白噪声占总能量的50%,而脉冲噪声和50 Hz工频噪声各占25%。通过改变混合噪声的信噪比(SNR),测试系统在干扰条件下的鲁棒性,实验结果如表5所示。实验结果表明,在加入噪声后系统性能有所下降,但在35dB噪声水平下系统仍然能够保持较高的分类准确率。此外,还进行了长期运行测试。系统连续运行24小时,并每4小时采集一次输出数据。结果表明,在整个测试过程中系统的编码输出基本保持稳定。

表5 加入噪声后的实验结果

(4) 分类精度的定量分析

为了进一步定量分析系统在信号分类中的性能,引入了多种评价指标,其定义如下:

 
 
 
 

其中,TP、TN、FP和FN分别表示真正例、真反例、假正例和假反例。当系统正确识别健康状态信号,即两层滤波矩阵均满足    大于    时,该结果被计为真正例;当系统正确识别内圈故障信号时,则计为真反例。相应地,将健康信号误判为内圈故障计为假正例,将内圈故障误判为健康状态计为假反例。实验共测试400段健康信号和400段内圈故障信号,实验结果如表6和表7所示。结果表明,该系统能够较好地区分正样本与负样本,并具有较低的总体分类错误率。这说明该系统在当前分类任务中表现良好,具有较高的可靠性。

表6 轴承状态预测结果统计

表7 指标的结果

(5) 信号持续时间的影响

同时,考虑到分类准确率可能受到输入信号持续时间的影响,还进行了实验以验证实现准确分类所需的最短信号时长。实验中将信号持续时间设置为0–25ms,步长为2.5ms,实验结果如图9所示。结果表明,随着信号持续时间的增加,分类准确率逐渐提高。当信号持续时间达到10ms时,分类准确率达到87.50%;当信号持续时间增加到20ms时,分类准确率稳定达到99.50%。

图9 不同持续时间输入信号的精度

3.3 凯斯西储大学(CWRU)轴承数据集

为了进一步验证所提出系统在不同数据集上的有效性,本研究使用公开的CWRU轴承数据集,在不同负载和故障严重程度条件下评估其多类别分类能力。本研究使用驱动端轴承振动数据,其故障类型、故障等级和负载情况列于表8中。其中IRF和ORF分别表示内圈故障和外圈故障。在本研究中,由于需要对4种信号进行分类,因此重新设置并优化系统参数,输出编码如表9所示。实验结果总结如图10所示。可以看出,所设计的系统能够成功分类4种不同工况下的轴承振动信号,结果验证了所提出的方法能够在不同数据集之间有效应用。

表8 CWRU公共轴承数据集故障类型

图10系统输出不同故障类型、故障大小、负载的CWRU信号

表9 不同信号经过全层滤波后的编码值

3.4 开关磁阻电机(SRM)数据集

除了机械故障之外,电机还可能出现电气故障。为了进一步验证该方法在混合故障诊断中的性能,本研究还处理了来自SRM实验平台的另一组数据。SRM的故障类型如表10所示,其中混合故障为轴承机械故障、高电阻连接(HRC)电气故障以及霍尔传感器故障的组合。SRM的详细信息可参考文献[36]。在表10中,I1表示轴承内圈存在宽度为1 mm的缺陷,O1表示轴承外圈存在宽度为1 mm的缺陷,H表示霍尔故障,A1表示A相出现电阻值为1 Ω的HRC故障,B0.5表示B相出现0.5 Ω的HRC故障。

表10 SRM的混合轴承和HRC故障

分类结果如图11所示。经过第一层滤波矩阵后,系统将轴承内圈故障与HRC混合故障信号分离;随后第二层滤波矩阵进一步区分轴承外圈与HRC混合故障信号以及霍尔与HRC 混合故障信号。实验结果表明,即使在另一种类型电机的复杂混合故障信号条件下,所提出的系统仍然能够实现准确的故障分类。

图11 SRM中混合轴承、HRC和霍尔故障的分类结果

3.5 数据集的关键信息摘要

上述实验结果表明,所设计系统能够对具有不同特征的多种机械信号进行分类。为了便于快速参考,数据集的关键信息总结于表11。

表11 实验数据集关键信息

4 电机故障信号实时分类

4.1 实验装置

实验装置如图12所示。从右到左,三个BLDCM分别代表不同故障状态:健康状态、内圈2 mm故障以及外圈2 mm故障。每个电机下方对应一个BLDCM驱动器用于驱动电机。电机左侧为直流稳压电源,为电机驱动器提供电源。电机右侧为实际设计的模拟电路模型,其中包括两层滤波矩阵、四AD637模块、一个加法器模块、一个主控制模块以及三个电源模块。电路板下方为IEPE信号调理放大器(LZ-1106E,Langzhen 公司),其为加速度传感器(CT1010L,Chengko 公司)提供恒流源驱动。


图12 实时信号处理与故障诊断实验装置

原始加速度传感器信号经过信号调理放大器后输出为未进行额外处理的归一化信号。加速度传感器通过磁铁固定在电机上方以获取轴承振动信号。信号调理放大器的输出连接至新型模拟电路的输入端。电机上方为示波器,实际模拟电路的四个输出连接至示波器的四个输入通道,通过观察示波器上的四个输出通道即可直接获得对应编码,从而判断相应的故障类型。

4.2 实时信号处理的性能验证

图 12 所示首先将加速度传感器放置在具有2 mm外圈故障的电机上,随后开启恒流源和电机电源,此时加速度传感器输出的电压信号表示电机在2 mm外圈故障条件下的轴承振动,该信号直接输入至设计电路板的输入端。电路板四个通道的输出从右到左依次对应为第一层滤波矩阵的LP输出、第一层滤波矩阵的HP输出、第二层滤波矩阵的LP输出以及第二层滤波矩阵的HP输出。这四个通道的输出连接至示波器对应的输入通道,结果如图13(a)所示。示波器的通道1和通道2分别表示第一层滤波矩阵的LP和HP输出,而通道3和通道4分别表示第二层滤波矩阵的LP和HP输出。由于示波器四个通道的零点均设置在同一位置,因此它们在屏幕上的相对位置代表其幅值大小。

图13(a)显示通道1位于通道2上方,因此第一层滤波矩阵的输出编码为 [1, 0];同样,通道3位于通道4上方,因此第二层滤波矩阵的输出编码也为 [1, 0],因此整体输出编码为 [1, 0, 1, 0]。类似地,当将加速度传感器放置在具有2 mm内圈故障的电机上时,可得到图13(b)所示结果,其中第一层滤波矩阵输出编码为 [1, 0],第二层滤波矩阵输出编码为 [0, 1],整体输出编码为 [1, 0, 0, 1]。当加速度传感器放置在健康轴承电机上时,输出结果如图13(c)所示,其中第一层滤波矩阵输出编码为 [0, 1],第二层滤波矩阵输出编码为 [0, 1],因此整体输出编码为 [0, 1, 0, 1]。真实实验结果与仿真实验结果一致,验证了所提出方法的有效性。

图13 实时信号处理和故障诊断的实验验证:(a)轴承外圈故障,(b)轴承内圈故障,(c)健康轴承

4.3 变速条件下的性能验证

本小节在电机转速变化条件下验证所提出系统的性能。如图14所示,图中左列展示系统能够成功分类信号的情况。图14(a)给出了电机转速变化曲线,其在1300 rpm到1600 rpm之间以5s为周期进行正弦变化。图14(b)和图14(c)分别展示第一层和第二层滤波器的RMS输出。图14 不同转速范围下的转速变化及相应的系统输出:(a)小转速范围条件下电机转速变化曲线;(b)和(c)成功分类的第1层和第2层滤波器输出;(d)大转速范围工况下电机转速变化曲线;(e)和(f)第1层和第2层未成功分类的滤波器输出

在相同时间区间内,模拟电路系统输出的变化趋势与电机转速变化高度一致。在该转速范围内,经过短暂的瞬态调整后,系统能够输出正确编码,与之前在恒定转速条件下得到的结果一致。图14右列子图展示系统无法 正确分类信号的情况。图14(d)显示电机转速在1000 rpm到1600 rpm之间波动。在较高转速时系统能够保持正确输出编码,如图14(e)左侧粉色框所示;然而在最低转速处,如图14(e)红色框所示,输出编码出现偏差。这是因为转速变化会改变振动信号的频率分布,从而影响系统输出。因此,所提出系统更适用于恒速或小幅转速变化的运行工况。

4.4 验证系统的响应时间和能耗

本小节验证系统的推理时间和能耗。为了评估系统推理时间,在BLDCM的两种工况下进行实验,健康状态和霍尔传感器故障状态。霍尔传感器故障通过断开其信号线实现[37]。如图15左侧蓝色背景区域所示,系统输出对应电机健康状态,其编码为 [0, 1, 0, 1]。随后引入突发霍尔传感器故障,系统对该变化作出响应,如黄色背景区域所示。图15右侧粉色背景区域表示系统稳定检测到霍尔故障后的输出,其编码为 [0, 1, 1, 0]。通过测量黄色 区域宽度估算突发故障的检测时间约为78 ms,结果表明系统能够以较小延迟高效检测故障。

图15 模拟电路分类系统对突发故障检测的响应时间

此外,将所设计模拟系统的推理时间与在Raspberry Pi 嵌入式系统上实现的两种经典方法SVM和CNN 进行比较。所有实验均使用相同的BLDCM 信号。如表12和图16所示,尽管所提出系统的分类准确率略低于SVM和CNN,但其推理时间显著低于对比方法。这些结果表明,所提出系统在保持较高分类准确率的同时,在实时性能和计算延迟方面具有明显优势。

图16 不同分类器在树莓派嵌入式系统上的推理结果

表12 不同分类方法的准确率和推理时间的比较

此外,通过对所有电路组件能耗进行求和评估系统功耗。在给定电源条件下,MCU、MAX261芯片以及RMS计算电路的功耗分别约为 89 mW、200 mW 和 120 mW,总系统功耗约为2.1 W。相比之下,使用Raspberry Pi 4B进行基于深度学习的故障信号训练与分类时功耗约为7 W,而Jetson Orin NX平台约为15 W。详细对比结果见表13。未来工作中,可使用电阻、电容和电感等基本电子元件构建固定截止频率滤波器,以进一步降低系统整体功耗。

表13 功耗对比

4.5 基于模拟电路的分类器的比较

基于模拟电路的分类器近年来受到研究人员广泛关注,因为其无需ADC即可实现信号分类并具有较高处理速度。在本小节中,将所设计的决策树分类器与其他类型的模拟电路分类器进行比较,包括LDA、SVM和神经网络,结果如表14所示。LDA、SVM 以及神经形态分类器的模拟实现具有低功耗和高并行处理能力等显著优势,但这些方法通常需要定制的大规模集成电路(VLSI)技术,目前仍处于实验室研究阶段,在实现大规模生产之前VLSI成本极高。相比之下,本文所设计系统采用基本离散电子元件构建,具有良好的灵活性。当然,如果需要进行大规模生产,本文提出的方法和系统同样可以采用VLSI技术实现。此外,本研究从信号采集、信号处理到结果展示的完整信号流程角度验证了所设计系统的工程实用性。在参考文献39–43的对比方法中,仅使用离线数据集进行分类验证。因此,所设计系统更适用于部署成本低、系统可靠性高且工程实用性强的工业应用场景。

表14 基于模拟电路的不同分类器的比较

5 讨论

本研究提出了一种基于模拟电路的实时信号处理与机器故障诊断系统。尽管所提出方法的性能已从多个方面得到验证,但类似主题的研究仍然较少。因此,为了使该方法在实际应用中更加灵活,本文对所提出方法的改进方向进行了讨论。

5.1 信号类型数量与滤波器数量之间的关系

本文提出了一种基于模拟电路的决策树分类器,该分类器利用多级滤波矩阵实现特征提取与分类。实验结果表明,对于本文所涉及的三分类轴承故障任务,需要两个内部决策节点,每个节点对应一层滤波矩阵,即HP和LP滤波模块。每个模块由四个滤波模块组成,因此完成三分类任务需要八个滤波模块。进一步分析表明,分类数量与滤波器数量之间呈线性增长关系,这一关系来源于决策树的二叉树结构,其具体表达如下式:

 

其中,K为待分类故障个数,L为所需滤波器个数。 此外,在当前系统实现中,每一层滤波矩阵均配置为双输出结构,即LP和HP滤波器。对于三分类任务,需要两层滤波矩阵,总计涉及八个MAX261模块,这在一定程度上引入了冗余。为了解决这一问题,未来可以研究一种结合分层复用策略和差分放大机制的协同方案。在优化各层滤波器的截止频率之后,可利用MCU精确控制时间间隔并动态调节MAX261器件的截止频率,使算法优化能够确定每一层的最佳截止频率。在这种架构下,仅需要一对LP和HP滤波器即可完成分类任务。

5.2 集成电路实时故障诊断和显示

当前电路设计依赖离散模块,包括1个MCU、8个模拟滤波器、4个RMS计算模块以及1个求和电路,总系统功耗约为2.1 W。未来可以利用专用集成电路(ASIC)技术将整个系统集成到单一芯片中。在ASIC实现中,这些模拟功能可以通过低功耗CMOS跨导单元和乘法单元实现,其功耗有望降低至约50 mW。此外,大规模集成不仅可以降低单芯片成本,同时还能提高系统可靠性,使系统更加适用于工业实时故障诊断应用。

图17 未来ASIC技术后的模拟电路模型示意图

最后,采用ASIC技术后的模拟电路模型结构如图17所示。传感器采集的信号可以直接连接到电路板预设的信号输入接口,这些信号随后由集成多种功能模块的ASIC进行处理,处理后的输出信号直接连接到电路板上方的LED灯组。通过引入基于差分放大的编码方案,输出可以表示为数字电压电平的形式:当输出电压为正时编码为 1,反之编码为 0。因此可以利用LED来识别编码输出,当编码输出为1时LED点亮,当编码输出为0时LED熄灭。通过观察LED状态即可直接识别故障类型,无需额外的显示设备如示波器。在这种情况下,可以实现设备状态信号的实时处理并降低功耗,从而减少能耗、延长设备运行时间并降低运行成本。

5.3 滤波器特性对系统输出的影响

本研究中使用四阶集成模拟滤波器构建决策树节点。滤波器特性如滤波类型、阶数和截止频率都会影响系统输出。为了进一步评估滤波器特性的影响,采用由离散电子元件构建的二阶滤波器替代原有四阶滤波器进行对比。所构建二阶LP滤波器的原理图和实物照片分别如图18(a)和图18(b)所示。该滤波器由电阻、电容和运算放大器构成,其详细信息见图18(a)。

图18 由分立电子元件构成的二阶低电压滤波器:(a)原理图,(b)照片

具有相同截止频率2670 Hz的二阶和四阶滤波器的频率响应如图19所示。可以看出,两种滤波器在衰减比、过渡带斜率以及整体频率响应形状方面均存在差异,这进一步导致相位失真和信号延迟的不同。

图19 二阶和四阶LP滤波器的频率响应

一段振动信号被输入到这两个LP滤波器中,其输出如图20所示。为了评估信号通过滤波器后的波形变化,在输入信号波形中标记了一个参考点。如图20(b)和图20(c)所示,随着滤波器阶数增加,系统群延迟表现出可预测的累积特性,这与巴特沃斯无限冲激响应(IIR)滤波器的理论相位响应特性一致。二阶和四阶滤波器的时间延迟分别为0.14 ms和0.32 ms。

图20 (a)输入信号、(b)二阶和(c)四阶LP滤波器输出信号的波形比较

将原有四阶LP滤波器替换为二阶LP滤波器后的最终编码输出如图21所示。与四阶滤波器输出相比,二阶滤波器输出(红线)中可以观察到明显的波形波动。然而第一层LP滤波器的幅值仍然高于第一层HP滤波器,因此仍可得到正确编码 [1, 0]。由此可见,不同滤波器类型和结构不会影响本研究中的正确输出,因此为了简化系统,仅对截止频率进行优化以构建基于决策树的模拟电路分类器。此外,与集成四阶滤波器(MAX261)相比,由离散电子元件构建的二阶滤波器将功耗从200 mW降低到21 mW。从另一方面来看,尽管四阶滤波器结构具有更高功耗和更大相位延迟,但其输出信号质量和稳定性更好,这在当前应用场景中具有重要的工程意义。总体而言,所设计系统具有较高鲁棒性,在考虑复杂度、噪声条件和成本等因素时,其滤波器选择具有较好的灵活性,适用于不同潜在应用场景。

图21 二阶和四阶滤波器的输出结果

5.4 噪声干扰在实际场景中的影响

在工业机电系统中,信号采集和处理性能容易受到多种干扰源的影响。为了增强噪声测试的工程代表性,第3.2节采用由高斯白噪声、脉冲噪声和50 Hz工频干扰组成的混合噪声模型。具体而言,高斯白噪声用于模拟传感器热噪声和模拟前端电路中的电子噪声,脉冲噪声用于模拟由机械冲击、开关动作或强电磁干扰引起的瞬态扰动,而50 Hz工频噪声则反映工业环境中常见的干扰源,例如电源耦合、接地不良以及线路感应干扰[45–47]。这些噪声成分的组合旨在模拟连续干扰和脉冲干扰同时存在的复杂工业噪声环境。

需要指出的是,尽管该混合噪声模型在一定程度上捕捉了工业环境中主要的干扰机制,但模拟噪声仍无法完全再现真实工业场景中复杂的电磁耦合条件。为了进一步验证所提出系统在实际工业干扰环境下的鲁棒性,本文在真实电磁干扰环境中进行了补充实验,如图22所示。在这些实验中,利用电磁线圈产生的交变磁场和永磁体产生的静态磁场作为干扰源,通过在电路板上方均匀移动干扰源来模拟工业环境中常见的磁场扰动和电磁耦合效应。

图22 静磁场和交变磁场干扰下的系统鲁棒性实验

两种磁场干扰条件下的系统输出与无干扰条件下的结果进行对比,如图23所示。信号输出波形可分为三个阶段:第一段、第二段和第三段分别对应电磁线圈干扰、无干扰以及永磁体干扰条件下的系统输出。实验结果表明,在外部磁场干扰作用下,系统输出仅出现轻微波动,但从输出编码角度来看,分类结果未受到影响。这进一步验证了所提出基于模拟电路的分类系统在复杂噪声干扰条件下的鲁棒性。


图23 磁场干扰下的系统输出

6 结论

本研究提出了一种受决策树启发的模拟电路分类器,该分类器能够直接处理由加速度传感器采集的连续振动信号,而无需使用传统的ADC和DSP。该分类器由离散电子元件构建,并根据待处理信号对系统参数进行优化。通过仿真信号以及来自三种电机实验平台的真实振动信号验证了所设计系统的有效性和优势。与传统DSP方法相比,该方法避免了数字信号转换与预处理所固有的延迟和能耗,因此特别适用于低功耗和实时嵌入式应用场景。需要强调的是,所提出的方法并非旨在替代当前最先进的高精度模式分类方法,如新兴的深度学习模型。该方法更适用于信号类别数量有限且需要实时处理的应用场景。未来的研究工作将重点扩展模拟特征提取能力,并提高系统在更广泛信号类型和运行条件下的适应能力。



编辑:曹希铭

校核:李正平、陈凯歌、赵栓栓、赵学功、白亮、任超、Tina、陈宇航、海洋、Kira、王金、赵诚、肖鑫鑫、张优

该文资料搜集自网络,仅用作学术分享,不做商业用途,若侵权,后台联系小编进行删除


来源:故障诊断与python学习
ACTMechanicalSystemInspire振动非线性化学电源电路通用航空航天船舶汽车ANSA参数优化理论电机材料人工智能
著作权归作者所有,欢迎分享,未经许可,不得转载
首次发布时间:2026-04-13
最近编辑:4月前
故障诊断与python学习
硕士 签名征集中
获赞 87粉丝 152文章 327课程 0
点赞
收藏
作者推荐

论文学习||AgentOps:面向LLM智能体系统的运维框架综述(下)

在上期内容论文学习||AgentOps:面向LLM智能体系统的运维框架综述(上)中,我们已梳理了智能体系统的分类、异常现象、运维体系及监控相关内容,本期将聚焦论文下半部分,为大家完整分享前沿综述论文——《AgentOps:面向LLM智能体系统的运维框架综述》(下)。该研究开创性提出了面向智能体系统的全生命周期运维新范式,在上期界定的智能体内部异常与智能体间异常两大核心类别基础上,进一步深入拆解异常类型,全面覆盖推理、规划、动作、内存、环境、任务规范、安全、通信、信任、涌现行为、终止等11类具体异常。同时,论文构建了包含监控、异常检测、根因分析、修复验证四大环节的AgentOps(智能体系统运维)闭环框架,重点阐述了根因分析的分类体系及异常检测与根因分析的映射关系,并给出了涵盖验证、迭代修复、异常解决的完整解决方案。相较于传统AIOps方法,AgentOps首次将模型参数、注意力图谱、思维链快照等语义级数据纳入监控体系,有效破解了智能体系统的“黑箱”问题。此外,论文还针对AgentOps在监测、异常检测、根因分析、解决方案四大维度面临的挑战,展望了未来发展方向,最终形成完整结论,为智能体规模化、可靠落地提供了重要支撑。论文链接:通过点击本文左下角的阅读原文进行在线阅读及下载。 论文基本信息论文题目: A Survey on AgentOps: Categorization, Challenges, and Future Directions论文来源:arXivDoi:https://doi.org/10.48550/arXiv.2508.02121github地址:https://github.com/linafaik08/agentic-investor-brief作者: Zexin Wang1,*, Jingjing Li1, Quan Zhou1, Haotian Si1, Yuanhao Liu2, Jianhui Li1, Gaogang Xie1, Fei Sun3, Dan Pei4, Changhua Pei1 论文时间: 2025年8月 机构: 1:Computer Network Information Center, Chinese Academy of Sciences, China 2:Hangzhou Institute for Advanced Study, University of Chinese Academy of Sciences., China 3:Institute of Computing Technology, Chinese Academy of Sciences, China 4:Tsinghua University, China摘要随着大语言模型(LLMs)推理能力的持续提升,基于LLM的智能体系统在灵活性和可解释性方面较传统系统更具优势,因而备受关注。然而,尽管智能体系统在学术界和工业界广受研究关注并得到广泛应用,但这类系统与传统系统一样,常会遭遇异常现象。这些异常导致系统不稳定且存在安全隐患,阻碍了其进一步发展。因此,亟需建立一套全面系统的智能体系统运维方法论。遗憾的是,当前关于智能体系统运维的研究尚显匮乏。为填补这一空白,本文开展了智能体系统运维的系统性调研,旨在构建清晰的领域框架、界定核心挑战并推动后续发展。本文首先系统定义智能体系统中的异常现象,将其划分为智能体内部异常与智能体之间异常两大类。随后提出名为"智能体系统运维(AgentOps)"的创新性综合运维框架。本文详细阐释了该框架的四个关键阶段:监控、异常检测、根本原因分析及问题解决,并给出了具体定义。关键词:人工智能;软件与应用安全;智能体系统,运营 目录1 引言 2 智能体系统的分类 2.1 智能体系统的定义 2.2 智能体分类3 智能体系统中的异常现象 3.1 智能体系统中异常的定义 3.2 智能体内部异常 3.3 智能体间异常 4 智能体系统运维 4.1 运维演变 4.2 传统系统运维与智能体系统运维的区别 4.3 结论 5 监控智能体系统 5.1 监测数据示意图 5.2 当前监测方法 5.3 挑战 6 异常检测 6.1 推理异常 6.2 规划异常 6.3 动作异常 6.4 内存异常 6.5 环境异常 6.6 任务规范异常 6.7 安全异常 6.8 通信异常 6.9 信任异常 6.10 涌现行为异常 6.11 终止异常 7 根本原因分析 7.1 代理失败根本原因分类体系 7.2 从异常检测到根本原因分析的映射 8 解决方案 8.1 解决方案验证 8.2 解析模式:迭代修复与多轮验证 8.3 代理系统的异常解决 9 AgentOps的挑战与未来方向 9.1 监测 9.2 异常检测 9.3 根本原因分析 9.4 解决方案 10 结论注:小编能力有限,如有翻译不恰之处,请多多指正~若想进一步拜读完整版,请下载原论文进行细读。 6 异常检测6.1 推理异常推理异常的检测与缓解方法可根据所用输入信息的类型分为白盒、灰盒和黑盒三类。白盒方法利用令牌序列、每个令牌的相关概率以及模型参数。相比之下,灰盒方法不使用模型参数。最后,黑盒技术仅依赖于令牌序列。6.1.1 白盒模型SPALMA[9]提出大型语言模型具备独立评估先前状态准确性的能力。然而即便拥有此能力,大型语言模型仍可能产生幻觉。这是因为大型语言模型本质上是令牌预测器,其在每个步骤中致力于预测概率相对较高的令牌,但未必能确保整个令牌序列具有最高概率。此外,LLM采用概率采样而非直接输出最高概率的词元。因此SPALMA认为,LLM的内部参数在某种程度上能反映幻觉现象。为解决此问题,他们提出基于LLM参数的分类器。该分类器通过涵盖多元主题的大型数据集训练,能够以零样本方式检测幻觉。OPERA[49]提出在推理阶段解决幻觉问题,无需像SPALMA等方法那样引入额外数据或训练模型。其动机源于在自注意力图中观察到的"局部过度信任"现象:特定摘要令牌周围的注意力分数呈现出列状结构,即聚合模式。该模式在长上下文中更易出现,从而增加幻觉概率。为解决此问题,OPERA引入列向量度量识别聚合模式,并设计惩罚机制调整令牌生成概率以降低幻觉概率。此外,该方法提出回溯策略:当根据评分检测到幻觉时,系统将回溯至摘要令牌重新生成序列。诚实模型[108]提出,当问题超出大型语言模型的知识边界时会产生幻觉。该模型着重强调模型的诚实性,认为诚实的模型应坦率回答其掌握的问题,并在缺乏必要知识时谦逊承认。最初定义了进化指标来评估模型是否对超出能力范围的问题作出回应。此外引入"IDK(我不知道)"响应机制,要求模型在遇到知识边界外的问题时必须给出IDK回复。最后探讨了提示工程和监督式微调等技术手段以解决此类异常现象。6.1.2 灰盒方法LURE[123]认为,通过在大规模高质量数据上进行大量训练来减少幻觉现象并不可行。因此,该研究提出轻量级解决方案。通过实验与理论分析,其识别出导致幻觉的三大因素:共现关系、不确定性及物体 位置。基于这些因素,LURE利用大型语言模型同时构建幻觉样本与正常样本。据此数据训练的校验器负责在推理阶段检测幻觉并直接修改响应内容。Conformal[79]从保形预测中汲取灵感,提出尽管语言模型的采样空间有限,仍可通过采样与修剪方法获得更优质的响应。具体而言,该方法通过计算令牌序列的logit值来评估采样响应的质量。若响应满足特定停止规则则予以保留,否则予以舍弃。6.1.3 黑箱Debate[26]指出,以往缓解幻觉的方法(如自我一致性)通常仅针对单个模型实例。然而,受《心灵社会》启发,Debate 提出不同大型语言模型或智能体可对同一输入提供多元视角。为此,每个实例需被提示阅读并评估其他所有实例的响应,从而更新自身答案。通过迭代优化,该方法旨在获得更精确的解决方案。CoK[62]是一种创新的推理框架,它使大型语言模型能够在回答过程中主动查询多个异构知识源(如维基 百科和数据库),以获取准确的事实信息。这些信息将逐步整合到生成的推理链中,从而降低产生"幻觉"的风险。在知识体系框架内,先前生成的推理链将被复审并修正,进而优化后续推理。这种迭代过程能逐步提升整体响应的实事准确性与逻辑连贯性。6.2 规划异常规划异常可根据其发生位置分为单步异常和多步异常。6.2.1 单步生成Introspective[63]研究指出,大型语言模型生成的计划方案常存在不切实际或违背常识的问题。为解决此问题,本文提出两种技术方案:首先采用RAG技术召回相似计划方案,辅助生成合理的后续步骤;其次运用符合性预测技术,基于词元概率生成多个高质量答案,并通过人类反馈进一步优化选择。API-bank[59]提出,通过微调大型语言模型(LLMs)可增强其规划能力,从而减少幻觉现象。为此,API-bank 广泛收集了涉及真实 API 调用的对话,构建了训练数据集用于模型训练。该训练显著提升了模型的规划能力。在评估阶段,研究重点分析了被识别为规划幻觉的主要错误,并勾勒出潜在的未来研究方向。6.2.2 多步骤任务Toollm[78]指出,尽管先前方法已减少规划幻觉现象,但仍存在若干局限。主要问题在于API库等方法受限于上下文,仅关注单次API调用。然而现实环境中,完成任务往往需要调用多个API并进行多次交互。为解决此问题,Toollm 收集大量API数据,同时生成单工具与多工具指令。此外,该研究提出基于深度优先搜索的决策树模型,用于构建连贯的规划路径。通过这些数据,大型语言模型(LLMs)经过微调后显著提升了工具调用能力。反思机制[88]提出,智能体在多次迭代后可能产生幻觉。为解决此问题,该机制基于外部反馈构建解决方案,使智能体能够回顾先前执行步骤并优化后续轨迹。该反馈可分为三类:简单的二进制环境反馈、针对常见失败情况的预定义启发式策略,以及自我评估(如使用LLM进行二元分类决策或编写单元测试进行编程)。相较于强化学习训练等方法,这种反思机制更为轻量且高效。6.3 动作异常由于操作通常通过函数调用和MCP执行,操作异常可分为函数调用异常和MCP异常。6.3.1 函数调用在早期阶段,动作执行是通过函数调用实现的。当发生错误时,系统会立即返回错误信息,使得异常检测和缓解相对简单。因此,本节将不对此主题进行深入讨论。6.3.2 MCP.AI-Infra-Guard [91] 运用智能体技术检测 MCP 内部潜在风险,包括工具中毒攻击和跑路等常见威胁。异常检测仅是AI-Infra-Guard 在 MCP 中的部分功能,该系统还能对 AI 组件执行安全扫描。MCP Guardian的核心机制是在基于MCP的AI系统中添加一个"安全优先"的中间件层。该层增强了客户端(MCP 客户端)与数据源/工具服务器(MCP 服务器)之间的通信能力,主要包含四个核心组件:身份验证、速率限制、调用信息详细日志记录以及数据包内容深度检测。6.4 内存异常由于代理的记忆分为短期记忆和长期记忆,记忆异常可分为短期记忆异常和长期记忆异常。6.4.1 短期记忆先前的方法(如旋转位置嵌入 RoPE)在短上下文窗口上训练,却在更长的窗口上进行推理,导致外推能力薄弱。为解决此问题,PI[16]引入了位置插值机制。该方法利用位置编码可为非整数值的特性,通过缩放整个窗口(例如将 4096缩减至 2048)使其适应模型上下文窗口长度的限制。CoA[118]指出,先前用于扩展上下文窗口长度的方法(如微调)容易导致"中间信息丢失"问题。为解决此问题,CoA 提出多智能体协作方案:第一阶段中,不同智能体分别处理输入的不同片段并传递结果给后续智能体;第二阶段由管理智能体整合这些输入以生成最终答案。6.4.2 长期记忆ReDeep[89]提出,在 RAG 过程中,外部知识与模型内部参数之间的冲突极易引发幻觉异常。为解决此问题,ReDeep通过计算并处理两项评分来评估幻觉:外部上下文评分与参数化知识评分。通过调节残差流中知识前馈网络(FFNs)与复 制头(Copying Heads)的贡献,该方法有效抑制了幻觉现象。LRP4RAG [44] 采用经典算法——分层相关性传播(LRP),通过在生成器输出逻辑值后执行反向传播 LRP 来获取相关性矩阵。该相关性矩阵随后被输入预训练分类器以检测幻觉。总体而言,RAG 中的幻觉检测与标准幻觉检测具有显著相似性。6.5 环境异常环境异常通常体现在环境相关指标的不规则性或日志异常中。因此,传统的基于微服务的监控和异常检测,诸如时间序列异常检测等方法能够有效解决这些问题。因此,本文不再对此进行进一步阐述。6.6 任务规范异常如前所述,任务规格不明确极易导致任务失败,但此类异常往往被忽视。传统系统鲜少涉及人类参与,其运行通常聚焦于执行阶段,却未在执行前阶段处理人类配置问题。而在 AgentOps 中,人类作为智能体系统的重要组成部分,其所引发的异常现象已无法被忽视。然而,目前针对该问题的研究尚显不足。尽管部分研究将其视为一种重要的异常类型[11],但鲜有有效解决方案被提出。一种可行方法是采用类似幻觉检测的技术,通过评估大型语言模型对不同提示的潜在状态响应来实现。其原理在于:清晰的提示会降低后续阶段的随机性,而模糊的提示则可能导致更广泛的潜在路径。6.7 安全异常安全异常可能严重危及系统安全性,因此催生了多种检测恶意攻击的方法,其中主要采用基于图论的方法。6.7.1 图论方法多智能体投票法是处理外部攻击引发的智能体安全异常的常用手段。然而GUARDIAN[121]指出该方法忽视了智能体间的依赖关系。因此其将智能体系统建模为图结构,并采用编码器-解码器框架对整个图进行压缩与重建。通过重建评分识别潜在异常位置。SentinelAgent [41] 指出,多智能体系统中可能出现多种安全异常,其中多智能体协调风险尤为常见。为应对这一问题,该方案提出三层检测方法:首先从全局视角出发,随后逐步深入进行更细致的检查。6.8 通信异常通信异常的主要成因在于代理系统的持续扩张,导致传输消息量不断攀升。然而其中大量消息实属冗余,过度的冗余信息反而可能引发任务失败。6.8.1 冗余性AgentPrune[112]指出,对话内与对话间的交互均可能导致通信冗余,代理会消耗大量标记并进行低效的交流。为解决此问题,AgentPrune 提出将整个智能体系统构造为图结构,并训练基于低秩原理的图掩码。该掩码用于提取并聚焦图中关键部分的通信。AgentPrune既缓解了通信冗余,又提升了通信效率。G-Designer [113]采用更宏观的视角,主张最优通信拓扑结构会因任务而异。因此,它会生成针对特定任务定制的不同拓扑结构。具体而言,它运用图自编码器对整个智能体系统进行压缩,并重建最优拓扑结构。6.9 信任异常信任异常通常涉及评估代理消息的可靠性。一种直接的方法是采用推理异常讨论中的方法来处理此问题。然而,从系统层面的视角审视该问题也能带来新的见解。ATrust[38]强调,随着A2A通信日益普及,评估来自不同源代理的消息可信度变得日益重要。若未能做到这一点,将严重危及任务安全性。然而,该领域仍存在诸多挑战。基于提示工程的方法易产生幻觉,而依赖外部工具的方法则受限于工具质量。ATrust通过六维度注意力图评估可信度:事实准确性、逻辑一致性、相关性、偏见、语言质量及清晰度。6.10 涌现行为异常涌现行为异常源于多个智能体间的复杂交互,导致无法归因于任何单一智能体的系统级行为。此类异常具有高度隐蔽性,因为它们可能并未违反任何单个智能体的约束条件,却仍会引发系统层面的不良后果。目前业内尚无有效方法能检测此类异常。6.11 终止异常此类异常可能表现为无限循环或过早终止。无限循环通常可通过日志和跟踪记录轻松检测,而过早终止则通常通过监控任务成功率等指标来识别。目前,业内尚无其他前沿且有效的相关研究成果。7 根本原因分析随着自主智能体成为关键业务运营的核心组成部分,对其故障进行快速精准的根本原因分析(RCA)已成为保障系统可靠性的核心挑战。与传统软件不同,智能体故障的根本原因分散于基础设施、模型行为和编排逻辑之中,常形成复杂的因果链--某一维度的故障往往会触发其他维度的故障。本节旨在为智能体运维(AgentOps)建立系统化的RCA框架,该框架将明确定义问题空间、建立诊断映射,并提出可执行的应对策略。7.1 代理失败根本原因分类体系要有效诊断故障,本文首先需要一套能够准确归因故障源的分类体系。本文提出的分类法并非单纯的学术练习,而是经过精心设计以确保其可操作性,并引导业界聚焦于最具创新性的挑战。其设计基于两大核心动机:首先,该框架直接契合构建和维护代理系统所涉及的独特技术栈与团队职责。这确保了根本原因分析(RCA)流程的结果并非抽象结论,而是针对相应团队的明确指令——无论是系统问题对应的运维/站点可靠性工程(SRE)团队,模型相关问题对应的机器学习工程团队,还是编排逻辑对应的代理开发团队。这种与实际责任的紧密结合,使该框架具备极高的可操作性。其次,该分类法在战略上将"旧"问题与"新"问题区分开来。它将系统可靠性这一已充分理解的领域,与"软逻辑"协调这一新兴且至关重要的挑战区分开来。通过这种方式,本文得以利用数十年的现有工程实践。7.2 从异常检测到根本原因分析的映射在实践中,根本原因分析(RCA)流程由异常检测(AD)系统的警报触发。异常检测系统回答"发生了什么问题",而根本原因分析则必须探究"为何发生"。为确保本文叙述的连贯性,必须在 AD 部分识别的异常类型与 RCA 框架的根本原因类别之间建立清晰的映射关系。异常检测框架将异常分为两个层级:单体内部异常(涉及单个智能体的内部认知过程)与跨体异常(涉及智能体与其环境之间的广泛交互)。本文的根因分析框架能够系统性地追溯这些观测到的异常,将其溯源至系统中心维度、模型中心维度或协调中心维度。表 7 展示了这种映射关系,揭示了智能体故障的多维特性。该映射揭示了一个关键洞见:单一的高级异常类型很少仅由单一根本原因引发。例如,AD 系统检测到的推理异常可能源于系统层问题(RAG 提供的错误数据)、模型层问题(核心幻觉)或协调层问题(缺陷提示)。因此,根本原因分析(RCA)流程的作用在于运用下文所述方法论,厘清这些潜在成因并精准定位故障的真正根源。这种结构化方法能避免团队过早将责任归咎于模型——实际问题可能源于数据或提示工程环节。8 解决方案8.1 解决方案验证代理系统运行中最关键的组件之一,是对实施的解决方案进行系统性验证,以确保其在有效纠正检测到的异常的同时,未引入不良副作用。主要评估指标是任务成功率,若解决方案实施后代理的任务成功率持续高于实施前,则该解决方案被视为有效。目前评估该指标主要有两种方法:人工标注:由人类专家依据详细评分标准评估智能体表现。该方法被视为准确性的黄金标准,能对任务成功与突发行为的微妙之处作出细致判断。然而其资源消耗大,难以有效扩展以实现持续的实时监控。LLM-as-a-Judge [120]:作为可扩展的替代方案,该方法采用独立的强大大型语言模型(LLM)来评估智能体的表现。该"评判者"LLM 依据预定义的成功标准和评分细则,对智能体的日志和输出进行评估,从而实现任务成功率的快速、大规模自动化评估。8.2 解析模式:迭代修复与多轮验证与传统 IT 系统中异常处理通常遵循线性离散的"检测-诊断-修复"工作流不同,处理智能体系统中的异常需要向持续迭代管理转变。在现代智能体系统中,"局部影响"的假设--即修复措施可控且效果可预测--已根本失效。这种失效源于两大核心特性:首先,当智能体由大型语言模型驱动时,其行为本质上具有概率性和非确定性;相同输入在多次试验中未必产生相同输出。其次,系统作为复杂适应性系统运行,其整体行为是无数非确定性智能体局部交互的涌现属性。因此,修复单个智能体的异常并非简单修复,而是对系统平衡的扰动--这种干预将改变所有交互智能体的运行环境。该挑战的核心在于其引发次级效应和级联行为转变的高度可能性。假设某个智能体被诊断出规划异常,导致其运行效率低于最优水平。运维团队可能通过修改其规划启发式或效用函数进行干预。虽然干预的预期直接效果可能得以实现--例如:随着智能体效率的提升,由此引发的行为改变必然改变智能体间的动态关系,可能导致不可预见的系统性故障。例如,新获得高效能的智能体可能垄断关键共享资源,导致其他智能体资源匮乏,进而引发通信异常与突发性异常--表现为系统瘫痪或资源冲突升级。本质上,解决智能体内部异常时,无意中催生了更复杂的智能体间异常,这种现象难以事先预测。鉴于这些挑战,异常解决必须是一个循环往复且基于经验的过程。任何修复方案都应视为需要广泛验证的临时假设。干预后系统不会立即修复,需要经过多轮观察周期来监测全局性能与交互模式。这将使新动态得以显现,潜在副作用浮出水面。因此,异常解决成为系统性调优的迭代过程:实施干预→多轮观察系统响应→分析涌现行为→优化修复方案→直至达成稳定的预期状态。8.3 代理系统的异常解决为解决复杂智能体系统中的异常现象,本文提出一个清晰可行的框架,将潜在解决方案划分为两大类:系统设计驱动型解决方案与提示优化驱动型解决方案。系统设计驱动型解决方案是基础性的架构模式,通过在系统层面嵌入稳健框架、安全机制和反馈回路,确保安全可靠的运行。这类方案通常由系统架构师和工程师负责。相较之下,提示优化驱动型解决方案聚焦于智能体与其底层语言模型的直接交互,涉及认知流程与交互指令的迭代优化--这属于人工智能与提示工程师的领域。这种分工使团队能更有效地诊断故障根源:究竟源于基础设计缺陷,还是指令逻辑问题。8.3.1 系统设计驱动的解决方案这些方案是系统架构的有机组成部分,需要正式的工程设计。它们专注于构建持久的弹性框架,实施预防性安全措施,并建立响应式反馈循环以实现检测与演进。8.3.2 基于提示优化的决策方案这些策略侧重于与智能体底层语言模型的直接交互。它们通常在智能体的推理循环中实现,涉及动态生成、优化和评估用于引导智能体思维过程与行动的提示。9 AgentOps的挑战与未来方向9.1 监测在当前的代理系统中,监控面临两大主要挑战。首先,传统监控工具的能力有限--它们主要捕获指标、日志和跟踪数据。如第5节所述,模型数据和检查点数据在代理系统中至关重要,但它们往往超出常规可观测性方法的范围。其次,海量观测数据(尤其是模型相关数据)若管理不当,将带来巨大的内存开销。因此,未来关键发展方向在于构建能够大规模有效观测多样化数据类型,同时确保高效存储与资源利用的监控解决方案。9.2 异常检测如第3节所述,当前智能体系统中的异常现象具有多样性特征,这带来了重大挑战:缺乏能够同时识别多种异常类型的统一检测算法。为每种异常类型部署独立的异常检测模型将给在线服务带来巨大开销。因此,关键的未来方向在于探索更轻量高效的算法设计,以统一方式检测更广泛的异常类型--本质上是为代理系统开发全面且可扩展的异常检测框架。9.3 根本原因分析如第7节所述,结构化RCA框架虽提供了清晰的诊断路径,但在实践中面临重大挑战:因果归因的模糊性。单个观测到的异常可能源于系统、模型和编排层多重交织的根本原因,导致难以孤立故障的真实根源。若对每个潜在原因分别进行深入分析,将引入显著的诊断延迟和计算开销。因此,关键的发展方向在于构建更自动化高效的因果推断技术,以统一方式解析复杂故障场景--本质上是为智能体系统打造可扩展的智能根本原因分析引擎。9.4 解决方案在AgentOps的解决阶段,主要挑战在于由大型语言模型驱动的智能体系统固有的复杂性和不可预测性。与传统IT系统相比,智能体系统的解决方案无法依赖确定性、孤立的修复措施,因为智能体行为具有概率性特征,且存在复杂的自适应交互。解决单个智能体的局部异常往往会引发不可预见的次级效应、级联行为转变及系统性不稳定,需要通过迭代修复和多轮验证来应对。有效的解决机制需要持续监控与优化,综合运用系统级设计(如冗余机制、防护栏、回滚策略和自适应政策)与模型级干预(包括提示优化和自我修正)。这种迭代方法能确保异常真正解决且不产生意外副作用,但持续的观察、验证和系统调优需求显著增加了解决过程的复杂性。 10 结论大型语言模型推理能力的持续提升显著加速了智能体系统的发展进程。然而,智能体系统频繁遭遇异常状况,当前尚缺乏有效的运维解决方案。本文提出智能体系统异常的新定义及全面分类体系,将其划分为智能体内部异常与智能体间异常。此外,本文专门针对智能体系统设计了新型运维框架AgentOps,该框架涵盖四大核心组件:监控、异常检测、根本原因分析及问题解决。各组件均经过深入分析与系统归类。本研究整体上深化了对智能体系统的认知与管理,为其更稳健可靠的部署奠定了基础。编辑:肖鑫鑫校核:李正平、陈凯歌、曹希铭、赵学功、白亮、任超、海洋、陈宇航、Kira、Tina、王金、赵诚、赵栓栓、张优该文资料搜集自网络,仅用作学术分享,不做商业用途,若侵权,后台联系小编进行删除来源:故障诊断与python学习

未登录
还没有评论
课程
培训
服务
行家
VIP会员 学习计划 福利任务
下载APP
联系我们
帮助与反馈