首页/文章/ 详情

面向安全关键工程系统的可信智能体 AI 框架:可审计的无故障标签机械故障诊断(上)

1小时前浏览0

    当大语言模型参与机械故障诊断,如何让诊断结论有据可查?本期推荐论文提出了一种由感知、诊断与验证三个智能体协作的可信诊断框架。系统仅利用正常工况数据和轴承几何参数,通过调用物理分析工具,在无需故障类别标签的条件下开展诊断,并记录谐波、频率偏差与边带等关键证据。论文将可审计推理、诊断纠错与组件失效后的规则回退纳入统一流程,为智能体走向可靠的工业应用提供了值得关注的思路。由于论文篇幅较长,分为上下两篇介绍。

    论文基本信息

    论文题目:

    A trustworthy agentic AI framework for auditable label-free machinery fault diagnosis in safety-critical engineering systems

    论文日期:2026(online)

    发表期刊:

    Advanced Engineering Informatics 77 (2027), 105205

    论文链接:

    https://doi.org/10.1016/j.aei.2026.105205

    作者:

    Yuntong Chen,Binhao Liu,Yingqi Li,Ziang Wang,Liping Ma,Jianyu Liu,Xitian Tian,Lijiang Huang(∗)

    作者单位:

    School of Mechanical Engineering, Northwestern Polytechnical University, Xi’an, Shaanxi 710072, China.

    目录

    摘要

    符号与缩略语

    1 引言

    2 相关工作

    2.1 轴承故障诊断的深度学习方法

    2.2 基于大语言模型的轴承故障诊断

    2.3 工程信息学中的多智能体大语言模型系统

    2.4 研究空白总结

    3 方法

    3.1 问题定义与框架概述

    3.1.1 问题定义

    3.1.2 框架架构

    3.2 基于自编码器的正常基线学习

    3.3 感知智能体:大语言模型自适应异常评估

    3.3.1 动机

    3.3.2 多指标融合

    3.3.3 两级决策架构

    3.4 诊断智能体:基于物理的工具链推理

    3.4.1 设计理念

    3.4.2 三层工具架构

    3.4.3 推理过程

    3.4.4 跨域泛化

    3.5 验证智能体:证据一致性与反思纠正

    3.5.1 动机

    3.5.2 三步证据一致性协议

    3.5.3 反思纠正循环

    3.6 多智能体编排流程

    3.6.1 流程执行

    3.6.2 设计属性

    3.6.3 计算成本

    3.7 框架的可信性属性

    4 实验与结果

    4.1 实验设置

    4.2 域内评估

    4.3 消融研究

    4.4 感知智能体评估

    4.5 向未见目标数据集的无故障标签迁移

    4.6 诊断推理分析

    4.6.1 系统性审计记录评估

    4.6.2 案例一:标准正确诊断

    4.6.3 案例二:边带消歧

    4.6.4 包络谱证据可视化

    4.6.5 错误分析

    4.6.6 频率匹配容差分析

    4.6.7 轴承参数扰动分析

    4.7 与基于大语言模型的诊断方法比较

    5 结论

    摘要

    在安全关键机械的状态监测中部署智能体 AI,不仅要求诊断能力,还要求可审计的推理、组件失效时的平稳降级,以及可验证的安全属性。传统数据驱动诊断模型难以充分满足这些要求,尤其是在新投用设备缺乏带故障标签训练数据的情况下。本文提出一种可信的多智能体大语言模型(LLM)框架,通过以物理为依据的工具编排,实现无故障标签的机械故障诊断:仅需要正常工况运行数据与轴承几何参数,在任何阶段都不使用故障类别标签。

    三个协作智能体——感知、诊断与验证智能体——分别执行异常评估、迭代频谱推理及证据一致性约束,为每次诊断生成完整的谐波、频率偏差与边带证据溯源记录,以支持人机协同诊断。框架通过四种机制在架构层面实现可信性:(i)严格分离 LLM 与原始振动信号处理,将所有数值运算交给经过验证的计算工具;(ii)为每次诊断生成包含匹配谐波、频率偏差和边带证据的完整记录,实现可审计的推理溯源;(iii)通过防回退安全约束,阻止反思纠正将已识别故障回退为正常;(iv)在 LLM 组件失效时启用规则回退,确保系统平稳降级。

    在凯斯西储大学(CWRU)数据集上,框架使用三个 LLM 后端取得 92.4%–95.1% 的准确率,与完全监督微调基线的差距在 1.7 个百分点以内。在向三个未见目标域 Paderborn、JNU 和 MFPT 进行无故障标签迁移时,框架取得平均 95.6% 的故障检测率;五个监督基线——包括可使用无标签目标域数据的域适应方法——则坍缩为恒定类别预测。消融表明,仅物理工具链即可达到 82.8% 准确率,LLM 编排额外贡献 12.2 个百分点,提升主要集中在物理证据存在歧义的样本上。

    关键词:可信智能体 AI;多智能体 LLM;可审计推理;基于物理的工具编排;无故障标签机械故障诊断;安全关键状态监测。

    符号与缩略语


    1. 引言

    滚动轴承是旋转机械中最容易发生故障的部件之一。在航空发动机、风力机、核电设备及智能制造产线等安全关键基础设施中,轴承故障占旋转设备故障事件的 40%–50% [1–3]。AI 驱动诊断系统在这些基础设施中的部署迅速增加,但也出现了一个关键的不匹配:智能体 AI 和大语言模型近期的能力跃升带来了新的失效模式,包括幻觉推理、不透明的决策路径,以及分布偏移下的无声性能退化,而传统故障诊断框架从未针对这些问题进行设计 [4,5]。

    因此,对于部署在安全关键机械中的诊断系统,要求已从单纯的准确率扩展为三个相互关联的可信性目标:在控制误报率的同时,在失效发生前识别早期缺陷;在不同设备类型和工况间保持稳定诊断能力,并在 AI 组件失效时平稳降级;向工程师提供可审计的推理溯源,以支持人机协同决策 [6]。同时实现这三个目标,已成为安全关键工程系统部署智能体 AI 的核心挑战。

    过去十年,应对这些目标的主流方法是数据驱动深度学习 [7–9]。卷积神经网络(CNN)、残差网络(ResNet)、长短期记忆网络(LSTM)及注意力机制等架构被广泛用于从振动信号中提取特征和分类故障,并在标准基准上取得极高准确率 [10–12]。迁移学习与域适应也被用于减轻工况变化引起的域偏移,提高跨工况泛化 [13,14]。

    然而,这些数据驱动方法存在三个根本局限。第一,它们高度依赖大量带标签故障样本,而工业现场恰恰最缺乏故障样本:对于新投用设备、小批量定制机械,以及航空发动机、风力机、核电站等高可靠性系统,最需要故障样本时往往无法获得;等真实故障发生并完成标注,预测性维护的价值已经丧失 [4,15]。第二,当模型迁移到训练集未覆盖的新设备或工况时,诊断性能急剧下降。第三,深度学习模型本质上是黑箱,缺乏可解释的推理过程,难以向工程师提供故障机理层面的诊断证据 [5]。本文后续跨数据集实验进一步发现,即使采用无标签目标域数据进行对抗训练的域适应方法,在面对几何参数、采样系统及运行转速都不同于源域的未见设备时,也会完全坍缩为单一类别恒定预测。

    LLM 从大规模语料中获得的领域知识、多步推理能力与工具调用能力,为突破这些局限带来新可能。原则上,LLM 可以像人类工程师一样从物理原理出发进行诊断推理,而不只是模式匹配。一些研究沿特征文本化与微调 [16]、多模态频谱融合 [17]、端到端信号表示 [18] 三条路线将 LLM 引入轴承诊断。但这些方法具有共同假设:LLM 在训练或微调时必须接触故障标签,其角色仍主要局限于“模式分类器”,即输入特征、输出类别。这没有充分发挥 LLM 在多步推理、工具编排和证据整合方面最独特的能力,也未真正解决上述三个目标。因此,对训练集未覆盖的设备或故障类型,现有 LLM 方法仍面临与深度学习相同的泛化瓶颈。

    除了准确率,在安全关键基础设施部署智能体 AI,还要求将可信性作为架构要求:LLM 可能产生物理上不正确的幻觉推理、不透明决策,或在分布偏移下无声退化。这些失效模式既未纳入传统诊断框架的设计,也不能靠事后可解释性技术加以防止。

    与此同时,在化学合成、力学求解、气动优化与结构健康监测等工程科学领域,多智能体 LLM 系统已展示出通过编排物理工具链解决复杂任务的潜力 [19–21]。这些工作表明,LLM 的工程价值不仅在模式识别,更在于充当驱动物理工具链的智能推理引擎:LLM 决定“使用哪个工具、如何解释工具输出”,数值计算则交由确定性工具完成。

    不过,旋转机械故障诊断与上述任务存在两方面结构性差异。第一,振动信号是高频时间序列,处于 LLM 训练分布之外,不能直接由 LLM 处理,因此必须在架构上严格分离 LLM 推理与信号处理。第二,漏检真实故障的代价远高于对误报正常状态进行复检的代价,这种非对称代价要求在异常感知和反思纠正阶段进行专门设计。直接移植已有多智能体范式无法满足这些约束。

    综合深度学习与现有 LLM 方法对故障标签的根本依赖、LLM 在相邻工程领域作为推理编排器的成功实践,以及振动诊断的特殊结构约束,本文提出如下问题:能否构建一个任何阶段均不需要故障标签、仅使用正常工况运行数据学习基线、也不依赖故障分类器训练的轴承故障诊断框架,让 LLM 通过物理公式与信号分析工具逐步推理,而非执行数据驱动模式匹配?相较于收集所有失效模式的故障样本,正常数据的采集负担显著更低。

    为回答这一问题,我们提出以物理为依据的多智能体诊断推理框架,其核心原则是严格分离 LLM 推理与信号处理。LLM 从不直接访问原始振动信号,而是调用特征频率计算、包络解调、峰值检测、谐波匹配等物理分析工具,依照轴承故障机理逐步推理,最终生成附带完整证据链的诊断结论。系统包含三个协作智能体:感知智能体融合自编码器异常检测与时频域统计指标,自适应评估信号异常;诊断智能体在 ReAct 范式下驱动物理工具链定位故障;验证智能体进行证据一致性检查、基于边带的消歧及反思纠正,确保诊断结论可靠。

    本文主要贡献如下。

    1. 针对安全关键旋转设备在新投用或低故障率阶段难以获得故障标签的可靠性监测瓶颈,提出物理工具链驱动的无标签 LLM 诊断推理范式。诊断知识编码于轴承动力学方程和谐波匹配规则,而非学习得到的权重中;LLM 从模式分类器转变为驱动确定性物理工具的推理编排器。框架在任何阶段均不需要带标签故障样本;部署至新轴承类型只需更新几何参数与轴转速,从而避免跨设备迁移中源域分布不再成立时,数据驱动方法的诊断知识无法访问的风险。
    2. 针对漏检与误报风险不对等的高度非对称安全代价,设计感知、诊断与验证三智能体协作架构,在架构层面严格分离 LLM 推理与振动信号处理。感知智能体融合自编码器重构偏差、频带 z 分数及时域冲击性指标,构建跨域自适应多指标判据,无需重新校准阈值即可在目标设备上保持稳定故障检测能力,明确应对非对称安全代价。
    3. 针对单次 LLM 推理容易受到确认偏差影响、难以满足安全关键诊断可审计要求的问题,构建多层证据一致性验证协议。协议依据轴承故障调制机理,引入边带消歧,系统性解决包络谱中 BPFO/BPFI 谐波重叠导致的内外圈误分类;同时加入具有防回退约束的反思纠正循环,允许修订诊断结论,但防止将已识别故障错误回退为正常。每次诊断都生成包含匹配谐波、频率偏差及边带证据的完整可追踪推理链,为安全关键系统中的人机协同诊断决策提供可审计依据。

    2. 相关工作

    本节回顾直接支持本研究的三类工作:轴承故障诊断的深度学习方法、基于 LLM 的轴承诊断方法,以及工程领域多智能体 LLM 系统。在此基础上,第 2.4 节总结推动本文方法设计的研究空白。

    2.1. 轴承故障诊断的深度学习方法

    近年来,深度学习已成为智能轴承故障诊断的主流。卷积神经网络 [10]、面向小样本的 CNN-BiLSTM 混合架构 [11]、提高泛化的贝叶斯变分 Transformer [12]、声振物理信息融合网络 [1],以及面向少样本的自适应频率注意力 Transformer [5],共同确立了“特征提取器 + 分类头”的端到端范式,在 CWRU 等标准基准上达到近乎完美的准确率 [22]。近期进展还包括具有内置可解释性约束的可信轻量级小波 Transformer [23]、面向标签稀缺诊断的半监督原型对比学习 [24],以及用于跨域泛化的多尺度图迁移学习 [25]。

    但部署至训练集未覆盖的设备或工况时,模型性能显著退化,即众所周知的跨域问题。现有应对方法有两条路线,均仍依赖故障标签。第一条路线在保留源域故障标签的前提下减轻域偏移,代表策略包括迁移学习与域适应 [7,14]、物理信息先验与多尺度信号表示 [26,27]、从物理知识出发的生成式零样本学习 [28]、基于 CycleGAN 的单域泛化 [29],以及分布式机械设备间的通信高效联邦学习 [30]。这些方法虽然不同程度缓解域偏移,但都要求源域带标签故障数据。

    第二条路线尝试完全去除对目标域故障数据的依赖。例如,Hou 等 [13] 在没有真实故障数据时,使用动力学仿真模型生成虚拟故障样本训练分类器。但这仅用仿真样本替换真实样本,对每种新轴承仍需建立模型并训练分类器,同时面临仿真到现实的域差异 [4,15]。

    更根本地说,无论采用哪条路线,深度学习仍是数据驱动模式匹配,其诊断知识完全编码于训练样本。即使借助注意力图和 SHAP 等事后可解释性技术,也只能揭示模型关注哪些输入特征,不能说明这些特征为何在物理上对应某类故障 [5,6]。故障标签依赖与物理可解释性缺失这两重局限,推动研究者转向同时具有先验知识与推理能力的 LLM。

    2.2. 基于 LLM 的轴承故障诊断

    现有工作可分为四条技术路线。

    第一条是特征文本化与微调。Tao 等 [16] 将振动信号的时域和频域统计特征转换为结构化文本描述,利用 LoRA、QLoRA 等参数高效微调技术适配 LLM,展示了一定的跨工况和跨数据集泛化。

    第二条是多模态融合。Wang 等 [17] 提出 DiagLLM,将包络谱图与专家知识共同输入多模态 LLM,通过视觉指令调优实现可解释故障识别。

    第三条是端到端信号表示。Peng 等 [18] 提出 BearLLM,将原始振动信号直接编码为 LLM 可理解的 token 序列,构建通用轴承健康管理基础模型。

    第四条可视为前三者的混合变体。Bao 等 [31] 将包络谱与理论特征频率以结构化文本输入 LLM,同时利用通道注意力 CNN 提供初始分类,再由微调后的 LLM 输出可解释诊断说明。

    尽管路线不同,这四类工作均假设 LLM 在训练或微调阶段必须接触故障标签,其作用局限于分类器或事后解释者。这意味着它们不能在完全没有故障样本的条件下运行,在训练集以外设备或故障类型上面临与深度学习相同的泛化瓶颈。更重要的是,这些方法未充分发挥 LLM 最独特的能力:以知识为依据的多步推理、工具编排及证据整合。释放这些能力,需要从“LLM 作为分类器”转向“LLM 作为推理编排器”,这也正是近年来更广泛工程界出现的方向。

    2.3. 工程信息学中的多智能体 LLM 系统

    将 LLM 作为推理编排器、协调多个工具和子智能体完成复杂任务的范式,由 Yao 等 [32] 的 ReAct 框架奠定,并迅速进入科学发现与工程科学。近期综述 [33,34] 系统梳理了多智能体 LLM 在灾害韧性基础设施和智能制造中的发展。本节从与框架设计直接相关的三个维度回顾代表工作。

    LLM 驱动物理工具链的可行性。在化学领域,Boiko 等 [35] 的 Coscientist 通过调用合成规划、代码执行与实验硬件接口,展示了 LLM 自主开展化学研究的能力;Bran 等 [36] 的 ChemCrow 将 18 个专业化学工具整合到 LLM 智能体,实现从反应预测到合成路线规划的端到端任务求解。在力学与气动设计领域,Ni [19] 提出的 MechAgents 通过多智能体合作求解有限元力学问题;Fan 等 [20] 的 AirfoilAgent 通过任务规划、知识整合与反思纠正三个智能体协作,实现翼型气动优化。

    更广泛地,物理融合 AI 已在相邻工程领域得到发展:文献 [37] 将气动物理模型嵌入电动飞机螺旋桨设计的智能预测框架;文献 [38] 采用自监督 Informer 预测电动飞机锂电池荷电状态。虽然这些工作未采用多智能体架构,却与上述智能体研究共享一个认识:通过工具编排或模型架构编码领域物理原理,可以形成比纯数据驱动方法更具泛化性的工程 AI。总体而言,LLM 的核心价值在于通过可审计推理编排领域工具完成复杂任务,而非取代这些工具;这构成了本文将 LLM 定位为诊断推理编排器的理论基础。

    多智能体任务分解与反思纠正。在结构健康监测领域,Sharma 等 [21] 的智能体 AI 框架构建感知、认知、行动和反思闭环,其物理约束结合自适应决策的理念与本文最为接近。但该框架基于部分可观测马尔可夫决策过程(POMDP)和贝叶斯推断,而非 LLM 工具调用,且只在数值仿真中验证。在物理仿真领域,Park 等 [39] 提出自我纠正的多智能体框架,将语言驱动物理仿真与解释耦合成闭环;Bu 等 [40] 构建了自主生物医学数据分析的自进化多智能体 LLM 系统。在制造与安全领域,Wang 等 [41] 提出爆炸荷载安全评估的 LLM 多智能体框架;Yu 等 [42] 提出隧道基础设施缺陷检测与维护建议的双智能体协作框架。相似范式也应用于注塑知识迁移 [43]、智能车间调度 [44]、具身制造系统 [45] 及智能维护知识图谱 [46]。这些工作展示了“感知→分析→决策”任务分解的有效性,并验证反思纠正在提高推理可靠性方面的价值。

    与旋转机械故障诊断的结构性差异。尽管取得进展,旋转机械诊断仍有两个根本差异,使现有范式不能直接移植。

    第一是输入模态不兼容。故障诊断的核心输入是高频采样振动时间序列,通常为 12–100 kHz,这一模态完全不在 LLM 的训练分布中。不同于化学分子式或力学有限元参数,振动信号无法通过有意义的直接文本化输入 LLM,因此需要架构级推理—信号处理分离,而不只是提示工程。

    第二是内在非对称代价。优化设计或知识检索中,错误通常意味着效率损失或人工修正;故障诊断中,漏检造成的设备损坏与停机损失远大于误报带来的复检成本。因此,异常感知阶段必须保持跨域高检测率,宁可误报也避免漏检;反思纠正阶段必须防止已识别故障回退为正常,即安全单调性约束。据我们所知,现有多智能体 LLM 工作尚未在架构层面同时处理这两个约束。

    2.4. 研究空白总结

    综合以上文献,可识别三个未解决空白。

    空白 1:故障标签依赖与可审计推理缺失。深度学习的诊断知识完全编码于训练样本,缺少物理先验和可审计推理 [5,6]。现有 LLM 诊断,无论特征文本化微调 [16]、多模态融合 [17]、端到端信号表示 [18],还是频谱提示联合微调 [31],均需接触故障标签;LLM 仍是分类器而非推理器。两类方法都面临训练集未覆盖设备的泛化瓶颈。

    空白 2:多智能体 LLM 范式尚未应用于旋转机械故障诊断。工具驱动多智能体 LLM 已在化学 [35,36]、力学 [19]、气动设计 [20] 及结构健康监测 [21] 中验证,但旋转机械诊断的高频振动输入与非对称代价要求架构级设计,尚无工作同时满足这两个约束。

    空白 3:缺少针对故障诊断的闭环验证与安全单调性保障。现有系统多采用开放环单次推理或通用反思 [39,40],缺少专门的故障诊断验证协议。包络谱中的 BPFO 高阶谐波与 BPFI 谐波频率重叠会造成系统性内外圈误分类;通用反思还可能将已识别故障回退为正常。两者都需要专门的物理约束机制。

    表 1 从故障标签需求、跨数据集迁移、可解释性、信号处理方式及非对称代价设计五个维度比较代表方法,显示没有任何现有单一方法同时弥补上述三个空白。本文框架遵循三个原则:(i)将诊断知识编码于物理公式,而非学习权重;(ii)在架构上严格分离 LLM 推理与信号计算;(iii)通过具有防回退约束的闭环验证,维持诊断的安全单调性。下一节给出具体方法。

    表 1 代表性轴承故障诊断方法比较

    注:√ 表示明确具备能力;△ 表示部分具备或需重新训练/适配;× 表示不具备。“跨数据集”指无需重新训练即可诊断几何参数、采样率或故障机理不同的轴承;“非对称代价设计”指是否明确考虑漏检比误报代价更高。据作者所知,本文方法是唯一同时满足三个要求的方法:(i)不需要故障标签;(ii)无需任何故障标签即可实现真正跨数据集迁移;(iii)明确处理故障诊断的非对称代价结构。

    3. 方法

    本节先形式化诊断问题并概述架构(3.1),随后介绍自编码器基线学习(3.2)及感知(3.3)、诊断(3.4)、验证(3.5)三个协作智能体,再说明将其整合的编排流程(3.6)。

    3.1. 问题定义与框架概述

    3.1.1. 问题定义

    考虑几何参数为   、以转速   (RPM)运行的滚动轴承。四个参数分别为滚珠直径、节圆直径、滚动体数量及接触角。驱动端加速度计以采样率    采集振动信号   。诊断任务是确定故障类型:

     

    与第 2.4 节表 1 比较一致,现有范式都需要故障标签,而本文仅需正常工况数据。监督深度学习要求所有类别的故障标签;迁移学习虽放宽域约束,仍依赖源域故障标签;LLM 微调方法将振动特征文本化,并通过 LoRA 适配权重,仍需有标签数据。本文将诊断表述为基于物理的无故障标签推理任务,仅需:(i)用于基线学习的正常工况数据集   ;(ii)轴承几何参数   ;(iii)转速   ;(iv)将   、   与故障特征频率关联的物理公式。任何阶段都不涉及故障标注样本、领域专属微调或带标签振动数据。

    3.1.2. 框架架构

    框架包含三个专门的 LLM 智能体,分别封装振动分析实践中的异常感知、故障识别及证据验证功能。这种分解模拟人类诊断专家的工作:状态监测人员先筛查异常,振动分析人员通过频谱识别故障机理,高级工程师再审查证据链并发布报告。

    如图 1,框架分四个功能阶段。阶段 1 准备轴承几何参数与转速,仅使用正常振动数据训练自编码器以建立健康基线(3.2)。阶段 2 由感知智能体通过“快速路径/LLM 研判”两级策略,将自编码器指标(MSE 比值、频带 z 分数)与时域指标(峭度、峰值因子)融合,评估异常(3.3)。阶段 3 激活诊断智能体,在 ReAct [32] 中交替执行思考、行动、观察,迭代驱动涵盖运动学频率计算、包络谱分析及确定性谐波匹配的三层工具链(3.4)。阶段 4 调用验证智能体,通过内外圈边带消歧约束证据一致性,必要时触发带防回退约束的反思纠正,将问题返回诊断智能体(图 1 虚线箭头;3.5)。完整编排见算法 1(3.6)。

    图 1 基于物理的多智能体框架架构。流程包括四阶段:1)输入与仅用正常数据的自编码器基线学习;2)感知智能体通过两级快速路径/LLM 研判进行多指标异常评估;3)诊断智能体在三层物理工具链(运动学计算、信号分析、诊断推理)上执行基于 ReAct 的迭代推理;4)验证智能体通过边带消歧和防回退反思纠正确保证据一致性。

    贯穿框架的关键架构原则是:LLM 从不处理原始振动信号。FFT、包络解调和谱峰提取均由确定性计算工具执行;LLM 负责选择工具、在物理语境下解释数值输出,并将中间结果串联成连贯诊断论证。这种分离发挥了 LLM 的上下文推理与多证据综合能力,又避免让其接触训练分布中不存在的高频时间序列模态。

    除解决模态差距外,这一分离也应对核工业、航空航天等安全关键行业的严格数据隐私约束。由于仅向 LLM 传输文本化统计指标和工具指令,相比通常每秒数十 MB 的原始振动信号,带宽需求可忽略,框架实际上消除了通过外部 API 泄露敏感运行数据的风险。

    LLM 编排工具和解释结果,但不直接处理原始信号。为确保复现性和透明度,三个智能体的完整结构化提示模板,包括任务描述、工具调用格式和约束规则,详见附录 B“LLM 智能体指令模板”。

    3.2. 基于自编码器的正常基线学习

    自编码器是唯一数据驱动组件,仅在正常振动数据上训练。它的目的不是执行二分类异常检测——该角色交给感知智能体——而是定量表征健康轴承行为,以便在多个粒度上衡量偏差。

    自编码器采用四层一维卷积编码器,通道依次为   ,卷积核大小为 7、5、5、3,每层后接 ReLU 和 2 倍最大池化;对称转置卷积解码器恢复原维度。输入为长度    的信号片段的幅值谱,在 12 kHz 采样下约对应 1.37 s,片段重叠 50%。频谱划分为    个互不重叠的 500 Hz 频带,覆盖 0–6000 Hz。采用 Adam,学习率   ,批大小 32,训练 100 个 epoch。跨域部署时,用目标域正常数据、相同超参数重新训练自编码器;其他组件无需修改。

    四层架构兼顾正常振动谱结构表示能力与目标域快速重训的轻量性。由于自编码器只是测量模块,其输出随后由感知智能体的多指标融合机制结合上下文解释(3.3),最终诊断由物理工具链决定,因此整体诊断性能并不关键依赖某种特定自编码器架构。第 4.4 节的实验验证了这种韧性:跨域时全局 MSE 比值失去可靠性,框架仍通过补偿性多指标推理保持超过 90% 的检测率。

    每个信号片段转换至频域并分解为    个不重叠频带。自编码器    通过最小化下式学习重构频带能量向量   :

     

    训练后,每个测试信号可获得三个层级的偏差信息:

    • 全局偏差:MSE 比值     ,其中      为重构误差,     为训练分布导出的阈值,用于描述总体异常。
    • 频带级偏差:第      个频带的      量化局部频谱偏差,识别最异常频段。
    • 最异常频带:按      排序,为后续包络分析提供方向性指导,例如建议解调共振频带。

    这些输出作为结构化输入传给感知智能体,而不是直接做二分类。该设计明确规定自编码器负责“测量”而非“决策”;决策提升至感知智能体,由其结合其他指标进行上下文判断。

    架构的实际优势是跨域部署仅需目标轴承正常工况数据,无需故障示例或带标签振动数据。跨域应用(4.5)时,全局 MSE 比值可能因分布偏移变得不可靠,但频带 z 分数和下游物理推理能够补偿,实验对此作了验证。

    3.3. 感知智能体:LLM 自适应异常评估

    3.3.1. 动机

    传统振动异常检测依赖固定统计阈值。域内有效,但存在两种常见失效:其一,边界样本的 MSE 比值接近阈值,小噪声波动就会翻转检测结果,导致不一致诊断;其二,跨域遇到不同轴承类型时,重构误差分布不可预测地变化,使阈值失去意义,例如健康轴承   ,故障轴承却   。

    我们观察到,频带 z 分数与时域峭度等补充指标,常能捕获全局 MSE 比值漏掉的故障特征。早期故障产生的冲击内容,可能在整体重构误差超过阈值之前显著提高峭度。这促使我们设计根据上下文自适应加权、综合异构指标的机制,而非使用预先固定的决策树。

    3.3.2. 多指标融合

    对于每个输入信号,感知智能体接收结构化指标集 合:

     

    其中    是 MSE 比值,   是最异常的前    个频带的 z 分数与范围,   为峭度,   为峰值因子,   为偏度。指标被文本化为结构化提示,各数值附带物理解释,例如:“3000–3500 Hz 频带:z 分数 6.5(高度异常);峭度 5.8(检测到冲击性内容)”。

    3.3.3. 两级决策架构

    如图 2,感知智能体采用两级策略,在效率与推理深度之间取得平衡。

    第一级:确定性快速路径。当指标明确无歧义时,不调用 LLM,以降低延迟和 API 成本:

    • :立即判为异常,高置信度;信号远超正常分布。
    •    ,且仅限同域:立即判为正常,高置信度;全部指标都支持健康行为。

    第二级:LLM 研判。对于所有中间或模糊情况,通常包括   、指标不一致,或跨域运行,LLM 综合完整指标集,输出状态、置信度、可疑频带及自然语言理由。

    本级的关键是跨域感知。当跨域标志激活时,提示明确要求 LLM 降低 MSE 比值权重,优先参考峭度与频带 z 分数,因为它们比全局重构统计对分布偏移更稳健。提示还要求模糊情况下倾向判为“可疑”,体现漏检故障代价远高于额外频谱分析的非对称代价结构。

    若 LLM 调用因 API 超时或解析失败而失败,则启用保守规则回退:

     

    时将信号判为异常,从而确保平稳降级,不因基础设施问题而无声漏检。

    图 2 感知智能体两级评估策略的决策流程。

    3.4. 诊断智能体:基于物理的工具链推理

    3.4.1. 设计理念

    诊断智能体是核心分析引擎。其设计基于一个认识:LLM 不需要理解振动信号本身,而需要理解振动分析流程。正如高级工程师指导初级分析员“在 2–6 kHz 频带上计算包络谱,寻找谱峰并检查它们是否对应 BPFO 谐波”,LLM 一边推理哪些步骤适合当前异常模式,一边编排计算工具序列。

    该机制采用 ReAct [32]:LLM 交替执行思考步骤(用自然语言说明下一步分析什么以及原因)与行动步骤(用选定参数调用具体工具),直至积累足够诊断证据。

    3.4.2. 三层工具架构

    工具集分为三层,在不同抽象层级编码领域知识。

    第一层:物理计算。编码滚动轴承基本运动学方程。给定    和   ,计算缺陷特征频率:

     

    其中   。对每个频率计算至五阶谐波,作为评估观测频谱的确定性参考。

    第二层:信号分析。实现成熟的轴承信号处理技术。包络谱工具在共振频带进行带通滤波、Hilbert 变换解调和 FFT,提取轴承缺陷调制频率。FFT 频谱工具直接分析低频机械故障。谱峰提取工具检测显著峰并估计 SNR,仅保留    的峰作为有效证据。

    第三层:诊断推理支持。实现将频谱证据映射为故障结论的分析逻辑。特征频率匹配工具在    容差内确定性比较观测峰与理论频率,生成按排名排列的故障类型摘要,并内置三种消歧机制:

    1. SNR 过滤:排除 SNR 低于 3.0 的峰,防止噪声伪影抬高谐波计数。
    2. BSF/FTF 审慎规则:滚珠与保持架故障在物理上较少见;当 BSF 或 FTF 匹配数仅略高于 BPFO/BPFI 时,调整排名,优先考虑更可能的内外圈故障。
    3. BPFO/BPFI 歧义检测:当内外圈谐波计数最多相差 1 时,明确标记歧义,并建议边带分析。

    知识库工具提供故障严重程度指标、常见频谱模式及维护建议等补充知识,使推理以已有工程经验为依据。

    3.4.3. 推理过程

    诊断智能体遵循标准振动分析的结构化流程:

    1. 根据轴承几何参数与转速计算理论特征频率。
    2. 在感知智能体异常频带所指示的共振频段计算包络谱。
    3. 从包络谱提取显著谱峰。
    4. 用确定性匹配工具比较观测峰与理论故障频率。
    5. 查询知识库,将诊断置于工程上下文中。
    6. 输出故障类型、置信度、证据链及严重程度评估等结构化结果。

    每一步,LLM 选择工具并确定参数,例如根据可疑频带选择带通范围;随后在物理上下文中解释结果,并决定证据是否充足。关键约束是要求 LLM 信任确定性匹配工具的数值输出,而非手工比较频率,以防幻觉引发误诊。

    3.4.4. 跨域泛化

    该架构的独特优势在于,跨域迁移无需重训、微调或域适应。诊断新轴承时,只需更新几何参数    和转速   ,物理计算层便自动产生正确特征频率。LLM 推理过程保持不变,因为它操作的是谐波匹配、包络解调等物理原理,而非学习特征模式。跨域模式下,诊断智能体采用更保守的报告策略,即使频谱证据较弱也标记故障,因为陌生工况下故障特征可能被削弱。

    3.5. 验证智能体:证据一致性与反思纠正

    3.5.1. 动机

    LLM 单次推理容易受到两种已知失效模式影响:确认偏差,即过早锁定假设并选择性解释后续证据;模糊情况下过度自信,即指标矛盾仍报告高置信度。验证智能体通过结构化三步证据一致性协议,在独立于诊断智能体推理路径的基础上系统检查。

    3.5.2. 三步证据一致性协议

    如图 3,协议按顺序执行三个步骤。

    步骤 1:感知—诊断一致性。检查诊断是否符合感知结果。两种模式触发干预:

    • 感知高置信正常,但诊断为故障:对于特别容易受偶然谐波匹配影响的 BSF/FTF(滚珠/保持架)诊断,立即覆盖为正常;对于 BPFO/BPFI(内外圈)诊断,标记不一致并交给 LLM 审查,不自动覆盖,因为即使全局异常指标处于边界,内外圈故障仍可能产生清晰谱特征。
    • 感知异常,但诊断正常:由诊断智能体跨域逻辑处理,并在验证报告中记录,以保证可追溯性。

    步骤 2:边带消歧。当诊断为 inner_race 或 outer_race,且 BPFO/BPFI 谐波数最多相差 1 时,调用边带检测工具。该步骤利用基本物理区别:内圈缺陷随轴旋转,经过承载区时在轴频    上产生幅值调制,形成:

     

    处的边带;外圈缺陷相对承载区静止,不产生这一调制。

    工具检查 BPFI 基频周围的包络谱边带:

    • 检测到至少 3 个边带,且至少 1 对对称边带:强烈支持内圈故障。
    • 检测到至少 2 个边带:中等程度支持内圈故障。
    • 无边带:与外圈故障一致,即静止缺陷、无幅值调制。

    该机制直接针对包络谱诊断中内外圈混淆的主要来源——BPFO/BPFI 谐波重叠。

    步骤 3:LLM 综合验证。以下任一情况成立时,调用 LLM 综合证据:(i)感知和诊断矛盾;(ii)边带检测修改了诊断;(iii)诊断置信度低于“高”;(iv)证据链中含明确歧义标志。LLM 接收完整上下文,输出确认、修改或拒绝原诊断的验证决定。

    图 3 验证智能体的三步证据一致性协议,以及具有防回退约束的反思纠正。

    3.5.3. 反思纠正循环

    当验证智能体的 LLM 审查认为诊断应修改时,流程并不直接覆盖输出,而是启动反思纠正:将验证反馈追加至提示,再把样本返回诊断智能体。反馈说明具体疑点,例如“边带分析与内圈分类相矛盾,请重新考虑外圈故障”,指导重新检查证据。

    重新分析结果再次验证,但不触发更多反思,将循环限制为一次,避免计算失控。核心约束是:重新分析不得从故障回退为正常。该规则防止针对具体故障类型的反馈,例如“重新考虑内圈还是外圈”,意外导致诊断智能体完全放弃故障判断。

    3.6. 多智能体编排流程

    3.6.1. 流程执行

    算法 1 形式化完整流程。整体按顺序执行,并带有条件式反思分支。

    算法 1 多智能体诊断推理流程

    3.6.2. 设计属性

    流程架构体现可靠无标签诊断所需的四种属性。

    感知—推理分离。解耦异常评估与故障识别,避免边界异常分数使整个诊断流程被跳过。即使 MSE 低于阈值,感知智能体也可判为可疑并建议分析,确保潜在故障不被无声忽略。

    确定性计算与 LLM 编排。FFT、包络解调、频率匹配等数值运算由经过验证的确定性工具完成;LLM 仅负责工具选择、参数确定与结果解释。这种混 合架构结合传统信号处理的数值可靠性与 LLM 的上下文推理、多证据综合能力。

    有界反思与防回退。反思最多一次,避免无 界计算;防回退保证反思只能细化诊断,例如从内圈改为外圈,而不能放弃故障判断,维持证据积累过程的单调性。

    平稳降级。LLM 调用失败时,各阶段默认采用保守规则:感知阶段基于阈值检测,验证阶段基于规则修正边带结论。系统始终产生诊断,不无声失败。

    3.6.3. 计算成本

    每个诊断实例需要 2–5 次 LLM 调用:快速路径不适用时进行一次感知调用,诊断阶段进行若干迭代调用,必要时增加验证与反思调用。端到端延迟每样本 30–90 s,主要由 LLM API 调用决定。

    虽然该延迟不适于实时连续监测,但框架适于定期检查、维护决策支持及离线批分析,这些场景优先考虑可解释性和诊断准确率。对于航空发动机、核电等安全关键系统,预期部署方式是在计划维护窗口内离线批量分析记录的振动数据。连续实时告警可由感知智能体的确定性快速路径(3.3.3,第一级)支持,其延迟小于 1 s,且独立于 LLM 可用性。三个 LLM 后端的详细效率指标见补充表 S1。

    3.7. 框架的可信性属性

    在阐述属性前,先明确本文“可信性”的范围。它指一组架构设计原则,系统性减少安全关键应用中已识别的 LLM 失效模式,包括幻觉风险、推理不透明、不受控诊断回退及组件无声失败。属性通过消融(4.3)与案例(4.6)进行经验验证,并不构成数学证明或认证级保证意义上的形式化安全保障;它们代表安全关键环境中负责任部署智能体 AI 的工程实践。

    第 3.1—3.6 节的架构共同实现以下四种区别于传统 LLM 诊断系统的属性。

    属性 1:LLM 推理与信号计算的架构分离。LLM 不处理原始信号,数值运算交由经过验证的工具(3.1.2)。这消除了要求 LLM 解释训练分布外模态所引起的一类幻觉风险;仅传输文本化统计量,而非原始流,也符合安全关键行业隐私要求。

    属性 2:可审计的推理溯源。每次诊断附带完整记录:匹配谐波及其与理论值的偏差、经过 SNR 过滤的谱峰、边带证据、感知指标及验证决策(3.3—3.5)。记录使输出从黑箱预测转化为可审计工程建议,支持人机协同决策,使工程师可独立评估歧义样本。

    属性 3:安全单调的反思纠正。反思限一次,且防回退规则禁止已识别故障变回正常。这种类似于非递减安全谓词的属性,确保反馈只能细化故障类型,如内圈改为外圈,而不能放弃诊断,从而应对通用 LLM 反思的已知失效模式。

    属性 4:组件失效时平稳降级。API 失败或输出格式错误时,各阶段启用保守规则回退(原文引用 3.6.2):感知阶段使用阈值,诊断阶段采用确定性谐波计数最大值,验证阶段使用规则边带纠正。系统在降级状态下仍产生诊断,使基础设施级可靠性不取决于外部 LLM 服务。表 5 的纯确定性消融对此作了验证:全部 LLM 不可用时,仅靠确定性工具链与人工规则仍取得 82.8% 准确率,保留有意义的诊断能力。

    四种属性共同构成框架的可信性约定。第 4.3—4.6 节通过消融量化各组件贡献,并用案例展示推理链的可审计性。

    (实验及结论见下篇)



    编辑:Kira
    校核:李正平、陈凯歌、赵栓栓、曹希铭、赵学功、白亮、任超、海洋、陈宇航、Tina、王金、赵诚、肖鑫鑫、张优
    该文资料搜集自网络,仅用作学术分享,不做商业用途,若侵权,后台联系小编进行删除


    来源:故障诊断与python学习
    ACTMechanicalSystem振动化学旋转机械通用航空航天python通信海洋理论电机爆炸多尺度
    著作权归作者所有,欢迎分享,未经许可,不得转载
    首次发布时间:2026-10-09
    最近编辑:1小时前
    故障诊断与python学习
    硕士 签名征集中
    获赞 87粉丝 153文章 335课程 0
    点赞
    收藏
    作者推荐

    T-ASE 开源代码论文推荐|把分布建模移到隐空间,能缓解数据漂移误报吗?

    工业传感器持续产生多变量时间序列,训练数据又未必是完全干净的正常样本。采集噪声和系统偏差造成数据漂移后,正常数据与异常数据可能在原始空间重叠,基于密度的检测器容易给正常片段较高的异常分数。同济大学与韦恩州立大学团队提出自适应隐空间分布模型(Adaptive Latent Distribution Model,ALDM)。模型先用上下文学习、可学习距离和软分配构建隐表示,再由条件归一化流估计隐空间密度。作者还给出事件级评价指标,并公开包含 180 个人工注入异常事件的田纳西-伊士曼过程扩展(Tennessee Eastman Process Extension,TEPE)数据集。论文信息英文题目 Adaptive Latent Distribution Modeling for Industrial Time Series Anomaly Detection作者 Yu Liu、Yifan Song、Shaolong Shu、Feng Lin、Jun Wang、Yafeng Guo作者与机构 Yu Liu 来自同济大学计算机科学与技术学院。Yifan Song、Shaolong Shu、Jun Wang、Yafeng Guo 来自同济大学电子与信息工程学院,Feng Lin 来自韦恩州立大学电气与计算机工程系。期刊信息 IEEE Transactions on Automation Science and Engineering,Vol. 23,2026,7893-7907发表时间 2026 年 3 月DOI 10.1109/TASE.2026.3674236代码与数据 https://github.com/YuLiu-61/ALDM论文速览问题 采集噪声和偏差会造成数据漂移,使正常与异常分布在原始空间重叠。直接建模原始数据密度时,漂移后的正常片段可能进入低密度区域并触发误报。逐点 F1 分数(point-wise F1 score,F1)和 AUROC 也无法直接判断完整异常事件是否被检出。方法 ALDM 用上下文学习提取变量依赖和时间关系,以自适应距离计算和软分配训练隐编码器,再用条件归一化流估计隐表示的密度。训练集异常分数的四分位距用于确定测试阈值。证明 ROC曲线下面积(Area Under the Receiver Operating Characteristic Curve,AUROC)采用百分数表示时,ALDM 在安全水处理(Secure Water Treatment,SWaT)、池化服务器指标(Pooled Server Metrics,PSM)、火星科学实验室探测器(Mars Science Laboratory rover,MSL)和 TEPE 上分别达到 90.5±1.3、86.8±3.4、70.1±0.8、82.5±0.8,均为表中最高值。四个数据集的事件级 F1 分数(event-level F1 score, )也均为最高值。MSL 的逐点 F1 是例外,ALDM 为 0.3926,低于 CrossAD 的 0.4058。目录研究任务与数据漂移问题ALDM 如何完成异常检测上下文学习自适应距离、软分配与隐编码密度估计、联合训练与阈值为什么还要评价完整异常事件数据集与实验条件四个数据集上的主要结果AUROC、逐点 F1 与事件级 F1平稳性和分数分布消融、开销与参数敏感性适用条件与开源资源 研究任务与数据漂移问题论文研究工业信息物理系统(Industrial Cyber-Physical Systems,CPS)的无监督多变量时序异常检测。含 个变量、总长度为 的序列先按窗口长度 和步长 切分,每个分段经过模型后得到正常或异常的二元标签。实验采用污染训练设定,即训练数据允许含有异常样本。这项任务包含一条连续的问题链。采集噪声和偏差先引起数据漂移,漂移让正常与异常分布在原始空间发生重叠,重叠又使密度模型难以划清两类边界。论文图 1 选取 SWaT 数据集中全部为正常的时段,蓝色 区域出现垂直漂移后,GANF 和 MTGFlow 的异常分数明显升高,ALDM 的分数变化较小。 ALDM 不在原始数据空间继续拟合密度,而是先学习一个更适合分布建模的隐空间。ALDM 如何完成异常检测论文图 3 给出了完整数据流。输入分段同时进入上下文学习和隐编码路径。上下文学习产生条件信息 与时间嵌入 ,时间嵌入用于计算距离 和软分配权重。软分配进入对比损失并更新隐编码器。编码器输出 后,条件归一化流根据 对其密度建模,最终由似然得到异常分数。 图中的三条主线分别对应上下文条件、隐空间学习和异常判定。训练阶段同时更新三个模块,测试阶段沿用训练好的网络与训练分数确定的阈值。上下文学习上下文学习(Context Learning,CL)接收一个 的多变量分段。模型把不同传感器变量视为图节点,以自注意力学习当前分段的动态邻接矩阵。循环神经网络提取时间隐藏状态,图卷积再融合变量依赖、当前隐藏状态与前一时刻隐藏状态,输出空间-时间条件 。这部分信息有两个去向。时间嵌入 进入自适应距离计算,融合后的 则作为归一化流的条件信息。自适应距离、软分配与隐编码自适应距离计算(Adaptive Distance Computation,ADC)不预先固定一种距离公式。论文通过矩阵分解构造可学习度量: 为循环神经网络输出的时间嵌入维度。 为下三角矩阵, 为对角矩阵。两者随机初始化,并在训练中通过梯度下降更新。时间嵌入 与 的距离为: 表示同一分段内两个时间位置的上下文距离。距离越小,软分配(Soft Assignment,SA)权重越大: 为 sigmoid 函数, 控制权重分布的锐度。 进入时间级对比损失,用于调节不同时刻之间的学习权重。隐编码器由输入投影、时间戳掩码和膨胀卷积网络组成。训练时,模型从同一分段中采样两个重叠区间并执行掩码,形成增强视图。膨胀卷积网络含 10 个残差块,每块有两个一维卷积层,第 个残差块的膨胀率为 。实例级损失负责区分不同分段,时间级损失利用软分配建模分段内部的时间关系,两者共同组成 。密度估计、联合训练与阈值条件归一化流(Conditional Normalizing Flow,CNF)接收隐表示 和上下文条件 ,通过一系列可逆变换把复杂隐分布映射到高斯基分布,并以最大似然损失 训练。ALDM 的联合目标为: 用于平衡密度建模与对比学习,论文默认取 。第 个分段的异常分数是隐表示各维度的平均负对数似然: 在这里表示隐表示参与求和的维度数, 是第 维分量。似然越低, 越高。训练结束后,模型先计算整个训练集的异常分数,再采用四分位距(Interquartile Range,IQR)规则确定阈值: 和 分别是训练分数的第 25 和第 75 百分位数。测试分段依次经过上下文学习、隐编码和 CNF。若 高于阈值,模型输出异常标签。为什么还要评价完整异常事件工业异常通常持续一段时间。逐点指标关注单个时间点,不能直接回答一个完整事件是否被检出。论文图 2 中,方法 1 检出的异常点更多,却只覆盖一个真实事件。方法 2 检出的点更少,但覆盖了全部三个事件。 作者把连续真实异常点定义为异常事件,把连续预测异常点定义为预测段。真实事件与一个或多个预测段存在完全或部分重叠时,计入事件级真正例 。没有任何重叠时,计入事件级假负例 。事件召回率为: 事件精确率在逐点精确率上加入假正例惩罚: 和 分别是逐点真正例数和假正例数。该式中的 表示正常数据点总数,与前文表示变量维度的 含义不同。事件级 F1 为: 该指标把异常事件覆盖率与逐点假正例惩罚合在一起。论文同时报告 AUROC、未应用逐点调整的逐点 F1,以及事件级 。数据集与实验条件实验覆盖三个公开数据集和作者构建的田纳西-伊士曼过程扩展(Tennessee Eastman Process Extension,TEPE)数据集。SWaT 51 路传感器,1 秒采样。论文的数据说明写明 4 天内包含 41 次攻击。PSM 来自 eBay 多个服务器节点的性能指标,用于识别性能劣化或安全漏洞相关异常。MSL 来自好奇号的遥测数据,用于监测任务期间的运行参数异常。TEPE 包含 53 个过程变量、20 种异常工况和 360 个操作日,以 1 分钟为采样间隔,共模拟 180 个人工注入异常事件。TEPE 扩展自田纳西-伊士曼过程,覆盖反应器、产品冷凝器、气液分离器、循环压缩机和产品汽提塔。论文构建该数据集,是因为 SWaT、PSM、MSL 中可用于事件级评价的异常事件数相对有限。 图 4 给出 TEPE 的主要过程单元及其连接关系。它说明 53 个过程变量来自同一化工流程中的多类测量和控制位置。参与比较的基线包括 DeepSAD、DeepSVDD、USAD、DAGMM、GANF、MTGFlow、FITS 和 CrossAD。论文使用各方法公开实现,保留原网络结构,并采用对应文献报告的超参数。全部实验运行于 Ubuntu Linux 64 位、Python 3.8 和 PyTorch 环境,硬件为 Intel Core i9-13900KF @5.8 GHz、32 GB 内存和 NVIDIA RTX 4090 @24 GB。所有实验的检测窗口为 60,步长为 10。ALDM 的权重衰减为 ,优化器采用 AdamW。OneCycleLR 的起始百分比为 0.2,初始学习率为 0.002,最大学习率为 0.004。SWaT 异常比例 0.121,批量大小 512,训练 100 轮。PSM 异常比例 0.278,批量大小 256,训练 250 轮。MSL 异常比例 0.105,批量大小 256,训练 250 轮。TEPE 异常比例 0.208,批量大小 256,训练 40 轮。训练流程依次是分段、上下文与隐空间联合训练、训练集异常分数计算和 IQR 阈值确定。测试时使用训练好的网络计算分段分数,再与同一阈值比较。论文正文没有给出精确训练集与测试集样本数、随机种子和重复实验次数。四个数据集上的主要结果AUROC、逐点 F1 与事件级 F1论文表 II 的 AUROC 以百分数表示,结果写作均值±标准差。原文没有说明重复实验次数。ALDM 与各数据集次高方法的对比如下。SWaT ALDM 为 90.5±1.3,MTGFlow 为 84.8±1.5,绝对提高 5.7 个百分点。PSM ALDM 为 86.8±3.4,MTGFlow 为 85.7±1.5,提高 1.1 个百分点。MSL ALDM 为 70.1±0.8,MTGFlow 为 67.2±1.7,提高 2.9 个百分点。TEPE ALDM 为 82.5±0.8,USAD 为 81.6±0.2,提高 0.9 个百分点。 图 5 展示四个数据集上的 ROC 曲线。表 II 中,ALDM 在四个数据集的 AUROC 均为最高值。论文表 III 没有采用 point adjustment。ALDM 的逐点 F1 与事件级 分别为:SWaT 0.6881 / 0.8985。PSM 0.7926 / 0.7516。MSL 0.3926 / 0.5303。TEPE 0.6175 / 0.7460。ALDM 在四个数据集的事件级 均为最高值,在 SWaT、PSM 和 TEPE 的逐点 F1 也为最高值。MSL 上,CrossAD 的逐点 F1 为 0.4058,高于 ALDM 的 0.3926。这个例外说明逐点结果与事件级结果需要分开报告。 图 6 对比 ALDM 与 MTGFlow 在 SWaT 和 TEPE 上的异常分数。按作者描述,ALDM 在异常区域给出更高分数,在正常区域给出更低分数,并在部分事件边界处呈现更陡的变化。平稳性和分数分布作者使用增广迪基-富勒检验(Augmented Dickey-Fuller,ADF)比较四个数据集的平稳性。SWaT ADF 统计量 −0.780, 。PSM ADF 统计量 −6.060, 。MSL ADF 统计量 −1.228, 。TEPE ADF 统计量 −9.48, 。论文将 SWaT 和 MSL 描述为非平稳性较强的数据集。ALDM 在二者上的 AUROC 增幅分别为 5.7 和 2.9 个百分点。 图 7 第一行是 MTGFlow,第二行是 ALDM。MTGFlow 在 SWaT、PSM、MSL、TEPE 上的正常与异常分数重叠值分别为 0.28、0.44、0.33、0.09。作者报告 ALDM 在四个数据集上的重叠面积均更小,但没有在正文逐一列出 ALDM 的四个数值。消融、开销与参数敏感性消融实验论文考察 CL、ADC 和 SA 的作用。SWaT 上,三个数值依次为 AUROC、逐点 F1、事件级 。M0,不使用三个组件 73.5±4.3 / 0.3206 / 0.4267。M1,仅使用 SA 88.5±0.9 / 0.6592 / 0.8790。M2,使用 ADC 和 SA 90.0±0.6 / 0.6786 / 0.8979。ALDM,使用 CL、ADC 和 SA 90.5±1.3 / 0.6881 / 0.8985。SA 在 SWaT 上带来的变化最大,M0 到 M1 的 AUROC 提高 15.0 个百分点,逐点 F1 提高 0.3386,事件级 提高 0.4523。CL 的作用存在数据集差异,部分 PSM 和 TEPE 配置的某些指标会下降,因此不能把消融结果概括为每个模块在所有条件下都单独提高全部指标。论文还将 ADC 与表 VI 中的 TD、COS、DTW 三种静态距离标记比较。ADC 在四个数据集的 AUROC 和事件级 均为最高值。TEPE 的逐点 F1 是例外,TD 为 0.6244,ADC 为 0.6175。原文没有展开 TD 的全称。直接学习完整距离矩阵时,训练初期出现 NaN。特征值裁剪需要在每轮训练后执行半正定锥投影,SWaT 上每轮耗时为 283 秒,Cholesky 分解方案为 30 秒。 图 8 给出 SWaT 在第 1、30、60 和 100 轮训练时的 t-SNE 分布。蓝色表示正常样本,红色表示异常样本。图中两类样本的边界随训练逐渐变得清晰。训练与推理开销ALDM 单次推理约需 223 MFLOPs。论文以 NVIDIA Jetson Nano 的 141 GFLOPs 算力估算单次推理延迟为 20-50 ms,该数值是估算结果。在 RTX 4090 实验环境下,ALDM 处理四个完整数据集的训练时间和测试时间为:SWaT 38.34 分钟 / 9.36 秒。PSM 6.74 分钟 / 2.59 秒。MSL 6.09 分钟 / 2.46 秒。TEPE 18.31 分钟 / 7.58 秒。SWaT 上,MTGFlow 的训练时间为 2.86 分钟,测试时间为 4.84 秒。ALDM 对应为 38.34 分钟和 9.36 秒。表 VII-VIII 显示,ALDM 的训练成本明显较高,测试时间仍处于秒级。参数敏感性论文扫描了窗口大小 、隐空间维度 和损失平衡权重 。SWaT 和 PSM 的 AUROC 与事件级 在窗口 60-80 附近达到峰值,过长窗口会引入冗余信息。隐空间维度为 512 时,部分结果轻微下降。作者建议采用 256-320 的中等维度。多数数据集在 时取得较好的 AUROC 和事件级 ,窗口大小和损失权重仍需按数据集调整。 图 9 分别给出窗口大小、隐空间维度和损失权重对三类指标的影响,曲线也显示不同数据集对窗口和权重的偏好并不完全一致。适用条件与开源资源论文给出三项适用边界。如果训练集包含覆盖典型运行场景的丰富正常数据,基于重建或预测的方法可能优于 ALDM。这些方法能够直接利用干净正常样本学习决策边界。IQR 阈值假设训练数据多数正常。当异常污染率超过 25% 时,阈值可能产生偏差并降低泛化表现。归一化流受可逆变换架构限制。面对高度多模态或拓扑复杂的隐分布时,模型可能出现误报或漏报。作者提出的后续方向包括更稳健的阈值机制、更灵活的生成先验,以及其他隐空间投影技术。 通讯作者: 舒少龙,同济大学控制科学与工程系教授,博士生导师。研究方向包括离散事件系统、信息物理系统、智慧监控与工业智能等。聚焦于信息物理系统中的逻辑动态行为,创建了以可测性为核心的离散事件动态系统状态估计理论。发表论文80多篇,在控制领域顶级期刊IEEE Transactions on Automatic Control和Automatica上发表论文10多篇。主持国家级项目4项,参与承担国家级项目10多项。研究成果应用于智能建筑、智慧电网、智慧港口等行业中,获上海市自然科学二等奖一项(第一完成人)。编辑:曹希铭校核:李正平、陈凯歌、Leo、赵学功、白亮、任超、海洋、陈宇航、Kira、Tina、王金、赵诚、肖鑫鑫、张优来源:故障诊断与python学习

    未登录
    还没有评论
    课程
    培训
    服务
    行家
    VIP会员 学习计划 福利任务
    下载APP
    联系我们
    帮助与反馈