当大语言模型参与机械故障诊断,如何让诊断结论有据可查?本期推荐论文提出了一种由感知、诊断与验证三个智能体协作的可信诊断框架。系统仅利用正常工况数据和轴承几何参数,通过调用物理分析工具,在无需故障类别标签的条件下开展诊断,并记录谐波、频率偏差与边带等关键证据。论文将可审计推理、诊断纠错与组件失效后的规则回退纳入统一流程,为智能体走向可靠的工业应用提供了值得关注的思路。由于论文篇幅较长,分为上下两篇介绍。
论文题目:
A trustworthy agentic AI framework for auditable label-free machinery fault diagnosis in safety-critical engineering systems
论文日期:2026(online)
发表期刊:
Advanced Engineering Informatics 77 (2027), 105205
论文链接:
https://doi.org/10.1016/j.aei.2026.105205
作者:
Yuntong Chen,Binhao Liu,Yingqi Li,Ziang Wang,Liping Ma,Jianyu Liu,Xitian Tian,Lijiang Huang(∗)
作者单位:
School of Mechanical Engineering, Northwestern Polytechnical University, Xi’an, Shaanxi 710072, China.
摘要
符号与缩略语
1 引言
2 相关工作
2.1 轴承故障诊断的深度学习方法
2.2 基于大语言模型的轴承故障诊断
2.3 工程信息学中的多智能体大语言模型系统
2.4 研究空白总结
3 方法
3.1 问题定义与框架概述
3.1.1 问题定义
3.1.2 框架架构
3.2 基于自编码器的正常基线学习
3.3 感知智能体:大语言模型自适应异常评估
3.3.1 动机
3.3.2 多指标融合
3.3.3 两级决策架构
3.4 诊断智能体:基于物理的工具链推理
3.4.1 设计理念
3.4.2 三层工具架构
3.4.3 推理过程
3.4.4 跨域泛化
3.5 验证智能体:证据一致性与反思纠正
3.5.1 动机
3.5.2 三步证据一致性协议
3.5.3 反思纠正循环
3.6 多智能体编排流程
3.6.1 流程执行
3.6.2 设计属性
3.6.3 计算成本
3.7 框架的可信性属性
4 实验与结果
4.1 实验设置
4.2 域内评估
4.3 消融研究
4.4 感知智能体评估
4.5 向未见目标数据集的无故障标签迁移
4.6 诊断推理分析
4.6.1 系统性审计记录评估
4.6.2 案例一:标准正确诊断
4.6.3 案例二:边带消歧
4.6.4 包络谱证据可视化
4.6.5 错误分析
4.6.6 频率匹配容差分析
4.6.7 轴承参数扰动分析
4.7 与基于大语言模型的诊断方法比较
5 结论
在安全关键机械的状态监测中部署智能体 AI,不仅要求诊断能力,还要求可审计的推理、组件失效时的平稳降级,以及可验证的安全属性。传统数据驱动诊断模型难以充分满足这些要求,尤其是在新投用设备缺乏带故障标签训练数据的情况下。本文提出一种可信的多智能体大语言模型(LLM)框架,通过以物理为依据的工具编排,实现无故障标签的机械故障诊断:仅需要正常工况运行数据与轴承几何参数,在任何阶段都不使用故障类别标签。
三个协作智能体——感知、诊断与验证智能体——分别执行异常评估、迭代频谱推理及证据一致性约束,为每次诊断生成完整的谐波、频率偏差与边带证据溯源记录,以支持人机协同诊断。框架通过四种机制在架构层面实现可信性:(i)严格分离 LLM 与原始振动信号处理,将所有数值运算交给经过验证的计算工具;(ii)为每次诊断生成包含匹配谐波、频率偏差和边带证据的完整记录,实现可审计的推理溯源;(iii)通过防回退安全约束,阻止反思纠正将已识别故障回退为正常;(iv)在 LLM 组件失效时启用规则回退,确保系统平稳降级。
在凯斯西储大学(CWRU)数据集上,框架使用三个 LLM 后端取得 92.4%–95.1% 的准确率,与完全监督微调基线的差距在 1.7 个百分点以内。在向三个未见目标域 Paderborn、JNU 和 MFPT 进行无故障标签迁移时,框架取得平均 95.6% 的故障检测率;五个监督基线——包括可使用无标签目标域数据的域适应方法——则坍缩为恒定类别预测。消融表明,仅物理工具链即可达到 82.8% 准确率,LLM 编排额外贡献 12.2 个百分点,提升主要集中在物理证据存在歧义的样本上。
关键词:可信智能体 AI;多智能体 LLM;可审计推理;基于物理的工具编排;无故障标签机械故障诊断;安全关键状态监测。
符号与缩略语
滚动轴承是旋转机械中最容易发生故障的部件之一。在航空发动机、风力机、核电设备及智能制造产线等安全关键基础设施中,轴承故障占旋转设备故障事件的 40%–50% [1–3]。AI 驱动诊断系统在这些基础设施中的部署迅速增加,但也出现了一个关键的不匹配:智能体 AI 和大语言模型近期的能力跃升带来了新的失效模式,包括幻觉推理、不透明的决策路径,以及分布偏移下的无声性能退化,而传统故障诊断框架从未针对这些问题进行设计 [4,5]。
因此,对于部署在安全关键机械中的诊断系统,要求已从单纯的准确率扩展为三个相互关联的可信性目标:在控制误报率的同时,在失效发生前识别早期缺陷;在不同设备类型和工况间保持稳定诊断能力,并在 AI 组件失效时平稳降级;向工程师提供可审计的推理溯源,以支持人机协同决策 [6]。同时实现这三个目标,已成为安全关键工程系统部署智能体 AI 的核心挑战。
过去十年,应对这些目标的主流方法是数据驱动深度学习 [7–9]。卷积神经网络(CNN)、残差网络(ResNet)、长短期记忆网络(LSTM)及注意力机制等架构被广泛用于从振动信号中提取特征和分类故障,并在标准基准上取得极高准确率 [10–12]。迁移学习与域适应也被用于减轻工况变化引起的域偏移,提高跨工况泛化 [13,14]。
然而,这些数据驱动方法存在三个根本局限。第一,它们高度依赖大量带标签故障样本,而工业现场恰恰最缺乏故障样本:对于新投用设备、小批量定制机械,以及航空发动机、风力机、核电站等高可靠性系统,最需要故障样本时往往无法获得;等真实故障发生并完成标注,预测性维护的价值已经丧失 [4,15]。第二,当模型迁移到训练集未覆盖的新设备或工况时,诊断性能急剧下降。第三,深度学习模型本质上是黑箱,缺乏可解释的推理过程,难以向工程师提供故障机理层面的诊断证据 [5]。本文后续跨数据集实验进一步发现,即使采用无标签目标域数据进行对抗训练的域适应方法,在面对几何参数、采样系统及运行转速都不同于源域的未见设备时,也会完全坍缩为单一类别恒定预测。
LLM 从大规模语料中获得的领域知识、多步推理能力与工具调用能力,为突破这些局限带来新可能。原则上,LLM 可以像人类工程师一样从物理原理出发进行诊断推理,而不只是模式匹配。一些研究沿特征文本化与微调 [16]、多模态频谱融合 [17]、端到端信号表示 [18] 三条路线将 LLM 引入轴承诊断。但这些方法具有共同假设:LLM 在训练或微调时必须接触故障标签,其角色仍主要局限于“模式分类器”,即输入特征、输出类别。这没有充分发挥 LLM 在多步推理、工具编排和证据整合方面最独特的能力,也未真正解决上述三个目标。因此,对训练集未覆盖的设备或故障类型,现有 LLM 方法仍面临与深度学习相同的泛化瓶颈。
除了准确率,在安全关键基础设施部署智能体 AI,还要求将可信性作为架构要求:LLM 可能产生物理上不正确的幻觉推理、不透明决策,或在分布偏移下无声退化。这些失效模式既未纳入传统诊断框架的设计,也不能靠事后可解释性技术加以防止。
与此同时,在化学合成、力学求解、气动优化与结构健康监测等工程科学领域,多智能体 LLM 系统已展示出通过编排物理工具链解决复杂任务的潜力 [19–21]。这些工作表明,LLM 的工程价值不仅在模式识别,更在于充当驱动物理工具链的智能推理引擎:LLM 决定“使用哪个工具、如何解释工具输出”,数值计算则交由确定性工具完成。
不过,旋转机械故障诊断与上述任务存在两方面结构性差异。第一,振动信号是高频时间序列,处于 LLM 训练分布之外,不能直接由 LLM 处理,因此必须在架构上严格分离 LLM 推理与信号处理。第二,漏检真实故障的代价远高于对误报正常状态进行复检的代价,这种非对称代价要求在异常感知和反思纠正阶段进行专门设计。直接移植已有多智能体范式无法满足这些约束。
综合深度学习与现有 LLM 方法对故障标签的根本依赖、LLM 在相邻工程领域作为推理编排器的成功实践,以及振动诊断的特殊结构约束,本文提出如下问题:能否构建一个任何阶段均不需要故障标签、仅使用正常工况运行数据学习基线、也不依赖故障分类器训练的轴承故障诊断框架,让 LLM 通过物理公式与信号分析工具逐步推理,而非执行数据驱动模式匹配?相较于收集所有失效模式的故障样本,正常数据的采集负担显著更低。
为回答这一问题,我们提出以物理为依据的多智能体诊断推理框架,其核心原则是严格分离 LLM 推理与信号处理。LLM 从不直接访问原始振动信号,而是调用特征频率计算、包络解调、峰值检测、谐波匹配等物理分析工具,依照轴承故障机理逐步推理,最终生成附带完整证据链的诊断结论。系统包含三个协作智能体:感知智能体融合自编码器异常检测与时频域统计指标,自适应评估信号异常;诊断智能体在 ReAct 范式下驱动物理工具链定位故障;验证智能体进行证据一致性检查、基于边带的消歧及反思纠正,确保诊断结论可靠。
本文主要贡献如下。
本节回顾直接支持本研究的三类工作:轴承故障诊断的深度学习方法、基于 LLM 的轴承诊断方法,以及工程领域多智能体 LLM 系统。在此基础上,第 2.4 节总结推动本文方法设计的研究空白。
近年来,深度学习已成为智能轴承故障诊断的主流。卷积神经网络 [10]、面向小样本的 CNN-BiLSTM 混合架构 [11]、提高泛化的贝叶斯变分 Transformer [12]、声振物理信息融合网络 [1],以及面向少样本的自适应频率注意力 Transformer [5],共同确立了“特征提取器 + 分类头”的端到端范式,在 CWRU 等标准基准上达到近乎完美的准确率 [22]。近期进展还包括具有内置可解释性约束的可信轻量级小波 Transformer [23]、面向标签稀缺诊断的半监督原型对比学习 [24],以及用于跨域泛化的多尺度图迁移学习 [25]。
但部署至训练集未覆盖的设备或工况时,模型性能显著退化,即众所周知的跨域问题。现有应对方法有两条路线,均仍依赖故障标签。第一条路线在保留源域故障标签的前提下减轻域偏移,代表策略包括迁移学习与域适应 [7,14]、物理信息先验与多尺度信号表示 [26,27]、从物理知识出发的生成式零样本学习 [28]、基于 CycleGAN 的单域泛化 [29],以及分布式机械设备间的通信高效联邦学习 [30]。这些方法虽然不同程度缓解域偏移,但都要求源域带标签故障数据。
第二条路线尝试完全去除对目标域故障数据的依赖。例如,Hou 等 [13] 在没有真实故障数据时,使用动力学仿真模型生成虚拟故障样本训练分类器。但这仅用仿真样本替换真实样本,对每种新轴承仍需建立模型并训练分类器,同时面临仿真到现实的域差异 [4,15]。
更根本地说,无论采用哪条路线,深度学习仍是数据驱动模式匹配,其诊断知识完全编码于训练样本。即使借助注意力图和 SHAP 等事后可解释性技术,也只能揭示模型关注哪些输入特征,不能说明这些特征为何在物理上对应某类故障 [5,6]。故障标签依赖与物理可解释性缺失这两重局限,推动研究者转向同时具有先验知识与推理能力的 LLM。
现有工作可分为四条技术路线。
第一条是特征文本化与微调。Tao 等 [16] 将振动信号的时域和频域统计特征转换为结构化文本描述,利用 LoRA、QLoRA 等参数高效微调技术适配 LLM,展示了一定的跨工况和跨数据集泛化。
第二条是多模态融合。Wang 等 [17] 提出 DiagLLM,将包络谱图与专家知识共同输入多模态 LLM,通过视觉指令调优实现可解释故障识别。
第三条是端到端信号表示。Peng 等 [18] 提出 BearLLM,将原始振动信号直接编码为 LLM 可理解的 token 序列,构建通用轴承健康管理基础模型。
第四条可视为前三者的混合变体。Bao 等 [31] 将包络谱与理论特征频率以结构化文本输入 LLM,同时利用通道注意力 CNN 提供初始分类,再由微调后的 LLM 输出可解释诊断说明。
尽管路线不同,这四类工作均假设 LLM 在训练或微调阶段必须接触故障标签,其作用局限于分类器或事后解释者。这意味着它们不能在完全没有故障样本的条件下运行,在训练集以外设备或故障类型上面临与深度学习相同的泛化瓶颈。更重要的是,这些方法未充分发挥 LLM 最独特的能力:以知识为依据的多步推理、工具编排及证据整合。释放这些能力,需要从“LLM 作为分类器”转向“LLM 作为推理编排器”,这也正是近年来更广泛工程界出现的方向。
将 LLM 作为推理编排器、协调多个工具和子智能体完成复杂任务的范式,由 Yao 等 [32] 的 ReAct 框架奠定,并迅速进入科学发现与工程科学。近期综述 [33,34] 系统梳理了多智能体 LLM 在灾害韧性基础设施和智能制造中的发展。本节从与框架设计直接相关的三个维度回顾代表工作。
LLM 驱动物理工具链的可行性。在化学领域,Boiko 等 [35] 的 Coscientist 通过调用合成规划、代码执行与实验硬件接口,展示了 LLM 自主开展化学研究的能力;Bran 等 [36] 的 ChemCrow 将 18 个专业化学工具整合到 LLM 智能体,实现从反应预测到合成路线规划的端到端任务求解。在力学与气动设计领域,Ni [19] 提出的 MechAgents 通过多智能体合作求解有限元力学问题;Fan 等 [20] 的 AirfoilAgent 通过任务规划、知识整合与反思纠正三个智能体协作,实现翼型气动优化。
更广泛地,物理融合 AI 已在相邻工程领域得到发展:文献 [37] 将气动物理模型嵌入电动飞机螺旋桨设计的智能预测框架;文献 [38] 采用自监督 Informer 预测电动飞机锂电池荷电状态。虽然这些工作未采用多智能体架构,却与上述智能体研究共享一个认识:通过工具编排或模型架构编码领域物理原理,可以形成比纯数据驱动方法更具泛化性的工程 AI。总体而言,LLM 的核心价值在于通过可审计推理编排领域工具完成复杂任务,而非取代这些工具;这构成了本文将 LLM 定位为诊断推理编排器的理论基础。
多智能体任务分解与反思纠正。在结构健康监测领域,Sharma 等 [21] 的智能体 AI 框架构建感知、认知、行动和反思闭环,其物理约束结合自适应决策的理念与本文最为接近。但该框架基于部分可观测马尔可夫决策过程(POMDP)和贝叶斯推断,而非 LLM 工具调用,且只在数值仿真中验证。在物理仿真领域,Park 等 [39] 提出自我纠正的多智能体框架,将语言驱动物理仿真与解释耦合成闭环;Bu 等 [40] 构建了自主生物医学数据分析的自进化多智能体 LLM 系统。在制造与安全领域,Wang 等 [41] 提出爆炸荷载安全评估的 LLM 多智能体框架;Yu 等 [42] 提出隧道基础设施缺陷检测与维护建议的双智能体协作框架。相似范式也应用于注塑知识迁移 [43]、智能车间调度 [44]、具身制造系统 [45] 及智能维护知识图谱 [46]。这些工作展示了“感知→分析→决策”任务分解的有效性,并验证反思纠正在提高推理可靠性方面的价值。
与旋转机械故障诊断的结构性差异。尽管取得进展,旋转机械诊断仍有两个根本差异,使现有范式不能直接移植。
第一是输入模态不兼容。故障诊断的核心输入是高频采样振动时间序列,通常为 12–100 kHz,这一模态完全不在 LLM 的训练分布中。不同于化学分子式或力学有限元参数,振动信号无法通过有意义的直接文本化输入 LLM,因此需要架构级推理—信号处理分离,而不只是提示工程。
第二是内在非对称代价。优化设计或知识检索中,错误通常意味着效率损失或人工修正;故障诊断中,漏检造成的设备损坏与停机损失远大于误报带来的复检成本。因此,异常感知阶段必须保持跨域高检测率,宁可误报也避免漏检;反思纠正阶段必须防止已识别故障回退为正常,即安全单调性约束。据我们所知,现有多智能体 LLM 工作尚未在架构层面同时处理这两个约束。
综合以上文献,可识别三个未解决空白。
空白 1:故障标签依赖与可审计推理缺失。深度学习的诊断知识完全编码于训练样本,缺少物理先验和可审计推理 [5,6]。现有 LLM 诊断,无论特征文本化微调 [16]、多模态融合 [17]、端到端信号表示 [18],还是频谱提示联合微调 [31],均需接触故障标签;LLM 仍是分类器而非推理器。两类方法都面临训练集未覆盖设备的泛化瓶颈。
空白 2:多智能体 LLM 范式尚未应用于旋转机械故障诊断。工具驱动多智能体 LLM 已在化学 [35,36]、力学 [19]、气动设计 [20] 及结构健康监测 [21] 中验证,但旋转机械诊断的高频振动输入与非对称代价要求架构级设计,尚无工作同时满足这两个约束。
空白 3:缺少针对故障诊断的闭环验证与安全单调性保障。现有系统多采用开放环单次推理或通用反思 [39,40],缺少专门的故障诊断验证协议。包络谱中的 BPFO 高阶谐波与 BPFI 谐波频率重叠会造成系统性内外圈误分类;通用反思还可能将已识别故障回退为正常。两者都需要专门的物理约束机制。
表 1 从故障标签需求、跨数据集迁移、可解释性、信号处理方式及非对称代价设计五个维度比较代表方法,显示没有任何现有单一方法同时弥补上述三个空白。本文框架遵循三个原则:(i)将诊断知识编码于物理公式,而非学习权重;(ii)在架构上严格分离 LLM 推理与信号计算;(iii)通过具有防回退约束的闭环验证,维持诊断的安全单调性。下一节给出具体方法。
表 1 代表性轴承故障诊断方法比较

注:√ 表示明确具备能力;△ 表示部分具备或需重新训练/适配;× 表示不具备。“跨数据集”指无需重新训练即可诊断几何参数、采样率或故障机理不同的轴承;“非对称代价设计”指是否明确考虑漏检比误报代价更高。据作者所知,本文方法是唯一同时满足三个要求的方法:(i)不需要故障标签;(ii)无需任何故障标签即可实现真正跨数据集迁移;(iii)明确处理故障诊断的非对称代价结构。
本节先形式化诊断问题并概述架构(3.1),随后介绍自编码器基线学习(3.2)及感知(3.3)、诊断(3.4)、验证(3.5)三个协作智能体,再说明将其整合的编排流程(3.6)。
考虑几何参数为 、以转速 (RPM)运行的滚动轴承。四个参数分别为滚珠直径、节圆直径、滚动体数量及接触角。驱动端加速度计以采样率 采集振动信号 。诊断任务是确定故障类型:
与第 2.4 节表 1 比较一致,现有范式都需要故障标签,而本文仅需正常工况数据。监督深度学习要求所有类别的故障标签;迁移学习虽放宽域约束,仍依赖源域故障标签;LLM 微调方法将振动特征文本化,并通过 LoRA 适配权重,仍需有标签数据。本文将诊断表述为基于物理的无故障标签推理任务,仅需:(i)用于基线学习的正常工况数据集 ;(ii)轴承几何参数 ;(iii)转速 ;(iv)将 、 与故障特征频率关联的物理公式。任何阶段都不涉及故障标注样本、领域专属微调或带标签振动数据。
框架包含三个专门的 LLM 智能体,分别封装振动分析实践中的异常感知、故障识别及证据验证功能。这种分解模拟人类诊断专家的工作:状态监测人员先筛查异常,振动分析人员通过频谱识别故障机理,高级工程师再审查证据链并发布报告。
如图 1,框架分四个功能阶段。阶段 1 准备轴承几何参数与转速,仅使用正常振动数据训练自编码器以建立健康基线(3.2)。阶段 2 由感知智能体通过“快速路径/LLM 研判”两级策略,将自编码器指标(MSE 比值、频带 z 分数)与时域指标(峭度、峰值因子)融合,评估异常(3.3)。阶段 3 激活诊断智能体,在 ReAct [32] 中交替执行思考、行动、观察,迭代驱动涵盖运动学频率计算、包络谱分析及确定性谐波匹配的三层工具链(3.4)。阶段 4 调用验证智能体,通过内外圈边带消歧约束证据一致性,必要时触发带防回退约束的反思纠正,将问题返回诊断智能体(图 1 虚线箭头;3.5)。完整编排见算法 1(3.6)。

图 1 基于物理的多智能体框架架构。流程包括四阶段:1)输入与仅用正常数据的自编码器基线学习;2)感知智能体通过两级快速路径/LLM 研判进行多指标异常评估;3)诊断智能体在三层物理工具链(运动学计算、信号分析、诊断推理)上执行基于 ReAct 的迭代推理;4)验证智能体通过边带消歧和防回退反思纠正确保证据一致性。
贯穿框架的关键架构原则是:LLM 从不处理原始振动信号。FFT、包络解调和谱峰提取均由确定性计算工具执行;LLM 负责选择工具、在物理语境下解释数值输出,并将中间结果串联成连贯诊断论证。这种分离发挥了 LLM 的上下文推理与多证据综合能力,又避免让其接触训练分布中不存在的高频时间序列模态。
除解决模态差距外,这一分离也应对核工业、航空航天等安全关键行业的严格数据隐私约束。由于仅向 LLM 传输文本化统计指标和工具指令,相比通常每秒数十 MB 的原始振动信号,带宽需求可忽略,框架实际上消除了通过外部 API 泄露敏感运行数据的风险。
LLM 编排工具和解释结果,但不直接处理原始信号。为确保复现性和透明度,三个智能体的完整结构化提示模板,包括任务描述、工具调用格式和约束规则,详见附录 B“LLM 智能体指令模板”。
自编码器是唯一数据驱动组件,仅在正常振动数据上训练。它的目的不是执行二分类异常检测——该角色交给感知智能体——而是定量表征健康轴承行为,以便在多个粒度上衡量偏差。
自编码器采用四层一维卷积编码器,通道依次为 ,卷积核大小为 7、5、5、3,每层后接 ReLU 和 2 倍最大池化;对称转置卷积解码器恢复原维度。输入为长度 的信号片段的幅值谱,在 12 kHz 采样下约对应 1.37 s,片段重叠 50%。频谱划分为 个互不重叠的 500 Hz 频带,覆盖 0–6000 Hz。采用 Adam,学习率 ,批大小 32,训练 100 个 epoch。跨域部署时,用目标域正常数据、相同超参数重新训练自编码器;其他组件无需修改。
四层架构兼顾正常振动谱结构表示能力与目标域快速重训的轻量性。由于自编码器只是测量模块,其输出随后由感知智能体的多指标融合机制结合上下文解释(3.3),最终诊断由物理工具链决定,因此整体诊断性能并不关键依赖某种特定自编码器架构。第 4.4 节的实验验证了这种韧性:跨域时全局 MSE 比值失去可靠性,框架仍通过补偿性多指标推理保持超过 90% 的检测率。
每个信号片段转换至频域并分解为 个不重叠频带。自编码器 通过最小化下式学习重构频带能量向量 :
训练后,每个测试信号可获得三个层级的偏差信息:
这些输出作为结构化输入传给感知智能体,而不是直接做二分类。该设计明确规定自编码器负责“测量”而非“决策”;决策提升至感知智能体,由其结合其他指标进行上下文判断。
架构的实际优势是跨域部署仅需目标轴承正常工况数据,无需故障示例或带标签振动数据。跨域应用(4.5)时,全局 MSE 比值可能因分布偏移变得不可靠,但频带 z 分数和下游物理推理能够补偿,实验对此作了验证。
传统振动异常检测依赖固定统计阈值。域内有效,但存在两种常见失效:其一,边界样本的 MSE 比值接近阈值,小噪声波动就会翻转检测结果,导致不一致诊断;其二,跨域遇到不同轴承类型时,重构误差分布不可预测地变化,使阈值失去意义,例如健康轴承 ,故障轴承却 。
我们观察到,频带 z 分数与时域峭度等补充指标,常能捕获全局 MSE 比值漏掉的故障特征。早期故障产生的冲击内容,可能在整体重构误差超过阈值之前显著提高峭度。这促使我们设计根据上下文自适应加权、综合异构指标的机制,而非使用预先固定的决策树。
对于每个输入信号,感知智能体接收结构化指标集 合:
其中 是 MSE 比值, 是最异常的前 个频带的 z 分数与范围, 为峭度, 为峰值因子, 为偏度。指标被文本化为结构化提示,各数值附带物理解释,例如:“3000–3500 Hz 频带:z 分数 6.5(高度异常);峭度 5.8(检测到冲击性内容)”。
如图 2,感知智能体采用两级策略,在效率与推理深度之间取得平衡。
第一级:确定性快速路径。当指标明确无歧义时,不调用 LLM,以降低延迟和 API 成本:
第二级:LLM 研判。对于所有中间或模糊情况,通常包括 、指标不一致,或跨域运行,LLM 综合完整指标集,输出状态、置信度、可疑频带及自然语言理由。
本级的关键是跨域感知。当跨域标志激活时,提示明确要求 LLM 降低 MSE 比值权重,优先参考峭度与频带 z 分数,因为它们比全局重构统计对分布偏移更稳健。提示还要求模糊情况下倾向判为“可疑”,体现漏检故障代价远高于额外频谱分析的非对称代价结构。
若 LLM 调用因 API 超时或解析失败而失败,则启用保守规则回退:
时将信号判为异常,从而确保平稳降级,不因基础设施问题而无声漏检。

图 2 感知智能体两级评估策略的决策流程。
诊断智能体是核心分析引擎。其设计基于一个认识:LLM 不需要理解振动信号本身,而需要理解振动分析流程。正如高级工程师指导初级分析员“在 2–6 kHz 频带上计算包络谱,寻找谱峰并检查它们是否对应 BPFO 谐波”,LLM 一边推理哪些步骤适合当前异常模式,一边编排计算工具序列。
该机制采用 ReAct [32]:LLM 交替执行思考步骤(用自然语言说明下一步分析什么以及原因)与行动步骤(用选定参数调用具体工具),直至积累足够诊断证据。
工具集分为三层,在不同抽象层级编码领域知识。
第一层:物理计算。编码滚动轴承基本运动学方程。给定 和 ,计算缺陷特征频率:
其中 。对每个频率计算至五阶谐波,作为评估观测频谱的确定性参考。
第二层:信号分析。实现成熟的轴承信号处理技术。包络谱工具在共振频带进行带通滤波、Hilbert 变换解调和 FFT,提取轴承缺陷调制频率。FFT 频谱工具直接分析低频机械故障。谱峰提取工具检测显著峰并估计 SNR,仅保留 的峰作为有效证据。
第三层:诊断推理支持。实现将频谱证据映射为故障结论的分析逻辑。特征频率匹配工具在 容差内确定性比较观测峰与理论频率,生成按排名排列的故障类型摘要,并内置三种消歧机制:
知识库工具提供故障严重程度指标、常见频谱模式及维护建议等补充知识,使推理以已有工程经验为依据。
诊断智能体遵循标准振动分析的结构化流程:
每一步,LLM 选择工具并确定参数,例如根据可疑频带选择带通范围;随后在物理上下文中解释结果,并决定证据是否充足。关键约束是要求 LLM 信任确定性匹配工具的数值输出,而非手工比较频率,以防幻觉引发误诊。
该架构的独特优势在于,跨域迁移无需重训、微调或域适应。诊断新轴承时,只需更新几何参数 和转速 ,物理计算层便自动产生正确特征频率。LLM 推理过程保持不变,因为它操作的是谐波匹配、包络解调等物理原理,而非学习特征模式。跨域模式下,诊断智能体采用更保守的报告策略,即使频谱证据较弱也标记故障,因为陌生工况下故障特征可能被削弱。
LLM 单次推理容易受到两种已知失效模式影响:确认偏差,即过早锁定假设并选择性解释后续证据;模糊情况下过度自信,即指标矛盾仍报告高置信度。验证智能体通过结构化三步证据一致性协议,在独立于诊断智能体推理路径的基础上系统检查。
如图 3,协议按顺序执行三个步骤。
步骤 1:感知—诊断一致性。检查诊断是否符合感知结果。两种模式触发干预:
步骤 2:边带消歧。当诊断为 inner_race 或 outer_race,且 BPFO/BPFI 谐波数最多相差 1 时,调用边带检测工具。该步骤利用基本物理区别:内圈缺陷随轴旋转,经过承载区时在轴频 上产生幅值调制,形成:
处的边带;外圈缺陷相对承载区静止,不产生这一调制。
工具检查 BPFI 基频周围的包络谱边带:
该机制直接针对包络谱诊断中内外圈混淆的主要来源——BPFO/BPFI 谐波重叠。
步骤 3:LLM 综合验证。以下任一情况成立时,调用 LLM 综合证据:(i)感知和诊断矛盾;(ii)边带检测修改了诊断;(iii)诊断置信度低于“高”;(iv)证据链中含明确歧义标志。LLM 接收完整上下文,输出确认、修改或拒绝原诊断的验证决定。

图 3 验证智能体的三步证据一致性协议,以及具有防回退约束的反思纠正。
当验证智能体的 LLM 审查认为诊断应修改时,流程并不直接覆盖输出,而是启动反思纠正:将验证反馈追加至提示,再把样本返回诊断智能体。反馈说明具体疑点,例如“边带分析与内圈分类相矛盾,请重新考虑外圈故障”,指导重新检查证据。
重新分析结果再次验证,但不触发更多反思,将循环限制为一次,避免计算失控。核心约束是:重新分析不得从故障回退为正常。该规则防止针对具体故障类型的反馈,例如“重新考虑内圈还是外圈”,意外导致诊断智能体完全放弃故障判断。
算法 1 形式化完整流程。整体按顺序执行,并带有条件式反思分支。
算法 1 多智能体诊断推理流程

流程架构体现可靠无标签诊断所需的四种属性。
感知—推理分离。解耦异常评估与故障识别,避免边界异常分数使整个诊断流程被跳过。即使 MSE 低于阈值,感知智能体也可判为可疑并建议分析,确保潜在故障不被无声忽略。
确定性计算与 LLM 编排。FFT、包络解调、频率匹配等数值运算由经过验证的确定性工具完成;LLM 仅负责工具选择、参数确定与结果解释。这种混 合架构结合传统信号处理的数值可靠性与 LLM 的上下文推理、多证据综合能力。
有界反思与防回退。反思最多一次,避免无 界计算;防回退保证反思只能细化诊断,例如从内圈改为外圈,而不能放弃故障判断,维持证据积累过程的单调性。
平稳降级。LLM 调用失败时,各阶段默认采用保守规则:感知阶段基于阈值检测,验证阶段基于规则修正边带结论。系统始终产生诊断,不无声失败。
每个诊断实例需要 2–5 次 LLM 调用:快速路径不适用时进行一次感知调用,诊断阶段进行若干迭代调用,必要时增加验证与反思调用。端到端延迟每样本 30–90 s,主要由 LLM API 调用决定。
虽然该延迟不适于实时连续监测,但框架适于定期检查、维护决策支持及离线批分析,这些场景优先考虑可解释性和诊断准确率。对于航空发动机、核电等安全关键系统,预期部署方式是在计划维护窗口内离线批量分析记录的振动数据。连续实时告警可由感知智能体的确定性快速路径(3.3.3,第一级)支持,其延迟小于 1 s,且独立于 LLM 可用性。三个 LLM 后端的详细效率指标见补充表 S1。
在阐述属性前,先明确本文“可信性”的范围。它指一组架构设计原则,系统性减少安全关键应用中已识别的 LLM 失效模式,包括幻觉风险、推理不透明、不受控诊断回退及组件无声失败。属性通过消融(4.3)与案例(4.6)进行经验验证,并不构成数学证明或认证级保证意义上的形式化安全保障;它们代表安全关键环境中负责任部署智能体 AI 的工程实践。
第 3.1—3.6 节的架构共同实现以下四种区别于传统 LLM 诊断系统的属性。
属性 1:LLM 推理与信号计算的架构分离。LLM 不处理原始信号,数值运算交由经过验证的工具(3.1.2)。这消除了要求 LLM 解释训练分布外模态所引起的一类幻觉风险;仅传输文本化统计量,而非原始流,也符合安全关键行业隐私要求。
属性 2:可审计的推理溯源。每次诊断附带完整记录:匹配谐波及其与理论值的偏差、经过 SNR 过滤的谱峰、边带证据、感知指标及验证决策(3.3—3.5)。记录使输出从黑箱预测转化为可审计工程建议,支持人机协同决策,使工程师可独立评估歧义样本。
属性 3:安全单调的反思纠正。反思限一次,且防回退规则禁止已识别故障变回正常。这种类似于非递减安全谓词的属性,确保反馈只能细化故障类型,如内圈改为外圈,而不能放弃诊断,从而应对通用 LLM 反思的已知失效模式。
属性 4:组件失效时平稳降级。API 失败或输出格式错误时,各阶段启用保守规则回退(原文引用 3.6.2):感知阶段使用阈值,诊断阶段采用确定性谐波计数最大值,验证阶段使用规则边带纠正。系统在降级状态下仍产生诊断,使基础设施级可靠性不取决于外部 LLM 服务。表 5 的纯确定性消融对此作了验证:全部 LLM 不可用时,仅靠确定性工具链与人工规则仍取得 82.8% 准确率,保留有意义的诊断能力。
四种属性共同构成框架的可信性约定。第 4.3—4.6 节通过消融量化各组件贡献,并用案例展示推理链的可审计性。
(实验及结论见下篇)