首页/文章/ 详情

“数字孪生/故障诊断”专题||数字孪生+视觉语言大模型:用于多场景工业故障诊断(下)

7月前浏览888

工业设备的故障诊断,能不能像 ChatGPT 一样:看懂时频图、说清故障原因、还能给维修建议?这篇一区顶刊论文给出的答案是:可以,数字孪生 × 多模态大模型:工业故障诊断进入“可对话时代”🤖。

本期推荐的这篇是西安交通大学许权宁的文章,本文系统综述了工业故障诊断从“数据驱动深度模型”走向“大模型时代”的完整技术脉络:首先回顾了传统规则/模型/数据三类范式的演进瓶颈,继而梳理了大型语言模型、视觉模型与多模态视觉-语言模型(LVLMs:Large Vision-Language Models)在故障预测与健康管理(PHM:Prognostics and Health Management) 领域的最新进展,指出通用大模型因缺乏工业知识、难以应对跨工况分布漂移与高质量样本稀缺等痛点;在此基础上,重点剖析了数字孪生驱动的深度合成数据、参数高效微调(LoRA:Low-Rank Adaptation)、跨模态对齐与对比学习等关键技术如何协同解决样本不足、域泛化与可解释性三大核心问题,最终提出面向多场景、可对话、可迁移的下一代智能故障诊断大模型研究框架与未来挑战。  

由于文章篇幅过长,小编将分两次为大家翻译介绍这篇论文。第一篇推文系统梳理了大型视觉-语言模型在工业故障诊断中的瓶颈与突破:围绕“高质量跨工况数据难获取、模型通用知识难迁移”两大痛点,作者先回顾数据驱动、模型驱动与知识驱动三类智能诊断范式的演进,指出传统深度方法在跨域泛化上的先天缺陷;随后提出“深度数字孪生”思路,用六自由度轴承动力学+CycleGAN 虚拟-实测闭环映射,低成本生成高保真、多健康状态振动样本,为后续大型视觉-语言模型训练提供足量且物理一致的时频图谱数据,奠定多场景诊断基础。  

本篇推文聚焦实验验证与落地价值。在CWRU、HUST、PU、XJTU四数据集上,FDGLM单工况准确率99.5%,跨工况仍达91.5%,跨数据集95.9%,均显著优于CNN、ViT、VisualGLM等基线;消融试验证实两阶段微调与双损失缺一不可,LoRA秩8、每类3000样本即达最优,数字孪生数据把真实信号相似度从0.5提升到0.92,为工业现场少样本、强噪声环境下的可迁移、可解释智能维护提供了即用型解决方案。 
 

希望对大家的学习有所帮助,文章质量很高同时希望大家可以多多引用。如果有故障诊断相关方向研究人员希望宣传自己研究成果,欢迎大家在公众 号后台与小编联系投稿,大家一起交流学习。  

论文链接:通过点击最左下角的阅读原文进行在线阅读及下载。  

论文基本信息

论文题目: Deep digital twin-powered large vision-language model for multi-scenario industrial fault diagnosis

论文期刊:Advanced Engineering Informatics

Doi:https://doi.org/10.1016/j.aei.2025.103997

作者: Quanning Xu(a), Guangrui Wen(b), Zihao Lei(c),Shulong Gu(d),Yu Su(e),Zhifen Zhang(f),Xuefeng Chen(g)
论文时间: 2025年
机构: 

a National Key Lab of Aerospace Power System and Plas ma Technology, Xi’an Jiaotong University, Xi’an 710049, China

b State Key Laboratory for Manufacturing System Engineering, Xi’an Jiaotong University, Xi’an 710049, China

c School of Mechanical Engineering, Xi’an Jiaotong University, Xi’an, Shaanxi 710049, China

作者简介:许权宁,西安交通大学机械工程学院博士研究生,国家航空航天动力系统与等离子体技术重点实验室、机械制造系统工程国家重点实验室核心成员。长期聚焦工业人工智能、数字孪生与多模态大模型融合研究,近三年在《Advanced Engineering Informatics》等顶刊以一作/通讯身份发表多篇论文,主导开发了面向多场景工业故障诊断的开源框架 FDGLM。(来源:ResearchGate)

摘要

数据驱动的深度学习技术已被广泛采纳于工业健康监测与维护。然而,传统诊断方法常受场景特异性限制且智能能力不足。新近发展的大规模视觉-语言模型为智能故障诊断提供了先进的人机交互范式。本研究通过提出故障诊断通用语言模型(FDGLM:Fault Diagnosis General Language Model)框架,将LVLMs拓展至工业故障诊断,实现跨多种运行工况与数据集的智能化诊断。首先,依托先进数字孪生技术生成高质量振动样本以支撑模型训练;这些样本经短时傅里叶变换(STFT:Short-Time Fourier Transform)处理,生成增强的时频谱图,满足故障诊断通用语言模型(FDGLM:Fault Diagnosis General Language Model)训练对大规模数据的需求。随后,采用低秩自适应策略对预训练视觉模型进行微调,联合交叉熵损失与圆损失以同步提升对工业故障时频特征的判别能力与鲁棒性。接着,利用领域专用文本指令对语言模型进行微调,实现视觉与文本模态的深度对齐,使因果故障分析与维护决策成为可能。最后,在四个独立数据集上开展跨工况与跨数据集实验,结果显示:同工况诊断精度达0.995,变条件为0.890,跨数据集为0.947,同时呈现专业级对话诊断能力。实验结果证实,FDGLM以极小微调代价即可提供适用于工业场景的可靠诊断,性能优于现有框架,为下一代工业装备健康管理提供解决方案。
关键词:大语言模型;大规模视觉-语言模型;故障诊断;多模态大语言模型;数字孪生

目录

1 引言

2 相关研究

   2.1 智能故障诊断

   2.2 大规模模型

3 深度数字孪生模型

   3.1 滚动轴承的虚拟表示

   3.2 虚拟-物理数据流融合

4 所提出的大规模视觉-语言模型

   4.1 模型架构

   4.2 预训练视觉模型的微调

   4.3 查询变换器

   4.4 预训练语言模型的微调

   4.5 实现流程

5 实验验证

   5.1 数据集配置与预处理

   5.2 实验设计与实现细节

   5.3 数字孪生模型验证

   5.4 单工况验证

   5.5 跨工况验证

   5.6 跨数据集验证

   5.7 超参数分析

   5.8 消融实验

6 结论


注:小编能力有限,如有翻译不恰之处,请多多指正~
     若想进一步拜读完整版,请下载原论文进行细读。    

5 实验验证

为全面评估所提出的数字孪生驱动 LVLM 在故障诊断中的性能,本文在四种轴承数据集上开展大量实验,覆盖三大场景:单工况、跨工况与跨数据集泛化。单工况场景仅含一台机器且参数固定,主要考核模型对标准故障模式的识别能力;跨工况场景让同一台机器在不同负载或转速下运行,用以检验模型对工况变化的鲁棒性;跨数据集场景则引入不同机器或实验平台,测试模型对异构数据源的适应性。该评估方案系统验证了所提框架在多样应用场景下的精度与鲁棒性。

5.1 数据集配置与预处理

实验共使用三个公开数据集与一个自采数据集,详情如下:(1) CWRU 轴承数据集:该广泛使用的基准数据集包含健康、内圈故障、外圈故障及滚动体故障四种状态;每种故障按缺陷尺寸再分轻、中、重三级,共在四种负载-转速组合下采集,采样频率 12 kHz,轴承型号 SKF 6205。(2) HUST 轴承数据集:涵盖健康状态及滚动体、内圈、外圈的轻微与严重故障,涉及多转速工况;采用三轴加速度计记录振动信号,轴承型号 ER-16 K,采样频率 25.6 kHz。(3) PU 数据集:包含内圈、外圈及复合故障的多级严重程度;故障通过人工损伤与加速寿命试验引入,采样频率 64 kHz,轴承型号 SKF 6203。(4) XJTU 数据集(研究团队自采):利用轴承故障模拟平台采集,含健康、内圈故障、外圈故障、滚动体故障四种状态,共十二种运行工况,采样频率 12 kHz,轴承型号 SKF 6207。

基于上述数据集,本文构建了对应的多模态图像-文本数据集,用于模型训练与评估。具体而言,以 STFT 将一维振动信号转为二维时频表征:截取 1024 点信号段并变换为时频图像,作为视觉输入。针对数据稀缺问题,利用所提出的深度数字孪生模型预先大规模生成训练样本。每张时频图像配对一条硬提示,如 “What is the fault with the bearing?”,引导语言模型;对应的文本标签依据专家知识预设模板自动生成,内容涵盖诊断结果、健康状态描述及维护建议,亦可借助 ChatGPT 等大语言模型辅助生成。

5.2 实验设计与实现细节

鉴于真实工业场景数据采集困难且大模型天然面临数据稀缺,本研究采用深度数字孪生方法,合成覆盖多种健康状态的大规模振动信号,用于扩充数据集并支撑所提模型的充分训练。为验证框架有效性,本文与传统机器学习算法、深度学习算法及先进计算机视觉分类模型开展对比实验,具体基线方法包括多层感知机(MLP:Multilayer Perceptron)、支持向量机(SVM:Support Vector Machine)、卷积神经网络(CNN:Convolutional Neural Network),以及 VGG16、ResNet18、DenseNet、ViT、Swin Transformer、ConvNeXt、ChatGLM2-6B-chat [10] 和 VisualGLM [32] 等深度模型。为保证评估严谨全面,采用四项广泛认可的指标:召回率(REC:Recall)、F1 分数(F1:F1-score)、准确率(ACC:Accuracy)与精确率(PRE:Precision) [50],每项指标均在多次独立实验上取平均,以降低随机性并增强统计鲁棒性。

所提出的 FDGLM 框架以预训练 ViT为视觉编码器,ChatGLM-6B 为文本编码器。为提升微调性能,LoRA 矩阵被均匀且分层地注入两个编码器的选定层 [7,32,51]:具体而言,LoRA 矩阵嵌入 ViT 的第 0、13、26、38 层以及 ChatGLM-6B 的第 0、13、27 层,并设为可训练参数。训练过程分两阶段,分别进行 10 000 次与 5 000 次迭代,学习率 0.001,批次大小 8。所有训练均在显存 86 GB 的 NVIDIA A40 GPU 上完成。值得注意的是,每种健康状态类别通过第 3 章所述数字孪生框架扩充至 3 000 个样本,确保所有故障类别数据均衡。后续消融实验进一步探究样本量与诊断性能之间的关系。

5.3 数字孪生模型验证

为评估所提出数字孪生模型的有效性,本节对比合成孪生信号与 XJTU 数据集真实测量的相似度与保真度。虚拟-物理映射网络使用 Adam 优化器训练,批次大小为 10,共 500 个 epoch,每类包含 150 个训练样本;初始学习率设为 0.01,每 50 个 epoch 衰减一次。所有实验在 Windows 11 系统、PyTorch 2.1 环境下完成,计算平台为 Intel Core i7-12650H CPU、GeForce RTX 4060 GPU 及 16 GB RAM;更多实现细节见文献 [41]。轴承动态参数汇总于表 1,图 10 给出外圈故障工况下的信号对比。通过定义几何与运行参数,虚拟实体生成各健康状态的仿真振动响应;这些响应经预训练的虚拟-物理映射网络映射,得到对应孪生信号。以外圈故障为例,图 10 在时域、频域与包络域分别对比仿真信号、孪生信号与真实信号;为公平比较,所有信号幅值均归一化至 [-1, 1] 区间。

表1 采用SKF - 6207中的轴承参数

       
       

图10 对比分析了XJTU数据集的外圈故障响应:( a )、( d )和( g )说明了测量数据的时间轮廓、频谱特征和解调频谱;( b )、( e )和( h )与模拟数据相对应;而( c ),( f )和( i )描述了虚拟孪生数据。

在时域中,三种信号均呈现重复性冲击模式且变化趋势一致;仿真信号因虚拟实体理想化构建而波形清晰、冲击尖锐,不含测量噪声、制造公差或安装误差,真实信号则受环境噪声畸化。包络谱中,所有信号均清晰显示故障特征频率及其谐波;值得注意的是,仿真信号对内圈与滚动体缺陷相关频率成分予以强化,而真实信号中这些成分因多源振动与噪声被削弱,给直接模型更新与校准带来困难。包络谱幅值方面,仿真与真实信号在特征频率位置一致但幅度不同,孪生信号有效补偿该失配:在虚拟-物理映射过程中,引入环境与故障相关信息,同时保留测试观测到的高频共振响应,使仿真信号转化为孪生信号后故障频率及谐波得到凸显,表明该方法在吸收环境影响的同时保持故障信息。该性能得益于映射网络的多层级架构:Self-ONN 编码器实现层内高效特征提取,注意力增强跳跃连接强化层间表征,多深度编码器保证多尺度学习,而采用复合损失的对抗训练机制促进跨域信息融合与分布对齐 [41]。

为进一步评估信号相似度,对归一化信号进行分布拟合分析。图 11 给出滚动体、内圈、外圈三类故障在单位时间内的振动响应高斯拟合结果,表明映射网络有效对齐跨域细节与空间特征,融合环境及振动信息,将仿真信号转化为近似真实测量的孪生信号,显著缩小分布差异。此外,采用皮尔逊相关系数量化信号相似度(表 2):仿真-真实信号相似度约 0.5,孪生-真实信号相似度超过 0.92,大幅提升其用于诊断模型训练的价值。

       

图11 数据分布拟合于XJTU数据集。( a )滚动体故障,( b )内圈故障,( c )外圈故障

表2 不同状态下信号相似度的比较

       

5.4 单工况验证

   

表 3 与表 4 分别给出 XJTU 与 HUST 轴承数据集在单一工况下的诊断结果,展示各方法性能。经 STFT 处理后,振动信号的时频表示显著提升了轴承故障状态的可表征性 [52]。在所有轴承状态中,所提 FDGLM 始终优于其他方法,总体诊断准确率超过 99.5%。传统机器学习算法(包括 SVM 与 MLP)表现较差;在训练数据充足的前提下,基于 Transformer 的网络较传统卷积神经网络优势明显,因此 DCNN、ResNet18、DenseNet121 与 VGG16 性能均低于 ViT、Swin-Transformer 及所提 FDGLM。值得注意的是,ResNet18 与 DenseNet121 利用多通道特征复用提升分类性能,在 HUST 数据集上分别取得 95.678% 与 97.282% 的准确率。采用分层移位窗口注意力的 Swin-Transformer 位列第二,在 XJTU 与 HUST 数据集上分别达到 99.300% 与 99.100% 的准确率。ChatGLM2-6B-chat 作为代表性大语言模型,依赖 24 个手工提取的时域与频域特征输入 [10],在两个基准数据集上平均诊断准确率为 98.5% 与 98.2%;然而,其单一文本模态的依赖性限制了诊断能力的进一步提升。相比之下,VisualGLM 采用两阶段协同微调策略进行领域适配,输入为时频图像,在同一基准数据集上分类准确率达到 99.1% 与 98.9%。基于 Transformer 架构的 FDGLM 采用两阶段微调策略优化时频图像特征表示,并利用 Query Transformer 对齐视觉与文本模态。图 12 给出表现最优模型的混淆矩阵,DenseNet121、VGG16、ViT、Swin Transformer、ChatGLM2-6B-chat、VisualGLM 与 FDGLM 均实现接近完美的故障分类。图 12 中,坐标轴标签 1–7 分别对应以下轴承状态:健康状态、轻微与严重滚动体故障、轻微与严重内圈故障、轻微与严重外圈故障。健康状态易于区分,而同类型不同严重程度的故障分类难度较大,导致基线方法出现多数误分类。

         

表3 在XJTU数据集上的对比实验结果

     

         
               

表4 在HUST数据集上的对比实验结果

           
     
     
     
         

图12 对 HUST 数据集上各种方法的混淆矩阵进行比较。(a) 支持向量机 (SVM),(b) 多层感知器 (MLP),© 深度卷积神经网络 (DCNN),(d) ResNet18,(e) DenseNet121,(f) VGG16,(g) ViT,(h) Swin-Transformer,(i) ConvNeXt,(j) ChatGLM2-6B-chat,(k) VisualGLM,(l) FDGLM

     

由表 3 可见,除表现最差的 SVM 外,FDGLM 在微调阶段的可训练参数最少(0.86 M)。尽管总参数量达 72 亿,FDGLM 借助 LoRA 技术,仅在视觉编码器第 0、13、26、38 层与语言编码器第 0、13、27 层插入轻量可训练矩阵,其余预训练参数全部冻结,既保留基座模型表达能力,又实现工业故障诊断的高效领域适配,凸显以极低微调开销完成工业数据处理的巨大潜力。训练平台上,我们对各方法进行单样本推理延迟量化分析:如表 3 所示,传统机器学习与深度学习模型推理时间远短于大规模模型,差异主要源于参数量与结构复杂度。值得注意的是,ChatGLM2-6B-chat 的推理延迟高出一个数量级,根源在于其生成机制与架构设计:相比仅需一次前向的传统判别模型,LLM 通常采用自回归策略生成文本序列,输出长度 L 需 L 次前向,且每次均包含计算开销远高于卷积的自注意力机制;LVLM 额外引入视觉编码器与跨模态融合模块,推理时间最长。未来可通过量化(将权重与激活由高精度转低精度以减少内存、加速计算)、系统级推理优化与模型编译、架构级剪枝与知识蒸馏等手段提升大规模模型推理效率。我们进一步在搭载 i7-12650H 处理器、GeForce RTX 4060 GPU 与 16 GB 内存的笔记本上进行推理实验,延迟虽适度增加,模型仍稳定运行,验证了边缘部署的可行性。

此外,FDGLM 通过人机交互实现智能故障诊断:其友好界面即使对非专业用户也能输出精准健康评估。如图 13 所示,界面分为左右两栏——左侧展示时频谱图与输入区,右侧呈现诊断结果与维护建议。与传统方法仅输出标签不同,FDGLM 依托知识增强语料,可生成详细健康评估、推断潜在故障根因并提供维护指导;同时支持文本与视觉多模态输入,弥合图像诊断与自然语言处理的鸿沟。图 14 与图 15 给出更多健康状态的定性诊断示例,可见模型在不同文本提示下均保持强鲁棒性,持续实现准确故障识别、因果分析与建议生成。作为 PHM(Prognostics and Health Management)领域的重大进展,该视觉-语言框架以智能、交互的解决方案超越传统方法,将精准诊断与易用部署相结合,显著提升工业设备的智能维护水平。

     
   
     
         

图13 轴承健康状态评估人机交互界面的演示

           
               

图14 轴承健康状态评估人机交互界面的演示在HUST数据集上使用FDGLM进行故障诊断的定性案例研究。( a )轻微滚动体故障,( b )严重滚动体故障,( c )轻微内圈故障

             
           
               

图15 不同文本提示的故障诊断定性案例研究。( a )严重的内圈故障,( b )轻微的外圈故障,( c )严重的外圈故障

             
     

为评估通用 LVLM 在工业时频图像识别中的有效性,本研究对比三款代表性模型:Qwen 3、DeepSeek-V3.1 与 GPT-5。图 16 以 HUST 数据集中“轻微内圈故障”时频图为输入,统一查询指令为 “What is the fault with the bearing?”。Qwen 3 仅检测到谱图中与机械缺陷相关的离散异常频率成分,未能指明具体故障类别,亦未提供失效机理解读或维护建议。DeepSeek-V3.1 起初未识别输入为轴承振动信号时频图;在补充提示 “This is a time–frequency diagram of the bearing vibration signal” 后,仍无法判定故障类别,仅能分析潜在原因并给出维护建议。GPT-5 表现最佳,直接识别出内圈故障并构建连贯推理链,但仍缺乏对根本失效机理的解释、决策支持洞察及故障严重度量化。实验揭示通用 LVLM 在工业诊断中的两大关键局限:(i) 专用时频特征辨识能力不足,导致诊断精度下降;(ii) 训练语料工业知识匮乏,制约其生成符合 PHM 需求的失效分析与维护策略。这些缺陷凸显了本文提出 FDGLM 框架在工业故障诊断中的必要性与技术优势。

   
       

图16 在HUST数据集上使用其他LVLM进行故障诊断的定性案例研究。( a ) Qwen 3,( b ) Deepseek-V3 . 1,( c ) GPT - 5

     

5.5 跨工况验证

为评估所提 FDGLM 模型在未见运行工况下的诊断泛化能力,我们利用 CWRU 与 HUST 轴承数据集设计跨工况迁移诊断实验。如表 5 所示,每个数据集包含四种不同的转速-负载组合工况;据此,为每个数据集构建四项跨工况诊断任务(表 6),用以检验模型在不同运行工况下的诊断迁移性能。

           

表5 CWRU和HUST数据集的运行工况

         
       
             
               

表6 跨工况诊断任务配置与诊断准确性

             
         
       
           

实验结果表明,尽管不同运行条件导致分布偏移,FDGLM 在所有跨工况任务中仍保持高诊断准确率:在 CWRU 数据集上,面对转速与负载变化,准确率均超过 93.0%;在转速变化显著的 HUST 数据集上,任务 3 准确率最低(89.0%),四项任务平均准确率达 91.5%。这些结果证实 FDGLM 在单数据集跨工况诊断中具备强适应性与鲁棒性;尽管性能较单工况略有下降,但在未改动模型架构或损失函数的前提下取得该表现,凸显了框架固有的泛化能力。

为深入评估跨工况诊断性能,本文聚焦 HUST 数据集任务 4 开展对比实验,基线方法与第 5.4 节保持一致,所有结果取多次独立运行平均,并给出最优运行的混淆矩阵。如表 7 所示,相较于单工况基准,各方法在跨工况场景下均出现性能下降;FDGLM 仍以 93.3% 的分类准确率领先。Swin-Transformer 与 ConvNeXt 降幅较小(约 1–1.5%),性能逼近 FDGLM;传统 CNN 方法鲁棒性不足,准确率普遍低于 90%。ChatGLM2-6B-chat 仅依赖交叉熵损失进行故障诊断,且受限于单一文本模态,跨域诊断效能受限;VisualGLM 虽采用结合交叉熵与对比损失的两阶段协同优化策略,但在工况差异显著的跨域工况下表现仍不理想,表明传统对比损失仍有较大改进空间。

表7 在HUST数据集上针对任务4的对比实验结果

         

图 17 的坐标轴定义与图 12 保持一致。图 17 显示,与第 5.4 节中同一故障类别内的严重程度误分不同,跨工况验证导致更复杂且分散的错误模式:工况偏移使多数基线模型不仅混淆同一故障的不同严重程度,还错分不同故障类型,充分暴露这些模型在未见工况下面对分布偏移时的泛化局限。FDGLM 在跨工况任务中的鲁棒性部分源于视觉编码器微调阶段采用的 Circle 对比损失——该损失通过增大正样本对相似度、减小负样本对相似度,优化特征空间,促使模型学到在工况变化下仍保持稳定的判别性故障特征,从而提升分布偏移下的泛化能力。总体而言,结果表明 FDGLM 能够捕捉轴承信号在不同工况下的共性故障模式,并将其泛化至未见场景进行诊断,显著增强了模型在多变工况内的诊断泛化能力。

       
     
       
         
         
           

图17 在HUST数据集上对任务4的各种方法的混淆矩阵进行比较。( a ) SVM,( b ) MLP,( c ) Dcnn,( D ) Resnet18,( E ) Densenet121,( f ) Vgg16,( G ) VIT,( H ) Swin-Transform,( I ) Convnext,( J ) Chatglm2-6B-Chat,( K ) Visualglm,( L ) Fdglm

           
             

5.6 跨数据集验证

为评估所提 FDGLM 模型的跨域诊断能力,本文利用 XJTU、CWRU、HUST 与 PU 四个独立轴承数据集开展全面跨数据集迁移诊断实验。实验设计确保各数据集健康状态类别严格一致,仅聚焦三类代表性状态:健康、内圈故障与外圈故障。各数据集在轴承型号(如 SKF6205、ER-16 K、SKF6207)、运行工况(转速与负载变化)及环境噪声等方面存在显著异质性,给故障诊断的领域适配带来巨大挑战。表 8 汇总了实验设置与诊断性能。

                     

表8 跨数据集诊断任务配置与诊断准确率

                   
                 

FDGLM 在所有跨数据集任务中的平均分类准确率达 95.9%,彰显其出色的领域泛化能力;值得注意的是,跨数据集任务的平均诊断精度高于跨工况场景,这可归因于跨数据集设置中健康类别更少、诊断目标更一致。任务 1 获得最高诊断准确率,表明模型对 XJTU 数据集的适应性最佳。HUST 数据集采用 ER-16 K 轴承,与其他三个数据集使用的 SKF 系列差异显著,导致任务 3 分类准确率最低(94.7%),说明诊断模型对轴承型号变化存在一定敏感性——该敏感性源于轴承型号与负载-转速条件交互带来的显著分布偏移。结果证实,即使在完全不同数据集上训练与测试,FDGLM 仍保持强劲诊断性能,体现出其提取域不变故障特征并将知识有效迁移至未见领域的能力,显著提升了模型的跨域泛化水平。

                     

5.7 超参数分析              

                 

5.7.1 LoRA矩阵的秩

本节研究 LoRA 矩阵秩对所提模型微调性能的影响。LoRA 秩直接决定微调期间引入的可训练参数数量,并显著影响模型对轴承故障诊断的适应能力。尽管更高秩在理论上提供更大参数容量,实际微调性能仍受计算资源、样本规模等实验条件约束。为隔离这些因素,我们在受控实验设置下分析 LoRA 秩与诊断准确率的关系;不同层中的所有 LoRA 矩阵共享同一秩配置。

如表 9 所示,秩按 2 的幂次系统设置为 4、8、16、32 与 64 [32],并在此配置下评估预训练 ViT 与 ChatGLM-6B 的微调性能。提高秩可扩大可训练参数规模、增强模型表征能力,但也增加数据需求与计算开销。实验结果表明,在计算与数据资源受限条件下,诊断准确率并非随 LoRA 秩单调上升,而是呈现非单调趋势:当秩设为 8 时,可训练参数总量为 0.86 M,FDGLM 取得最佳性能;秩超过 16 后,准确率较峰值略有下降,原因在于额外参数在有限数据与硬件条件下引入更高的过拟合风险与优化难度。因此,秩 = 8 在当前配置下达到最优,并被用于本研究所有基于 LoRA 的微调。

                         

表9 不同LoRA矩阵秩次下的诊断性能

                       
                     
                 
                   
                   
                     

5.7.2 训练数据量

如前所述,真实轴承振动数据不足以支撑大规模视觉-语言模型训练:例如,CWRU 与 HUST 数据集采样频率分别为 12 kHz 与 25.6 kHz,但每种健康状态仅提供约 10 s 有效数据;采用 1024 点无重叠分段,每类仅生成约 117 与 250 个样本。即便借助重采样等数据增广,样本总量仍远低于有效训练需求,且增广可能加剧过拟合风险。工业现场故障呈偶发、昂贵特性,进一步导致样本不平衡等复杂挑战。为缓解数据稀缺,本文采用深度数字孪生框架合成覆盖不同健康状态的多样化振动信号;本节考察合成数据集规模与诊断性能之间的关系。

为评估训练数据量的影响并确定达到高准确率所需的最小样本规模,本文开展控制实验:在固定全部超参数与架构的前提下,测试每类 1 000、2 000、3 000、4 000 及 5 000 张时频图像五种样本量,这些图像均由合成振动信号经 STFT 生成;模型在每种配置下训练,并在独立测试集上评估。如图 18 所示,实验结果显示样本量与诊断准确率呈强相关:当每类样本为 1 000 与 2 000 时,模型准确率分别为 0.911 与 0.933,未达理论潜力,表明有限数据无法覆盖故障变异,削弱特征鲁棒性;当每类样本增至 3 000 时,准确率大幅提升至 0.995;继续增至 4 000 与 5 000 仅带来边际提升,无统计学显著改善。因此,在当前数字孪生配置、模型架构与计算约束下,每类 3 000 样本足以使 FDGLM 性能接近最优,结果证实深度数字孪生在扩充训练数据、缓解真实数据局限方面的有效性。

                         
                             

图18 不同样本量下的诊断性能

                           
                         
                             
                             

5.8 消融实验

为严格评估 FDGLM 框架各核心组件的有效性与适应性,本节开展全面消融实验。整体 FDGLM 微调流程分两大阶段:视觉模型微调与语言模型微调。具体而言,在预训练视觉主干适配过程中引入两类损失函数进行联合优化:(1)交叉熵损失,用于增强故障类别可判别性;(2)Circle 对比损失,旨在提升所学特征表示的鲁棒性与泛化性。据此,本研究系统探究两微调阶段的单独及联合效应,以及上述两种视觉损失函数的各自贡献与协同作用。

为保证公平与可比性,所有消融实验仅变动被测组件,其余配置完全一致;评估在 HUST 数据集单一工况下进行,结果汇总于表 10。若直接将预训练语言与视觉模型用于工业数据而不经 LoRA 微调,诊断性能急剧下降,表明预训练模型仅与通用视觉-文本输入对齐,难以从工业谱图中提取具有判别力的类别相关特征。仅微调语言模型时,诊断准确率显著下降且不稳定,说明视觉编码器若未适配,模型无法捕捉显著时频模式,诊断能力受限。单独使用交叉熵或 Circle 损失,诊断准确率分别为 0.977 与 0.973;二者在视觉模型微调中联合应用时,诊断性能进一步提升,凸显互补性:交叉熵损失强化决策边界学习,Circle 损失促进更具判别力且鲁棒的特征嵌入,协同提升编码器提取有效故障特征的能力。借助优化后的视觉编码器,再对语言模型进行微调,可将更丰富的视觉语义与文本表征融合,带来显著性能增益。综上,消融研究证实:视觉模型微调是 FDGLM 适配工业故障诊断的基础;交叉熵与 Circle 损失联合使用优于单独应用;所引入的两阶段微调方案通过联合优化视觉与语言组件,充分释放模型潜力,实现准确且鲁棒的故障诊断。

                             

表10 不同成分的消融研究结果

                             
                             
                             
                             

6 结论

本文提出一种新颖的数字孪生驱动大规模视觉-语言模型 FDGLM,为工业装备故障诊断提供智能、交互式解决方案。针对高质量多模态训练数据获取难题,采用深度数字孪生技术合成物理一致的振动信号,构建大规模训练语料;并引入两阶段领域适配策略,弥合通用预训练模型与特定工业应用之间的鸿沟。具体而言,视觉编码器以 LoRA 微调,联合交叉熵与 Circle 对比损失,增强时频图像的模式识别能力;语言编码器则借助专家诊断语料微调,实现跨模态语义对齐、故障推理与维护决策支持。大量实验表明,FDGLM 在多种诊断场景中表现优异:单工况准确率 99.6%,变工况 91.5%,跨数据集迁移 95.9%。超参数调优确定了最佳 LoRA 秩与最少样本量;消融研究验证了两阶段适配策略及集成视觉损失设计的有效性。本研究为工业系统智能运维开辟了新范式。未来工作将聚焦于解决真实工业环境中突发故障带来的小样本与零样本挑战;此外,

编辑:赵栓栓

校核:李正平、陈凯歌、曹希铭、赵学功、白亮、任超、海洋、陈宇航、Kira、Tina、王金、赵诚、肖鑫鑫、张优

该文资料搜集自网络,仅用作学术分享,不做商业用途,若侵权,后台联系小编进行删除


来源:故障诊断与python学习

ACTMechanicalSystem振动通用航空航天python海洋LMS理论电机多尺度数字孪生控制试验人工智能数控
著作权归作者所有,欢迎分享,未经许可,不得转载
首次发布时间:2026-02-26
最近编辑:7月前
故障诊断与python学习
硕士 签名征集中
获赞 87粉丝 153文章 336课程 0
点赞
收藏
作者推荐

论文学习||AgentOps:面向LLM智能体系统的运维框架综述(上)

随着大模型智能体与AI技术的迅猛发展,智能体正逐步渗透至各行各业,成为人机交互、任务自动化与系统智能化的核心载体。然而,智能体在日益复杂的环境与场景中持续运行,其行为可控性、系统稳定性与长期可靠性也面临全新挑战——智能体的运维及异常检测,逐渐从幕后走向关键地位,成为保障其安全、高效、可持续运行的重要基石。 本期给大家推荐一篇关于大语言模型智能体运维的前沿综述论文:《AgentOps:面向LLM智能体系统的运维框架综述》,开创性地提出了针对智能体系统的全生命周期运维新范式。该研究系统定义了智能体系统的异常体系,将其划分为"智能体内部异常"与"智能体间异常"两大核心类别。论文构建了包含监控、异常检测、根因分析、修复验证四大关键阶段的AgentOps(Agent System Operations,智能体系统运维)闭环框架,显著提升了智能体系统在不确定性环境下的自愈能力与运行可靠性。相比传统AIOps方法,AgentOps首次将模型参数、注意力图谱、思维链快照等语义级数据纳入监控范畴,有力解决了智能体系统"黑箱"难题。由于文章篇幅过长,小编将分两次为大家翻译介绍这篇论文。论文链接:通过点击本文左下角的阅读原文进行在线阅读及下载。 论文基本信息论文题目: A Survey on AgentOps: Categorization, Challenges, and Future Directions论文来源:arXivDoi:https://doi.org/10.48550/arXiv.2508.02121github地址:https://github.com/linafaik08/agentic-investor-brief作者: Zexin Wang1,*, Jingjing Li1, Quan Zhou1, Haotian Si1, Yuanhao Liu2, Jianhui Li1, Gaogang Xie1, Fei Sun3, Dan Pei4, Changhua Pei1 论文时间: 2025年8月 机构: 1:Computer Network Information Center, Chinese Academy of Sciences, China 2:Hangzhou Institute for Advanced Study, University of Chinese Academy of Sciences., China 3:Institute of Computing Technology, Chinese Academy of Sciences, China 4:Tsinghua University, China摘要随着大语言模型(LLMs)推理能力的持续提升,基于LLM的智能体系统在灵活性和可解释性方面较传统系统更具优势,因而备受关注。然而,尽管智能体系统在学术界和工业界广受研究关注并得到广泛应用,但这类系统与传统系统一样,常会遭遇异常现象。这些异常导致系统不稳定且存在安全隐患,阻碍了其进一步发展。因此,亟需建立一套全面系统的智能体系统运维方法论。遗憾的是,当前关于智能体系统运维的研究尚显匮乏。为填补这一空白,本文开展了智能体系统运维的系统性调研,旨在构建清晰的领域框架、界定核心挑战并推动后续发展。本文首先系统定义智能体系统中的异常现象,将其划分为智能体内部异常与智能体之间异常两大类。随后提出名为"智能体系统运维(AgentOps)"的创新性综合运维框架。本文详细阐释了该框架的四个关键阶段:监控、异常检测、根本原因分析及问题解决,并给出了具体定义。关键词:人工智能;软件与应用安全;智能体系统,运营 目录1 引言 2 智能体系统的分类 2.1 智能体系统的定义 2.2 智能体分类3 智能体系统中的异常现象 3.1 智能体系统中异常的定义 3.2 智能体内部异常 3.3 智能体间异常 4 智能体系统运维 4.1 运维演变 4.2 传统系统运维与智能体系统运维的区别 4.3 结论 5 监控智能体系统 5.1 监测数据示意图 5.2 当前监测方法 5.3 挑战 6 异常检测 6.1 推理异常 6.2 规划异常 6.3 动作异常 6.4 内存异常 6.5 环境异常 6.6 任务规范异常 6.7 安全异常 6.8 通信异常 6.9 信任异常 6.10 涌现行为异常 6.11 终止异常 7 根本原因分析 7.1 代理失败根本原因分类体系 7.2 从异常检测到根本原因分析的映射 8 解决方案 8.1 解决方案验证 8.2 解析模式:迭代修复与多轮验证 8.3 代理系统的异常解决 9 AgentOps的挑战与未来方向 9.1 监测 9.2 异常检测 9.3 根本原因分析 9.4 解决方案 10 结论注:小编能力有限,如有翻译不恰之处,请多多指正~若想进一步拜读完整版,请下载原论文进行细读。 1 引言随着DeepSeek-R1[35]和Claude[4]等技术的出现,当前大型语言模型(LLMs)的推理能力正持续增强。基于LLMs构建的智能体系统--尤其是多智能体系统--凭借其强大的认知引擎特性,已具备完成各类复杂任务与社会模拟[60]的能力,当配备多样化工具时[78]表现尤为突出。相较于微服务架构[75]等传统系统,智能体系统能提供更优的自动化水平、增强的可解释性及更强的灵活性。因此,代理系统的研究与工业应用蓬勃发展,越来越多的在线服务[50],例如客户支持和推荐系统,开始采用这些代理系统。 图1 智能体系统的异常现象。左侧展示任务执行过程中的异常情况,智能体在整合网络搜索结果时出现幻觉,导致生成错误答案。右侧呈现拍卖角色扮演模拟中的异常现象,对买家1的攻击引发异常高价竞标,最终导致拍卖崩 盘。 然而,尽管智能体系统应用广泛,其缺陷依然存在。相较于传统微服务系统,智能体系统提供的更高灵活性也带来了更多异常现象。如图1所示,任务执行常因幻觉等问题而失败。在角色扮演场景中,对单个智能体的攻击可能导致整个模拟系统的崩溃。因此,为保障智能体系统的安全稳定并推动其持续发展,高效的运维机制至关重要。 尽管运维技术历经演变--从早期的手动操作到基于规则的方法,再到后来的IT运维人工智能(AIOps),但代理系统与传统系统在根本上存在显著差异。基于大型语言模型(LLM)的智能体行为特征与硬编码传统系统存在根本差异,主要区别包括:(1)智能体系统中出现的异常类型更为多样;(2)智能体系统对可观测性要求远高于传统系统,需重点关注LLM等模块;(3)异常的多样性使得统一方法无法在智能体系统中实现异常检测与根本原因分析。(4)代理系统的故障处置相对复杂且具有挑战性,需要多维度考量与迭代优化。因此传统运维技术难以适用于代理系统,亟需针对该类系统开发定制化的新型运维技术。 目前,针对智能体系统有效运行维护策略的综合性研究尚显不足。多数研究仍聚焦于智能体系统的孤立方面,而非解决其整体运行挑战。例如,Durante等[27]阐述了智能体范式与分类体系;Chakraborty等人[12]深入探讨基础模型中的幻觉现象,涵盖其定义与检测方法;Deng等人[24]研究多智能体系统安全问题,主要涉及外部恶意攻击,并将威胁划分为执行内安全与交互安全两类;Shi等人[85]则详细剖析了图形用户界面智能体的安全问题及评估方法。 为进一步推动智能体系统的发展,本文提出智能体系统运维(AgentOps)的概念--这是专为智能体系统设计的新型运维框架。首先,本文对智能体系统中的异常现象给出了精确定义并提出系统性分类框架,主要将异常分为代理内部异常与代理间异常两类。这两大类涵盖了代理系统生命周期中的执行前、执行中及执行后阶段。此外,借鉴传统运维实践,本文将代理系统的运维流程划分为四个阶段:监控、异常检测、根本原因分析及问题解决。针对每个阶段,本文识别出代理系统中出现的新挑战,并提出详细定义与潜在解决方案。据本文所知,这是首次系统性提出AgentOps概念并规范其各项流程定义的研究。2 智能体系统的分类2.1 智能体系统的定义智能体系统指能够感知环境、自主决策、执行行动并最终完成任务的智能系统。这类系统通常由多个智能体构成,并具备四项核心能力[69]。随着大型语言模型的兴起与发展,当代智能体系统常基于这些模型构建,因其在多模态数据理解与推理方面具备卓越能力,且擅长工具运用。因此,本文主要聚焦于基于大型语言模型的智能体系统运作机制。 l 、工具调用:基于大型语言模型的智能体系统通过工具调用与环境交互,持续获取观测数据作为反馈。该反馈为自动化推理与决策过程提供参考依据。早期实现中,工具调用通过函数调用完成--针对特定任务编写专用函数,并将函数描述格式化后输入至大型语言模型。然而不同语言模型间的差异导致格式及其他信息需频繁调整。模型上下文协议(MCP)[3]通过标准化大型语言模型、外部数据源与工具之间的通信协议从根本上解决了这一问题。MCP的引入既促进了服务提供商开发对应服务API,同时避免了资源浪费。 2、推理与行动:随着DeepSeek-R1[35]等具备推理能力的LLM出现,大型语言模型的推理能力日益强大,足以支撑基于LLM的智能体系统实现自动化决策并执行各类复杂任务。众多方法通过提示工程有效调用LLM的推理能力来增强智能体系统。例如:Chain-of-Thought[105]采用少样本方法引导LLM逐步推理;ReAct[109]提出"思考先行于行动"的策略;Reflexion[88]则建议在特定周期后对完整推理路径进行反思。 3、短期与长期记忆:与人类相似,基于大型语言模型的智能体系统因令牌长度限制而具有有限的知识存储能力,因此需要有效的知识管理机制。常见的知识管理范式是将信息划分为短期记忆与长期记忆。短期记忆包含与当前任务密切相关的少量知识和观察结果,通常通过提示工程提供给大型语言模型。长期记忆则包含大量虽与当前任务关联性不强,但可在任务执行特定步骤时调用的知识库。长期记忆通常通过检索增强生成(RAG)和向量数据库进行管理。当需要调用知识时,系统会基于查询向量与知识向量间的相似度进行检索。诸如GraphRAG[28]等RAG与向量数据库的创新技术,正持续推动该领域的发展。 4、智能体通信:尽管多智能体系统日益受到关注,但大量研究表明,在许多场景中,其性能有时并不优于单一智能体。这凸显了智能体通信的关键作用。有效的分工与协作理应带来更优结果。因此,针对大型语言模型(LLM)代理的通信标准与协议已陆续提出,其中包括广为人知的代理间通信(A2A)[18]协议。A2A协议引入了代理卡片的概念,用于系统化定义每个代理的能力,同时使客户端代理能够高效管理任务及所有参与代理。2.2 智能体分类在基于大型语言模型(LLMs)的智能体系统研究中,可根据参与智能体的数量进行基础分类。如图2所示,智能体系统可分为单智能体系统(SAS)与多智能体系统(MAS)。SAS系统以单个大型语言模型驱动的智能体为核⼼处理单元。图2 智能体系统的分类体系 这类系统通常应用于以下类型任务:推理:该智能体通过调用内置知识或上下文线索,执行逻辑或数学推理以及因果推理。例如,AI科学家[67]通过开放式推理过程探索自动化科学发现。 对话:智能体维持对话状态,解析用户意图,并生成语义连贯的回应。对话任务已超越文本交互范畴,延伸至包含图像、音频和视频的多模态沟通,例如GPT-4o[52]等系统所展示的应用。 交互:智能体通过信息交换或执行操作,直接与相对简单且可预测的外部环境进行交互。典型代表是WebArena[122],其中智能体与结构化网页界面进行交互。 相比之下,多智能体系统(MAS)由多个基于大型语言模型(LLM)的智能体在共享环境中协同运作。这些智能体既可相互协作,亦可相互竞争,使得MAS特别适用于处理单智能体系统难以应对的分布式、并发性或战略复杂性问题。典型的MAS应用包括: 角色扮演与仿真:智能体被赋予特定身份、背景及行为规则,并在预定义框架内以符合角色特性的方式互动。此类仿真可研究由微观层面的交互所引发的宏观层面的涌现现象,例如社会动态、经济系统及疫情传播。典型案例包括模拟地缘政治冲突的WarAgent[48],以及建模宏观经济活动的EconAgent[60]。 合作与协作:多个智能体共享共同或部分一致的目标,并通过任务分解、协商和信息交换来实现这些目标。例如,在ChatDev[77]中,智能体协同参与代码生成和调试工作。 博弈论互动:在目标可能冲突的情境中,行为主体必须在决策过程中考虑他人的策略。这涉及以下要素:竞争、谈判与激励机制设计,例如拍卖、多方博弈和零和博弈[45]。 值得注意的是,多智能体系统(MAS)能够完成传统智能体系统(SAS)的任务,且通常能提升性能。然而,这需要付出系统复杂性增加、潜在突发故障风险及更高维护成本的代价。因此,在SAS与MAS之间进行选择时,应基于目标应用领域的具体需求与约束条件[33]。3 智能体系统中的异常现象3.1 智能体系统中异常的定义前文指出,各类智能体系统的成功率并不高,表明存在大量阻碍任务任务成功完成的异常情况。根据Who&When[116]的研究,他们认为这些系统中的异常主要发生在任务执行的特定步骤。具体而言,若在某个异常步骤进行干预使其转化为常规步骤,从而确保任务成功完成,则该步骤即可被识别为异常步骤。然而,这一定义相当有限。传统微服务系统通常能长期稳定运行,无需考虑执行前与执行后阶段。相比之下,智能体系统的任务执行与其执行前提示密切相关,而执行后成功完成并不必然意味着未发生异常(例如推理幻觉等仍可能导致错误结果)。因此,如图3所示,本文将智能体系统中的异常定义为:在执行前、执行中或执行后阶段出现的任何导致任务中断或无法有效完成的情况。 图3 智能体系统中异常的定义基于上述定义,本文提出了一种针对智能体系统异常的新分类方法。如前所述,智能体系统可分为单智能体系统和多智能体系统。因此,异常既可能发生在单个智能体内部,也可能出现在多智能体交互过程中。这类似于传统服务架构中,异常既可能出现在单个服务的内部流程中,也可能发生在服务间通信过程中。因此,如图4所示,本文将所有异常归类为两类:智能体内部异常与智能体间异常。图4 智能体系统中的异常分类体系3.2 智能体内部异常 要完成复杂任务,智能体系统需要多个智能体协同完成不同子任务。智能体执行这些子任务的过程占据了任务执行时间的大部分。在执行子任务期间,智能体必须进行推理与规划,同时通过多种方式与环境交互,这极易导致异常现象的发生。代理系统中最常见的是代理内部异常。 1、推理异常。智能体利用认知系统进行推理,进而指导后续行动,并为完成复杂任务奠定基础。近年来,众多方法被提出以增强推理能力,包括精细调整方法(如 SFT[104]、RLHF[73]、Search-R1[53]和 DeepSeek-R1[35])以及(如CoT[105]、Reflexion[88]、Self-Consistency[102]、CoK[61]和StepBack[119]等提示工程技术。尽管这些技术提供了支持,推理过程中仍频繁现异常现象。 2、规划异常。自主规划与工具调用是智能体系统完成任务的核心功能。然而,受限于当前大型语言模型的概率特性,规划异常不可避免。此类异常通常源于规划阶段出现的幻觉现象。Park等[74]指出,幻觉表现为系统在解释待执行操作的不确定性时,错误预测自主系统的可行性。Kwon等人[55]观察到LLM常产生与前期推理相悖的行动方案。Wang等人[97]与Ren等人[82]指出,LLM这类生成式模型极易产出不合逻辑且错误的规划方案。Hu等人[46]将幻觉定义为与不存在实体(如错误工具或参数)的交互行为。综上所述,规划异常显著影响任务规划阶段,常导致任务失败,因此亟需重点关注。 3、操作异常。在智能体系统中,初始操作通过函数调用实现。然而,由于接口非标准化和不一致等问题,操作异常容易发生。WANG 等[98]指出函数调用实践中的挑战,如延迟、API选择错误和系统故障。Wu等人[106]指出函数调用存在"越狱"风险:攻击者可构造特殊请求,诱使LLM调用敏感函数或绕过限制。MCP的出现已实现LLM与工具交互的标准化。然而,MCP并非万能良方;在实际应用中,MCP服务器的配置变更常导致操作异常[91]。 4、记忆异常。如前所述,智能体系统的记忆分为短期记忆与长期记忆。短期记忆指大型语言模型的上下文范围。即便当前大型语言模型的上下文范围不断扩展,仍常无法满足任务需求。因此许多智能体框架采用滑动窗口管理上下文,这可能导致重要初始信息(如任务完成指令)的丢失。即使LLM上下文容量满足任务需求,刘等[65]的研究表明,LLM常会忽略长上下文中段的信息。PI-LLM[95]也证实了LLM在工作记忆方面存在瓶颈。5、环境异常。随着智能体系统的规模持续扩大,它们消耗了大量资源,尤其当智能体在本地执行资源密集型操作时。这可能导致环境相关的异常,例如资源不足或CPU使用率过高。3.2 智能间异常 1、任务规范异常。Cemri等人[11]指出,许多任务层面的失败源于任务定义不清,例如提示语不够明确。Altmann等人[2]强调,当任务定义不完善时,即使每个智能体的个体行为相对合理,也容易导致追逐和阻塞等情况。SentinelAgent[41]指出,当任务描述或提示未能充分涵盖潜在协作模式时,智能体可能偏离目标、形成串通,或出现提示注入等不可预见行为。因此,在执行前阶段评估任务描述的完整性,并在执行阶段进行反馈调整,是至关重要的操作步骤。 2、安全异常。尽管已开发出A2A[34]和ACP[51]等协议来标准化代理之间的通信,但它们仅确保不同代理能使用相同协议进行通信,并未解决协议整体的安全性问题。Frost等人[31]指出,在现实中的智能体系统中,某些智能体可能遭受恶意攻击,导致其频繁发送请求或消息,类似于分布式拒绝服务(DDoS)攻击。He 等[39]提出针对智能体系统的特定攻击方法(如图5所示),这些攻击既可针对智能体本身,也可针对智能体间的通信。 图5 不同类型的攻击3、通信异常。正如Bronsdon[10]所强调的,在代理间消息交换过程中常会出现通信异常。这些异常具体表现为消息风暴--由过量消息传递引发,可能导致资源耗尽和延迟增加,最终造成任务失败。AgentPrune[112]同时指出消息冗余问题,强调过量消息并不能提升智能体系统的效率,反而会因冗余导致智能体迷失方向。 4、信任异常。ATrust[38]指出,大型语言模型(LLM)代理对所有接收到的消息一视同仁。He等[40]强调,LLM代理在接受其他代理的消息并将其纳入自身上下文时,既不进行一致性验证,也不考虑这些消息是否可信。然而不同代理的基础模型可能存在差异,加之记忆能力等因素的差别,它们在特定领域的处理能力也可能存在显著差异。例如,代码代理的编程能力明显强于通用型代理。因此不应统一对待不同代理的消息。盲目信任所有代理消息可能导致信息冲突或错误;反之若完全不信任任何代理,系统又将丧失协作能力。代理间的信任问题作为影响协作效率的关键因素,亟待解决。 5、涌现行为异常。Sanjeev[83]指出,当多个智能体相互作用时,会产生宏观模式或行为,这些模式或行为在单独分析智能体时难以预测或解释,即为涌现行为。布朗斯顿[10]认为,涌现行为异常源于多实体间的复杂交互,由此产生的系统级行为无法归因于任何单一实体。因此,涌现行为异常虽属于相对较少被理解的异常类别,却可能引发严重后果。 6、终止异常。Cemri等[11]与微软[70]均将过早终止异常视为智能体系统中的重要异常类别。Smurfs[14]指出,在单智能体模式下,深度优先搜索决策树(DFSDT)常面临过早终止问题--系统在未完成多步推理时便过快调用终止工具。该问题会严重影响复杂任务的完整性与逻辑一致性。Zhang等[116]将过早终止识别为多智能体系统中常见且可精确定位的故障根源。4 智能体系统运维本节将深入探讨AgentOps的起源、定义及具体范畴。本文将首先追溯运维的演变历程,该历程自然引出了AgentOps概念。随后,本文将概述AgentOps与传统运维在不同阶段的主要差异,阐明传统运维为何无法应对智能体系统的挑战。最后,将给出AgentOps的精确定义。4.1 运维演变如图6所示,运维技术历经时代演进持续进步。从早期的手动运维到后期的基于规则的自动化运维,每个阶段都标志着重大飞跃。机器学习的迅猛发展,尤其是深度学习的突破,进一步推动了运维技术的革新。近年来,大型语言模型(LLM)强大的推理与分析能力催生了越来越多采用LLM智能体实现自动化运维的方法。 图6 操作演进历程 除了运维技术的演进,运维对象也发生了转变。最初,运维工作仅聚焦于传统软硬件系统,如微服务系统。随着机器学习的快速发展,模型规模日益庞大,训练与推理等过程中故障频发。这催生了管理机器学习模型的各类运维技术--即MLOps。近年来,大型语言模型(LLM)代理已能自主完成任务,促使众多服务采用智能体替代传统模式。由此,智能体系统已成为当今行业服务构建的主流方式。然而智能体系统与传统系统存在本质差异:传统系统行为由底层代码决定,具有确定性;而智能体系统基于概率模型构建,其推理与行动具有随机性。因此智能体系统的运维方式与传统系统截然不同,直接套用传统技术并不可行。为此本文提出AgentOps(智能体运维)概念,下文将详细阐述传统系统运维与 AgentOps的区别。4.2 传统系统运维与智能体系统运维的区别4.2.1 操作时间线如图7所示,该行业通常将操作划分为四个阶段:监控、异常检测、根本原因分析和解决。 l监控:在监控阶段,可观测性工具被部署以尽可能全面地从多维度收集系统运行时数据。这包括指标、日志、追踪等内容,为后续异常检测等流程提供关键支持。 异常检测:当系统故障发生时,必须利用监控数据及时发现异常。这有助于在短时间内阻止故障进一步蔓延,从而最大限度地降低潜在影响。 根本原因分析:当系统发生故障时,问题可能通过不同组件的调用而蔓延,导致多个组件触发警报。唯有通过根本原因分析才能找出问题根源,从而实现快速解决。 解决方案:通过上述流程确定根本原因后,可通过通知站点可靠性工程师(SRE)或采用自动化修复方法解决问题。 图7 传统系统操作与智能体系统操作的比较4.2.2 传统系统运维与智能体系统运维的差异如图7所示,尽管传统系统运维与代理系统运维的时间线相似,但两者在每个阶段都存在显著差异。这正是需要建立全新运维框架--AgentOps的原因。下文将详细阐述这些差异。 监控:主要差异在于监控数据的类型。基于OpenTelemetry[8]的传统系统运行监控侧重于指标、日志和追踪数据,这些数据反映系统的实际运行状态,可用于系统状态的逆向工程。然而对于代理系统而言,根本区别在于服务由大型语言模型(LLM)代理提供,其本质具有随机性。这要求对LLM代理的相关模块进行额外监控。LLM代理主要由语言模型和代理组件构成。针对语言模型部分,监控需涵盖模型参数、注意力图、令牌对数等相关状态;而代理组件则必须在每个步骤监控检查点(如内存和环境状态)。监控这些代理层级的检查点不仅能更清晰地把握代理系统状态,还便于执行回滚操作--这正是代理系统相较传统系统在可操作性方面的重要优势。 异常检测:差异主要体现在异常检测的应用时机上。传统系统运维应用于确定性系统时,依赖的数据通常被认为准确可靠,可直接作为异常检测的输入。而智能体系统通过 LLM 智能体生成数据,其正确性无法保证。因此异常检测不仅需验证数据生成的合理性,还需利用这些数据进一步评估系统状态。 根本原因分析:差异主要体现在定位的对象和粒度层面。传统根本原因分析侧重于识别服务、Pod或环境层面的问题,甚至深入代码层面。而对于代理系统,由于涉及LLM代理,定位可能需要识别代理的具体行为,或在 LLM 处理流程的特定步骤中识别幻觉现象。 决议:主要差异在于决议过程。在传统系统运行中,一旦明确故障的精确位置和原因,即可通过基于相关领域知识的确定性程序迅速解决问题。而在智能体系统中,由于内在随机性,解决过程具有长期性和复杂性,需要持续测试并可能回滚(利用监测阶段的相关数据),最终才能达到最优状态。例如,若智能体系统异常的根本原因是提示词不合理,则可能需要持续进行提示词优化测试。 4.3 结论 基于上述差异,本文将代理化系统运维(AgentOps)定义为涵盖执行前、执行中及执行后阶段的综合运维框架。与传统系统运维类似,AgentOps同样包含四个阶段:监控、异常检测、根本原因分析及问题解决。AgentOps与传统系统运维(如AIOps)的根本差异在于运维主体的本质。这种主体性质的区别导致各阶段呈现显著差异,每个阶段都需要全新的技术解决方案。 5 监控智能体系统5.1 监测数据示意图5.1.1 传统数据在传统监控数据中,使用OpenTelemetry[8]收集的指标、日志和追踪数据同时存在于微服务系统和代理系统中。然而,如前所述,代理系统中的数据与微服务系统中的数据存在显著差异。传统微服务系统通常侧重于监控系统指标和应用性能监控(APM)指标。然而在融合了LLM智能体的智能体系统中,则引入了与LLM及智能体相关的额外指标,例如LLM延迟和工具调用延迟。此外,由于成本是智能体系统的重要考量因素,还包含了各类成本相关指标,如消耗的令牌数量。在当前垂直行业的智能体系统应用中,RAG技术不可或缺,因此也需要相关的RAG指标。 关于追踪,如图8所示,微服务追踪通常指通过API 调用实现的服务间交互。这些API调用的参数由用户操作或预定义系统规则决定,因此相对稳定且直观。但在智能体系统中,每个智能体的输入输出及其与工具的交互(包括智能体间调用)往往由大型语言模型生成,引入了高度不确定性。这些不确定性正是追踪数据的核心要素——因此在智能体系统中,追踪不仅涵盖智能体与工具间的关联关系,更包含每个步骤的输入输出。由此可见,追踪数据是智能体系统的关键要素。在日志方面,如图9所示,微服务系统与代理系统具有相当的相似性。微服务系统的日志记录服务整体的行为,而代理系统的日志则捕捉代理的行为。 图8 微服务系统与智能体系统的追踪数据对比 图9 日志数据示例 5.1.2 模型数据随着数据安全问题的日益凸显,越来越多的在线代理系统选择采用本地部署的开源大型语言模型作为推理引擎[36]。若将LLM纯粹视为黑盒模型而忽略其内部状态,本文仅能观察其输入与输出。此类信息极为有限,不足以检测LLM内部发生的异常。因此,越来越多的方法开始将LLM视为白盒模型,旨在从其隐藏层和令牌对数值中收集内部参数[9, 49]。 5.1.3 检查点数据相较于微服务系统,智能体系统具备更强的控制力,能够通过数据复现任意时刻的系统状态。这为代理系统内的运维工作提供了显著优势。如图10所示,本文可以记录智能体系统在不同时间点会记录包括内存环境等检查点信息。当发生故障时,这些检查点数据使本文能够回滚至先前状态,解决问题并最终获得正确结果。 图10 检查点数据的收集及其在回滚过程中的应用 5.2 当前监测方法 基于大型语言模型的智能体系统的可观测性工具也在快速发展。这些工具主要遵循前述收集指标、日志和追踪数据的原则。大多数代理系统可观测性工具集成了追踪、指标、数据集、实验、评估、提示优化及管理等功能。LangDB[56]作为首个完全用Rust开发的可观测性工具,通过路由器优化实现成本控制,具备更高效率和内部集成性。Langfuse[57]支持OpenTelemetry集成,是开源社区中最活跃的可观测性工具。Helicone[42]除观测工具外,还整合缓存管理以降低延迟并节约资源,通过网 关回退等机制保障代理系统的安全性和可扩展性。HoneyHive[43]采用分布式追踪技术,能有效处理多模态系统,支持自定义追踪范围以聚焦特定系统维度。PromptLayer[68]最初为提示优化而设计,现将可观测性作为任务完成的必要组件,涵盖提示排序与评分等功能。TruLens[94]作为 Python 包,可无缝对接LLamaIndex等多种框架,并通过人类反馈高效迭代优化智能体系统。OpenLLMetry[93]遵循OpenTelemetry 标准,兼容各类框架,但缺乏提示优化与评估测试等功能。LangWatch[58]与 Literal AI[64]作为标准可观测性工具,具备可观测性评估与开发功能,其中LangWatch已集成 MCP 服务器。源自传统深度学习的MLFlow[21]支持在智能体系统中使用自定义指标。DeepEval[20]主要侧重于评估,缺乏可观测性功能;而AgentOps[1]则强调对整个系统的运行监督,同时具备可观测性功能。 5.3 挑战 尽管存在众多适用于代理系统的可观测性工具,挑战依然存在。 海量数据:随着代理系统持续扩展,代理数量不断增加,每个代理都会产生大量数据。当加入模型数据和检查点数据时,这一挑战尤为突出。如此庞大的数据集在采集、存储和分析方面都面临着重大挑战。 缺乏多样化的监控数据:如前所述,与传统微服务系统相比,智能体系统存在日志、追踪和指标数据不足的问题。 安全漏洞:智能体程序能够自主调用可能修改内存的工具。若缺乏适当的监控与警报机制,极易导致数据泄露及其他损失。因此,在完善代理程序监控方面仍有很长的路要走。 编辑:肖鑫鑫校核:李正平、陈凯歌、曹希铭、赵学功、白亮、任超、海洋、陈宇航、Kira、Tina、王金、赵诚、赵栓栓、张优该文资料搜集自网络,仅用作学术分享,不做商业用途,若侵权,后台联系小编进行删除来源:故障诊断与python学习

未登录
还没有评论
课程
培训
服务
行家
VIP会员 学习计划 福利任务
下载APP
联系我们
帮助与反馈