在上期内容论文学习||AgentOps:面向LLM智能体系统的运维框架综述(上)中,我们已梳理了智能体系统的分类、异常现象、运维体系及监控相关内容,本期将聚焦论文下半部分,为大家完整分享前沿综述论文——《AgentOps:面向LLM智能体系统的运维框架综述》(下)。
该研究开创性提出了面向智能体系统的全生命周期运维新范式,在上期界定的智能体内部异常与智能体间异常两大核心类别基础上,进一步深入拆解异常类型,全面覆盖推理、规划、动作、内存、环境、任务规范、安全、通信、信任、涌现行为、终止等11类具体异常。同时,论文构建了包含监控、异常检测、根因分析、修复验证四大环节的AgentOps(智能体系统运维)闭环框架,重点阐述了根因分析的分类体系及异常检测与根因分析的映射关系,并给出了涵盖验证、迭代修复、异常解决的完整解决方案。
相较于传统AIOps方法,AgentOps首次将模型参数、注意力图谱、思维链快照等语义级数据纳入监控体系,有效破解了智能体系统的“黑箱”问题。此外,论文还针对AgentOps在监测、异常检测、根因分析、解决方案四大维度面临的挑战,展望了未来发展方向,最终形成完整结论,为智能体规模化、可靠落地提供了重要支撑。
论文链接:通过点击本文左下角的阅读原文进行在线阅读及下载。
论文题目: A Survey on AgentOps: Categorization, Challenges, and Future Directions
论文来源:arXiv
Doi:https://doi.org/10.48550/arXiv.2508.02121
github地址:https://github.com/linafaik08/agentic-investor-brief
1:Computer Network Information Center, Chinese Academy of Sciences, China
2:Hangzhou Institute for Advanced Study, University of Chinese Academy of Sciences., China
3:Institute of Computing Technology, Chinese Academy of Sciences, China
4:Tsinghua University, China
随着大语言模型(LLMs)推理能力的持续提升,基于LLM的智能体系统在灵活性和可解释性方面较传统系统更具优势,因而备受关注。然而,尽管智能体系统在学术界和工业界广受研究关注并得到广泛应用,但这类系统与传统系统一样,常会遭遇异常现象。这些异常导致系统不稳定且存在安全隐患,阻碍了其进一步发展。因此,亟需建立一套全面系统的智能体系统运维方法论。遗憾的是,当前关于智能体系统运维的研究尚显匮乏。为填补这一空白,本文开展了智能体系统运维的系统性调研,旨在构建清晰的领域框架、界定核心挑战并推动后续发展。本文首先系统定义智能体系统中的异常现象,将其划分为智能体内部异常与智能体之间异常两大类。随后提出名为"智能体系统运维(AgentOps)"的创新性综合运维框架。本文详细阐释了该框架的四个关键阶段:监控、异常检测、根本原因分析及问题解决,并给出了具体定义。
1 引言
2 智能体系统的分类
2.1 智能体系统的定义
2.2 智能体分类
3 智能体系统中的异常现象
3.1 智能体系统中异常的定义
3.2 智能体内部异常
3.3 智能体间异常
4 智能体系统运维
4.1 运维演变
4.2 传统系统运维与智能体系统运维的区别
4.3 结论
5 监控智能体系统
5.1 监测数据示意图
5.2 当前监测方法
5.3 挑战
6 异常检测
6.1 推理异常
6.2 规划异常
6.3 动作异常
6.4 内存异常
6.5 环境异常
6.6 任务规范异常
6.7 安全异常
6.8 通信异常
6.9 信任异常
6.10 涌现行为异常
6.11 终止异常
7 根本原因分析
7.1 代理失败根本原因分类体系
7.2 从异常检测到根本原因分析的映射
8 解决方案
8.1 解决方案验证
8.2 解析模式:迭代修复与多轮验证
8.3 代理系统的异常解决
9 AgentOps的挑战与未来方向
9.1 监测
9.2 异常检测
9.3 根本原因分析
9.4 解决方案
10 结论
6.1 推理异常
推理异常的检测与缓解方法可根据所用输入信息的类型分为白盒、灰盒和黑盒三类。白盒方法利用令牌序列、每个令牌的相关概率以及模型参数。相比之下,灰盒方法不使用模型参数。最后,黑盒技术仅依赖于令牌序列。
6.1.1 白盒模型
SPALMA[9]提出大型语言模型具备独立评估先前状态准确性的能力。然而即便拥有此能力,大型语言模型仍可能产生幻觉。这是因为大型语言模型本质上是令牌预测器,其在每个步骤中致力于预测概率相对较高的令牌,但未必能确保整个令牌序列具有最高概率。此外,LLM采用概率采样而非直接输出最高概率的词元。因此SPALMA认为,LLM的内部参数在某种程度上能反映幻觉现象。为解决此问题,他们提出基于LLM参数的分类器。该分类器通过涵盖多元主题的大型数据集训练,能够以零样本方式检测幻觉。OPERA[49]提出在推理阶段解决幻觉问题,无需像SPALMA等方法那样引入额外数据或训练模型。其动机源于在自注意力图中观察到的"局部过度信任"现象:特定摘要令牌周围的注意力分数呈现出列状结构,即聚合模式。该模式在长上下文中更易出现,从而增加幻觉概率。为解决此问题,OPERA引入列向量度量识别聚合模式,并设计惩罚机制调整令牌生成概率以降低幻觉概率。此外,该方法提出回溯策略:当根据评分检测到幻觉时,系统将回溯至摘要令牌重新生成序列。诚实模型[108]提出,当问题超出大型语言模型的知识边界时会产生幻觉。该模型着重强调模型的诚实性,认为诚实的模型应坦率回答其掌握的问题,并在缺乏必要知识时谦逊承认。最初定义了进化指标来评估模型是否对超出能力范围的问题作出回应。此外引入"IDK(我不知道)"响应机制,要求模型在遇到知识边界外的问题时必须给出IDK回复。最后探讨了提示工程和监督式微调等技术手段以解决此类异常现象。
6.1.2 灰盒方法
LURE[123]认为,通过在大规模高质量数据上进行大量训练来减少幻觉现象并不可行。因此,该研究提出轻量级解决方案。通过实验与理论分析,其识别出导致幻觉的三大因素:共现关系、不确定性及物体 位置。基于这些因素,LURE利用大型语言模型同时构建幻觉样本与正常样本。据此数据训练的校验器负责在推理阶段检测幻觉并直接修改响应内容。Conformal[79]从保形预测中汲取灵感,提出尽管语言模型的采样空间有限,仍可通过采样与修剪方法获得更优质的响应。具体而言,该方法通过计算令牌序列的logit值来评估采样响应的质量。若响应满足特定停止规则则予以保留,否则予以舍弃。
6.1.3 黑箱
Debate[26]指出,以往缓解幻觉的方法(如自我一致性)通常仅针对单个模型实例。然而,受《心灵社会》启发,Debate 提出不同大型语言模型或智能体可对同一输入提供多元视角。为此,每个实例需被提示阅读并评估其他所有实例的响应,从而更新自身答案。通过迭代优化,该方法旨在获得更精确的解决方案。CoK[62]是一种创新的推理框架,它使大型语言模型能够在回答过程中主动查询多个异构知识源(如维基 百科和数据库),以获取准确的事实信息。这些信息将逐步整合到生成的推理链中,从而降低产生"幻觉"的风险。在知识体系框架内,先前生成的推理链将被复审并修正,进而优化后续推理。这种迭代过程能逐步提升整体响应的实事准确性与逻辑连贯性。
6.2 规划异常
规划异常可根据其发生位置分为单步异常和多步异常。
6.2.1 单步生成
Introspective[63]研究指出,大型语言模型生成的计划方案常存在不切实际或违背常识的问题。为解决此问题,本文提出两种技术方案:首先采用RAG技术召回相似计划方案,辅助生成合理的后续步骤;其次运用符合性预测技术,基于词元概率生成多个高质量答案,并通过人类反馈进一步优化选择。API-bank[59]提出,通过微调大型语言模型(LLMs)可增强其规划能力,从而减少幻觉现象。为此,API-bank 广泛收集了涉及真实 API 调用的对话,构建了训练数据集用于模型训练。该训练显著提升了模型的规划能力。在评估阶段,研究重点分析了被识别为规划幻觉的主要错误,并勾勒出潜在的未来研究方向。
6.2.2 多步骤任务
Toollm[78]指出,尽管先前方法已减少规划幻觉现象,但仍存在若干局限。主要问题在于API库等方法受限于上下文,仅关注单次API调用。然而现实环境中,完成任务往往需要调用多个API并进行多次交互。为解决此问题,Toollm 收集大量API数据,同时生成单工具与多工具指令。此外,该研究提出基于深度优先搜索的决策树模型,用于构建连贯的规划路径。通过这些数据,大型语言模型(LLMs)经过微调后显著提升了工具调用能力。反思机制[88]提出,智能体在多次迭代后可能产生幻觉。为解决此问题,该机制基于外部反馈构建解决方案,使智能体能够回顾先前执行步骤并优化后续轨迹。该反馈可分为三类:简单的二进制环境反馈、针对常见失败情况的预定义启发式策略,以及自我评估(如使用LLM进行二元分类决策或编写单元测试进行编程)。相较于强化学习训练等方法,这种反思机制更为轻量且高效。
6.3 动作异常
由于操作通常通过函数调用和MCP执行,操作异常可分为函数调用异常和MCP异常。
6.3.1 函数调用
在早期阶段,动作执行是通过函数调用实现的。当发生错误时,系统会立即返回错误信息,使得异常检测和缓解相对简单。因此,本节将不对此主题进行深入讨论。
6.3.2 MCP.
AI-Infra-Guard [91] 运用智能体技术检测 MCP 内部潜在风险,包括工具中毒攻击和跑路等常见威胁。异常检测仅是AI-Infra-Guard 在 MCP 中的部分功能,该系统还能对 AI 组件执行安全扫描。MCP Guardian的核心机制是在基于MCP的AI系统中添加一个"安全优先"的中间件层。该层增强了客户端(MCP 客户端)与数据源/工具服务器(MCP 服务器)之间的通信能力,主要包含四个核心组件:身份验证、速率限制、调用信息详细日志记录以及数据包内容深度检测。
6.4 内存异常
由于代理的记忆分为短期记忆和长期记忆,记忆异常可分为短期记忆异常和长期记忆异常。
6.4.1 短期记忆
先前的方法(如旋转位置嵌入 RoPE)在短上下文窗口上训练,却在更长的窗口上进行推理,导致外推能力薄弱。为解决此问题,PI[16]引入了位置插值机制。该方法利用位置编码可为非整数值的特性,通过缩放整个窗口(例如将 4096缩减至 2048)使其适应模型上下文窗口长度的限制。CoA[118]指出,先前用于扩展上下文窗口长度的方法(如微调)容易导致"中间信息丢失"问题。为解决此问题,CoA 提出多智能体协作方案:第一阶段中,不同智能体分别处理输入的不同片段并传递结果给后续智能体;第二阶段由管理智能体整合这些输入以生成最终答案。
6.4.2 长期记忆
ReDeep[89]提出,在 RAG 过程中,外部知识与模型内部参数之间的冲突极易引发幻觉异常。为解决此问题,ReDeep通过计算并处理两项评分来评估幻觉:外部上下文评分与参数化知识评分。通过调节残差流中知识前馈网络(FFNs)与复 制头(Copying Heads)的贡献,该方法有效抑制了幻觉现象。LRP4RAG [44] 采用经典算法——分层相关性传播(LRP),通过在生成器输出逻辑值后执行反向传播 LRP 来获取相关性矩阵。该相关性矩阵随后被输入预训练分类器以检测幻觉。总体而言,RAG 中的幻觉检测与标准幻觉检测具有显著相似性。
6.5 环境异常
环境异常通常体现在环境相关指标的不规则性或日志异常中。因此,传统的基于微服务的监控和异常检测,诸如时间序列异常检测等方法能够有效解决这些问题。因此,本文不再对此进行进一步阐述。
6.6 任务规范异常
如前所述,任务规格不明确极易导致任务失败,但此类异常往往被忽视。传统系统鲜少涉及人类参与,其运行通常聚焦于执行阶段,却未在执行前阶段处理人类配置问题。而在 AgentOps 中,人类作为智能体系统的重要组成部分,其所引发的异常现象已无法被忽视。然而,目前针对该问题的研究尚显不足。尽管部分研究将其视为一种重要的异常类型[11],但鲜有有效解决方案被提出。一种可行方法是采用类似幻觉检测的技术,通过评估大型语言模型对不同提示的潜在状态响应来实现。其原理在于:清晰的提示会降低后续阶段的随机性,而模糊的提示则可能导致更广泛的潜在路径。
6.7 安全异常
安全异常可能严重危及系统安全性,因此催生了多种检测恶意攻击的方法,其中主要采用基于图论的方法。
6.7.1 图论方法
多智能体投票法是处理外部攻击引发的智能体安全异常的常用手段。然而GUARDIAN[121]指出该方法忽视了智能体间的依赖关系。因此其将智能体系统建模为图结构,并采用编码器-解码器框架对整个图进行压缩与重建。通过重建评分识别潜在异常位置。
SentinelAgent [41] 指出,多智能体系统中可能出现多种安全异常,其中多智能体协调风险尤为常见。为应对这一问题,该方案提出三层检测
方法:首先从全局视角出发,随后逐步深入进行更细致的检查。
6.8 通信异常
通信异常的主要成因在于代理系统的持续扩张,导致传输消息量不断攀升。然而其中大量消息实属冗余,过度的冗余信息反而可能引发任务失败。
6.8.1 冗余性
AgentPrune[112]指出,对话内与对话间的交互均可能导致通信冗余,代理会消耗大量标记并进行低效的交流。为解决此问题,AgentPrune 提出将整个智能体系统构造为图结构,并训练基于低秩原理的图掩码。该掩码用于提取并聚焦图中关键部分的通信。AgentPrune既缓解了通信冗余,又提升了通信效率。
G-Designer [113]采用更宏观的视角,主张最优通信拓扑结构会因任务而异。因此,它会生成针对特定任务定制的不同拓扑结构。具体而言,它运用图自编码器对整个智能体系统进行压缩,并重建最优拓扑结构。
6.9 信任异常
信任异常通常涉及评估代理消息的可靠性。一种直接的方法是采用推理异常讨论中的方法来处理此问题。然而,从系统层面的视角审视该问题也能带来新的见解。ATrust[38]强调,随着A2A通信日益普及,评估来自不同源代理的消息可信度变得日益重要。若未能做到这一点,将严重危及任务安全性。然而,该领域仍存在诸多挑战。基于提示工程的方法易产生幻觉,而依赖外部工具的方法则受限于工具质量。ATrust通过六维度注意力图评估可信度:事实准确性、逻辑一致性、相关性、偏见、语言质量及清晰度。
6.10 涌现行为异常
涌现行为异常源于多个智能体间的复杂交互,导致无法归因于任何单一智能体的系统级行为。此类异常具有高度隐蔽性,因为它们可能并未违反任何单个智能体的约束条件,却仍会引发系统层面的不良后果。目前业内尚无有效方法能检测此类异常。
6.11 终止异常
此类异常可能表现为无限循环或过早终止。无限循环通常可通过日志和跟踪记录轻松检测,而过早终止则通常通过监控任务成功率等指标来识别。目前,业内尚无其他前沿且有效的相关研究成果。
随着自主智能体成为关键业务运营的核心组成部分,对其故障进行快速精准的根本原因分析(RCA)已成为保障系统可靠性的核心挑战。与传统软件不同,智能体故障的根本原因分散于基础设施、模型行为和编排逻辑之中,常形成复杂的因果链--某一维度的故障往往会触发其他维度的故障。本节旨在为智能体运维(AgentOps)建立系统化的RCA框架,该框架将明确定义问题空间、建立诊断映射,并提出可执行的应对策略。
7.1 代理失败根本原因分类体系
要有效诊断故障,本文首先需要一套能够准确归因故障源的分类体系。本文提出的分类法并非单纯的学术练习,而是经过精心设计以确保其可操作性,并引导业界聚焦于最具创新性的挑战。其设计基于两大核心动机:
首先,该框架直接契合构建和维护代理系统所涉及的独特技术栈与团队职责。这确保了根本原因分析(RCA)流程的结果并非抽象结论,而是针对相应团队的明确指令——无论是系统问题对应的运维/站点可靠性工程(SRE)团队,模型相关问题对应的机器学习工程团队,还是编排逻辑对应的代理开发团队。这种与实际责任的紧密结合,使该框架具备极高的可操作性。
其次,该分类法在战略上将"旧"问题与"新"问题区分开来。它将系统可靠性这一已充分理解的领域,与"软逻辑"协调这一新兴且至关重要的挑战区分开来。通过这种方式,本文得以利用数十年的现有工程实践。
7.2 从异常检测到根本原因分析的映射
在实践中,根本原因分析(RCA)流程由异常检测(AD)系统的警报触发。异常检测系统回答"发生了什么问题",而根本原因分析则必须探究"为何发生"。为确保本文叙述的连贯性,必须在 AD 部分识别的异常类型与 RCA 框架的根本原因类别之间建立清晰的映射关系。
异常检测框架将异常分为两个层级:单体内部异常(涉及单个智能体的内部认知过程)与跨体异常(涉及智能体与其环境之间的广泛交互)。本文的根因分析框架能够系统性地追溯这些观测到的异常,将其溯源至系统中心维度、模型中心维度或协调中心维度。表 7 展示了这种映射关系,揭示了智能体故障的多维特性。该映射揭示了一个关键洞见:单一的高级异常类型很少仅由单一根本原因引发。例如,AD 系统检测到的推理异常可能源于系统层问题(RAG 提供的错误数据)、模型层问题(核心幻觉)或协调层问题(缺陷提示)。因此,根本原因分析(RCA)流程的作用在于运用下文所述方法论,厘清这些潜在成因并精准定位故障的真正根源。这种结构化方法能避免团队过早将责任归咎于模型——实际问题可能源于数据或提示工程环节。
8.1 解决方案验证
代理系统运行中最关键的组件之一,是对实施的解决方案进行系统性验证,以确保其在有效纠正检测到的异常的同时,未引入不良副作用。主要评估指标是任务成功率,若解决方案实施后代理的任务成功率持续高于实施前,则该解决方案被视为有效。目前评估该指标主要有两种方法:
人工标注:由人类专家依据详细评分标准评估智能体表现。该方法被视为准确性的黄金标准,能对任务成功与突发行为的微妙之处作出细致判断。然而其资源消耗大,难以有效扩展以实现持续的实时监控。
LLM-as-a-Judge [120]:作为可扩展的替代方案,该方法采用独立的强大大型语言模型(LLM)来评估智能体的表现。该"评判者"LLM 依据预定义的成功标准和评分细则,对智能体的日志和输出进行评估,从而实现任务成功率的快速、大规模自动化评估。
8.2 解析模式:迭代修复与多轮验证
与传统 IT 系统中异常处理通常遵循线性离散的"检测-诊断-修复"工作流不同,处理智能体系统中的异常需要向持续迭代管理转变。在现代智能体系统中,"局部影响"的假设--即修复措施可控且效果可预测--已根本失效。这种失效源于两大核心特性:首先,当智能体由大型语言模型驱动时,其行为本质上具有概率性和非确定性;相同输入在多次试验中未必产生相同输出。其次,系统作为复杂适应性系统运行,其整体行为是无数非确定性智能体局部交互的涌现属性。因此,修复单个智能体的异常并非简单修复,而是对系统平衡的扰动--这种干预将改变所有交互智能体的运行环境。
该挑战的核心在于其引发次级效应和级联行为转变的高度可能性。假设某个智能体被诊断出规划异常,导致其运行效率低于最优水平。运维团队可能通过修改其规划启发式或效用函数进行干预。虽然干预的预期直接效果可能得以实现--例如:随着智能体效率的提升,由此引发的行为改变必然改变智能体间的动态关系,可能导致不可预见的系统性故障。例如,新获得高效能的智能体可能垄断关键共享资源,导致其他智能体资源匮乏,进而引发通信异常与突发性异常--表现为系统瘫痪或资源冲突升级。本质上,解决智能体内部异常时,无意中催生了更复杂的智能体间异常,这种现象难以事先预测。
鉴于这些挑战,异常解决必须是一个循环往复且基于经验的过程。任何修复方案都应视为需要广泛验证的临时假设。干预后系统不会立即修复,需要经过多轮观察周期来监测全局性能与交互模式。这将使新动态得以显现,潜在副作用浮出水面。因此,异常解决成为系统性调优的迭代过程:实施干预→多轮观察系统响应→分析涌现行为→优化修复方案→直至达成稳定的预期状态。
8.3 代理系统的异常解决
为解决复杂智能体系统中的异常现象,本文提出一个清晰可行的框架,将潜在解决方案划分为两大类:系统设计驱动型解决方案与提示优化驱动型解决方案。系统设计驱动型解决方案是基础性的架构模式,通过在系统层面嵌入稳健框架、安全机制和反馈回路,确保安全可靠的运行。这类方案通常由系统架构师和工程师负责。相较之下,提示优化驱动型解决方案聚焦于智能体与其底层语言模型的直接交互,涉及认知流程与交互指令的迭代优化--这属于人工智能与提示工程师的领域。这种分工使团队能更有效地诊断故障根源:究竟源于基础设计缺陷,还是指令逻辑问题。
8.3.1 系统设计驱动的解决方案
这些方案是系统架构的有机组成部分,需要正式的工程设计。它们专注于构建持久的弹性框架,实施预防性安全措施,并建立响应式反馈循环以实现检测与演进。
8.3.2 基于提示优化的决策方案
这些策略侧重于与智能体底层语言模型的直接交互。它们通常在智能体的推理循环中实现,涉及动态生成、优化和评估用于引导智能体思维过程与行动的提示。
9.1 监测
在当前的代理系统中,监控面临两大主要挑战。首先,传统监控工具的能力有限--它们主要捕获指标、日志和跟踪数据。如第5节所述,模型数据和检查点数据在代理系统中至关重要,但它们往往超出常规可观测性方法的范围。其次,海量观测数据(尤其是模型相关数据)若管理不当,将带来巨大的内存开销。因此,未来关键发展方向在于构建能够大规模有效观测多样化数据类型,同时确保高效存储与资源利用的监控解决方案。
9.2 异常检测
如第3节所述,当前智能体系统中的异常现象具有多样性特征,这带来了重大挑战:缺乏能够同时识别多种异常类型的统一检测算法。为每种异常类型部署独立的异常检测模型将给在线服务带来巨大开销。因此,关键的未来方向在于探索更轻量高效的算法设计,以统一方式检测更广泛的异常类型--本质上是为代理系统开发全面且可扩展的异常检测框架。
9.3 根本原因分析
如第7节所述,结构化RCA框架虽提供了清晰的诊断路径,但在实践中面临重大挑战:因果归因的模糊性。单个观测到的异常可能源于系统、模型和编排层多重交织的根本原因,导致难以孤立故障的真实根源。若对每个潜在原因分别进行深入分析,将引入显著的诊断延迟和计算开销。因此,关键的发展方向在于构建更自动化高效的因果推断技术,以统一方式解析复杂故障场景--本质上是为智能体系统打造可扩展的智能根本原因分析引擎。
9.4 解决方案
在AgentOps的解决阶段,主要挑战在于由大型语言模型驱动的智能体系统固有的复杂性和不可预测性。与传统IT系统相比,智能体系统的解决方案无法依赖确定性、孤立的修复措施,因为智能体行为具有概率性特征,且存在复杂的自适应交互。解决单个智能体的局部异常往往会引发不可预见的次级效应、级联行为转变及系统性不稳定,需要通过迭代修复和多轮验证来应对。有效的解决机制需要持续监控与优化,综合运用系统级设计(如冗余机制、防护栏、回滚策略和自适应政策)与模型级干预(包括提示优化和自我修正)。这种迭代方法能确保异常真正解决且不产生意外副作用,但持续的观察、验证和系统调优需求显著增加了解决过程的复杂性。
大型语言模型推理能力的持续提升显著加速了智能体系统的发展进程。然而,智能体系统频繁遭遇异常状况,当前尚缺乏有效的运维解决方案。本文提出智能体系统异常的新定义及全面分类体系,将其划分为智能体内部异常与智能体间异常。此外,本文专门针对智能体系统设计了新型运维框架AgentOps,该框架涵盖四大核心组件:监控、异常检测、根本原因分析及问题解决。各组件均经过深入分析与系统归类。本研究整体上深化了对智能体系统的认知与管理,为其更稳健可靠的部署奠定了基础。
编辑:肖鑫鑫
校核:李正平、陈凯歌、曹希铭、赵学功、白亮、任超、海洋、陈宇航、Kira、Tina、王金、赵诚、赵栓栓、张优
该文资料搜集自网络,仅用作学术分享,不做商业用途,若侵权,后台联系小编进行删除