麦肯锡1年实战总结:6个Agentic AI企业级实操落地经验
当前企业级Agent失败远多于成功,越来越多企业也意识到Agent的方向选择和实施过程的重要性远大于技术开发。麦肯锡结合一年来自身主导的50多个,以及市场上的数十个Agentic AI项目,总结了六个实操级落地经验,可供正在Agent建设的供应商或行业企业参考。这6个实践经验都针对性的来自市场上Agent建设常见的失败问题,给出了比较具体的实施建议:
- 工作流程也要结合Agent的应用进行重构
- Agent不是万能的,需多种技术综合应用
持续优化迭代,使Agent获得使用者信任
让每一步都易于跟踪和验证
识别共性任务,构建可重用Agent
本文具体内容来自对文章《One year of agentic AI:Six Lessons from the people doing the work》的理解和翻译,原文链接见文末“阅读原文”。以下是6个经验的具体解释。1. 工作流程也要结合Agent的应用进行重构
很多公司过于关注Agent本身,但实际上要让Agent发挥效果,需要从根本上考虑重构工作流,在以人为工作核心的情况下,将不同的Agent和自动化工具融入人、流程、步骤形成的新的工作流。重构工作流需要绘制流程图并识别关键的用户痛点,构建一个自学习,通过反馈机制持续强化的系统。例如一个正在开发合同审查工作流程Agent的律所,业务涉及的法律不断演变,有新的案例法、地域性细微差别和政策解释,使得将专业知识沉淀具有挑战性。
为了应对这些变化,团队设计其Agent在工作流程中学习。例如,记录和分类文档编辑器中的每个用户编辑动作,工程师和数据科学家以此训练Agent、调整提示逻辑并丰富知识库,让Agent持续学习到新的专业知识。
同时,在复杂流程中,需要为每个不同的任务分配不同的技术工具。例如,保险公司通常有复杂的大调查工作流,涵盖多个步骤(如索赔处理和承保),每个步骤都需要不同类型的工作和识别任务。公司可以通过综合应用基于规则的系统、分析型AI、生成式AI和Agent的组合来重新设计这类工作流,由一个Agent做总体协调和集成,从而实现任务的完整闭环,减少外部干预,如下图。
2. Agent不是万能的,需多种技术综合应用
AI Agent能做很多事,但不应该被用于所有事情,很多领导者并没有考虑过任务是否应该使用AI Agent。评估Agent 可以问的关键问题是:需要完成的工作是什么,以及每个潜在团队成员或代理的相对才能是什么,以共同实现这些目标?很多问题可以使用基于规则的自动化、预测分析或大模型提示词工程,并不需要Agent。需要明确流程有多标准化,流程需要处理多少变化,以及哪些工作部分最适合由代理来完成。- 变化少、高标准化的工作流程,如平台对新入投资者的验证或监管披露,往往受到严格管理并遵循可预测的逻辑,这些场景下,相比于提供价值,Agent可能带来更多的复杂性和不确定性
- 变化性强、低标准化的工作流程更适合Agent。例如,一家金融服务公司部署了Agent来提取复杂的金融信息,减少了所需的人工验证量并简化了工作流程。这些任务需要信息聚合、验证检查和合规性分析——这些都是Agent可以高效处理的任务
同时,思维不能局限在用或者不用Agent,很多时候很多其他技术可以解决问题,更重要的是找到最适合场景的工具,并与人如何协作从而实现价值最大化。如果任务基于规则且重复,具有结构化输入(例如,数据输入),则使用基于规则的自动化。
如果输入是非结构化的(例如,长篇文档),但任务仍然是提取性或生成性的,则使用生成式AI、自然语言处理或预测分析
如果任务涉及从历史数据中进行分类或预测,则使用预测分析或生成式AI
如果输出需要综合、判断或创造性解释,则使用生成式AI
如果任务涉及多步骤决策,并且具有高度可变输入和上下文的长尾,请使用 AI Agent
3.持续优化迭代,使Agent获得使用者信任
很多在Agent演示时让人印象深刻,实际部署用起来却很糟糕,人们很快就会对Agent失去信心,并不再使用。
公司应该像对待员工发展一样投资Agent开发。一位企业高管表示:“Agent的部署更像招聘新员工,而不是部署软件。”Agent应该被赋予明确的职责描述,进行入职培训,并持续获得反馈,以便他们变得更有效率并定期改进。
开发有效的Agent需要结合人员专业知识创建评估指标,并针对任务定制足够精细的最佳实践案例,这些评估指标和最佳实践案例既用来测试Agent,也作为Agent的培训手册。
这些最佳实践案例可能存在于标准化的工作程序中,也可能存在于人们的大脑中,编制这些案例时,重要的是要关注那些顶尖表现者和其他人的差异因素。例如,对于销售代表来说,这些差异性因素可能包括他们如何推动对话、处理异议以及匹配客户风格。
专家应该全流程参与Agent的测试过程,记录给定输入及期望的结果,并将实际输出逐字纪录,分析差异,从而持续对Agent进行修正。尽管这些测试案例可能有上千个甚至更多。
一家全球性银行在改造其客户画像和信用风险分析流程时,认真采纳了这一方法。每当Agent在合规方面的输出建议与人类判断不一致时,团队就会判断逻辑差距,完善决策标准,并重新运行测试。
例如,在某个案例中,Agent的初始分析过于笼统。团队提供了该反馈,然后开发并部署了额外的Agent,以确保提供的分析深度能在正确的粒度级别上提供有用的见解。他们采用的一种方法是通过连续多次询问Agent“为什么”。这种方法确保了Agent表现良好,从而大大增加了人们接受其输出的可能性。
一些典型的评估指标示例
任务成功率(端到端)。任务成功率衡量的是工作流正确完成且无需升级或人工干预的百分比,反映了实际应用价值。
F1 分数/精确率和召回率。该指标平衡了假阳性和假阴性,适用于分类、提取和决策准确性任务,这些任务有明确的可衡量结果(即,是或否)。
检索准确率。检索准确率是指相对于真实数据集检索到的正确文档、事实或证据的百分比,这对于RAG检索增强型工作流至关重要。
语义相似度。语义相似度通过生成输出和参考输出之间的基于嵌入的余弦相似度来衡量,捕捉了超越精确单词匹配的意义对齐。
将 LLM 作为评判者。使用大型语言模型(LLM)作为评判者,涉及将输出与黄金标准或人类偏好进行评估。该指标适用于主观判断,如清晰度、帮助性和推理合理性等。
偏差检测(通过混淆矩阵)。偏差检测使用混淆矩阵测量不同用户组之间结果的系统性差异,突出偏差显现的位置(例如,假阴性不均衡地影响某一组)。
幻觉率。该指标追踪事实性错误或不支持声明出现的频率,确保Agent输出的可信度。
校准误差(置信度与准确度)。校准误差测量代理的置信度得分是否与实际正确性一致,这对于风险敏感型工作流程非常重要。
4.让每一步都易于跟踪和验证
当公司部署了成百上千的Agent,但又只跟踪最后的结果,出现错误时找到原因就变得非常困难
Agent的性能应该在工作流的每个步骤中进行验证,从而及早发现错误,改善性能。
例如,在一个文档审查工作流程中,团队发现系统在遇到新的一批案件时准确率突然下降。但由于他们使用可观察性工具跟踪了过程中的每一步,团队迅速确定了问题:某些用户群体提交了质量较低的数据,导致错误的解释和下游推荐效果不佳。于是团队改进了其数据收集方式,向提交数据的用户提供了文档格式指南,并调整了系统的解析逻辑,Agent的性能迅速回升。5.识别共性任务,构建可重用Agent
很多公司在推进Agent过程中,经常为每个任务创建一个Agent,但这可能导致冗余和浪费,因为很多时候同一个Agent可以完成多个采用类似操作(如提取、搜索、分析等)的不同任务。如何平衡创建可重用Agent还是单一任务Agent,需要在快速建设的同时,也做出避免限制未来能力的决策,这些决策通常需要大量的分析和判断经验。比较简单的方式是从识别重复性任务开始。企业可以开发可跨不同工作流程轻松复用的Agent和Agent组件,形成一套集中式的服务和资产在同一平台,以便后续开发和重用。这些服务资产可能包括预设的提示词、可重用的代码、培训材料,应用模式等。据麦肯锡的经验,这可以减少 30% 到 50% 的非必要工作。6.合理处理人在工作流中的位置
随着Agent的应用,人将何去何从市场上有很多的分歧。尽管Agent的应用,人依然扮演重要角色,人们需要监督模型准确性、确保合规性、运用判断力以及处理极端情况,但一些工作流程中引入Agent肯定会引起所需人的变化,企业管理者需要谨慎的管理过渡过程,划定Agent的工作范围。麦肯锡的经验是,公司应该有意识地重新设计工作流程,以便人与智能体能够良好协作,否则即使是最先进的Agent也面临静默失败、错误累积和用户拒绝的风险。(作者理解,如果搞Agent是奔着替代人去,人肯定不配合,显然搞不成。如果是跟人协作,那人更容易配合和使用起来)例如之前提到的希望使用智能体进行法律分析工作流程的律所为例。在设计工作流程时,团队花时间确定了在哪里、何时以及如何进行人工介入。在其中一个案例中,Agent能够以高精度组织核心主张和金额,但由于这些主张在整个案件中的核心地位,律师需要双重检查并批准它们。类似地,Agent能够向案件推荐工作计划方法,但由于决策的重要性,人们不仅要审查,还要调整推荐。Agent还被设置为遇到边缘案例和异常情况时进行突出提示,从而帮助律师形成更全面的认识。在流程结束时,仍需有人签署文件,以个人执照和资质为法律决策提供担保。开发简洁的视觉UI也能够使人更轻松地与Agent交互。例如,一家财产险和意外险公司开发了交互式UI(如边界框、高亮显示和自动滚动),以帮助审查者快速验证AI生成的摘要。当人们点击某个见解时,程序会直接滚动到正确的页面并高亮显示相应的文本。这种对用户体验的关注节省了时间,减少了犹豫不决,并增强了系统信心,最终使用户接受度接近 95%。