本期推荐论文提出了一种面向传统设备与智能工厂设备的工业物联网(Industrial Internet of Things, IIoT)数字孪生系统,并将多 Agent 大语言模型(Large Language Models, LLM)框架集成到数字孪生环境中。该框架通过 MTConnect(Manufacturing Technology Connect,制造技术互联)协议采集传统机床部件、智能设备以及建筑环境传感器的实时数据,并利用监督 Agent、机器专家 Agent、数据可视化 Agent 和故障诊断与控制 Agent 协同完成查询分类、实时数据解释、专家知识检索、故障诊断和远程控制。论文进一步将 LLM 与数字孪生、人工智能(Artificial Intelligence, AI)虚拟头像和语音交互结合,使操作人员能够通过自然语言查询设备状态、获取诊断建议并调整设备参数。实验结果表明,该系统能够以较低延迟融合传统设备与智能设备数据,并在三维打印(Three-Dimensional Printing, 3D Printing)故障诊断与控制场景中有效改善打印质量,为面向智能制造的人机协作、故障诊断和数字孪生增强提供了可落地的 Agent 化解决方案。
论文题目:IIoT-enabled digital twin for legacy and smart factory machines with LLM integration
论文日期:2025
论文期刊:Journal of Manufacturing Systems
论文链接:https://doi.org/10.1016/j.jmsy.2025.03.022
作者:Anuj Gautam、Manish Raj Aryal、Sourabh Deshpande、Shailesh Padalkar、Mikhail Nikolaenko、Ming Tang、Sam Anand
作者单位:
1、Center for Global Design and Manufacturing, Siemens Simulation Technology Center, Department of Mechanical & Materials Engineering, University of Cincinnati, Cincinnati, OH, USA
2、Smart Manufacturing Lab, UC Digital Futures, University of Cincinnati, Cincinnati, OH, USA
3、eXtended Reality Lab, UC Digital Futures, University of Cincinnati, Cincinnati, OH, USA
摘要
1. 引言
2. 相关工作
3. 方法
3.1 实时数据采集与标准化
3.1.1 传统设备与智能设备数据采集
3.1.2 用于数据标准化与流式传输的 MTConnect 协议
3.2 多 Agent LLM 框架开发
3.2.1 监督 Agent
3.2.1.1 合成数据集创建
3.2.1.2 通过微调进行模型优化
3.2.2 可视化 Agent
3.2.3 机器专家 Agent
3.2.4 故障诊断 Agent
3.3 数字孪生环境开发
3.3.1 系统设计与架构
3.3.2 渲染与用户交互
3.4 面向人机交互的人工智能驱动头像
3.5 双向通信与远程机器控制
3.5.1 命令库与函数映射
3.5.2 动态函数选择
4. 结果
4.1 数据采集
4.2 监督 Agent 性能
4.3 多 Agent LLM 框架
4.3.1 可视化 Agent
4.3.2 机器专家 Agent
4.3.3 故障诊断与机器控制 Agent(案例研究:Ultimaker S5)
4.4 数字孪生与头像交互
4.5 计算成本与可扩展性
5. 结论与未来工作
近年来,大语言模型(Large Language Models, LLM)的发展显著改变了自然数据解释、翻译和用户培训等领域。然而,当 LLM 被用于辅助实时、上下文敏感的机器数据分析时,仍然存在明显不足。本文提出了一种多 Agent LLM 框架,该框架能够通过工业物联网(Industrial Internet of Things, IIoT)平台访问并解释实时数据和历史数据,从而支持基于证据的推理。
实时数据通过 MTConnect 数据流协议采集自多类传统设备部件(例如七段数码显示器、拨动开关和旋钮)、智能设备(例如三维打印(Three-Dimensional Printing, 3D Printing)设备)以及建筑环境数据源(例如声音传感器和温度测量设备)。进一步地,本文开发了由四类专用 Agent 组成的多 Agent LLM 框架,包括监督 Agent、机器专家 Agent、数据可视化 Agent 和故障诊断 Agent,用于处理特定制造任务。
随后,该 LLM 框架被集成到数字孪生中,以实现非结构化数据的实时可视化。本文还探讨了基于 LLM 的数字孪生如何通过虚拟头像充当实时虚拟专家,从而减少对传统手册或主管经验的依赖。为了展示该框架的功能和有效性,本文给出了一个包含传统设备部件和现代机器的案例研究。结果表明,LLM 在数字孪生环境中辅助解释和推断实时机器数据具有实际应用价值。
关键词:大语言模型;工业物联网;数字孪生;多 Agent 框架;检索增强生成。
信息物理系统(Cyber-Physical Systems, CPS)、物联网(Internet of Things, IoT)和云计算的引入,为工业 4.0 中更智能、更互联的制造环境奠定了基础。工业物联网是工业 4.0/5.0 的关键支柱之一,它通过数字孪生实现更高效的连接和更顺畅的交互。数字孪生是物理模型的虚拟表示,能够支持制造运行过程的实时监测、仿真和优化。它们在利用来自传感器和机器的实时 IoT 数据来优化生产、减少停机时间并提高整体效率方面发挥着关键作用。通过支持实时监测、误差预测和加工过程的自适应控制,数字孪生显著增强了制造运行能力。Fu 等人的近期研究强调了数字孪生在处理加工误差方面的关键作用,因为这些误差会影响产品质量、降低效率,并在制造环境中带来安全风险。
尽管数字孪生能够处理、分析和仿真实时数据,但它们往往忽视非结构化书面数据的重要性,例如机器手册和历史故障日志,而这些数据能够为决策提供额外上下文和指导。智能制造中的一个挑战是,访问和解释机器手册、历史故障记录以及操作文档非常耗时,而这些资料又常常是获得可执行洞察的必要来源。操作人员和工程师通常需要翻阅繁杂文档来排查故障、优化流程并做出知情决策,这会延迟生产。因此,在解释 IIoT 数据和非结构化数据时,专家反馈对于提供有价值的机器数据洞察至关重要。
本文提出了一种集成在数字孪生中的、基于大语言模型(LLM)的多 Agent 框架,该框架能够提供与机器相关的上下文感知专业知识和建议。LLM 是经过训练、能够理解和分析文本的强大语言工具,因此适合在制造环境中用自然语言解释大量非结构化信息。将 LLM 集成到数字孪生中,可以在不额外依赖专家的情况下提供专家分析、预测和可执行建议,从而节省时间和资源。
LLM 能够处理此类信息,并提供传统数据分析技术不易发现的相关洞察。传统上,LLM 仅在静态和历史数据集上训练,因此在数据不断变化的实时车间运行场景中难以直接适应。对于此类领域特定用例,LLM 通常需要通过微调进行动态更新。然而,每当数据更新时都重新微调模型既耗时、计算成本又高,也不现实。为解决这些挑战,本文引入了一个基于检索增强生成(Retrieval-Augmented Generation, RAG)的多 Agent LLM 框架,并将其微调到机器特定信息。RAG 是一种在用户查询和系统提示之外,从外部知识源补充相关上下文的方法。与依赖静态预训练的传统 LLM 不同,RAG 通过实时检索提升上下文准确性,并通过提供最新信息减少幻觉。
图 1 展示了本文提出的 RAG 框架概览。该框架能够通过相似度搜索检索机器特定数据,例如维护记录和运行信息,确保 LLM 生成的洞察与最新机器状态精确对齐。
图 1:检索增强生成框架概览
RAG 对非结构化数据的检索还进一步得到传统设备和智能设备数据集成的支持,而这种集成基于 MTConnect 协议实现。MTConnect 是一种开源通信协议,旨在从多类工业设备中高效采集数据。图 2 展示了本文提出的 IIoT 与 LLM 框架的集成方式。来自传统设备和智能设备的数据通过 MTConnect 协议进行标准化,并发送到 Web 服务器。随后,LLM 处理并解释这些 IIoT 数据和非结构化数据。相关信息被叠加到数字孪生模型上,并结合 AI 驱动头像,从而实现自然语言交互和实时机器调整。
图 2:传统设备、智能设备、数字孪生与 LLM Agent 的集成概览
本文框架的创新性包括:将实时机器数据和建筑环境传感数据集成到统一的 MTConnect 流式平台;开发用于上下文敏感信息处理的多 Agent LLM 架构;并将其可视化到数字孪生中,以增强用户交互。本文结构安排如下:第 2 节综述 IIoT、LLM 和数字孪生相关研究;第 3 节描述所提出的多 Agent LLM 框架及其在数字孪生中的集成;第4 节给出案例研究并讨论结果;第 5 节总结结论并提出未来研究方向。
IIoT 是智能制造的关键组成部分,涉及工业机器的实时数据采集、监测和分析,可用于预测性维护、生产过程优化和运行效率提升。Kliestik 等人指出,IIoT 有潜力通过促进信息在生产各阶段之间高效流动来变革制造业,从而改善决策并减少停机时间。类似地,Chhotaray 等人强调了 IIoT 在构建互联制造生态系统中的作用,这类生态系统由数据驱动洞察支撑,能够显著改善运行表现。
尽管 IIoT 已取得进展,但将老旧传统设备与现代智能设备集成仍然是一个重要挑战。在制造环境中,超过 70% 的设备属于传统设备。多数传统设备缺乏连接能力和智能化能力,因此成为实现完全一体化智能制造环境的障碍。本文作者团队的 Deshpande 等人以及 Durigan 等人的研究已经探讨了如何通过传感器和连接方案改造传统设备,使其成为 IIoT 生态系统的一部分。Deshpande 等人进一步扩展了该工作,重点研究数据通信、实时分析以及利用增强现实和人在环反馈实现过程反馈。然而,这些工作尚未从整体角度研究 LLM 与数字孪生的集成,以实现实时机器数据解释。
数字孪生通过创建物理资产、过程和系统的虚拟表示,进一步拓展了智能制造边界。这类虚拟模型支持实时监测、仿真和优化,为预测性维护和运行效率提升创造机会。Siddharth 等人展示了数字孪生如何成为提升制造过程可见性和控制能力的有效方法,从而支持更好的决策和主动维护策略。然而,这些系统通常缺乏能够利用实时和历史机器数据来指导用户理解机器或过程信息的智能聊天机器人或头像。LLM 的自然语言理解能力可以在这一场景中用于上下文决策、机器信息获取和任务自动化。
LLM 的自然语言理解和生成能力为多类任务中的人机交互提供了先进手段。生成式预训练 Transformer(Generative Pre-trained Transformer, GPT)系列中的 GPT-4 等 LLM 已被用于开发聊天机器人和虚拟助手。Jeon 等人开发了 ChatCNC,这是一种会话式机器监测框架,利用实时 RAG 和 LLM 增强与计算机数控(Computer Numerical Control, CNC)机器的自然语言交互。Xu 等人提出了一种集成 LLM 的生成式协同设计框架,将混合现实(Mixed Reality, MR)和生成式人工智能结合起来,以改善协作者之间的沟通并简化协同工作流程。此外,LLM 解释非结构化数据并生成人类可读文本的能力,使其成为制造环境中决策和任务自动化的有力工具。近期,Zheng 等人和 Jia 等人将 LLM 应用于工业场景,展示了其在故障诊断、任务分配和数据解释方面的潜力。Wang 等人开发了一种由 LLM 驱动的视觉与语言协作机器人导航系统,该系统允许协作机器人以更自然、上下文感知的方式解释人类指令,并根据操作人员反馈动态调整任务执行策略。然而,将 LLM 与 IIoT 和数字孪生结合,用于异常检测、故障分析和实时监测,仍然是一个新兴研究方向。
IIoT、数字孪生和 LLM 的组合为解决制造环境中传统设备与智能设备数据集成问题提供了有前景的路径。该框架能够实现实时数据可视化、机器专家支持和故障诊断,从而缩小传统系统与智能系统之间的差距。制造领域中 LLM 与数字孪生集成的研究仍处于相对早期阶段。已有初步研究显示出显著优势。例如,Eigner 和 Händler 以及 Da Silva 和 Cardoso 指出,由 LLM 驱动的机器人能够提供上下文反馈,并改善决策制定和运行效率。类似地,Grandi 等人研究了 LLM 在产品设计过程中用于材料选择的情况,通过评估其与专家建议的一致性并识别 LLM 与人类专家选择之间的差异来验证其作用。Sun 等人提出了一种由 LLM 驱动的多 Agent 框架,能够动态分析高维传感器数据,提高制造环境中的适应性、可追溯性和决策准确性。Leng 等人强调,未来研究应重点提升这些集成系统的互操作性、可扩展性和鲁棒性,以增强工业环境中的决策、自动化和人机协作。
为了从传统设备和智能设备中高效采集数据,所提出的框架依赖标准化协议,以保证不同机器之间的兼容性和无缝数据集成。本节讨论从传统设备和智能设备采集数据的方法,以及如何使用 MTConnect 对数据进行标准化和流式传输,以供进一步分析。

图 3:基于 MTConnect 的数据采集与流式传输概览
3.1.1 传统设备与智能设备数据采集
本文采用双重数据采集方法,从传统设备和现代智能设备中提取机器传感器数据。图 3 展示了数据采集涉及的组件。对于传统设备,本文方法建立在作者团队此前基于计算机视觉工具包(Computer Vision Toolkit, CVT)的模拟面板研究基础上。该模拟面板通过开源计算机视觉库(Open Source Computer Vision Library, OpenCV)中的图像处理算法,将拨动开关、旋钮、光学字符识别(Optical Character Recognition, OCR)显示器、仪表以及七段数码显示器中的数据数字化。用于演示的模拟面板是团队内部制作的面板,用于表示这些部件,并复 制工厂车间中常见的传统设备。
此外,为采集建筑环境数据,例如声音和空气质量传感器数据,作者使用制造商提供的定制软件界面来提取运行数据。这些传感器没有独立应用程序编程接口(Application Programming Interface, API),而是依赖通用串行总线(Universal Serial Bus, USB)连接。作者开发了一个基于 Python 的脚本,用于自动从软件界面捕获图像帧,重点识别并提取特定感兴趣区域(Region of Interest, ROI)。随后,捕获的图像通过 OpenCV 进行处理,从显示指标中提取相关数据。其他环境传感器的数据,例如温度传感器和光照传感器(Lux Meter),则通过独立 API 采集,并集成到 MTConnect 中。
对于智能设备,本文应用了多种数据采集方法来提取传感器数据。例如,对于 Ultimaker S5 这类基于熔融沉积成型(Fused Deposition Modeling, FDM)的 3D 打印机,作者使用表述性状态转移应用程序编程接口(Representational State Transfer Application Programming Interface, RESTful API)直接提取关键实时参数,并将其集成到 IIoT 框架中。对于 Stratasys F170 3D 打印机,数据通过指定互联网协议(Internet Protocol, IP)地址以MTConnect 格式访问。作者开发了一个 Python 脚本,利用基于超文本传输协议(HyperText Transfer Protocol, HTTP)的 requests 库向打印机的 MTConnect 端点发送 GET 请求。
3.1.2 传统设备与智能设备数据采集
本文采用 MTConnect 协议对来自传统设备和智能设备的数据进行流式传输。MTConnect 提供标准化结构,可将原始数据转换为统一的可扩展标记语言(Extensible Markup Language, XML)格式。图 4 展示了 MTConnect 框架中的通信流程,说明客户端、Agent、适配器和设备之间的交互以及数据流架构。整个过程从客户端向 Agent 请求数据开始。随后,Agent 轮询适配器,适配器再连接设备以收集所需数据。设备响应后,适配器将原始设备数据转换为符合 MTConnect 标准的 XML 格式。格式化后的数据随后提供给客户端进一步使用。之后,数据被输入多 Agent LLM 框架,为用户提供自然语言反馈。
图4:MTConnect数据检索序列工作流
所提出的多 Agent LLM 框架包含多个专用 Agent,这些 Agent 协同工作,用于处理用户输入、分析实时数据并提供运行洞察。核心 Agent 包括监督 Agent、可视化 Agent、机器专家 Agent 以及故障诊断与控制 Agent。每个 Agent 在构建模块化、高效的 IIoT 数据管理系统中承担特定角色。监督 Agent 作为中央协调器,根据用户输入将任务分配给其他 Agent。可视化 Agent 负责通过可视化图表和解释性摘要表示数据。机器专家 Agent 使用 RAG 从外部数据源动态检索相关信息,从而增强回答上下文。故障诊断与控制 Agent 负责以交互方式排查机器故障。该 Agent 利用实时数据和用户输入,迭代缩小潜在故障原因范围,并推荐纠正措施。图 5 对整体架构进行了全面概述,展示了 Agent 之间的关系、数据流以及系统中的任务分配方式。
图 5:多 Agent LLM 框架概览
监督 Agent 负责处理用户查询并将任务分配给合适的 Agent。作为框架的“大脑”,该 Agent 确保每个专用子 Agent 根据用户提示,在其预定范围内有效运行。收到用户查询后,监督 Agent 首先根据预定义类别对输入性质进行分类,例如可视化、故障诊断或通用机器专业知识。
3.2.1.1 合成数据集创建
开发有效监督 Agent 的一个关键挑战,是训练模型对多样化用户输入进行分类并适当地委派任务。为解决这一问题,本文创建了一个专门面向分类需求的合成数据集。该合成文本数据集通过将相关文档输入 ChatGPT,并用少量示例引导模型生成真实风格输入而得到。该半自动过程产生了多样化的带标签样本,用于训练监督 Agent。标签包括“Visualization”,“Ultimaker”,
“Stratasys”,“Mockpanel”和“Error”等类别。例如,与生成数据可视化表示有关的问题被标记为“Visualization”;而与机器故障排查有关的问题,则根据具体机器类型归类,例如 Ultimaker 3D 打印机相关问题被归为“Ultimaker”。
第 3.2.1.1 节生成的合成数据集被用作训练数据,用于微调 GPT-4o-mini。该数据集经过精心构建,包含制造应用中典型的多种用户查询和场景,使模型能够有效学习并分类不同意图。在微调过程中,80% 的数据用于训练,20% 的数据保留用于验证。这保证模型能够较好地泛化到未见样本,同时避免过拟合。
训练数据包含领域特定知识。许多工业环境依赖专有文档,例如专门的机器手册、维护日志和校准记录,而这些文档并不公开。例如,作者团队内部开发的 Mockpanel 代表一种传统设备,其用户手册并不公开。因此,该手册不会被任何公开大语言模型用于训练,这意味着通用模型无法提供关于该特定机器的有效回答。通过微调将这类专门知识集成到 LLM 中,并结合 RAG 等技术,系统在回答这些机器相关查询时能够提供更准确、更具上下文感知能力的结果。
除基于数据集的优化之外,本文还采用提示词工程作为微调的互补策略。尽管微调带来了性能提升,但由于制造查询复杂且 token 处理存在固有限制,微调并不总是足以保证模型达到最佳表现。因此,每个用户查询都需要经过精心设计的提示词,其中包含详细指令和上下文信息,以在推理过程中引导模型决策。论文附录 A 给出了用于改进微调模型的系统提示词,该提示词用于分类用户查询并将其分配给相应 Agent。系统提示词在每个提示中嵌入了有限数量的相关描述,以帮助强化模型进行准确分类的能力。
可视化 Agent 被开发用于管理数字孪生中的实时数据可视化。该 Agent 基于 MTConnect 协议流式传输的实时 IIoT 数据,动态生成静态图表和图形,以可视化来自传统设备和智能设备的数据。Microsoft 的语言交互式数据分析(Language-Interactive Data Analysis, LIDA)库提供了渲染基本图表和绘图的基础功能。然而,该库在解释或总结这些可视化结果所隐含的意义方面存在固有限制。为弥合这一差距,本文实现了一个额外的总结层,利用 GPT-4o 使 LLM 能够分析视觉趋势并提取有意义的洞察。
图 6 展示了与总结 Agent 集成的可视化 Agent 概览。该图说明原始数据如何流经可视化流水线,并最终转换为视觉输出和文本摘要。基于 GPT-4o 的附加层接收图表和绘图,并生成自然语言摘要。这些摘要为其他 Agent 提供来自数据可视化的关键洞察。
图 6:集成总结机器人的可视化 Agent 概览
机器专家 Agent 是多 Agent LLM 框架的关键组成部分,用于处理复杂用户查询。它能够从结构化知识库中动态检索并综合基于文本和图像的信息。通过采用 RAG 方法,该 Agent 将上下文相关数据结合起来,为用户输入提供专家级指导。图 7 展示了机器专家 Agent 将视觉数据(基于图像描述的数据)与 RAG 文本数据相结合的工作流程。
该过程从用户查询(步骤 1A 和 1B)以及存储在向量数据库中的知识库开始。随后,查询被转换为称为嵌入的数值表示,使机器能够解释和处理文本或图像。接着,系统执行余弦相似度搜索(步骤 2A 和 2B),以检索相关文本和图像元数据。本文使用余弦相似度,是因为它衡量的是用户查询嵌入与外部知识源嵌入之间的角度而非幅值,更关注语义意义而非文本长度。然后,检索到的上下文被用于通过 LLM 生成回答,同时检索相关图像(步骤 3A 和 3B)。最后,生成的图像和文本回答被返回给用户(步骤 4A 和 4B)。
图 7:基于 RAG 的机器专家 Agent 概览
为识别最适合处理复杂查询的语言模型,本文对标准 LLM 架构进行了测试,包括 GPT-4o mini、Mistral(7B)、Llama 3.1(405B)和 Mixtral 8x22B。每个模型都被集成到 RAG 框架中,并基于一组性能指标进行评估。本文考虑两类评估指标:准确率和基于大语言模型的评估(LLM-Eval)分数。准确率用于具有可验证答案的问题,例如机器尺寸或重量,这便于与已知值直接比较。对于主观和开放式查询,例如描述操作步骤,LLM-Eval 分数则基于 GPT-4o 和 Gemini 等更大语言模型的评估计算,其前提是假设更大模型在生成回答方面通常优于较小模型。
故障诊断 Agent 被开发用于在 IIoT 支持的数字孪生中对传统设备和智能设备进行实时故障诊断。该目标通过持续观察实时传感器数据、查询结构化知识库,并将这些信息与用户输入相结合来诊断机器故障实现。该 Agent 在多 Agent LLM 框架中动态工作,利用微调后的 LLM 和领域特定知识执行诊断。
图 8 展示了故障诊断 Agent 的整体工作流程,从基于实时传感器数据的初始故障检测,到通过多轮迭代生成故障原因和纠正措施建议。该图体现了一个闭环过程,即实时数据、用户反馈和诊断知识被结合起来生成推荐。流程从通过 MTConnect 获取实时 IIoT 数据开始,该协议以相同格式流式传输不同机器的温度、压力和运行状态等实时机器参数。如果用户发现异常,可以向 Agent 提出查询或报告问题。随后,Agent 访问故障数据库,该数据库包括历史故障日志、机器手册和诊断决策树。LLM 还使用带注释的数据集进行微调,这些数据集包含常见故障场景、错误代码和机器特定诊断数据。结合实时传感器输入后,该训练使模型能够针对可能的故障原因生成上下文准确的诊断结果。
随后,Agent 向用户展示问题的潜在原因,并给出相应纠正措施。用户可以通过提供额外上下文信息或验证系统给出的建议,进一步细化 Agent 的诊断。Agent 会重新评估实时数据,并在可能解决方案之间迭代,以找到根本原因。它还允许实时执行纠正措施。例如,当检测到由于 3D 打印机热床温度过高而产生过热问题时,系统可以提出运行参数调整建议。系统还支持通过自然语言命令即时修改机器参数,这一点在第 3.5 节中有更详细说明。
图 8:故障诊断 Agent 工作流概览
为了展示 IIoT 和 LLM 的有效性,作者开发了智能制造实验室的数字孪生。图 9 展示了开发阶段,从创建初始计算机辅助设计(Computer-Aided Design, CAD)模型,到添加机器,再到在 Unreal Engine 中应用真实材料。该数字孪生集成了传统设备和智能设备数据。
图 9:智能制造实验室数字孪生复 制方法
首先,作者基于物理实验室空间的详细 CAD 模型创建了数字孪生模型。在设计 3D 模型时,考虑了机器布置和基础设施布局等关键建筑要素。Siemens NX 被用于开发实验室中所有智能制造设备和传统制造设备的 3D 模型,包括 Ultimaker S5 和 Stratasys F170 3D 打印机,以及用于复 制传统设备部件的 Mockpanel。
在这一步中,CAD 模型被导入 Unreal Engine,并应用材料和表面属性以获得真实视觉表示。Unreal Engine 的材料库被用于为各种模型元素分配准确的物理属性,包括金属、塑料和反光表面。该过程通过 C++ 脚本和 Unreal Engine 插件实现,从而创建了高保真的数字孪生环境,使其在外观和尺度上接近真实实验室。
此外,作者开发了自定义 C++ 脚本,用于管理孪生系统的数据处理和运行时数据更新。该系统能够以最小延迟处理双向通信。第 3.5 节将更详细说明这一双向通信功能。为了提供交互体验,数字孪生模型与由多 Agent LLM 框架驱动的自然语言界面集成,使操作人员能够通过语音命令或文本输入与系统交互,以检查机器状态、调整机器设置或请求诊断信息。系统通过数字孪生中的视觉更新和机器调整向用户提供即时反馈。
本文在数字孪生环境中集成了 AI 驱动头像,以辅助用户进行语音交互。图 10 展示了数字孪生中 AI 驱动头像交互的工作流程,说明从初始用户语音输入到最终语音响应的逐步过程。交互从数字孪生麦克风捕获音频输入开始,随后使用 OpenAI 开发的先进语音识别模型 Whisper AI 对其进行处理。Whisper AI 将音频准确转录为文本,以理解语音命令。转录文本被发送到第 3.2 节所述的 LLM,并通过 LLM Agent 进一步处理。随后,LLM 生成文本回答,并借助 OpenAI 的文本转语音(Text-to-Speech, TTS)功能将其转换回语音。通过这种方式,头像能够以音频到音频的交互形式提供语音回答。数字孪生环境中的 AI 驱动头像是 MetaHuman 头像,提供视觉上真实且高度细节化的人物模型。该头像以静态模式作为人机交互的主要界面。
图 10:数字孪生系统中 AI 驱动头像交互流程
在数字孪生框架中,远程机器控制通过控制 Agent 实现。该 Agent 经过训练,能够通过调用预定义函数来执行机器操作。这些函数代表不同机器动作,控制 Agent 根据用户输入动态选择并执行合适函数。图 11 展示了基于命令库的机器控制 Agent 工作流程。
图 11:机器控制命令处理工作流
作者创建了一个命令库,其中包含预定义的机器控制函数,每个函数对应特定机器操作。每个函数都被设计为修改特定机器参数。控制 Agent 使用该命令库进行训练,将用户命令映射到库中的合适函数。该 Agent 已经过微调,能够理解自然语言命令并将其与相关函数调用关联起来。
为进一步增强这一过程,领域特定知识被加入训练集。例如,许多工业机器都有特定于公司流程的操作手册和校准指南。通过嵌入这些领域知识,控制 Agent 能够更好地确定应推送到数字孪生物理模型中的最优参数。这确保所建议的命令不仅在语法上正确,而且根据专有机器文档,在运行层面也是最优的。
如第 3.5.1 节所述,控制 Agent 可以根据用户意图选择并调用正确函数。这一能力使系统能够解释自然语言命令,并无缝执行对应的机器控制函数。例如,当操作人员发出命令时,Agent 会解释该指令,从命令库中检索相关函数,并执行该函数,而不要求操作人员手动指定函数或参数。
以 FDM 3D 打印机为例,如果操作人员发出“将打印头位置改为 (10, 15, 20)”的命令,Agent 会识别该命令对应函数change_head_position(x,y,z)。它会用给定坐标替换占位符,形成函数调用change_head_position(10,15,20)。这种动态函数选择使系统能够处理多种机器控制任务,而无需操作人员手动指定函数或参数。Agent 解释命令、从库中检索相关函数并执行。函数执行后,机器会向数字孪生发送实时反馈,确认请求动作已完成。这种由命令库和训练后控制 Agent 驱动的控制方法,使数字孪生环境中的机器操作更灵活、更实时,并提升运行效率和用户交互体验。
在这一过程中,融入领域特定洞察非常关键。虽然预训练 LLM 可能基于通用知识提出看似合理的参数值,但本文系统通过微调并集成专有信息,确保控制命令反映物理机器的实际运行要求和最优性能标准。这种集成弥合了数字孪生仿真环境与物理世界之间的差距,使系统无需现场干预即可实现精确远程控制。
数据采集系统有效地将传统设备和智能设备集成到数字孪生中,建立了统一、低延迟的数据流。为采集建筑环境传感器数据,系统部署了一套非侵入式摄像头设置(图 12a),直接从传感器显示屏捕获包含关键运行数据的感兴趣区域。利用基于 OpenCV 的算法,系统从这些视觉输入中提取颗粒物和二氧化碳水平等关键指标(图 12a)。对于 Mockpanel 中的传统设备部件,作者使用团队开发的计算机视觉工具包采集数据(图 12b)。随后,来自建筑环境传感器和 Mockpanel 的原始提取数据通过 MTConnect 协议进行标准化。完整采集和处理周期的平均延迟约为 1.3 秒,可满足接近实时的运行监测需求。相比之下,来自现代智能设备的数据,包括 Ultimaker S5(图 12c)和 Stratasys F170,则直接通过RESTful API 和 MTConnect 端点访问,从而进一步简化了采集流程。

图 12:来自传统设备和智能设备的数据采集
本文在多个 LLM 模型上评估了监督 Agent 的任务分配性能,重点关注查询分类指标,包括精确率、召回率、F1 分数和准确率。如图 13 所示,微调过程(第 3.2.1.2 节)显著提升了模型性能,各项指标相较基础版本均有明显改善。微调后的 GPT-4o mini 在所有指标上获得最高分,尤其在精确率和准确率方面表现突出,显示出其在准确分类并委派多样化用户查询方面的鲁棒性。该模型达到接近最优水平,准确率和 F1 分数分别为 82% 和 92%,表明其能够可靠处理从数据可视化请求到复杂故障排查任务的广泛查询。这种高水平表现反映了监督 Agent 在数字孪生环境中管理任务分类的有效性,能够确保用户查询被准确路由到专用 Agent。

图 13:GPT-3.5 和 GPT-4o mini 基础版本与微调版本在查询分类中的监督 Agent 性能对比
可视化 Agent 为 IIoT 数据生成实时、上下文感知的可视化结果,使操作人员能够快速解释环境和运行条件。在该示例中,Agent 创建了一个饼图,用于展示声音传感器捕获的声音水平,并将其分为低、中、高三个不同等级。图 14 显示,低声音水平占 42.1%,中等声音水平占 26.3%,高声音水平占 31.6%。
总结层在图表旁提供了文本解释,说明颜色编码的声音等级并总结数据分布。这种即时视觉反馈使操作人员能够快速评估传感器数据和环境条件,并做出知情决策。

图 14:声音水平按高、中、低分类的饼图及文本摘要
机器专家 Agent 使用 RAG 方法进行评估,评估重点是其处理复杂查询并提供专家级回答的能力。为此,本文采用两类评估:针对客观问题的数值准确率,以及针对主观、上下文相关任务的 LLM-Eval 分数。该评估方法遵循 Huang 等人的思路,即使用参数规模更大的 LLM 作为评估器,对较小模型生成的回答进行评估。对于准确率评估,作者向模型提出客观问题,例如“Ultimaker S5 的成型体积有多大?”以及“Ultimaker S5 的尺寸是多少?”这类问题可以直接、客观地评估模型检索并提供精确信息的能力。对于需要更深层上下文理解的主观任务,则由 GPT-4o 和 Gemini 评估生成回答的质量和相关性。
本文使用多个语言模型评估机器专家 Agent,以确定最适合在数字孪生环境中提供专家级回答的模型。表 1 展示了各模型的性能,包括 GPT-4o mini、Mistral(7B)、Llama 3.1(405B)和 Mixtral 8x22B。为评估鲁棒性,每组实验使用相同问题池重复五次,确保观察到的变化主要来自模型自身随机性,而不是测试数据差异。Llama 3.1 的准确率最高,为 0.916 ± 0.038,GPT-4o mini 紧随其后,准确率为0.903 ± 0.036。此外,GPT-4o mini 在主观评估中表现更好,其 LLM-Eval 分数分别为 0.922 ± 0.047 和0.925 ± 0.020(分别由 GPT-4o 和 Gemini 评估),显示出其提供上下文相关回答的强大能力。基于多个指标上稳定且鲁棒的结果,本文选择 GPT-4o mini 作为机器专家 Agent。
表 1:机器专家 Agent(基于 RAG)中不同语言模型的性能指标

为评估故障诊断与机器控制 Agent 的有效性,作者使用 Ultimaker S5 3D 打印机构建了一个受控实验。实验评估了该 Agent 诊断和解决 FDM 3D 打印中两个常见问题的能力:首层附着失败和表面粗糙。为测试目的,作者故意设置了错误打印参数,从而能够系统评估 Agent 基于实时数据识别并纠正这些问题的表现。
首层附着不良问题通过将热床温度设为 45 °C 引入,该温度低于聚乳酸(Polylactic Acid, PLA)的最佳值。确保首层正确附着对于任何 3D 打印的成功都非常关键,因为首层构成整个结构的基础。Agent 分析打印机实时数据后,识别出热床温度不合适,并建议将其升至 60 °C,这是 PLA 确保良好附着的标准温度。确认调整后,打印质量显著改善。
图 15 展示了故障诊断 Agent 的有效性,比较了 LLM 干预前后 3D 打印件质量的变化。图 15a 在同一零件中展示对比:“Before LLM”部分存在表面缺陷和不一致,而相邻的“After LLM”部分在实时错误纠正后质量显著提升。图 15b 显示,由于每层固有几何误差,正在打印的零件中仍然可能存在缺陷。在这种情况下,理想方案是暂停打印,并根据 LLM 建议的设计值重新开始。图 15c 显示在 LLM 反馈后完全重新打印的零件,初始错误已经消除。该结果表明,故障诊断 Agent 能够在生产早期发现问题并采取措施,从而提升打印质量并减少材料消耗。

图 15:故障诊断与机器控制Agent 解决 Ultimaker S5 打印问题:(a)数字孪生中 LLM Agent 的界面通信;(b)基于 LLM 的实时 IIoT 数据改变对 3D 打印的影响;(c)基于 LLM 的 IIoT 数据改变对 3D 打印的影响
本文评估了数字孪生系统展示来自智能设备和传统设备实时数据的能力,具体包括 Stratasys F170 和 Ultimaker S5 3D 打印机,以及包含传统机器数据的模拟面板。选择这些机器是为了测试系统处理多样化设备类型的能力,展示其跨现代技术和旧有技术的灵活性与兼容性,这对于集成制造环境至关重要。系统允许操作人员以 1 至 2 秒延迟在不同机器数据集之间切换,从而在单一界面中高效监测多台机器。
图 16 展示了 Ultimaker S5 和 Stratasys F170 的数据叠加到数字孪生模型上的效果,包括热床和挤出机温度、打印机状态以及关键部件位置等实时指标。数字孪生还集成了带有 LLM 聊天机器人的头像,用于自然语言交互。该头像能够检索实时机器数据,并通过语音命令准确回答用户查询。例如,当用户询问 Ultimaker S5 当前状态时,头像能够立即检索并报告相关运行参数。图中还展示了聊天界面,记录会话历史并显示传统模拟面板的数据叠加。这一设置允许操作人员与机器数据交互、接收反馈并控制运行,从而增强数字孪生中的用户参与度。

图 16:数字孪生环境中的实时数据叠加与头像
除性能指标外,本文还评估了系统计算成本。GPT-4o-mini 的价格为每 100 万输入 token 0.150 美元、每 100 万输出 token 0.600 美元。在实验中,30 个查询的总成本为 0.12 美元,每个查询约包含 450 个输入 token,并产生约 3000 个输出 token。这意味着,对于相似长度的输出,约 1 美元可处理约 250 个查询。此外,音频处理成本(使用 OpenAI 的 Whisper 和文本转语音模型)为每 100 万字符 15.00 美元,本文样例查询成本约为 0.22 美元。在硬件方面,作者在配备 RTX 3070 图形处理器(Graphics Processing Unit, GPU)的标准桌面计算机上运行数字孪生模型。
本文提出了面向工厂环境的多 Agent LLM 框架与数字孪生模型集成方案。该系统旨在提升运行效率,集成来自传统设备和智能设备的实时数据,并通过自然语言界面实现无缝监测、故障诊断和机器控制。由 LLM 聊天机器人支持的交互式头像允许操作人员使用语音和文本命令与机器交互,从而增强用户参与度。系统成功解决了常见 3D 打印问题,例如首层附着和表面粗糙,这表明该系统具有简化和优化制造过程的潜力。
在未来研究中,扩展系统与更广泛工厂机床的接口能力,例如 CNC 机床和机械臂,将提高其在多样化制造环境中的灵活性。另一个关键探索方向是将机器学习(Machine Learning, ML)模型与 LLM 集成,从而实现更高级的诊断和预测性维护。此外,作者正在研究处理涉及多个 Agent 的复合查询的策略。关于监督 Agent 的早期工作显示出良好前景,该 Agent 能够分解复杂查询并协调多个 Agent。进一步地,未来工作还可以集成虚拟现实(Virtual Reality, VR),以提供沉浸式、实时的数字孪生可视化,并支持对机器参数进行交互式调整。