首页/文章/ 详情

ToyADMOS:微型机器异常声音检测数据集

7月前浏览2332
ToyADMOS数据集专为机器运行声音异常检测(ADMOS,Anomaly Detection in Machine Operating Sounds而设计。为了构建ADMOS的大规模数据集,通过故意损坏微型机器(玩具)收集异常噪声。ToyADMOS数据集包含三个子数据集,分别用于机器状态检测、固定任务机器的故障诊断以及移动任务机器的故障诊断,每个子数据集包含超过180小时的正常机器运行声音,以及4,000多个异常声音样本,这些样本由四个麦克风以48 kHz采样率收集。 
数据集引用方式:Yuma Koizumi, Shoichiro Saito, Noboru Harada, Hisashi Uematsu and Keisuke Imoto, "ToyADMOS: A Dataset of Miniature-Machine Operating Sounds for Anomalous Sound Detection," in Proc of Workshop on Applications of Signal Processing to Audio and Acoustics (WASPAA), 2019. 
 

论文基本信息

论文题目ToyADMOS:A DATASET OF MINIATURE-MACHINE OPERATING SOUNDS FOR ANOMALOUS SOUND DETECTION

论文日期2019
论文链接https://arxiv.org/abs/1908.03299
数据链接https://zenodo.org/records/3351307
作者Yuma Koizumi1, Shoichiro Saito1, Hisashi Uematsu1, Noboru Harada1 and Keisuke Imoto2
1: NTT Media Intelligence Laboratories, Tokyo, Japan 
2: Ritsumeikan University, Shiga, Japan

目录

1 摘要

2 引言

3 数据集概述

3.1 玩具车数据集

3.2 玩具传送带数据集

3.3 玩具火车数据集

4 数据评估及基准

1 摘要

本文介绍了一个名为“ToyADMOS”的新数据集,专为机器运行声音异常检测而设计。目前尚无适用于ADMOS的大规模数据集,这是因为异常声音数据难以收集。为了构建一个用于ADMOS的大规模数据集,本文通过故意损坏微型机器(玩具)来收集其异常运行声音。发布的数据集包含三个子数据集,分别用于机器状态检测、执行固定几何任务机器的故障诊断以及执行移动任务机器的故障诊断。每个子数据集包括超过180小时的正常机器运行声音和超过4,000个异常声音样本,均使用四个麦克风以48-kHz采样率采集。

2 引言

通过故意损坏微型机器的部件来收集其正常和异常运行声音,由于微型机器可以安装在声学实验室中,因此可以控制录音条件。凭借这一优势,将ToyADMOS数据集设计为不仅可用于基本的无监督ADMOS,还可用于多种高级任务,如领域自适应、噪声抑制、数据增强和异常声音的少样本学习。ToyADMOS数据集具有以下特点:  

1、针对三种ADMOS任务设计:产品检测(玩具车)、固定机器故障诊断(玩具传送带)和移动机器故障诊断(玩具火车)。  

2、机器运行声音和环境噪声分别录制,用于模拟各种噪声水平。所有声音均使用四个麦克风录制,用于测试噪声抑制和/或数据增强技术,如混合增强。  

3、在每个任务中,使用了多个同类的机器;每台机器属于同一类玩具,但具有不同的详细结构。由于收集到的运行声音因个体差异而存在变化,该数据集可用于测试领域自适应技术,以吸收个体差异和/或噪声水平的变化。  

4、每个异常声音都被录制了多次,用于测试基于少样本学习的ADMOS,以便仅从几个样本中获取异常声音的特征。  

发布的数据集包含超过180小时的正常机器运行声音和超过4,000个异常声音样本,每个任务均使用四个麦克风以48kHz采样率采集。  

3 数据集概述

ToyADMOS数据集包含三个子数据集,分别对应三种类型的ADMOS任务。每个任务使用不同的玩具。各子数据集的名称和概述如下:  

玩具车: 为产品检测任务设计。一辆玩具车在检测装置上运行。声音数据用四个靠近检测装置的麦克风采集,如图1 (a) 和 (b),以及图3 (a) 所示。  

玩具传送带: 为固定机器的故障诊断设计。一个玩具传送带固定在桌面上,声音数据用四个麦克风采集。一个麦克风固定在传送带主体上,另外三个放置在桌面上,如图1 (c) 和图3 (b) 所示。  

玩具火车: 为移动机器的故障诊断设计。一辆玩具火车在铁路轨道上运行。声音数据用环绕轨道的四个麦克风采集,如图1 (d) 和图3 (c) 所示。

图1 玩具、部件和麦克风布置图  

为了收集因个体差异而产生的各种正常/异常声音,每种类型的玩具使用三个或四个模型录制运行声音;这些模型属于同一类玩具,但具有不同的详细结构。  

每个子数据集包含三种类型的声音数据:正常、异常和环境。其定义如下:  

1、正常声音: 目标机器按照其规格正常运行时产生的声音。  

2、异常声音: 目标机器因部件被故意损坏或添加异物而导致异常运行时产生的声音。  

3、环境噪声: 用于模拟工厂环境的环境噪声。噪声样本是在实际工厂的几个位置收集的,例如碰撞、钻孔、抽水和喷漆声音。这些声音由每个录音室角落的四个扬声器播放。  

使用四个全向麦克风(SHURE SM11-CN)收集这些声音。所有声音存储为多个wav文件,分为两种类型:独立(IND)和连续(CNT)。IND和CNT之间的区别如图2所示。IND wav文件在一个wav文件中包含整个操作过程(即从启动玩具到停止)的运行声音,每个wav文件大约10秒长。CNT wav文件在一个wav文件中只包含部分运行声音;运行声音连续录制,每10分钟切割一次。正常声音包含IND文件和CNT文件,异常声音包含IND文件,环境噪声包含CNT文件。IND和CNT分别主要假设用于训练和评估。这是因为在真实环境中收集IND数据很困难。CNT数据只需录制工作机器的运行声音即可收集,而IND型数据收集则需要机器多次启动/停止。因此,IND数据收集的成本远高于CND数据收集,导致实际使用的系统通常使用CNT数据集进行训练。

 

图2 独立波形文件(IND)与连续波形文件(CNT)在录制与数据处理方面的区别  

表1:ToyADMOS数据集中包含的声音数据  

表2:故意损坏部件及其状况列表  

3.1 玩具车子数据集  

该子数据集假设了一个产品检测任务,并承担了从检测装置上玩具车运行声音中检测异常声音的任务,如图1 (b) 所示。试验使用了一种名为“迷你四驱车”的玩具作为微型汽车机器,其四个轮胎通过齿轮和轴由小型电机驱动,如图1 (a) 所示。电机连接到稳压电源,在检测装置上的运行声音用四个麦克风录制。检测装置、麦克风和录音室中的扬声器布置如图3 (a) 所示。  

玩具车数据集设计为两种类型电机和轴承的异常组合;因此,案例数为四。每个IND正常和异常声音的wav文件长度为11秒,每个案例和通道记录了1,350个IND样本。IND正常声音的总小时数为66。每个案例和通道记录了大约150个CNT样本。请注意,为了减少电机负载,电机每运行10分钟后会休息10分钟。因此,CNT正常声音的总小时数为135,是CNT文件总长度的一半。异常声音是通过故意损坏轴、齿轮、轮胎和改变电压产生的,如表2所示。每个案例和通道总共记录了250个异常声音样本,包含这些组合(53种模式)。由于所有案例中麦克风位置相同,12小时的环境噪声仅录制一次。  

3.2 玩具传送带子数据集  

试验假设了一个固定机器的故障诊断任务,从固定在桌面上的玩具传送带运行声音中检测异常声音。使用了一种通过内置小型电机驱动皮带来运输小锡制玩具车的传送带,如图1 (c, 上) 所示。通道1麦克风放置在传送带主体上,其他麦克风放置在桌面上,如图1 (c, 下) 所示。桌面、麦克风和录音室中的扬声器布置如图3 (b) 所示。  

三种由同一制造商生产但尺寸不同的传送带被用作玩具传送带的异常案例;因此,案例数为三。每个IND正常和异常声音的wav文件长度为10秒,每个案例和通道记录了1,800个IND样本。因此,IND正常声音的总小时数为60。每个案例至少记录了124个CNT样本,CNT正常声音的总小时数为120。异常声音是通过故意损坏张紧轮、尾轮和皮带以及过度降低/提高电压产生的,如表2所示。总共记录了355个异常声音样本,包含这些组合(60种模式)。由于第一个麦克风放置在传送带上,每个案例中麦克风的位置不同。因此,所有案例都录制了12小时的环境噪声。  

3.3 玩具火车子数据集  

试验假设了移动机器的故障诊断任务,从玩具火车的运行声音中检测异常声音。也就是说,为了检测异常声音,需要结合四个通道的观测,试验使用了HO比例(大)和N比例(小)的模型铁路,它们是精确详细的微型铁路模型,如图1 (d) 所示。声音数据用环绕铁路轨道的四个麦克风采集。麦克风和录音室中的扬声器布置如图3 (c) 所示。由于HO比例和N比例铁路的尺寸不同,麦克风的位置也不同。图1 (d) 和图3 (c) 所示的麦克风布置是针对HO比例铁路的。在录制N比例机器声音时,移除了HO比例铁路并将麦克风移近N比例铁路。  

玩具火车的每个“案例”设计为两种类型火车(通勤列车和子弹头列车)和两种比例(HO比例和N比例)的组合;因此,案例数为四。每个IND正常和异常声音的wav文件长度为11秒,每个案例和通道记录了1,350个IND样本。IND正常声音的总小时数为66。每个案例和通道记录了74个CNT样本;因此,CNT正常声音的总小时数为197。异常声音是通过故意损坏首节/末节车厢和直线/弯曲铁路轨道产生的,如表2所示。总共记录了270个异常声音样本,包含这些组合(54种模式)。由于HO比例和N比例案例中麦克风位置不同,每个案例录制了12小时的环境噪声。

图3 所有设备的布置位置(俯视图)

 

4 数据评估及基准

为了说明ToyADMOS数据集的用法并展示其有用性,作者在三个子数据集上测试了一个简单的基准系统。

试验使用每个子数据集案例1的通道1测试了一个简单的无监督ADS任务。请注意,为了简化实验,试验在玩具火车子数据集中混合了通道1-4的观测值,并将其用作单通道观测。随机选择的1,000个IND正常声音样本用于训练,其他IND正常和IND异常声音样本用于评估。试验通过混合随机裁剪的环境噪声构建了训练和测试数据集。为了控制信噪比,试验将玩具车和玩具传送带子数据集中目标声音的波形乘以3.16(+10 dB),而在玩具火车子数据集中将噪声声音的波形乘以该值。所有声音下采样到16 kHz的采样率。  

试验使用简单的自编码器作为正常模型,其网络架构与中使用的几乎相同。AE的每个编码器/解码器有一个输入全连接神经网络(FCN)层、四个隐藏FCN层和一个输出FCN层。每个隐藏层有512个隐藏单元,编码器输出的维度为128。除解码器的输出层外,每个FCN层后使用修正线性单元。输入向量是64维的对数梅尔幅度谱,其前后10个时间帧被连接起来以考虑过去和未来的帧。AE的重构误差被用作异常分数,AE的参数被训练以最小化正常训练样本的异常分数。试验将初始100个epoch的学习率固定,并在100-200个epoch之间线性下降到初始学习率的1/100,初始学习率为10⁻⁴。试验总是在200个epoch后结束训练。  

试验计算了所有测试wav文件中每个时间帧的异常分数。如果异常分数即使在一帧中超过阈值,则该wav文件被判定为异常。该系统为玩具车、玩具传送带和玩具火车子数据集提供的受试者工作特征曲线下面积分别为0.874、0.981和0.843。通过分析假阴性检测(即漏检),试验发现系统频繁漏检玩具车子数据集中的“过电压”声音和玩具火车子数据集中“弯曲轨道”的异常声音。正常声音和过电压声音的频谱形状细节略有不同;然而,这些声音的幅度几乎没有变化。此外,弯曲轨道的损坏点远离所有四个麦克风;因此,被漏检的异常声音幅度较小。这些结果表明了使用ToyADMOS数据集进行ADMOS研究的一个方向:检测其时频结构与正常声音相比变化不大的异常声音。

编辑:肖鑫鑫

校核:李正平、陈凯歌、赵栓栓、赵学功、白亮、任超、Tina、陈宇航、海洋、陈莹洁、王金、赵诚、曹希铭、张优

该文资料搜集自网络,仅用作学术分享,不做商业用途,若侵权,后台联系小编进行删除


来源:故障诊断与python学习
振动碰撞旋转机械电源航空汽车ADSAcousticsUGpython海洋UM声学电机传动
著作权归作者所有,欢迎分享,未经许可,不得转载
首次发布时间:2026-01-02
最近编辑:7月前
故障诊断与python学习
硕士 签名征集中
获赞 87粉丝 152文章 327课程 0
点赞
收藏
作者推荐

开源论文推荐 | 一种基于独立样本的个体泛化框架,旨在构建更合理的故障诊断基准

域偏移是故障诊断中不可避免的现象,本期给大家推荐一篇沈卫明教授团队的论文:一种基于独立样本的个体泛化框架,旨在构建更合理的故障诊断基准。本文探讨了传统数据驱动故障诊断评估基准中一个被忽视的问题,即训练集和测试集中通常来源于同一个设备个体。个体差异(例如制造误差,装配差异)可能导致潜在的被忽视的域偏移问题。为了建立更合理的故障诊断基准,本研究探索了一种基于独立样本的个体泛化框架。论文基本信息论文题目:An individual generalization framework based on independent samples towards a more reasonable fault diagnosis benchmark论文期刊:Computers in Industry论文日期:2025论文链接:https://doi.org/10.48550/arXiv.2506.05854作者:Yiming He , Weiming Shen 机构:State Key Laboratory of Digital Manufacturing Equipment and Technology, Huazhong University of Science and Technology, Wuhan 430074, China作者简介:沈卫明,加拿大工程院院士,华中科技大学教授,IEEEFellow。现兼任 IET CIM 主编,IEEE TS MC、TASE 等杂志副主编。主要从事协同设计与制造、智能制造、生产调度、物联网、大数据、智能体理论与应用等方面的研究。在国际杂志及会议上发表论文 450 多篇,其中SCI检索 200 多篇,谷歌论文被引 28000余次(其中单篇论文被引最高 900 余次),谷歌学术 H 指数 83。获IEEE加拿大唐纳工业领袖奖和加拿大联邦大楼最佳能效奖等奖项。(来源:华中科技大学教师主页) 目录摘要1 引言2 相关工作3 所提个体泛化框架4 实验结果与讨论 4.1 一维卷积分块 4.2 多尺度分块交互 4.3 粗粒度时序定位器5 实验与讨论 5.1 案例1:帕德博恩大学轴承数据集 5.2 案例2:实际生产线整机级电机数据集 5.3 分析与讨论6 总结摘要域偏移是工业信号故障诊断中不可避免的现象。本文探讨了传统数据驱动故障诊断评估基准中一个被忽视的问题,即训练集和测试来源于同一个设备个体。为了建立更合理的故障诊断基准,研究了一种使用独立测试个体的个体泛化框架。此外,还应用了一种改进的轻量级Transformer,以增强动态全局特征提取和无关信息过滤。在帕德博恩大学轴承数据集和从实际生产线收集的机器级电机数据集上进行了综合实验。结果表明,传统基准无法有效评估对故障无关特征的筛选能力和对新个体的泛化能力。所提出的轻量级Transformer实现了最高的泛化性能,具有巨大的应用潜力。 关键词:评估基准,故障诊断,独立样本,Transformer,个体泛化1 引言智能故障诊断(IFD)是提升现代制造系统可靠性、稳定性与安全性的关键维护环节。随着深度学习(DL)技术的发展与落地,数据驱动式故障诊断已成为该领域的主流研究方向(Peng 等,2024;Xiao 等,2023)。 目前已有多个实验台被搭建,用于采集旋转机械的传感器信号,以此验证各类基于深度学习的故障诊断方法。行业内公认的评估基准是采用滑动窗口对不同时段的信号进行连续采样,进而构建训练集与测试集(Wang 等,2024a)。当前几乎所有故障诊断方法均沿用这一评估基准,并基于公开数据集开发了大量算法模型(Yu 等,2023;Li 等,2025)。 但鲜有研究关注该评估基准的合理性。由于深度学习技术最初广泛应用于图像和自然语言处理领域,其数据集构建基准便被直接迁移至故障诊断领域,未经过针对性的充分考量与深入探索。考虑到振动信号的周期性,同一设备不同时段的信号应被视为相同或相似样本,这类样本的干扰信息相近,数据分布偏移极小。在源设备个体上完成的模型验证,无法评估模型对实际工业场景中复杂干扰因素的抵抗能力,例如制造不一致性、装配差异以及数据采集环境中的噪声等(He 和 Shen,2023)。S mith 与 Randall 针对凯斯西储大学(CWRU)轴承数据集展开研究,得出了一项重要结论(S mith 和 Randall,2015):他们在传感器信号中观测到部分与轴承故障无关的脉冲信息,这类信息疑似与试验台的机械松动,以及每次轴承测试时的反复拆装操作相关。面对此类特殊的信号特征,现有评估基准可能引发两大问题: 1)故障诊断精度并不一定可靠:现有评估基准的一大潜在缺陷是验证集与测试集均来源于同一设备个体,从而忽略了上述干扰信息。多数基于设备个体标签的分类结果(例如 10 个轴承对应 10 个不同标签),仅能说明深度学习模型可区分不同的设备个体,无法保证模型实现了真正的故障分类,尤其是在干扰特征较为明显的场景下。 2)新设备个体泛化性能差:对于新的设备个体(即便属于同一类别),域偏移现象不可避免,在更复杂的实际工业环境以及存在装配误差的多部件系统中,这一现象会尤为突出。事实上,针对新个体的故障诊断可被视为一类全新的域泛化任务,需要对特征进行校正或抑制无关特征,在当前故障标签稀缺的行业现状下,这一需求更为迫切。 然而这些问题在后续研究中并未得到足够重视。一项重要的基准研究(Hendriks 等,2022)探讨了现有评估框架的潜在缺陷,并进一步验证了上述观点。另一项近期的基准研究也再次指出,相较于在源设备上开展诊断,实现不同个体设备间的泛化诊断具备更高的实际意义与应用价值(Zhao 等,2024)。因此,亟需更合理地构建数据集,确保训练集与测试集的设备个体无重叠,使其更贴近真实工业场景。此外,考虑到已有性能优异的物理模型方法可实现单一轴承的故障诊断,建议将研究目标转向更复杂的系统 —— 多部件系统中不同设备个体间的域差异可能会表现得更为显著(He 等,2023a)。 本文进一步探究了不同设备个体间被忽视的域差异,并提出了一套面向数据驱动智能故障诊断的个体泛化框架。同时,设计了一款改进型轻量级 Transformer 模型作为该框架的可行解决方案。具体而言,本文通过特征可视化技术对比了传统基准与独立样本评估基准的差异;在 Transformer 模型中集成了一系列即插即用的改进模块,包括一维卷积分块(1-DCP)、多尺度分块交互(MPI)以及粗粒度时序定位器(CTL),这些模块的设计初衷是增强模型的动态全局特征提取能力与无关信息过滤能力。研究首先基于具有代表性的公开实验室数据集 —— 帕德博恩大学轴承数据集(Less meier 等,2016),完成了对该泛化框架的测试;随后将所提模型部署于实际工业电机生产线,实现了多部件系统的复合故障诊断。实验结果表明,在新的评估基准下,所提方法的性能显著优于其他对比的先进深度学习模型。本文的主要贡献可总结如下: 1)本文揭示一种被忽视的潜在域偏移现象:不同设备个体固有的制造与装配差异,加之复杂的动态数据采集环境,即便对于同类型设备,也会导致不可避免的域差异。 2)提出个体泛化框架,将其作为更合理的故障诊断基准,以实现新设备个体上的可靠故障分类;并基于特征可视化技术,进一步论证与剖析了传统故障诊断基准的局限性。 3)设计一系列即插即用的模块嵌入先进的深度学习模型,以增强动态全局特征提取能力,降低个体差异的影响,提升模型泛化性能;通过帕德博恩大学轴承数据集与实际生产线上的工业电机整机数据集,验证了该模型和基准的有效性。 论文剩余部分的结构安排如下:第 2 节简要综述智能故障诊断的主流方法;第 4 节揭示设备间的域偏移现象并介绍所提泛化框架;第 5 节阐述所提模型的详细结构;实验步骤与相关分析在第 5.3 节呈现;第 6 节对全文进行总结。2 相关工作卷积神经网络(CNN)已然成为智能故障诊断(IFD)领域的主流模型架构,诸多 CNN 变体已在各类实验室数据集上完成验证。Zhang 等人提出的宽第一层卷积核 CNN(WDCNN)(Zhang 等,2017)是经典且易于实现的模型,被广泛用于对比实验。Li 等人提出了一种新颖的基于注意力机制的深度元迁移学习方法(ADMTL),可利用目标域的少量标注样本完成诊断任务(Li 等,2023)。Lu 等人设计了嵌入先验知识的卷积自编码器(PKECA),适用于跨转速、时变转速及小样本诊断场景(Lu 等,2025)。Ye 等人研发了多传感器残差卷积融合网络(MRCFN),通过多传感器特征信息的互补与校准实现高精度诊断(Ye 等,2025)。Wang 等人基于经典 ResNet 网络,设计了多源域特征适配网络(MDFAN),用于时变工况下的轴承故障诊断(Wang 等,2022)。这些研究通过借鉴和改进图像与自然语言处理领域的先进结构及算法,大幅提升了深度学习模型的分类性能与计算效率。 近年来,一种名为 Transformer 的新型注意力机制架构革新了深度学习领域。部分成功应用案例(Yoon 等,2023)已证实其强大的全局信息提取与多任务泛化能力,例如广受欢迎的 ChatGPT(Radford 等,2018)。学者们开始探索 Transformer 在故障诊断领域的性能表现(Ding 等,2022;Jin 等,2022)。Lian 等人提出了融合声振信号的残差注意力引导视觉 Transformer(RAViT),通过捕获并利用序列的长程依赖关系提升诊断效率(Lian 等,2025)。Wang 等人提出了基于 Transformer 架构的轻量级模型 C-ECAFormer,在强噪声干扰的小样本故障诊断中表现优异(Wang 等,2023)。Zhou 等人设计了轻量级 Transformer,以及带类间排斥判别的同质广义对比学习策略(HGCL-ICRD),用于变工况下的轴承故障诊断(Zhou 等,2025)。 Chen 等人提出轻量级卷积 Transformer(LCT),用于工业机器人的复合故障诊断(Chen 等,2023)。Weng 等人设计了多传感器融合 Transformer(MsFT),并在两个实验室数据集上完成验证(Weng 等,2023)。Wang 等人提出了特征增强型端到端故障诊断模型 PSparseFormer,在强噪声干扰下的特征提取与增强任务中效果显著(Wang 等,2024b)。但如前文分析,基于传统评估基准的实验所获得的分类精度,无法保证模型在未见过的新设备上的故障分类可靠性。在多数工业场景中,实际需求是对新设备个体进行诊断,而非在同一设备上反复训练与测试,全局域偏移与动态测试噪声干扰不可避免。此外,这一需求也限制了部分基于目标域信息引导训练的迁移学习与域适配技术的应用。 当前研究尚未充分挖掘 Transformer 在故障诊断领域的潜力,尤其是在被忽视的域泛化挑战方面。相较于 CNN 架构对空间变化敏感、长程特征感知能力薄弱的缺陷(Arkin 等,2023),Transformer 具备卓越的全局信息交互能力与注意力增强的特征过滤机制,非常适合在不同个体的域泛化任务中动态感知全局特征、抵抗多类干扰因素。3 所提个体泛化框架本节进一步分析和探讨个体差异对故障诊断任务的影响,并借助可视化技术对相关现象进行验证。 如引言所述,不同设备个体之间存在当前研究中被忽视的、由额外信息干扰引发的域差异。即便是同类型的目标诊断设备,依然存在域泛化需求 —— 故障诊断(即便在相同工况下)不能简单视为源域特征提取任务,因为诊断的对象始终是新的设备个体,而非在注入故障的实验设备上反复开展测试。 众所周知,旋转机械的信号具有明显的周期性。在同一设备上,不同时刻通过滑动窗口采集到的关键信息差异极小。图 1 展示了帕德博恩大学轴承数据集中 K005 和 K006 两种正常轴承的信号可视化结果:K005-1 和 K005-2 分别代表 K005 轴承的第一次和第二次测试数据,在传统评估基准中二者会分别作为训练集和测试集;K006 时域波形中的红色矩形标注的是 K005 轴承信号的幅值范围。可以看到,K005 和 K006 的时域信号存在显著差异,但 K005-1 和 K005-2 的波形却高度相似;在频域层面,即便是幅值低于 0.005 的噪声分量,二者也呈现出相似性。尽管 K005 和 K006 均为正常轴承,但二者在时域和频域均存在明显差异。 图1. 正常轴承的时域和频域信号 此外,本文对 K005、KI18 轴承不同时段的样本,以及 K006、KI21 轴承的样本进行了 T-SNE 可视化,结果如图 2 所示。能够发现,在传统任务设置下,训练样本和测试样本的域分布几乎没有差异;而在本文所提任务设置下,同类型的两个轴承样本则出现了分布差异(KI006 样本分布更分散,KI21 样本分布更集中)。 图2. 不同任务设置下部分轴承样本的T-SNE可视化 综上,传统诊断基准划分的测试集不能简单当作新样本,来评估故障诊断模型的真实泛化能力。当个体差异不可避免且愈发显著时,传统基准的缺陷会愈发突出,进而阻碍数据驱动故障诊断方法的推广与落地。图 3 对比了传统故障诊断框架与本文所提的独立样本故障诊断框架,其中 代表第 台设备的第 个样本。所提框架的显著改进在于,训练集和测试集之间不存在共享的设备个体信息。这种面向故障诊断的独立样本评估基准具有重要价值,且值得大力推广,后续实验将对此做进一步验证。 图 3. 传统故障诊断框架与所提独立样本故障诊断框架的对比 4 实验结果与讨论 本节提出了一系列先进的即插即用模块,并将其集成到 Transformer 基模型中,形成泛化诊断的解决方案(如图 4 (b) 所示)。该模型主要包含三个模块:一维卷积分块(1-DCP)、多尺度分块交互(MPI)和粗粒度时序定位器(CTL)。 图 4. 所提模型与视觉 Transformer(ViT)的对比 4.1 一维卷积分块最初用于自然语言处理的 Transformer 模型(Han 等,2021)可处理一维数据,看似适用于单通道信号。但实际中,信号输入长度通常可达数千个数据点,直接处理会产生极高的计算资源开销,因此不建议直接应用。这一问题在 Transformer 拓展至图像分类领域时同样存在(Dosovitskiy 等,2020)。研究人员采用分块分割方法解决该难题,实现了对二维数据的处理,但这类构造方式通常只是简单分割,仅能获取固定数量的空间位置信息。视觉 Transformer(ViT)的经典分块构造模式如图 4 (a) 所示。 本文设计的一维卷积分块(1-DCP),旨在为振动信号处理提供更灵活的标记器。具体而言,针对多通道信号,1-DCP 从时序维度同步处理所有通道,以此构建二维卷积分块(也可称为单向卷积分块)。该设计充分发挥了卷积的优势 —— 相较于线性运算,卷积具备更强的空间关联特征提取能力,且计算资源消耗更低;同时,它还结合了卷积的局部特征感知优势与 Transformer 的全局特征感知优势。此外,本文还提出了重叠卷积分块模式,能够更灵活地控制分块的类型与数量,从而捕获更丰富的信息。该设计的核心动机是兼顾输入信号的周期性与空间位置可变性。1-DCP 的数学表达式如下: 式中, 代表第 个分块的第 维数据;卷积核权重 与信号点 进行卷积运算。卷积分块的尺寸为[ , ],其中 为分块长度, 为信号通道数。在每个分块区域内,会执行 次全域卷积以构建卷积分块 ,最终得到输出 。分块数量N可通过下述公式计算: 为输入信号的长度。4.2 多尺度分块交互多尺度信息是振动信号的典型特征。 多尺度分块交互(MPI) 模块被设计为即插即用组件,用于进一步增强卷积分块之间的交互能力。MPI 模块由三个并行分支构成(如图 5 所示),卷积分块可基于空洞卷积实现不同尺度下的交互,其数学表达式为: 分块交互器的尺寸为[ , , ],其中 为参与交互的分块序列间隔。需注意,为保证特征维度的一致性,需采用 “same” 填充方式,且 需与 保持一致。对所有分支的多尺度分块进行求和并计算均值: 式中, 为并行尺度分支的数量。MPI 模块的最终融合输出为 。此外,模型还引入了内外位置编码(IEPC,He 和 Shen,2023),该编码可同时对标记间和标记内的位置信息进行编码: 式中, 为随机初始化的可学习矩阵(考虑到通过滑动窗口构建的信号样本具有动态性); 为与 维度相同的矩阵,代表内外位置编码。 图 5. 多尺度分块交互(MPI)模块的结构4.3 粗粒度时序定位器 为进一步强化关键有效特征并实现模型轻量化设计,本文将 粗粒度时序定位器(CTL) 设计为特征剪枝模块。其结构包含层归一化(LN)、残差连接和多头自注意力模块(MSA,Vaswani 等,2017),具体结构如图 6 所示。最终输出会通过 Tanh 函数映射至特定范围: 式中, 。随后,计算每个分块的特征值之和作为权重:提取权重排名前 的分块索引 ,并获取对应的原始分块: 剪枝后的分块会被输入至 Transformer 的骨干网络以进行进一步特征提取,其中多层感知机(MLP)的神经元数量分别设置为D和2D。模型采用带 10% 丢弃率(dropout)的一维全局平均池化(GAP)作为决策特征层,替代了传统 Transformer 框架中的展平(flatten)层与 MLP 层。 对于采用独热标签的单一故障诊断任务,模型使用基于 softmax 激活函数和类别交叉熵损失的分类器;对于多标签复合故障诊断任务,则采用基于 sigmoid 激活函数和二元交叉熵(BCE)损失函数的分类器(Ruby 和 Yendapalli,2020)。该分类器会对每个类别进行独立的二分类评估,将复合故障诊断任务转化为多个二分类任务。 图 6. 粗粒度时序定位器(CTL)模块的结构 5 实验与讨论本节在两个数据集的两种框架下对多个深度学习模型进行评估,并从多维度展开分析。实验代码基于 TensorFlow 2.6 框架编写,运行于搭载 NVIDIA GeForce RTX 3070 Ti 显卡的计算机。 选取的对比方法均为改进型卷积神经网络(CNN)模型,这类模型均提供完整源码,且通过特殊结构增强了泛化能力,便于研究人员快速评估与优化;同时,与部分大型深度模型相比,所选模型规模相近,可归为轻量化模型。在实际工业场景中,新目标设备个体的任何信息(无论是否标注)都难以在训练阶段获取,因此部分基于迁移学习和域适配的先进算法并不适用 —— 这类算法需借助目标域数据来引导迁移或域对齐过程。所有模型均采用 Adam 优化器训练 20 个 epoch,学习率设置为 0.01。本文选用的对比深度学习模型如下: 1)WDCNN(Zhang 等,2017):经典且受广泛关注的 CNN 模型,采用宽第一层卷积核,适用于滚动轴承故障诊断。 2)TICNN(Zhang 等,2018):基于训练干扰的先进抗噪 CNN 模型,针对滚动轴承故障诊断任务设计。 3)SRDCNN(Zhuang 等,2019):基于空洞卷积的先进 CNN 模型,用于滚动轴承故障诊断。 4)MSRFCNN(He 等,2023b):结合空洞卷积与多阶段残差的先进 CNN 模型,适配整机级电机故障诊断。 5)MS MCNN(He 等,2023a):搭载多尺度融合模块的先进 CNN 模型,可用于工业机器人与滚动轴承故障诊断。 6)基准模型(Baseline):配备一维卷积分块(1-DCP)标记器的 Transformer 模型,核心结构参数参考 He 和 Shen(2023)的研究,具体如表 1 所示。 7)B+CTL:在基准模型中嵌入粗粒度时序定位器(CTL)模块,用于消融实验。 8)B+MPI:在基准模型中嵌入多尺度分块交互(MPI)模块,用于消融实验。 9)B+MPI+CTL:在基准模型中同时嵌入 MPI 与 CTL 模块,用于消融实验。表 1 模型结构超参数 5.1 案例1:帕德博恩大学轴承数据集帕德博恩大学轴承数据集(Less meier 等,2016)是具有代表性的实验室数据集,可用于泛化诊断验证。实验采用多个 6203 型滚动轴承(包含人工模拟损伤和实际损伤,如图 7 所示),该数据集在相关基准研究中被高度推荐(Hendriks 等,2022)。选取多组实际损伤轴承的振动信号,验证独立样本评估基准的有效性;具体而言,将 K006、KA22 和 KI21 轴承的信号作为目标域测试集(从未出现在训练集中),其余轴承作为训练集(如表 2 所示)。为每个轴承随机采样 1000 个样本,每个样本包含 5120 个振动数据点。首先探究一维卷积分块(1-DCP)中步长s和重叠率对模型性能的影响,通过不同结构的 Transformer 基模型获取未见过设备诊断精度(UDA);根据实验结果(如表 3 所示),最终确定步长s取值为 256。 图 7. 帕德博恩大学轴承数据集的实验环境表 2 帕德博恩大学轴承数据集的轴承详情 表 3 步长与重叠率对泛化性能的影响 开展对比实验,分别获取传统基准下的 源设备诊断精度(SDA) 和独立样本评估基准下的 UDA,10 次实验的平均结果如表 4 和图 8 所示。可以看到,在传统基准下,所有测试的深度学习模型均能轻松实现接近 100% 的源设备诊断精度;但在新轴承个体测试中,模型无法维持预期的高精度,部分 CNN 模型的 UDA 出现大幅下降 ——WDCNN、TICNN 和 MSRFCNN 的 UDA 分别仅为 69.73%、73.64% 和 65.32%;通过先进结构提升感受野的 SRDCNN 和 MS MCNN,UDA 分别达到 85.44% 和 77.73%。得益于 Transformer 特有的全局注意力机制,嵌入本文所提模块的系列 Transformer 基模型展现出更优泛化性能;消融实验进一步表明,两个设计模块分别实现了 2.45% 和 2.08% 的 UDA 提升,同时让模型训练更稳定,最小标准差仅为 0.968。值得注意的是,10 次实验中 CNN 模型的训练过程极不稳定,导致 UDA 波动较大(例如 TICNN 和 SRDCNN 的部分实验结果 UDA 甚至超过所提框架),这说明 CNN 的特征提取具有较强随机性且缺乏过滤机制 —— 由于 CNN 的感受野局限于局部特征,且信号输入的空间位置具有动态性,其无法保证提取的每个局部特征都具备通用性和故障关联性。表 4 轴承故障诊断对比实验结果 图 8. 所有模型的轴承诊断精度箱线图 此外通过 T-SNE 可视化和混淆矩阵,从类别层面探究该现象(如图 9 和图 10 所示)。图 9 中 “I-F” 代表内圈故障样本,“O-F” 代表外圈故障样本;可以看到,部分 CNN 模型存在明显的个体聚类现象(尤其是 WDCNN 和 TICNN),直观反映出其提取的特征包含与个体相关、与类别无关的干扰信息 —— 该现象越显著,模型越难提取类别相关特征,跨设备泛化能力也就越差。故障个体间的域偏移问题更为严重,部分模型对外圈故障 L14 的误报率较高。而所提模型将 15 个轴承个体划分为 3 个区域,类内距离最小,同类别轴承可聚集形成重叠的公共簇。图 10 的混淆矩阵进一步阐明各类别的分类结果:多数网络对未见过的正常样本识别精度优异,但对新故障类别(尤其是内圈故障)易与外圈故障混淆,这说明部分对比 CNN 模型的决策特征并非精准的故障关联特征。所提模型能够从有限的源域信息中提取更准确的故障关联信息,充分证明其具备更高的应用潜力。 图 9. 所有模型决策层的 T-SNE 可视化。I-F 代表内圈故障样本;O-F 代表外圈故障样本 图 10. 所有模型的混淆矩阵 5.2 案例 2:实际生产线整机级电机数据集 本节提供一个实际生产线的应用案例。整机级电机是更复杂的多部件旋转系统,通常存在复合故障和更复杂的工业噪声。选取某厂商维修检测现场 18 台 1000rpm 的电机开展测试,通过 4 个通道采集融合振动信号,采样频率为 25600Hz;将 1-14 号电机作为训练集,15-18 号电机作为未见过的目标域测试集(如表 5 所示)。该数据采集环境无精密实验平台,导致域偏移和个体差异问题更为严重(如图 11 所示),即使是原始数据也能清晰观测到个体差异现象,因此独立样本诊断任务的重要性进一步凸显。针对复合故障标签,采用 F1 分数评估未见过设备 F1 值(UDF1),对比实验结果如表 6 所示。表 5 电机数据集详情 图 11. 实验平台与个体差异表 6 电机故障诊断对比实验结果 与案例 1 的轴承实验结果类似,电机故障诊断的源设备 F1 值(SDF1)与未见过设备 F1 值(UDF1)差异显著:WDCNN 的 UDF1 达 82.53%,超过 TICNN 的 66.80%;SRDCNN、MSRFCNN 和 MS MCNN 的 UDF1 分别为 84.53%、76.97% 和 86.27%。需要注意的是,Transformer 基架构的整体泛化性能优于 CNN 架构;对于所提模型,两个设计模块分别带来 1.85% 和 2.31% 的泛化性能提升,进一步验证了该特殊设计的优越性与通用性。 5.3 分析与讨论基于上述两个案例,从以下方面对智能故障诊断技术展开进一步讨论与总结: 1)个体差异的普遍性:轴承和整机级电机中均普遍存在个体差异,且会对数据驱动模型产生显著影响。如图 2 和图 9 所示,即使是同类型设备,不同个体间的数据仍存在分布差异,这是传统基准此前忽视的潜在缺陷。强烈建议未来在数据集构建和算法开发中纳入个体泛化考量:构建新数据集时,应采集多台设备的数据而非单一设备;验证算法性能时,训练集与测试集不应来自同一设备个体。 2)传统基准的局限性:传统基准无法有效验证模型对采集过程和测试环境引入的故障无关特征的屏蔽能力(如图 12 所示,所有 SDA 和 SDF1 均接近 100%)。在同一设备不同时段诊断中取得的高性能,无法保证模型的工程可靠性。部分基于传统诊断基准的算法模型可能仍具备有效性,但建议研究人员重新验证其独立样本泛化能力和实际工业场景适用性。 3)复杂系统诊断的挑战性:整机级电机数据集的诊断任务比实验室轴承数据集更具挑战性。尽管电机数据集规模大于轴承数据集,但其性能指标仍低于实验室轴承 —— 这可能是由于现场信号受更多干扰因素影响,且需处理更复杂的复合故障。 4)个体差异的缓解思路:增加同类设备数量可弱化个体差异,或通过设计多试验台训练数据主动掩盖个体差异;但在故障诊断领域,由于有效样本个体稀缺且标注成本高昂,此类增加数据样本的方案目前不具备实用性。 5)Transformer 模型的潜力:Transformer 基模型是极具前景的网络架构,其优异的全局特征感知能力和注意力机制,非常适合处理个体差异引发的全局特征偏移和无关干扰。 图 12. 源设备 F1 值(SDF1)与未见过设备 F1 值(UDF1)的对比6 总结本文探究了一种此前被忽视的、由动态数据采集过程、复杂测试环境以及固有装配差异引发的域偏移现象。即便对于状态类型相同的设备,不同个体间的数据分布仍存在差异。该现象在复杂整机级设备的故障诊断任务中表现得更为显著,使得此类诊断任务相比实验室轴承故障诊断具备更高的挑战性。仅在源设备个体上验证得到的高性能结果,无法保障模型的工程可靠性。 为此,本文提出了一种基于独立样本的个体泛化框架,并设计了一款改进型轻量化 Transformer 作为可行的解决方案,该模型融合了卷积神经网络(CNN)与 Transformer 架构的优势。研究还设计并嵌入了即插即用型模块,以实现多尺度信息交互与特征剪枝。 在公开轴承数据集与实际生产线工业电机数据集上开展的全面实验表明,独立样本评估基准具备重要的实践价值,同时也验证了所提模型的优越性。 在未来的研究工作中,我们将针对多台设备个体(而非单一设备)采集综合性数据集,且所有算法验证均会采用个体泛化框架。我们将进一步探究数据集规模对个体差异的影响,并致力于解决复杂整机级系统的复合故障诊断难题,尤其是未知复合故障组合的诊断任务。此外,个体差异的作用机制与影响因素也将是未来的研究方向,相关研究成果将有助于研发更可靠、更先进的特征提取模型。 开源代码获取:点击文章左下角阅读原文即可获取。编辑:李正平校核:陈凯歌、赵栓栓、曹希铭、赵学功、白亮、任超、海洋、陈宇航、Tina、王金、Kira、赵诚、肖鑫鑫、张优该文资料搜集自网络,仅用作学术分享,不做商业用途,若侵权,后台联系小编进行删除来源:故障诊断与python学习

未登录
还没有评论
课程
培训
服务
行家
VIP会员 学习计划 福利任务
下载APP
联系我们
帮助与反馈