工业传感器持续产生多变量时间序列,训练数据又未必是完全干净的正常样本。采集噪声和系统偏差造成数据漂移后,正常数据与异常数据可能在原始空间重叠,基于密度的检测器容易给正常片段较高的异常分数。
同济大学与韦恩州立大学团队提出自适应隐空间分布模型(Adaptive Latent Distribution Model,ALDM)。模型先用上下文学习、可学习距离和软分配构建隐表示,再由条件归一化流估计隐空间密度。作者还给出事件级评价指标,并公开包含 180 个人工注入异常事件的田纳西-伊士曼过程扩展(Tennessee Eastman Process Extension,TEPE)数据集。
英文题目 Adaptive Latent Distribution Modeling for Industrial Time Series Anomaly Detection
作者 Yu Liu、Yifan Song、Shaolong Shu、Feng Lin、Jun Wang、Yafeng Guo
作者与机构 Yu Liu 来自同济大学计算机科学与技术学院。Yifan Song、Shaolong Shu、Jun Wang、Yafeng Guo 来自同济大学电子与信息工程学院,Feng Lin 来自韦恩州立大学电气与计算机工程系。
期刊信息 IEEE Transactions on Automation Science and Engineering,Vol. 23,2026,7893-7907
发表时间 2026 年 3 月
DOI 10.1109/TASE.2026.3674236
问题 采集噪声和偏差会造成数据漂移,使正常与异常分布在原始空间重叠。直接建模原始数据密度时,漂移后的正常片段可能进入低密度区域并触发误报。逐点 F1 分数(point-wise F1 score,F1)和 AUROC 也无法直接判断完整异常事件是否被检出。
方法 ALDM 用上下文学习提取变量依赖和时间关系,以自适应距离计算和软分配训练隐编码器,再用条件归一化流估计隐表示的密度。训练集异常分数的四分位距用于确定测试阈值。
证明 ROC曲线下面积(Area Under the Receiver Operating Characteristic Curve,AUROC)采用百分数表示时,ALDM 在安全水处理(Secure Water Treatment,SWaT)、池化服务器指标(Pooled Server Metrics,PSM)、火星科学实验室探测器(Mars Science Laboratory rover,MSL)和 TEPE 上分别达到 90.5±1.3、86.8±3.4、70.1±0.8、82.5±0.8,均为表中最高值。四个数据集的事件级 F1 分数(event-level F1 score, )也均为最高值。MSL 的逐点 F1 是例外,ALDM 为 0.3926,低于 CrossAD 的 0.4058。
论文研究工业信息物理系统(Industrial Cyber-Physical Systems,CPS)的无监督多变量时序异常检测。含 个变量、总长度为 的序列先按窗口长度 和步长 切分,每个分段经过模型后得到正常或异常的二元标签。实验采用污染训练设定,即训练数据允许含有异常样本。
这项任务包含一条连续的问题链。采集噪声和偏差先引起数据漂移,漂移让正常与异常分布在原始空间发生重叠,重叠又使密度模型难以划清两类边界。论文图 1 选取 SWaT 数据集中全部为正常的时段,蓝色 区域出现垂直漂移后,GANF 和 MTGFlow 的异常分数明显升高,ALDM 的分数变化较小。
ALDM 不在原始数据空间继续拟合密度,而是先学习一个更适合分布建模的隐空间。
论文图 3 给出了完整数据流。输入分段同时进入上下文学习和隐编码路径。上下文学习产生条件信息 与时间嵌入 ,时间嵌入用于计算距离 和软分配权重。软分配进入对比损失并更新隐编码器。编码器输出 后,条件归一化流根据 对其密度建模,最终由似然得到异常分数。
图中的三条主线分别对应上下文条件、隐空间学习和异常判定。训练阶段同时更新三个模块,测试阶段沿用训练好的网络与训练分数确定的阈值。
上下文学习(Context Learning,CL)接收一个 的多变量分段。模型把不同传感器变量视为图节点,以自注意力学习当前分段的动态邻接矩阵。循环神经网络提取时间隐藏状态,图卷积再融合变量依赖、当前隐藏状态与前一时刻隐藏状态,输出空间-时间条件 。
这部分信息有两个去向。时间嵌入 进入自适应距离计算,融合后的 则作为归一化流的条件信息。
自适应距离计算(Adaptive Distance Computation,ADC)不预先固定一种距离公式。论文通过矩阵分解构造可学习度量:
为循环神经网络输出的时间嵌入维度。 为下三角矩阵, 为对角矩阵。两者随机初始化,并在训练中通过梯度下降更新。时间嵌入 与 的距离为:
表示同一分段内两个时间位置的上下文距离。距离越小,软分配(Soft Assignment,SA)权重越大:
为 sigmoid 函数, 控制权重分布的锐度。 进入时间级对比损失,用于调节不同时刻之间的学习权重。
隐编码器由输入投影、时间戳掩码和膨胀卷积网络组成。训练时,模型从同一分段中采样两个重叠区间并执行掩码,形成增强视图。膨胀卷积网络含 10 个残差块,每块有两个一维卷积层,第 个残差块的膨胀率为 。实例级损失负责区分不同分段,时间级损失利用软分配建模分段内部的时间关系,两者共同组成 。
条件归一化流(Conditional Normalizing Flow,CNF)接收隐表示 和上下文条件 ,通过一系列可逆变换把复杂隐分布映射到高斯基分布,并以最大似然损失 训练。
ALDM 的联合目标为:
用于平衡密度建模与对比学习,论文默认取 。
第 个分段的异常分数是隐表示各维度的平均负对数似然:
在这里表示隐表示参与求和的维度数, 是第 维分量。似然越低, 越高。
训练结束后,模型先计算整个训练集的异常分数,再采用四分位距(Interquartile Range,IQR)规则确定阈值:
和 分别是训练分数的第 25 和第 75 百分位数。测试分段依次经过上下文学习、隐编码和 CNF。若 高于阈值,模型输出异常标签。
工业异常通常持续一段时间。逐点指标关注单个时间点,不能直接回答一个完整事件是否被检出。论文图 2 中,方法 1 检出的异常点更多,却只覆盖一个真实事件。方法 2 检出的点更少,但覆盖了全部三个事件。
作者把连续真实异常点定义为异常事件,把连续预测异常点定义为预测段。真实事件与一个或多个预测段存在完全或部分重叠时,计入事件级真正例 。没有任何重叠时,计入事件级假负例 。事件召回率为:
事件精确率在逐点精确率上加入假正例惩罚:
和 分别是逐点真正例数和假正例数。该式中的 表示正常数据点总数,与前文表示变量维度的 含义不同。事件级 F1 为:
该指标把异常事件覆盖率与逐点假正例惩罚合在一起。论文同时报告 AUROC、未应用逐点调整的逐点 F1,以及事件级 。
实验覆盖三个公开数据集和作者构建的田纳西-伊士曼过程扩展(Tennessee Eastman Process Extension,TEPE)数据集。
TEPE 扩展自田纳西-伊士曼过程,覆盖反应器、产品冷凝器、气液分离器、循环压缩机和产品汽提塔。论文构建该数据集,是因为 SWaT、PSM、MSL 中可用于事件级评价的异常事件数相对有限。
图 4 给出 TEPE 的主要过程单元及其连接关系。它说明 53 个过程变量来自同一化工流程中的多类测量和控制位置。
参与比较的基线包括 DeepSAD、DeepSVDD、USAD、DAGMM、GANF、MTGFlow、FITS 和 CrossAD。论文使用各方法公开实现,保留原网络结构,并采用对应文献报告的超参数。
全部实验运行于 Ubuntu Linux 64 位、Python 3.8 和 PyTorch 环境,硬件为 Intel Core i9-13900KF @5.8 GHz、32 GB 内存和 NVIDIA RTX 4090 @24 GB。所有实验的检测窗口为 60,步长为 10。ALDM 的权重衰减为 ,优化器采用 AdamW。OneCycleLR 的起始百分比为 0.2,初始学习率为 0.002,最大学习率为 0.004。
训练流程依次是分段、上下文与隐空间联合训练、训练集异常分数计算和 IQR 阈值确定。测试时使用训练好的网络计算分段分数,再与同一阈值比较。论文正文没有给出精确训练集与测试集样本数、随机种子和重复实验次数。
论文表 II 的 AUROC 以百分数表示,结果写作均值±标准差。原文没有说明重复实验次数。ALDM 与各数据集次高方法的对比如下。
图 5 展示四个数据集上的 ROC 曲线。表 II 中,ALDM 在四个数据集的 AUROC 均为最高值。
论文表 III 没有采用 point adjustment。ALDM 的逐点 F1 与事件级 分别为:
ALDM 在四个数据集的事件级 均为最高值,在 SWaT、PSM 和 TEPE 的逐点 F1 也为最高值。MSL 上,CrossAD 的逐点 F1 为 0.4058,高于 ALDM 的 0.3926。这个例外说明逐点结果与事件级结果需要分开报告。
图 6 对比 ALDM 与 MTGFlow 在 SWaT 和 TEPE 上的异常分数。按作者描述,ALDM 在异常区域给出更高分数,在正常区域给出更低分数,并在部分事件边界处呈现更陡的变化。
作者使用增广迪基-富勒检验(Augmented Dickey-Fuller,ADF)比较四个数据集的平稳性。
论文将 SWaT 和 MSL 描述为非平稳性较强的数据集。ALDM 在二者上的 AUROC 增幅分别为 5.7 和 2.9 个百分点。
图 7 第一行是 MTGFlow,第二行是 ALDM。MTGFlow 在 SWaT、PSM、MSL、TEPE 上的正常与异常分数重叠值分别为 0.28、0.44、0.33、0.09。作者报告 ALDM 在四个数据集上的重叠面积均更小,但没有在正文逐一列出 ALDM 的四个数值。
论文考察 CL、ADC 和 SA 的作用。SWaT 上,三个数值依次为 AUROC、逐点 F1、事件级 。
SA 在 SWaT 上带来的变化最大,M0 到 M1 的 AUROC 提高 15.0 个百分点,逐点 F1 提高 0.3386,事件级 提高 0.4523。CL 的作用存在数据集差异,部分 PSM 和 TEPE 配置的某些指标会下降,因此不能把消融结果概括为每个模块在所有条件下都单独提高全部指标。
论文还将 ADC 与表 VI 中的 TD、COS、DTW 三种静态距离标记比较。ADC 在四个数据集的 AUROC 和事件级 均为最高值。TEPE 的逐点 F1 是例外,TD 为 0.6244,ADC 为 0.6175。原文没有展开 TD 的全称。
直接学习完整距离矩阵时,训练初期出现 NaN。特征值裁剪需要在每轮训练后执行半正定锥投影,SWaT 上每轮耗时为 283 秒,Cholesky 分解方案为 30 秒。
图 8 给出 SWaT 在第 1、30、60 和 100 轮训练时的 t-SNE 分布。蓝色表示正常样本,红色表示异常样本。图中两类样本的边界随训练逐渐变得清晰。
ALDM 单次推理约需 223 MFLOPs。论文以 NVIDIA Jetson Nano 的 141 GFLOPs 算力估算单次推理延迟为 20-50 ms,该数值是估算结果。
在 RTX 4090 实验环境下,ALDM 处理四个完整数据集的训练时间和测试时间为:
SWaT 上,MTGFlow 的训练时间为 2.86 分钟,测试时间为 4.84 秒。ALDM 对应为 38.34 分钟和 9.36 秒。表 VII-VIII 显示,ALDM 的训练成本明显较高,测试时间仍处于秒级。
论文扫描了窗口大小 、隐空间维度 和损失平衡权重 。
图 9 分别给出窗口大小、隐空间维度和损失权重对三类指标的影响,曲线也显示不同数据集对窗口和权重的偏好并不完全一致。
论文给出三项适用边界。
作者提出的后续方向包括更稳健的阈值机制、更灵活的生成先验,以及其他隐空间投影技术。
通讯作者: 舒少龙,同济大学控制科学与工程系教授,博士生导师。研究方向包括离散事件系统、信息物理系统、智慧监控与工业智能等。聚焦于信息物理系统中的逻辑动态行为,创建了以可测性为核心的离散事件动态系统状态估计理论。发表论文80多篇,在控制领域顶级期刊IEEE Transactions on Automatic Control和Automatica上发表论文10多篇。主持国家级项目4项,参与承担国家级项目10多项。研究成果应用于智能建筑、智慧电网、智慧港口等行业中,获上海市自然科学二等奖一项(第一完成人)。