Table of Contents
网络物理系统(CPS)将物理过程与数字控制系统整合,使得制造,运输和能源等各种行业能够实现自动化. 确保这些系统的安全和可靠性至关重要,特别是因为它们变得更加相互关联和复杂,关键的挑战之一是发现可能表明缺陷或网络攻击的异常现象,深层学习提供了强大的工具,通过从大量传感器和日志数据中学习复杂的模式来应对这一挑战,本条探讨了CPS中突出的异常探测深层学习技术,执行考虑,以及前进的道路.
了解CPS中的异常检测
异常检测涉及识别数据中不符合预期行为的模式。 在CPS中,异常现象可以表现为非正常的传感器读数、意外的系统响应或不规则的网络流量。 早期检测有助于防止故障、减少故障时间和加强安全。CPS中的异常现象可以分为点异常(突然突起)、背景异常(在特定时间背景下数据点异常)和集体异常(偏离正常模式的序列)。例如,管道中压力的突然下降可能表明漏水,而逐渐偏离的温度读数则会显示传感器的退化。 有效的检测必须考虑到CPS数据固有的高维度、时间依赖性和噪音。
异常检测的深层学习技术
深层学习通过使模型能够从大型数据集中学习复杂的模式,使异常探测发生了革命性的变化。 下面是CPS中应用的关键技术,每个技术都有不同的优点和使用案例。
自动编码器
自动编码器是神经网络, 训练来重建输入数据。 当重建错误超过阈值时, 异常物会被识别。 在 CPS 中, 它们被广泛用于在多变量传感器流上进行无监督的异常检测。 诸如稀疏的自动编码器、 解析自动编码器和 转录自动编码器等变体, 提高了噪音和空间模式的稳健性。 一个关键优势是自动编码器不需要标签异常; 它们学习正常行为和国旗偏差。 然而, 阈值选择和模型对正常变异的敏感性仍然是挑战 。
经常性神经网络(RNN)和长期短期记忆(LSTM)
RNN是针对顺序数据设计的,可以建模时间依赖性. 在CPS中,传感器读数形成时间序列,RNN预测未来值,并检测异常作为预测错误突起. LSTM和GRU变体减轻了消失的梯度问题,使其对长期依赖性有效. 例如,一个接受过正常生产周期训练的LSTM模型,在预测传感器值与实际读数相差时,可以检测异常. 注意机制通过聚焦相关时间步骤,进一步提高性能. 混合模型结合LSTM与自动编码器或CNN也非常流行.
革命神经网络(CNN).
CNN在空间或时间数据中擅长学习局部规律. 在CPS中,1D CNN处理时间序列传感器数据以提取突起或振荡等特征,而2D CNN可以应用于光谱或图像(例如从热相机). CNN在计算上效率高,既可用于分类,也可以用于重建异常探测,它们经常与RNN(例如CNN-LSTM)结合,以捕捉局部和顺序规律. Dald contellion和剩余连接可以增强处理长序的能力.
变异自动编码器(VAEs)
VAEs通过学习概率潜伏空间来扩展标准自动编码器。VAEs不单计算重建日志的相似性和KL差异,而是提供了量化不确定性的原则方法。这使得它们能够有效地检测罕见或新颖的异常。在CPS中,VAE被用于检测工业机械的微妙退化,并识别异常的控制指令。它们的基因性质也可以模拟反事实情景,协助进行根源分析。
遗传性横向网络(GANs)
GAN由一个发电机和一个受过对抗训练的歧义者组成. 对于异常探测,GAN学习正常数据的分布;异常被确定为生成者无法准确重建的数据点或者歧视者分类为假数据点. AnoGAN和高效GAN(EGBAD)是流行的变体. GAN在CPS中被成功用于断层探测和攻击识别,特别是在正常数据丰富且异常现象罕见的情况下. 然而,训练GAN可能是不稳定的,需要小心的超参数调制.
图表神经网络(GNNs)
许多CPS(如电网,水分配网络)都有基础的图结构. GNN可以通过沿边缘传播信息来建模传感器和动器之间的依赖性. GGraph community network(GCN)和 Graph 注意网络(GAT)通过学习节点表示和标注邻里模式的偏差来检测异常,这种方法对于检测协调攻击或级联故障是强有力的,挑战在于构建精确的系统图和管理大型网络.
执行情况考虑
CPS中实施异常检测的深度学习需要仔细考虑数据质量,模型培训和实时处理. 关键因素包括:
数据收集和预处理
传感器、动因器和网络日志提供的高质量、具有代表性的数据至关重要。 诸如正常化、处理缺失值和过滤噪音等预处理步骤提高了模型的稳健性。 数据增强(例如,增加合成异常)有助于解决类失衡问题。时间序列对接和滑动窗口分割对于顺序模型至关重要。
地物工程
虽然深层学习可以自动学习特征,但特定域的工程仍然可以提升性能. 诸如统计瞬间,频率域变换(FFT,波浪),滚动统计等特性提供了有用的前兆. 对于基于图表的模型,辅助矩阵和节点属性必须小心定义.
示范培训和鉴定
培训往往使用无监督或半监督的计划,因为标签异常很少。 常见的方法包括一等分类、最小化重建错误和最小化预测错误。 验证需要合成或标签异常集;精确度、召回度、F1分数等计量标准,以及ROC曲线下的区域标准。 交叉验证必须尊重时间顺序以避免数据泄漏。
实时部署
CPS应用需要低潜性. 推算,量化,知识蒸馏等模型压缩技术对于边缘部署至关重要. 硬件加速(GPU,TPU,FPGA)和高效模型架构(如MobileNet,TinyML)可以实现实时推论. 递增学习的流化架构可以让模型适应概念漂移而无需从零开始再培训.
评价计量和阈值
选择重建或预测阈值直接影响到假正率。 适应性阈值(例如移动误差平均值、动态百分位数)可以提高非固定环境中的稳健性。 此外,诸如检测假警报(MTTD)的平均值和在假警报(MTBFA)之间的平均值等衡量标准对于行动评估很有用。
挑战与未来方向
尽管人们有深度学习的希望,挑战依然存在。 平衡的数据集(罕见)可能导致模型偏向正常行为。 解释性是一个主要障碍:工程师需要信任模型输出,特别是在关键基础设施方面。 SHAP、LIME和注意力可视化等技术正在被采用,但需要进一步适应CPS。 反常的强健性是另一个问题 — — 攻击者可以设计逃避检测的投入。 最后,适应不断变化的系统行为(概念漂移)和跨不同但相关的CPS传输模型是积极的研究领域。
未来方向包括:
- Foblearning 在不共享原始数据的情况下,在多个CPS设施上培训保护隐私的模型.
- 解释性AI(XAI),为操作员提供可操作的洞察力,了解为什么标出一个数据点.
- 继续学习[,使模型能够适应新的正常模式,而不会灾难性的遗忘.
- 与基于物理学的模型(hybrid physics)结合,将数据驱动的规律与已知的系统动力学相结合,提高通缩性,降低数据要求.
- ] 用于探测设备上的异常情况,减少通信的超常和延迟。
结论
深层学习技术为网络物理系统中的异常检测提供了强大的方法,从而可以及早发现断层,提高安全性。 从自动编码器到图示神经网络,每一种技术都带来了适合不同的CPS架构和数据类型的独特优势。 成功实施取决于仔细的数据准备、模型验证和实时部署策略。 尽管可解释性和对抗性等挑战依然存在,但持续的研究保证了更有力和可信的解决方案。 随着CPS的继续扩展,深度学习将在保障其可靠性和安全方面起到越来越重要的作用。
关于这一专题的进一步解读,见[ Chaladathy和Chawla(2019)]的综合调查、NIST关于工业控制系统安全[的指南,以及最近关于[基于图的电网异常探测[的工作。此外, MLSys会议程序往往有与CPS有关的以部署为重点的文件。