通过传感器数据×数据解析进行的设备维护DX
第3篇 面向实现预估性维护的数据解析―利用正态分布的方法(1)
在“通过传感器数据×数据解析进行的设备维护DX”系列的第2篇中,我们对预估性维护中使用的数据解析技术以及数据解析的推进方法进行了解说。结合第1篇的内容,您应该已经掌握了将预估性维护与数据解析相结合时的要点。“通过传感器数据×数据解析进行的设备维护DX”系列介绍专门针对数据科学的内容,对预估性维护中使用的代表性数据解析方法进行解说,而在第3篇的本文中,我们重点介绍一种简单且有效的利用正态分布的霍特林T2方法。
引言―本文的结构
图1展示了本文的结构流程。在第1部分中,介绍本系列的方法说明中共通的内容。为深入讲解方法的细节,部分内容会使用数学公式,但会结合示意图和使用人工数据的具体事例,对霍特林T2方法的机制和实际应用进行通俗易懂的解说。
1. 异常度的定义和异常判定机制
本文及后续文章中介绍的离群值检测、异常检测和变化检测的全部方法,其共同目的是将表现出“与平时不同的行为”的数据点或其集合,作为离群值、异常或变化有选择地识别出来(有关离群值检测、异常检测和变化检测的概念,请参见第2篇)。为了通过具体方法实现这一目的,需要将“与平时不同的行为”这一概念,即异常本身,进行有效的数值化和定量化。
将异常进行数值化和定量化后的指标,通常称为异常度。异常度是以被认为表现出平时行为的数据点或数据集合(正常数据)为基准,定义为某个数据点或数据集合偏离该基准程度的一个取正值的数值指标(图2)。通过引入异常度,可以直观地理解为:如果某数据的异常度较小,其行为与平时相似;如果异常度较大,则表示存在异常。虽然异常度的定义会因所用方法而异,但其含义是与上述说明内容共通的。
为了使用异常度最终判断正常和异常,需要设定用于区分正常与异常的异常度阈值(图2右)。阈值的设定方法因具体方法而异,此外也常常根据使用者的需求来确定(<专栏1>离群值检测、异常检测和变化检测方法的评估指标)。需要认识到的重要一点是,基本上不存在适用于所有方法的通用阈值标准,而是需要根据具体场合自行设定。
以上内容是理解离群值检测、异常检测和变化检测的多个方法时需要掌握的最低限度的要点。在记住这些内容的基础上,下一部分将深入介绍离群值检测和异常检测中具有代表性的利用正态分布的方法的细节。
2. 利用正态分布的离群值检测和异常检测方法细节―霍特林T2方法
利用正态分布的离群值检测和异常检测方法被称为霍特林(Hotelling)T2方法。该方法假设为,当现有的正常数据为一维时,服从一维正态分布(图3-(i));当为多维时,服从多维正态分布(图3-(ii)),并据此进行异常度的定义和阈值设定。
在本部分中,首先说明使用一维正态分布*1的霍特林T2方法,然后说明在此基础上扩展到多维正态分布*1的霍特林T2方法。最后,介绍该方法在实际应用中的优缺点。本部分的结构旨在通过循序渐进的阅读加深对该方法的理解。
*1 一维正态分布和多维正态分布,亦分别称为单变量正态分布和多变量正态分布。
2.1 一维正态分布中的异常度和阈值
假设一维的正常数据服从一维正态分布(图3-(i))。根据正态分布的性质,此时正常数据将由以𝜇为中心、离散程度约为𝜎的值组成。正态分布的参数𝜇和𝜎需要根据现有的正常数据事先进行估计。
在上述假设下,某个数据点𝑥的异常度𝑎(𝑥)可由公式(1)定义。同时,图4给出了用于说明异常度概念的具体示例。
在图4中,假设两种类型的正常数据分别服从正态分布𝒩₁和𝒩₂。以下将通过在各分布中存在数据点𝑥₁和𝑥₂的示例,力求理解异常度这一指标以及阈值的概念。在该示例中,假设𝑥₂为正常数据,𝑥₁为异常数据。
从图4-(i)和公式(1)可以看出,异常度的分子项对应于某个数据𝑥与正常数据所服从的正态分布中心𝜇之间的距离,可以将该项理解为对“与平时不同”进行了单纯数值化。然而,只有分子项时,无法考虑正态分布的离散程度𝜎₁、𝜎₂*2。分母项则有效地弥补了这一点。图4右侧显示了𝑥₁和𝑥₂的异常度的实际计算结果,正如预期,𝑥₁的异常度值远大于𝑥₂,这清楚地表明异常度能够有效考虑分布的离散程度。
在阈值设定方面,可以利用异常度本身服从自由度为(1, 𝑛−1)的F分布,或自由度为1的卡方分布(<专栏2>卡方分布和F分布)这一概率分布的性质。F分布的自由度中出现的𝑛对应于用于估计参数𝜇和𝜎的正常数据的数量。
图3-(ii)显示了异常度近似服从的自由度为1的卡方分布,其形状表明,随着异常度增大,概率密度降低。也就是说,具有较大异常度的数据可以解释为发生概率很低的少见事件。使用概率分布时,根据某个数据异常度的罕见程度,即其发生概率,来设定将其视为异常的阈值。
如前所述,并不存在适用于全部情况的通用阈值,需要根据具体问题设定适当的值。按照惯例,经常使用卡方分布的上方5%或1%水平*3,并表示为𝛼=0.05或𝛼=0.01。图4-(ii)中的示例采用上方5%水平作为阈值,当某个数据的异常值高于该水平(图4-(ii)中的红色区域)时,即将该数据判定为异常。
以上讲述了利用概率分布进行阈值设定的方法,但除此之外还存在多种决定方法,如利用异常度大小本身的使用分位点(例如:上方1%点)的方法等。
*2 如果仅将分子项定义为异常度,则会得到数据点𝑥₂为异常的与预期相反的结果。
*3 对应于表现该异常度的数据出现概率为5%或1%的卡方分布值。
2.2 多维正态分布中的异常度和阈值
当正常数据为多维(𝑁>1)时,虽然数学公式会更加复杂,但思路本身与一维情况并无显著变化。假设数据维度为𝑁维,正常数据服从多维正态分布,并根据现有的正常数据预先估计其参数𝝁和𝚺⁻¹。此时,某个数据点𝒙=(𝑥₁, 𝑥₂, ⋯, 𝑥𝑁)T的异常度定义如下。
与公式(1)时相同,图5给出了公式(2)的具体计算示例(𝑁=2)。公式(2)中两次出现的(𝒙−𝝁)对应于公式(1)中的分子项,而𝚺⁻¹对应于公式(1)中的分母项,其含义与公式(1)几乎相同。如前所述,公式(1)中的分母项起到对分布离散程度进行均衡化的作用,而公式(2)中的分母项除了这一作用外,还能够在构成数据点𝒙的多个元素单位不同的情况下,以整合其信息的方式进行均衡化*4,并在各元素之间存在相关性时,能够有效反映其影响。通过进行具体的计算,可以更准确地理解这一点。对计算细节感兴趣的读者,请参阅图5-(ii)和(iii)中的计算示例。特别是关于相关性影响的讨论,将在Part 2的第3部分中结合使用人工数据的具体示例再次进行说明。
计算异常度之后的步骤与一维情况全然相同。唯独不同的一点是概率分布的自由度:对于多维正态分布,异常度服从自由度为(𝑁, 𝑛−𝑁)的F分布,或自由度为𝑁的卡方分布(<专栏2>卡方分布和F分布)。F分布的自由度中出现的𝑛对应于用于估计𝝁和𝚺⁻¹的正常数据的数量。
*4 例如,当𝒙=(𝑥₁, 𝑥₂)T时,假设𝑥₁为振动传感器值,𝑥₂为温度传感器值。两者在单位和可能的数值范围上全然不同,但通过公式(2)的分母项,可以计算有效综合考虑这两个值的异常度。图5及Part 2的第3部分中给出了相关示例。
2.3 霍特林T2方法的优缺点
以上对霍特林T2方法的细节进行了解说,关于其在实际应用中的相关优缺点,汇总于下方的表1中。针对缺点,还记载了其应对措施。
| 优点 | ・方法的机制清晰,结果易于解释 ・可处理多维数据并能考虑其相关性结构 |
|---|---|
| 缺点 | ・当正常数据不服从正态分布(例如:具有多峰的分布)或 存在特别异常的离群值时,性能会下降 ・当数据维度相对于数据数量过高时,性能会下降(维度灾难) ・发生异常时,无法计算哪个变量的影响大 |
| 针对缺点的应对措施 | ・考虑采用更灵活的方法(例如:具有多峰的分布:高斯混合模型(GMM)), 并在预处理中从正常数据中去掉离群值 ・事先删除不必要的变量,或通过降维避免维度灾难 (例如:主成分分析(PCA)、偏最小二乘回归(PLS)) ・使用能够计算各变量对异常贡献度的方法(例如:马氏距离-田口方法) |
<专栏1>离群值检测、异常检测和变化检测方法的评估指标
在离群值检测、异常检测和变化检测中,虽然有时可以通过目视检查对结果进行定性判断,但对结果进行定量评估也同样重要。对结果进行定量评估时不可或缺的是评估指标。图6给出了离群值检测、异常检测和变化检测中使用的代表性评估指标。
通过使用这样的评估指标,可以对需要实现的目标进行定义,从而有助于与预估性维护的利益相关者进行顺畅沟通,并能够比较不同方法获得的结果等,其益处十分显著。
另一方面,需要注意的一点是,在预估性维护中,有需要使用能够对希望进行定量评估的要点进行适当评估的评估指标。虽然一般常用的指标如图6所示,但具体应使用哪个指标需要根据实际情况决定。在选择评估指标时,重要的是重新确认预估性维护的目的以及为实现该目的应评估什么内容,同时确认在类似事例中使用的指标。应认识到,如有需要,创建独自的评估指标并用于评估,也存在这样的选项。
<专栏2>卡方分布和F分布
作为霍特林T2方法中异常度所服从的分布而出现的卡方分布和F分布,是具有如下所示性质的分布。
[卡方分布](“卡”为希腊字母𝜒)
当某个随机变量𝑧服从标准正态分布*5时,从该分布中独立获得的𝑚个变量𝑧𝑖(𝑖=1~𝑚)的平方和服从自由度为𝑚的卡方分布,其定义如下。
*5 指由𝒩(𝜇=0, 𝜎²=1)表示的正态分布。服从任意正态分布𝒩(𝜇, 𝜎²)的变量𝑥,都可以通过以下公式(3)所示的称为标准化的操作,将其转换为服从标准正态分布的变量𝑧。
自由度是决定分布形状的参数。赋予不同自由度时的卡方分布形状如图7-(i)所示。
卡方分布用于分布的拟合优度检验以及独立性检验等。在霍特林T2方法中,当正常数据数量𝑛足够大时,可以假设异常度近似服从卡方分布。
[F分布]
当某个随机变量𝑢、𝑣服从相互独立的自由度为𝑝, 𝑞的卡方分布(𝑢~𝜒𝑝², 𝑣~𝜒𝑞²)时,自由度为𝑝, 𝑞的F分布定义如下。
自由度是决定分布形状的参数。赋予不同自由度时的F分布形状如图7-(ii)所示。
F分布用于检验两个数据集的方差是否相等的F检验等。在霍特林T2方法中,可以假设将异常度乘以适当的尺度因子后得到的数值服从F分布。