通过传感器数据×数据解析进行的设备维护DX
第3篇 面向实现预估性维护的数据解析―利用正态分布的方法(2)
3. 霍特林T2方法的实际应用―基于人工数据的验证
本部分介绍使用人工数据实施离群值检测和异常检测的流程,旨在更加容易理解霍特林T2方法的运用。实施流程中也包含与第2篇的“2. 在预估性维护中进行数据解析的方法”中Step 2~4相对应的部分,因此这里沿用其表述。
3.1 使用的人工数据以及异常的观察和分类(Step 2和3)
图8展示了验证中使用的、模拟两种传感器(传感器1和2)的人工数据的时间序列图。数据前半部分为正常数据,后半部分为包含异常的验证数据,并提供了两种异常模式(异常数据①:绿色,异常数据②:橙色)。由于人工数据基于从正态分布生成的随机数,本次假设已预先知晓数据服从正态分布。
按照Step 2和3对异常进行分类时,可以看出异常数据②尤其在传感器2的数值上,呈现出似乎伴有漂移的异常。仅凭此图,很难将异常数据①识别为异常。这里暂且考虑以异常检测的形式应用霍特林T2方法。以下将把使用一维正态分布和多维正态分布的霍特林T2方法分别称为一维和多维霍特林T2方法。
3.2 方法的应用和结果评估(Step 4)
在本次的事例中,为了确认一维和多维(𝑁=2)霍特林T2方法的差异,实施了以下两种模式的情景验证(表2)。各情景的结果如图9所示。
从情景1的结果(图9-(i)和(ii))来看,对异常数据①完全未能检测出异常。对于异常数据②,虽然在传感器2一方有部分数据被正确判定为异常,但大多数仍未能判定为异常。另一方面,将视线转向情景2的结果(图9-(iii)),可以看到与情景1相比,异常数据①和②都有相当多的数据被适当地判定为异常,尤其对于异常数据②,几乎全部数据都成功被判定为异常。通过这一比较,可以理解假设多维正态分布的霍特林T2方法具有效果更优性。
在本文的最后,针对情景1与情景2之间为什么会产生较大的性能差异,我们想对其原因进行说明。关于这一点,通过在绘制传感器数据1和2的散点图上查看各情景中的阈值和异常判定范围,可以清楚地确认(图10)。
从散点图可以看出,在正常数据(黑色)中,传感器1与传感器2的值呈正相关*6。另一方面,在异常数据①(绿色)中,虽然传感器值的范围与正常数据相同,但呈负相关,而在异常数据②(橙色)中,虽然呈正相关,但传感器2的值相较于正常数据向略大的值偏移,二者都表现出偏离正常数据的行为。
这里希望关注的是情景1及2的阈值范围。在情景2中,阈值范围呈围绕正常数据的椭圆形(图10-(ii)白色背景),这是因为多维霍特林T2方法有效纳入了传感器1与传感器2之间的相关性(图5-(ii)和(iii)—Part 1的2.2部分)。因此,能够适当地将相关性不同的异常数据①以及传感器2值发生偏移的异常数据②判定为异常(图10-(ii)红色背景)。
与此形成对比的是情景1(图10-(i))。情景1中的一维霍特林T2方法,由于将传感器1和2分别作为输入,因此全然不考虑数据之间的相关性结构,而仅根据各传感器值的可能范围(图10-(i)白色背景)来判定异常。因此,尤其对于传感器值范围相同的异常数据①,结果是完全无法判定为异常。
*6 表示数据之间关联性或规律性的概念之一。当一方数值增加时,若另一方数值也增加,称为正相关,若另一方数值减少,则称为负相关。
4. 结语
本文从异常度的定义以及异常判定的机制导入讲解,随后对霍特林T2方法的理论与实际应用进行了解说。由于文中部分地方使用了数学公式,可能难以一次理解全部内容,但通过具体事例,希望您能够对霍特林T2方法的整体概况及其机制有了一定的了解。
不仅限于异常检测,在使用数据解析方法之际,理解其机制,并能够根据自身的课题选择合适的方法很重要。虽然理解机制需要投入时间和精力,但对于霍特林T2方法,希望您能通过多次反复阅读本文来加深理解。
[补充]与数学公式相关的定义及书写法
在处理数学公式之际,由于需要处理标量、向量和矩阵,因此将其定义和书写法整理于表3中。特别将与向量、矩阵及其操作相关的书写法整理于表4中。另外,与概率分布相关的书写法列于表5中。
(如果对表中记载内容的数学细节,或文中出现的指标的细节和定义感兴趣,建议查阅线性代数、统计学等专业书籍。)
*7 有时也会在向量、矩阵元素以外的用途附加下标数字和符号,这种情况下,每次会在文中进行定义。