检测数据非常值的五种统计技术

[复制链接]
发表于 昨天 03:36 | 显示全部楼层 |阅读模式

马上注册,结交更多好友,享用更多功能,让你轻松玩转社区。

您需要 登录 才可以下载或查看,没有账号?立即注册

×
处理数据的时候,最让人头大的往往不是复杂的模型调参,而是那些藏在角落里的非常值。
你是不是也遇到过这种糟心事:明明业务逻辑看着没毛病,一跑统计指标就飘红;或者模型结果突然断崖式下跌,排查半天发现是几个极端值在捣乱。
本日我们来聊聊最常用的 5 种非常值检测方法:Z-Score、IQR、LOF、Isolation Forest、马氏距离。
通过这篇文章,你将看到:

  • 什么数据形态该用哪种非常值检测方法。
  • 怎么用 Python 快速进行非常值检测并跑出结果。
  • 怎么把代码套到自己的业务数据上。
下面我们逐一来看。
1. Z-Score:用标准差倍数判定非常值

Z-Score 是最简单的一种,它算每个点和均值的距离,相当于几个标准差。一般 |Z| > 3 就算非常。
适合单变量、分布接近正态的数据。
下面拿北京地铁某站早高峰每分钟进站人数举例。
正常情况每分钟一百多人,偶然会有突发大客流或临时限流。
下面造 200 个正常值,围绕 120 波动,再塞 280、20、300 三个极端值。
  1. import numpy as np
  2. np.random.seed(42)
  3. normal = np.random.normal(120, 15, 200)
  4. data = np.concatenate([normal, [280, 20, 300]])
  5. mean = np.mean(data)
  6. std = np.std(data)
  7. z_scores = (data - mean) / std
  8. outlier_indices = np.where(np.abs(z_scores) > 3)[0]
  9. print("Z-Score 异常值:")
  10. for idx in outlier_indices:
  11.     print(f"索引 {idx}, 值 {data[idx]:.2f}, Z={z_scores[idx]:.2f}")
复制代码
  1. Z-Score 异常值:
  2. 索引 200, 值 280.00, Z=6.95
  3. 索引 201, 值 20.00, Z=-4.38
  4. 索引 202, 值 300.00, Z=7.82
复制代码
跑完的输出里,280、20、300 的 Z 值绝对值都凌驾 3,会被标出来,正常点根本不会误报。
这种单变量、近似正态的场景,Z-Score 简单直接,够用。
2. IQR:用四分位距判定非常值

IQR 不依靠均值和标准差,它看中间 50% 的数据范围。
超出 Q1 - 1.5 * IQR 或 Q3 + 1.5 * IQR 的点算非常。
适合偏态分布,或者有极端值的数据。
拿成都某小区住户月度电费举例。
大多数住户几十到两三百,少数开民宿、挖矿或者空调常开的,电费特别高。
电费本身是偏态的,用 IQR 比 Z-Score 稳。
  1. import numpy as np
  2. np.random.seed(1)
  3. normal = np.random.gamma(shape=4, scale=30, size=300)
  4. data = np.concatenate([normal, [2000, 5000, 8000]])
  5. q1 = np.percentile(data, 25)
  6. q3 = np.percentile(data, 75)
  7. iqr = q3 - q1
  8. lower_bound = q1 - 1.5 * iqr
  9. upper_bound = q3 + 1.5 * iqr
  10. outliers = data[(data < lower_bound) | (data > upper_bound)]
  11. print(f"Q1={q1:.2f}, Q3={q3:.2f}, IQR={iqr:.2f}")
  12. print(f"下界={lower_bound:.2f}, 上界={upper_bound:.2f}")
  13. print("IQR 异常值:", outliers)
复制代码
  1. Q1=77.89, Q3=161.82, IQR=83.93
  2. 下界=-48.01, 上界=287.72
  3. IQR 异常值: [ 289.37700599  289.53075874  289.93834029  328.543792   2000.
  4. 5000.         8000.        ]
复制代码
跑完会看到上界通常在两三百左右,2000、5000、8000 这些高额电费会被抓出来,少数正常偏高的电费也大概被带上。
整体上 IQR 对偏态数据比较抗干扰,适合先做一轮粗筛。
3. LOF:用局部密度判定非常值

LOF 看的是局部密度。它比较一个点和它邻人的密度,如果明显比周围稀疏,就认为非常。
适合多变量、局部密度不一样的数据。
拿杭州共享单车停放点早高峰借还车量举例。
正常站点借车和还车量大抵都在 30 左右,少数站点借车量极高、还车量极低,或者反过来。
这种非常不看单列数值,而是看组合和周围像不像。
  1. import numpy as np
  2. from sklearn.neighbors import LocalOutlierFactor
  3. np.random.seed(42)
  4. normal = np.random.normal([30, 30], [5, 5], size=(200, 2))
  5. outliers = np.array([[5, 80], [85, 10], [90, 90], [10, 10]])
  6. data = np.vstack([normal, outliers])
  7. lof = LocalOutlierFactor(n_neighbors=20, contamination=0.02)
  8. labels = lof.fit_predict(data)
  9. outlier_indices = np.where(labels == -1)[0]
  10. print("LOF 异常点:")
  11. for idx in outlier_indices:
  12.     print(f"索引 {idx}, 借车量={data[idx][0]:.1f}, 还车量={data[idx][1]:.1f}")
复制代码
  1. LOF 异常点:
  2. 索引 104, 借车量=32.6, 还车量=49.3
  3. 索引 200, 借车量=5.0, 还车量=80.0
  4. 索引 201, 借车量=85.0, 还车量=10.0
  5. 索引 202, 借车量=90.0, 还车量=90.0
  6. 索引 203, 借车量=10.0, 还车量=10.0
复制代码
跑完输出里,像 (5,80)、(85,10)、(90,90)、(10,10) 这种和正常站点密度明显差别的点会被标出来。
LOF 的好处是不要求全局统一分布,能找出局部行为非常的站点。
4. Isolation Forest:用随机隔离判定非常值

Isolation Forest 的思路是随机切分数据,非常点因为稀疏,通常几步就被单独隔离出来。适合数据量大、维度高的场景。
拿 618 电商订单举例。正常订单金额几十到几百,商品件数 1 到 5 件。非常订单大概是刷单、大额采购或恶意测试,金额和件数组合很离谱。
  1. import numpy as np
  2. from sklearn.ensemble import IsolationForest
  3. np.random.seed(7)
  4. n = 1000
  5. amount = np.random.normal(200, 80, n).clip(20, 800)
  6. items = np.random.poisson(2, n) + 1
  7. normal = np.column_stack([amount, items])
  8. outliers = np.array([
  9.     [9999, 100],
  10.     [0.01, 500],
  11.     [5000, 1],
  12.     [3000, 200]
  13. ])
  14. data = np.vstack([normal, outliers])
  15. iso = IsolationForest(contamination=0.01, random_state=42)
  16. labels = iso.fit_predict(data)
  17. outlier_indices = np.where(labels == -1)[0]
  18. print("Isolation Forest 异常订单:")
  19. for idx in outlier_indices:
  20.     print(f"索引 {idx}, 金额={data[idx][0]:.2f}, 件数={data[idx][1]:.0f}")
复制代码
  1. Isolation Forest 异常订单:
  2. 索引 47, 金额=379.81, 件数=1
  3. 索引 186, 金额=90.41, 件数=7
  4. 索引 267, 金额=224.73, 件数=9
  5. 索引 658, 金额=356.52, 件数=6
  6. 索引 660, 金额=109.25, 件数=8
  7. 索引 662, 金额=329.58, 件数=9
  8. 索引 888, 金额=60.75, 件数=9
  9. 索引 1000, 金额=9999.00, 件数=100
  10. 索引 1001, 金额=0.01, 件数=500
  11. 索引 1002, 金额=5000.00, 件数=1
  12. 索引 1003, 金额=3000.00, 件数=200
复制代码
跑完输出里,9999 元 100 件、0.01 元 500 件、5000 元 1 件、3000 元 200 件这些订单会被标出来。
因为 contamination 设成 0.01,大概还会误伤少量正常订单。
总体看,Isolation Forest 跑得快,适合先在大数据里筛可疑样本。
5. 马氏距离:用协方差结构判定非常值

马氏距离思量变量之间的协方差。单看某一项大概正常,组合起来很怪,它就能抓出来。
适合多变量且变量之间有相关性的数据。
拿某高中体测数据举例。身高、体重、肺活量三个变量有关联。
正常情况身高越高,体重和肺活量通常也会高一些。
下面造 300 条正常记录,再塞三条组合很怪的数据。
  1. import numpy as np
  2. from scipy.spatial.distance import mahalanobis
  3. np.random.seed(42)
  4. n = 300
  5. height = np.random.normal(170, 6, n)
  6. weight = 60 + 0.7 * (height - 170) + np.random.normal(0, 5, n)
  7. lung = 3500 + 30 * (height - 170) + np.random.normal(0, 300, n)
  8. normal = np.column_stack([height, weight, lung])
  9. outliers = np.array([
  10.     [170, 120, 2000],
  11.     [150, 80, 5000],
  12.     [190, 45, 3000]
  13. ])
  14. data = np.vstack([normal, outliers])
  15. mean = np.mean(data, axis=0)
  16. cov = np.cov(data, rowvar=False)
  17. inv_cov = np.linalg.inv(cov)
  18. distances = np.array([mahalanobis(x, mean, inv_cov) for x in data])
  19. threshold = np.percentile(distances, 97.5)
  20. outlier_indices = np.where(distances > threshold)[0]
  21. print("马氏距离异常体测记录:")
  22. for idx in outlier_indices:
  23.     print(f"索引 {idx}, 身高={data[idx][0]:.1f}, 体重={data[idx][1]:.1f}, 肺活量={data[idx][2]:.0f}, 距离={distances[idx]:.2f}")
复制代码
  1. 马氏距离异常体测记录:
  2. 索引 46, 身高=167.2, 体重=50.8, 肺活量=2608, 距离=2.87
  3. 索引 74, 身高=154.3, 体重=59.8, 肺活量=2606, 距离=3.33
  4. 索引 179, 身高=186.3, 体重=77.0, 肺活量=4176, 距离=3.08
  5. 索引 209, 身高=193.1, 体重=72.0, 肺活量=3925, 距离=3.82
  6. 索引 262, 身高=150.6, 体重=50.7, 肺活量=3381, 距离=3.31
  7. 索引 300, 身高=170.0, 体重=120.0, 肺活量=2000, 距离=10.35
  8. 索引 301, 身高=150.0, 体重=80.0, 肺活量=5000, 距离=8.29
  9. 索引 302, 身高=190.0, 体重=45.0, 肺活量=3000, 距离=6.06
复制代码
跑完输出里,身高 170、体重 120、肺活量 2000;
身高 150、体重 80、肺活量 5000;
身高 190、体重 45、肺活量 3000 这种组合会被标出来。
因为阈值取 97.5 百分位,大概还会带上少量边缘正常记录。
马氏距离适合处理变量有关联的多维非常检测,但协方差估计不定时结果会受影响。
总结

怎么选这 5 种方法?

  • Z-Score:单变量,近似正态分布,最省事。
  • IQR:单变量,偏态分布,或者有极端值,比较稳。
  • LOF:多变量,数据有局部密度差别,适合找“周围不一样”的点。
  • Isolation Forest:数据量大、维度高,想快速筛非常,优先用。
  • 马氏距离:多变量之间有明显相关性,需要把相关性思量进去。
注意:不管用哪种方法,末了都要联合业务进一步来判定是否非常值,不能只看算法结果。

免责声明:如果侵犯了您的权益,请联系站长及时删除侵权内容,谢谢合作!qidao123.com:ToB企服之家,中国第一个企服评测及软件市场,开放入驻,技术点评得现金.
回复

使用道具 举报

登录后关闭弹窗

登录参与点评抽奖  加入IT实名职场社区
去登录
快速回复 返回顶部 返回列表