统计学中的异常值是什么?
在统计学中,数据是理解各种现象的主要原材料,例如消费者行为、测试结果、患者健康状况、产品质量,甚至经济趋势。然而,并非所有数据点都“表现”与大多数数据点一致。有时我们会遇到一个或多个与数据集其他部分显著不同的值。这些异常值被称为离群值。理解离群值至关重要,因为它们会改变分析结论、影响预测模型,甚至可能揭示值得深入研究的重要事件。
理解异常值
简而言之,异常值是指与大多数数据显著不同的观测值或数据值。异常值可能高于(极高)或低于(极低)总体模式。例如,如果大多数学生的考试分数都在 60 到 90 分之间,而某个学生的分数为 5 分或 100 分,且显著偏离该范围,则应怀疑该分数为异常值。
需要强调的是:异常值并不总是意味着“错误”。异常值仅仅表明该值相对于数据集而言异常。异常值可能源于输入错误、测量仪器故障,或者仅仅反映了罕见但意义重大的现实世界事件。
简单示例
假设有 10 个人,他们的月收入数据(单位:百万印尼盾)如下:
5,5 6,6,6,7,7,7,8 50
这里,数字 50 与其他数字相比显得格外突出。50 是错误吗?可能是误读(应该是 5,0),但也可能是正确的,因为这个人是一位大企业主。无论如何,50 都是一个异常值——不同之处在于我们在分析中如何处理它。
为什么会出现异常值?
导致异常值出现的原因有很多:
1. 测量误差或工具误差
例如,由于干扰,温度传感器有时可能会读取极端值。
2. 数据记录或输入错误
经典例子:输入 1000 而不是 100,或者单位错误(厘米与米)。
3. 自然变异
在现实世界中,存在一些罕见但真实的现象:大型促销活动导致销量激增,病人对药物产生异常反应,或者运动员创造极端纪录。
4. 过程或条件的变化
例如,某工厂某天发生机器故障,导致次品数量急剧增加。
5. 混合人口
一个数据集可能包含多个不同的群体。例如,中学生和大学生的身高数据混杂在一起;一些“极端”值的出现可能并非由于异常情况,而是因为这些群体本身就存在显著差异。
异常值对统计分析的影响
异常值很重要,因为它们会显著影响分析结果,尤其是在对极端值敏感的方法中。
1. 影响平均值(均值)
平均值很容易被极端值拉高。以上述收入为例,即使大多数收入都在 5 到 8 左右,但如果平均值达到 50,就会显著提高平均值。
2. 影响标准差和方差
由于方差计算涉及与均值的平方差,异常值会夸大方差和标准差,使数据看起来比实际情况更“分散”。
3. 令人困惑的回归和机器学习模型
在线性回归中,异常值会使回归线产生偏差,导致大部分数据的预测效果不佳。在某些算法中,异常值还会导致模型过拟合或影响训练参数。
4. 影响假设检验
异常值会违反参数检验中常用的正态性和方差齐性假设,从而导致统计结论出现偏差。
然而,异常值也可能是重要的信号。在欺诈检测中,异常交易正是我们想要寻找的目标。在医疗保健领域,显著不同的实验室结果可能预示着严重的疾病。
如何检测异常值
没有一种“正确”的方法。异常值检测通常取决于具体情况、数据类型和分析目标。以下是一些常用方法:
1. 可视化:箱线图和散点图
箱线图常用于识别异常值。在箱线图中,异常值通常被标记为落在须线框之外的点。
– 散点图有助于发现两个变量之间关系中的异常值,例如体重与身高之间的关系。
可视化作为第一步很有用,因为它快速且直观。
2. 四分位距 (IQR) 方法
IQR 方法通常用于单变量数据(单变量)。
计算 Q1(第一四分位数)和 Q3(第三四分位数)
– IQR = Q3 − Q1
– 下限 = Q1 − 1,5 × IQR
– 上限 = Q3 + 1,5 × IQR
超出这些范围的值通常被视为异常值。这种方法相对稳健,因为它不太容易受到极端值的影响。
3. Z 分数(基于均值和标准差)
Z 分数衡量的是一个值与平均值之间的距离,单位为标准差。
– z = (x − 均值) / 标准差
|z| > 3(有时 > 2,5)的值通常被认为是异常值。
缺点:如果数据中已经包含较大的异常值,则均值和标准差会受到影响,从而导致检测准确度降低。
4. 基于模型和多元的方法
对于多变量数据,异常值并不总是只在一列中可见,而是在多个变量的组合中可见。
– 马氏距离常用于检测多元异常值。
– 在机器学习中,有一些方法,例如隔离森林、局部异常因子 (LOF) 或单类 SVM。
该方法适用于大型复杂数据集,例如金融交易异常检测。
如果发现异常值该怎么办?
最佳做法并非简单地删除它们。通常,异常值处理过程包括以下几个步骤:
1. 数据验证
– 检查是否存在输入错误、重复或单位错误。
– 与原始数据源(例如表格、传感器日志或手动记录)进行比较。
2. 理解上下文
– 这些极端值在这个领域内有意义吗?
例如,50°C 的人体体温几乎肯定是不正确的;但 50 万的收入可能是合理的。
3. 确定分析的目的
– 如果目标是了解“一般”行为,则可能需要处理异常值,以防止它们占据主导地位。
– 如果目标是发现罕见事件(欺诈、机器故障),那么异常值就是主要关注点。
4. 选择处理策略
一些常见选项:
– 删除:如果异常值被证明是错误且不具有代表性,则执行此操作。
– 数据转换:例如对倾斜数据进行对数转换。
– 温莎化/封顶:将极端值限制在某些百分位数(例如 p1 和 p99)。
– 使用稳健的方法:中位数、四分位距、稳健回归或抗异常值模型。
– 单独分析:有时将异常值作为特殊情况进行分析更为合适。
重要的是,决策必须有文件记录,以便分析过程透明且可问责。
异常值:问题还是宝贵信息?
异常值通常被视为“噪音”,因为它们会扭曲统计结果。然而,在许多情况下,异常值却是通往新洞见的门户:例如,是否存在高端客户群体、患者病情是否需要关注、生产流程是否进入新阶段,或者是否存在潜在的欺诈行为。因此,我们应该认真对待异常值,进行调查,而不是直接忽略它们。
结论
在统计学中,异常值是指显著偏离数据总体模式的值。异常值的产生可能源于误差、自然变异、流程变更或数据集内部的群体差异。它们会对均值、方差、统计检验和预测模型产生显著影响。异常值的检测可以通过可视化、四分位距 (IQR) 方法、z 分数,甚至多元方法和机器学习来实现。处理异常值必须考虑具体情况和目标:首先验证异常值,了解其成因,然后选择相应的策略,例如移除异常值、转换异常值、限制异常值或使用稳健的方法。
只要正确理解,异常值不仅仅是“奇数”,而是统计实践中的重要元素,可以提高数据驱动分析和决策的质量。