統計學中的異常值是什麼?

統計學中的異常值是什麼?

在統計學中,數據是理解各種現象的主要原材料,例如消費者行為、測試結果、患者健康狀況、產品質量,甚至經濟趨勢。然而,並非所有數據點都「表現」與大多數數據點一致。有時我們會遇到一個或多個與資料集其他部分顯著不同的值。這些異常值被稱為離群值。理解離群值至關重要,因為它們會改變分析結論、影響預測模型,甚至可能揭示值得深入研究的重要事件。

理解異常值

簡而言之,異常值是指與大多數數據顯著不同的觀測值或數據值。異常值可能高於(極高)或低於(極低)整體模式。例如,如果大多數學生的考試分數都在 60 到 90 分之間,而某個學生的分數為 5 分或 100 分,且顯著偏離該範圍,則應懷疑該分數為異常值。

需要強調的是:異常值並不總是意味著「錯誤」。異常值僅表示該值相對於資料集而言異常。異常值可能源自輸入錯誤、測量儀器故障,或僅反映了罕見但意義重大的現實世界事件。

簡單範例

假設有 10 個人,他們的月收入資料(單位:百萬印尼盾)如下:
5,5,6,6,6,7,7,7,8,50

這裡,數字 50 與其他數字相比顯得格外突出。 50 是錯誤嗎?可能是誤讀(應該是 5,0),但也可能是正確的,因為這個人是一位大企業主。無論如何,50 都是一個異常值——不同之處在於我們在分析中如何處理它。

為什麼會出現異常值?

導致異常值出現的原因有很多:

1. 測量誤差或工具誤差
例如,由於幹擾,溫度感測器有時可能會讀取極端值。

2. 資料記錄或輸入錯誤
經典範例:輸入 1000 而不是 100,或單位錯誤(公分與公尺)。

3. 自然變異
在現實世界中,存在一些罕見但真實的現象:大型促銷活動導致銷售量激增,病人對藥物產生異常反應,或運動員創造極端紀錄。

4. 製程或條件的變化
例如,某工廠某天發生機器故障,導致次品數量急劇增加。

5. 混合人口
一個資料集可能包含多個不同的群體。例如,中學生和大學生的身高數據混雜在一起;一些「極端」值的出現可能並非由於異常情況,而是因為這些群體本身就存在顯著差異。

異常值對統計分析的影響

異常值很重要,因為它們會顯著影響分析結果,尤其是在對極端值敏感的方法中。

1. 影響平均值(平均值)
平均值很容易被極端值拉高。以上述收入為例,即使大多數收入都在 5 到 8 左右,但如果平均值達到 50,就會顯著提高平均值。

2. 影響標準差和方差
由於方差計算涉及與平均值的平方差,異常值會誇大變異數和標準差,使資料看起來比實際情況更「分散」。

3. 令人困惑的回歸和機器學習模型
在線性迴歸中,異常值會使迴歸線產生偏差,導致大部分資料的預測效果不佳。在某些演算法中,異常值也會導致模型過度擬合或影響訓練參數。

4. 影響假設檢驗
異常值會違反參數檢定中常用的常態性和方差齊性假設,導致統計結論出現偏差。

然而,異常值也可能是重要的訊號。在詐欺偵測中,異常交易正是我們想要尋找的目標。在醫療保健領域,顯著不同的實驗室結果可能預示著嚴重的疾病。

如何檢測異常值

沒有一種「正確」的方法。異常值檢測通常取決於具體情況、資料類型和分析目標。以下是一些常用方法:

1. 視覺化:箱線圖與散佈圖
箱線圖常用於識別異常值。在箱線圖中,異常值通常被標記為落在須線框之外的點。
– 散佈圖有助於發現兩個變數之間關係中的異常值,例如體重與身高之間的關係。

視覺化作為第一步很有用,因為它快速且直觀。

2. 四分位數間距 (IQR) 方法
IQR 方法通常用於單變量資料(單變量)。
計算 Q1(第一四分位數)和 Q3(第三四分位數)
– IQR = Q3 − Q1
– 下限 = Q1 − 1,5 × IQR
– 上限 = Q3 + 1,5 × IQR

超出這些範圍的值通常被視為異常值。這種方法相對穩健,因為它不太容易受到極端值的影響。

3. Z 分數(基於平均值和標準差)
Z 分數衡量的是一個數值與平均值之間的距離,單位為標準差。
– z = (x − 均值) / 標準差
|z| > 3(有時 > 2,5)的值通常被認為是異常值。

缺點:如果資料中已經包含較大的異常值,則平均值和標準差會受到影響,導致檢測準確度降低。

4. 基於模型和多元的方法
對於多變量數據,異常值並不總是只在一列中可見,而是在多個變數的組合中可見。
– 馬氏距離常用於偵測多元異常值。
– 在機器學習中,有一些方法,例如隔離森林、局部異常因子 (LOF) 或單類 SVM。

此方法適用於大型複雜資料集,例如金融交易異常檢測。

如果發現異常值該怎麼辦?

最佳做法並非簡單地刪除它們。通常,異常值處理過程包括以下步驟:

1. 數據驗證
– 檢查是否有輸入錯誤、重複或單位錯誤。
– 與原始資料來源(例如表格、感測器日誌或手動記錄)進行比較。

2. 理解上下文
– 這些極端值在這個領域內有意義嗎?
例如,50°C 的人體體溫幾乎肯定是不正確的;但 50 萬的收入可能是合理的。

3. 確定分析的目的
– 如果目標是了解「一般」行為,則可能需要處理異常值,以防止它們佔據主導地位。
– 如果目標是發現罕見事件(詐欺、機器故障),那麼異常值就是主要關注點。

4. 選擇處理策略
一些常見選項:
– 刪除:如果異常值被證明是錯誤且不具代表性,則執行此操作。
– 資料轉換:例如對傾斜資料進行對數轉換。
– 溫莎化/封頂:將極端值限制在某些百分位數(例如 p1 和 p99)。
– 使用穩健的方法:中位數、四分位數間距、穩健迴歸或抗異常值模型。
– 單獨分析:有時將異常值作為特殊情況進行分析較為合適。

重要的是,決策必須有文件記錄,以便分析過程透明且可問責。

異常值:問題還是寶貴資訊?

異常值通常被視為“噪音”,因為它們會扭曲統計結果。然而,在許多情況下,異常值卻是通往新洞見的門戶:例如,是否存在高端客戶群、患者病情是否需要關注、生產流程是否進入新階段,或者是否存在潛在的欺詐行為。因此,我們應該認真對待異常值,進行調查,而不是直接忽略它們。

結論

在統計學中,異常值是指顯著偏離資料總體模式的值。異常值的產生可能源自於誤差、自然變異、流程變更或資料集內部的群體差異。它們會對平均值、變異數、統計檢定和預測模型產生顯著影響。異常值的檢測可以透過視覺化、四分位數間距 (IQR) 方法、z 分數,甚至多元方法和機器學習來實現。處理異常值必須考慮特定情況和目標:先驗證異常值,了解其成因,然後選擇相應的策略,例如移除異常值、轉換異常值、限制異常值或使用穩健的方法。

只要正確理解,異常值不僅僅是“奇數”,而是統計實踐中的重要元素,可以提高數據驅動分析和決策的品質。

請留言