Czym jest wartość odstająca w statystyce?

Czym jest wartość odstająca w statystyce

W statystyce dane stanowią podstawowy surowiec do zrozumienia zjawisk: zachowań konsumentów, wyników testów, stanu zdrowia pacjentów, jakości produkcji, a nawet trendów ekonomicznych. Jednak nie wszystkie dane zachowują się tak samo jak większość. Czasami napotykamy jedną lub więcej wartości, które wydają się znacząco różnić od reszty zbioru danych. Takie wartości odstające nazywane są wartościami odstającymi. Zrozumienie wartości odstających jest istotne, ponieważ mogą one zmieniać wnioski analityczne, wpływać na modele predykcyjne, a nawet wskazywać na ważne zdarzenia warte zbadania.

Zrozumienie wartości odstających

Mówiąc prościej, obserwacja lub wartość danych odstających to obserwacja lub wartość danych, która znacząco różni się od większości danych. Obserwacje odstające mogą być wyższe (ekstremalnie wysokie) lub niższe (ekstremalnie niskie) od ogólnego wzorca. Na przykład, jeśli wyniki większości uczniów w testach mieszczą się w przedziale 60–90, a pojedynczy wynik 5 lub 100 znacząco odbiega od normy, należy podejrzewać, że jest to obserwacja odstająca.

Należy podkreślić: wartość odstająca nie zawsze oznacza „błąd”. Oznacza ona po prostu, że wartość jest nietypowa w porównaniu z zestawem danych. Wartości odstające mogą wynikać z błędów wejściowych, wadliwych przyrządów pomiarowych lub po prostu odzwierciedlać rzadkie, ale istotne zdarzenia rzeczywiste.

Prosty przykład

Wyobraź sobie miesięczne dane dotyczące dochodów (w milionach rupii) 10 osób:
5, 5, 6, 6, 6, 7, 7, 7, 8, 50

Tutaj liczba 50 wyraźnie wyróżnia się na tle pozostałych. Czy 50 to błąd? Mogło to być błędne odczytanie (powinno być 5,0), ale mogło też być poprawne, ponieważ dana osoba jest właścicielem dużej firmy. W obu przypadkach 50 pozostaje wartością odstającą – różnica polega na tym, jak traktujemy ją w analizie.

Dlaczego pojawiają się wartości odstające?

Istnieje kilka powszechnych przyczyn pojawiania się wartości odstających:

1. Błąd pomiaru lub narzędzia
Na przykład czujnik temperatury może czasami odczytywać skrajne wartości z powodu zakłóceń.

2. Błędy w rejestrowaniu lub wprowadzaniu danych
Klasyczne przykłady: wpisanie 1000 zamiast 100 lub złe jednostki (cm zamiast m).

3. Naturalna zmienność
W realnym świecie zdarzają się rzadkie, ale realne zjawiska: gwałtowny wzrost sprzedaży dzięki dużej promocji, nietypowa reakcja pacjenta na lek lub rekord sportowca.

4. Zmiany w procesie lub warunkach
Na przykład, pewnego dnia w fabryce dochodzi do awarii maszyny, w wyniku czego liczba wadliwych produktów drastycznie wzrasta.

5. Populacje mieszane
Zbiór danych może zawierać kilka połączonych grup. Na przykład wzrost uczniów szkół średnich i studentów jest zróżnicowany; niektóre „skrajne” wartości mogą pojawiać się nie z powodu anomalii, ale dlatego, że grupy te są naprawdę różne.

Wpływ wartości odstających na analizę statystyczną

Wartości odstające są istotne, ponieważ mogą znacząco wpłynąć na wyniki analizy, zwłaszcza w przypadku metod wrażliwych na wartości ekstremalne.

1. Wpływa na średnią (wartość średnią)
Średnia jest łatwo „wyciągana” przez wartości skrajne. W powyższym przykładzie dochodu średnia byłaby znacznie zawyżona o wartość 50, mimo że większość mieści się w przedziale 5–8.

2. Wpływa na odchylenie standardowe i wariancję
Ponieważ obliczenia wariancji obejmują kwadraty różnic od średniej, obserwacje odstające mogą zawyżać wariancję i odchylenie standardowe, sprawiając wrażenie, że dane są bardziej „rozproszone” niż w rzeczywistości.

3. Zakłócające modele regresji i uczenia maszynowego
W regresji liniowej wartości odstające mogą zniekształcać linię regresji, co utrudnia prognozowanie większości danych. W niektórych algorytmach wartości odstające mogą powodować nadmierne dopasowanie modelu lub wpływać na parametry treningowe.

4. Testowanie hipotez wpływu
Wartości odstające mogą podważać założenia normalności rozkładu i jednorodności wariancji, często stosowane w testach parametrycznych, co może prowadzić do obarczenia błędem wniosków statystycznych.

Jednak obserwacje odstające mogą być również ważnymi sygnałami. W wykrywaniu oszustw, transakcje odstające są właśnie tym, czego szukamy. W opiece zdrowotnej znacząco różniące się wyniki badań laboratoryjnych mogą wskazywać na poważną chorobę.

Jak wykrywać wartości odstające

Nie ma jednej „właściwej” metody. Wykrywanie wartości odstających często zależy od kontekstu, typu danych i celów analizy. Oto kilka popularnych metod:

1. Wizualizacja: wykres pudełkowy i wykres punktowy
– Wykresy pudełkowe są bardzo popularne w wyszukiwaniu wartości odstających. Na wykresie pudełkowym wartości odstające są zazwyczaj oznaczane jako punkty znajdujące się poza ramką wąsów.
– Wykresy punktowe pomagają dostrzec wartości odstające w relacji między dwiema zmiennymi, na przykład wagą i wzrostem.

Wizualizacja jest przydatna na początek, ponieważ jest szybka i intuicyjna.

2. Metoda IQR (zakresu interkwartylowego)
Metodę IQR często stosuje się w przypadku danych jednowymiarowych.
– Oblicz Q1 (kwartyl 1) i Q3 (kwartyl 3)
– IQR = Q3 − Q1
– Dolna granica = Q1 − 1,5 × IQR
– Górna granica = Q3 + 1,5 × IQR

Wartości poza tymi granicami są zazwyczaj uznawane za wartości odstające. Ta metoda jest stosunkowo niezawodna, ponieważ nie jest w dużym stopniu zależna od wartości ekstremalnych.

3. Wynik Z (na podstawie średniej i odchylenia standardowego)
Wynik Z mierzy, jak bardzo wartość odbiega od średniej w jednostkach odchylenia standardowego.
– z = (x − średnia) / odchylenie standardowe
Wartości, dla których |z| > 3 (czasem > 2,5) są często uważane za wartości odstające.

Słabość: jeśli dane zawierają już duże wartości odstające, średnia i odchylenie standardowe ulegają zmianie, co sprawia, że ​​wykrywanie może być mniej dokładne.

4. Metody oparte na modelach i wielowymiarowe
W przypadku danych wielowymiarowych wartości odstające nie zawsze są widoczne tylko w jednej kolumnie, lecz w kombinacji kilku zmiennych.
– Odległość Mahalanobisa jest często wykorzystywana do wykrywania wielowymiarowych wartości odstających.
– W uczeniu maszynowym istnieją podejścia takie jak Isolation Forest, Local Outlier Factor (LOF) czy One-Class SVM.

Metoda ta sprawdza się w przypadku dużych i złożonych zbiorów danych, na przykład w wykrywaniu anomalii transakcji finansowych.

Co zrobić, jeśli znajdziesz wartość odstającą?

Najlepszym rozwiązaniem nie jest po prostu ich usunięcie. Zazwyczaj proces obsługi wartości odstających obejmuje kilka kroków:

1. Weryfikacja danych
– Sprawdź, czy wprowadzone dane nie są nieprawidłowe, czy nie ma powtórzeń lub czy nie występują nieprawidłowe jednostki.
– Porównaj z oryginalnym źródłem danych (np. formularzami, dziennikami czujników lub rekordami ręcznymi).

2. Zrozum kontekst
– Czy wartości skrajne mają sens w domenie?
– Na przykład, temperatura ludzkiego ciała wynosząca 50°C jest prawie na pewno nieprawidłowa, ale dochód na poziomie 50 milionów może być rozsądny.

3. Określ cel analizy
– Jeśli celem jest zrozumienie „ogólnego” zachowania, może zaistnieć potrzeba zajęcia się wartościami odstającymi, aby zapobiec ich dominacji.
– Jeśli celem jest znalezienie rzadkich zdarzeń (oszustw, awarii maszyn), głównym celem są wartości odstające.

4. Wybierz strategię postępowania
Oto kilka popularnych opcji:
– Usunięcie: wykonywane, jeśli okaże się, że obserwacja odstająca jest błędem i nie jest reprezentatywna.
– Transformacja danych: na przykład transformacja logarytmiczna dla danych przekrzywionych.
– Winsoryzacja/capowanie: ograniczanie wartości ekstremalnych do pewnych percentyli (np. p1 i p99).
– Stosuj solidne metody: medianę, IQR, solidną regresję lub modele odporne na wartości odstające.
– Analiza osobna: czasami bardziej odpowiednie jest analizowanie wartości odstających jako przypadków szczególnych.

Ważne jest, aby decyzje były dokumentowane, aby analiza była przejrzysta i rozliczalna.

Wartości odstające: problem czy cenna informacja?

Wartości odstające są często uważane za „szum”, ponieważ mogą zniekształcać podsumowania statystyczne. Jednak w wielu przypadkach wartości odstające są bramą do nowych spostrzeżeń: istnienia segmentu klientów premium, stanu pacjenta wymagającego uwagi, nowego etapu procesu produkcyjnego lub potencjalnego oszustwa. Dlatego wartości odstające należy traktować jako coś, co należy zbadać, a nie automatycznie odrzucić.

Wniosek

Wartość odstająca w statystyce to wartość, która znacząco odbiega od ogólnego wzorca danych. Wartości odstające mogą powstawać z powodu błędów, naturalnej zmienności, zmian w procesach lub różnic między grupami w zbiorze danych. Ich wpływ może być istotny na średnią, wariancję, testy statystyczne i modele predykcyjne. Wykrywanie wartości odstających można osiągnąć za pomocą wizualizacji, metod IQR, wartości Z, a nawet podejść wielowymiarowych i uczenia maszynowego. Postępowanie musi uwzględniać kontekst i cele: weryfikację, zrozumienie przyczyn, a następnie wybór strategii, takiej jak usuwanie, transformacja, ograniczanie wartości lub stosowanie metod odpornych.

Przy właściwym zrozumieniu, wartości odstające to nie tylko „liczby nieparzyste”, ale ważne elementy praktyki statystycznej, które mogą poprawić jakość analiz i decyzji opartych na danych.

Zostaw komentarz