통계학에서 이상치란 무엇인가?
통계학에서 데이터는 소비자 행동, 검사 결과, 환자 건강, 생산 품질, 심지어 경제 동향과 같은 현상을 이해하는 데 있어 가장 중요한 원자재입니다. 그러나 모든 데이터가 대다수와 같은 양상을 보이는 것은 아닙니다. 때로는 데이터 세트의 나머지 부분과 현저하게 다른 하나 이상의 값을 만나게 됩니다. 이러한 값을 이상치라고 합니다. 이상치를 이해하는 것은 분석 결과에 영향을 미치고, 예측 모델을 왜곡하며, 심지어 조사할 가치가 있는 중요한 사건을 나타낼 수도 있기 때문에 중요합니다.
이상치 이해하기
간단히 말해, 이상치란 대부분의 데이터와 현저하게 다른 관측값 또는 데이터 값을 말합니다. 이상치는 일반적인 패턴보다 높거나(극도로 높음) 낮을 수 있습니다(극도로 낮음). 예를 들어, 대부분의 학생 시험 점수가 60~90점 범위에 속하는데, 단 하나의 점수가 5점이나 100점처럼 이 범위에서 크게 벗어난다면, 그 점수는 이상치일 가능성이 높습니다.
여기서 중요한 점은 이상치가 항상 "오류"를 의미하는 것은 아니라는 것입니다. 이상치는 단순히 데이터 세트와 비교했을 때 해당 값이 비정상적임을 나타냅니다. 이상치는 입력 오류, 측정 장비의 결함 또는 드물지만 중요한 실제 사건을 반영하여 발생할 수 있습니다.
간단한 예
10명의 월 소득 데이터(백만 루피아 단위)를 가정해 보세요.
5, 5, 6, 6, 6, 7, 7, 7, 8, 50
여기서 숫자 50은 다른 숫자들과 확연히 구분됩니다. 50은 오류일까요? 잘못 읽은 것일 수도 있지만(실제로는 5,0이어야 함), 해당 인물이 대기업 소유주이기 때문에 정확한 값일 수도 있습니다. 어느 경우든 50은 이상치이며, 분석에서 어떻게 처리하느냐가 중요합니다.
이상치는 왜 나타나는가?
이상치가 나타나는 데에는 몇 가지 일반적인 원인이 있습니다.
1. 측정 오류 또는 공구 오류
예를 들어, 온도 센서는 간섭으로 인해 극단적인 값을 읽을 수 있습니다.
2. 데이터 기록 또는 입력 오류
대표적인 예로는 100 대신 1000을 입력하거나 단위를 잘못 입력하는 경우(cm와 m)가 있습니다.
3. 자연적 변이
현실 세계에는 드물지만 현실적인 현상들이 존재합니다. 예를 들어 대규모 프로모션으로 인한 매출 급증, 환자의 약물에 대한 비정상적인 반응, 또는 운동선수의 기록 경신 등이 있습니다.
4. 공정 또는 조건의 변화
예를 들어, 어떤 공장에서 특정 날짜에 기계 고장이 발생하여 불량품 수가 급격히 증가할 수 있습니다.
5. 혼합 인구
데이터 세트에는 여러 그룹이 결합되어 있을 수 있습니다. 예를 들어, 중학생과 대학생의 키 데이터가 섞여 있을 수 있는데, 이때 일부 "극단적인" 값은 이상치 때문이 아니라 실제로 두 그룹이 서로 다르기 때문에 나타나는 것일 수 있습니다.
이상치가 통계 분석에 미치는 영향
이상치는 분석 결과에 상당한 영향을 미칠 수 있기 때문에 중요하며, 특히 극단값에 민감한 방법에서는 더욱 그렇습니다.
1. 평균값에 영향을 미칩니다.
평균값은 극단적인 값에 쉽게 영향을 받습니다. 위 소득 예시에서, 대다수의 값이 5~8 정도임에도 불구하고, 50이라는 값이 평균값을 크게 부풀릴 수 있습니다.
2. 표준편차와 분산에 영향을 미칩니다.
분산 계산은 평균과의 차이를 제곱하는 방식으로 이루어지기 때문에 이상치는 분산과 표준편차를 부풀려 데이터가 실제보다 더 넓게 퍼져 있는 것처럼 보이게 할 수 있습니다.
3. 회귀 및 머신러닝 모델의 문제점
선형 회귀 분석에서 이상치는 회귀선을 왜곡시켜 대부분의 데이터에 대한 예측 정확도를 떨어뜨릴 수 있습니다. 일부 알고리즘에서는 이상치가 모델의 과적합을 유발하거나 학습 매개변수에 영향을 미칠 수도 있습니다.
4. 영향 가설 검증
이상치는 모수 검정에서 흔히 사용되는 정규성 및 분산의 동질성 가정을 위반할 수 있으므로 통계적 결론이 편향될 수 있습니다.
하지만 이상치는 중요한 신호가 될 수도 있습니다. 사기 탐지에서는 이상치 거래가 바로 우리가 찾아야 할 대상입니다. 의료 분야에서는 검사 결과가 크게 차이가 나는 경우 심각한 질병을 나타낼 수 있습니다.
이상치를 탐지하는 방법
정답이라고 할 수 있는 방법은 없습니다. 이상치 탐지는 상황, 데이터 유형, 분석 목표에 따라 달라집니다. 다음은 몇 가지 일반적인 방법입니다.
1. 시각화: 상자 그림 및 산점도
상자 그림은 이상치를 찾는 데 매우 유용합니다. 상자 그림에서 이상치는 일반적으로 수염 상자 바깥에 있는 점으로 표시됩니다.
산점도는 두 변수 간의 관계에서 이상치를 파악하는 데 도움이 됩니다. 예를 들어 몸무게와 키 사이의 관계를 살펴보는 데 유용합니다.
시각화는 빠르고 직관적이기 때문에 첫 단계로 유용합니다.
2. IQR(사분위 범위) 방법
IQR 방법은 주로 단일 변수 데이터(단변량)에 사용됩니다.
– Q1(1사분위수)과 Q3(3사분위수)을 계산하세요.
– IQR = Q3 − Q1
– 하한값 = Q1 − 1,5 × IQR
– 상한값 = Q3 + 1,5 × IQR
이러한 범위를 벗어나는 값은 일반적으로 이상치로 간주됩니다. 이 방법은 극단적인 값에 크게 영향을 받지 않기 때문에 비교적 안정적입니다.
3. Z-점수(평균과 표준편차 기준)
Z점수는 표준편차 단위로 값이 평균에서 얼마나 떨어져 있는지를 측정합니다.
– z = (x − 평균) / 표준편차
|z| > 3 (때로는 > 2,5)인 값은 종종 이상치로 간주됩니다.
단점: 데이터에 이미 큰 이상치가 포함되어 있는 경우 평균과 표준편차가 영향을 받아 이상치 탐지 정확도가 떨어질 수 있습니다.
4. 모델 기반 및 다변량 방법
다변수 데이터의 경우, 이상치는 항상 한 열에서만 나타나는 것이 아니라 여러 변수의 조합에서 나타날 수 있습니다.
마할라노비스 거리는 다변량 이상치를 탐지하는 데 자주 사용됩니다.
머신러닝에는 Isolation Forest, Local Outlier Factor(LOF), One-Class SVM과 같은 접근 방식이 있습니다.
이 방법은 금융 거래 이상 탐지와 같이 규모가 크고 복잡한 데이터 세트에 적합합니다.
이상치를 발견했을 때 어떻게 해야 할까요?
가장 좋은 방법은 단순히 삭제하는 것이 아닙니다. 일반적으로 이상치 처리 과정은 여러 단계를 거칩니다.
1. 데이터 검증
– 잘못된 입력, 중복 입력 또는 단위가 잘못되었는지 확인하십시오.
– 원본 데이터 소스(예: 양식, 센서 로그 또는 수동 기록)와 비교합니다.
2. 맥락을 이해하세요
– 해당 영역에서 극단적인 값들이 의미가 있을까요?
예를 들어, 사람 체온이 50°C라는 것은 거의 확실히 잘못된 수치이지만, 소득이 50천만이라는 것은 합리적인 수치일 수 있습니다.
3. 분석의 목적을 결정하십시오.
일반적인 행동 양식을 이해하는 것이 목표라면, 이상치가 전체 결과에서 지배적인 위치를 차지하지 않도록 처리해야 할 수도 있습니다.
– 목표가 드문 사건(사기, 기계 고장)을 찾는 것이라면 이상치에 집중하는 것이 주요 전략입니다.
4. 처리 전략을 선택하세요
일반적인 옵션은 다음과 같습니다.
– 제거: 이상치가 오류이며 대표성이 없는 것으로 판명된 경우에 수행됩니다.
– 데이터 변환: 예를 들어, 왜곡된 데이터에 대한 로그 변환.
– 윈저라이징/캡핑: 극단적인 값을 특정 백분위수(예: p1 및 p99)로 제한하는 것.
– 중앙값, 사분위 범위, 강건 회귀 또는 이상치 저항 모델과 같은 강력한 방법을 사용하십시오.
– 별도 분석: 때로는 이상치를 특수한 경우로 분석하는 것이 더 적절할 수 있습니다.
무엇보다 중요한 것은 분석의 투명성과 책임성을 확보하기 위해 모든 결정 사항을 문서화해야 한다는 점입니다.
이상치: 문제인가, 아니면 가치 있는 정보인가?
이상치는 통계적 요약을 왜곡할 수 있기 때문에 흔히 "잡음"으로 간주됩니다. 그러나 많은 경우 이상치는 새로운 통찰력을 얻을 수 있는 통로가 됩니다. 예를 들어, 프리미엄 고객층의 존재, 주의가 필요한 환자 상태, 생산 공정의 새로운 단계, 또는 잠재적인 사기 행위 등을 발견할 수 있습니다. 따라서 이상치는 무조건 무시하기보다는 조사해야 할 대상으로 여겨야 합니다.
결론
통계에서 이상치는 데이터의 일반적인 패턴에서 크게 벗어난 값입니다. 이상치는 오류, 자연적 변동, 프로세스 변경 또는 데이터 세트 내 그룹 차이로 인해 발생할 수 있습니다. 이상치는 평균, 분산, 통계 검정 및 예측 모델에 상당한 영향을 미칠 수 있습니다. 이상치 탐지는 시각화, 사분위 범위(IQR) 방법, z-점수, 다변량 분석 및 머신러닝을 통해 이루어질 수 있습니다. 이상치 처리는 맥락과 목표를 고려하여 수행해야 합니다. 즉, 이상치의 존재 여부를 검증하고 원인을 파악한 후, 제거, 변환, 값 제한 또는 강건한 방법 사용과 같은 전략을 선택해야 합니다.
이상치를 제대로 이해한다면, 이상치는 단순히 "이상한 숫자"가 아니라 데이터 기반 분석 및 의사 결정의 질을 향상시킬 수 있는 통계적 실무의 중요한 요소입니다.