통계학에서의 결측치 대체 방법

통계학에서의 결측치 대체 방법

통계 및 데이터 분석 실무에서 결측값 문제는 거의 항상 발생합니다. 데이터 결측은 응답자가 특정 질문에 답변하지 않거나, 기록 오류, 센서 간섭, 데이터 추출 과정 중 손상, 또는 완전히 일치하지 않는 여러 데이터 소스를 결합하는 과정에서 발생할 수 있습니다. 결측값을 적절하게 처리하지 못하면 분석의 질이 저하되고, 검정력이 감소하며, 심지어 편향된 결론으로 ​​이어질 수 있습니다. 결측값 처리의 가장 일반적인 접근 방식 중 하나는 사용 가능한 정보를 기반으로 추정값을 사용하여 결측값을 채우는 대체(imputation)입니다.

결측치 대체가 중요한 이유는 무엇일까요?

결측값을 단순히 삭제하는 대신 대체(imputation)를 선택하는 데에는 여러 가지 이유가 있습니다. 첫째, 결측값이 포함된 행/관측치를 삭제하는 것(예: 리스트와이즈 삭제)은 특히 결측값 비율이 높은 경우 표본 크기를 크게 줄일 수 있습니다. 둘째, 결측이 무작위로 발생하지 않은 경우 삭제 과정에서 편향이 발생할 수 있습니다. 셋째, 많은 통계 알고리즘이나 머신러닝 알고리즘은 완전한 데이터를 필요로 하므로, 대체는 편리한 전처리 단계가 됩니다.

하지만 결측치 대체는 단순히 "빈칸을 채우는 것"이 ​​아닙니다. 선택하는 방법은 결측 발생 메커니즘, 변수의 구조, 분석 목표를 고려해야 합니다. 부적절한 결측치 대체는 모델을 오도하고 분산을 감소시켜 결과가 실제보다 더 확실해 보이게 만들 수 있습니다.

데이터 손실 메커니즘

통계학 문헌에서 결측 데이터는 일반적으로 세 가지 주요 메커니즘으로 분류됩니다.

1. MCAR(완전 무작위 결측): 결측 데이터의 발생 확률이 관측 변수든 관측되지 않은 변수든 관계없이 모든 변수와 무관합니다. 예를 들어, 사고로 손상된 설문지가 이에 해당합니다.
2. MAR(Missing At Random, 무작위 결측): 결측 데이터의 확률은 관측 변수에 따라 달라지지만, 다른 변수를 통제한 후에는 결측값 자체에는 의존하지 않습니다. 예를 들어, 젊은 응답자는 소득 관련 질문에 결측할 가능성이 더 높지만, 나이 정보는 이용 가능합니다.
3. MNAR(Missing Not At Random, 무작위 결측이 아님): 결측 데이터의 확률은 결측 값 자체에 따라 달라집니다. 예를 들어, 소득이 매우 높은 사람들은 소득을 공개하지 않는 경향이 있습니다.

독서  질적 연구에서의 통계

MCAR/MAR 조건에서는 일반적으로 결측치 대체가 더 안전합니다. MNAR 조건에서는 결측치를 명시적으로 고려하는 모델이나 민감도 분석이 필요한 경우가 많습니다.

단순 대체 방법

1. 평균/중앙값/최빈값 대체
가장 간단한 방법은 결측값을 수치형 변수의 경우 평균이나 중앙값으로, 범주형 변수의 경우 최빈값으로 대체하는 것입니다. 이 방법의 장점은 간편하고 빠르며, 종종 기준선 역할을 한다는 점입니다. 단점은 분산을 줄이고 데이터 분포를 왜곡할 수 있다는 점인데, 특히 데이터가 비대칭이거나 이상치가 포함된 경우 더욱 그렇습니다. 일반적으로 중앙값은 평균보다 이상치에 더 강건합니다.

2. 상수 대치
결측값은 0, -1과 같은 특정 상수 또는 "알 수 없음"이라는 레이블로 채워집니다. 이는 해당 값이 특정한 의미를 가질 때(예: "거래 없음") 또는 결측값을 강조하기 위해 모델에 추가적인 지표를 제공해야 할 때 유용합니다. 그러나 임의의 상수를 선택하면 잘못된 패턴이 발생할 수 있습니다.

3. 핫덱 귀속
핫덱 기법에서는 여러 주요 변수를 기준으로 다른 "유사한" 관측치(기증자)의 값을 사용하여 결측값을 채웁니다. 이 방법은 설문조사에서 널리 사용됩니다. 핫덱은 데이터의 실제 값을 반영하기 때문에 현실적인 값을 유지하지만, "유사성"의 정의에 따라 결과가 민감하게 변할 수 있으며 표본 간 변동성을 유발할 수 있습니다.

모델 기반 결측치 대체 방법

4. 회귀 결측치 대체
결측값은 다른 변수들을 기반으로 도출된 회귀 모델을 사용하여 예측됩니다. 수치형 변수의 경우 선형 회귀를, 범주형 변수의 경우 로지스틱 회귀 또는 다항 로지스틱 회귀를 사용할 수 있습니다. 이러한 방식의 장점은 변수들 간의 관계를 활용할 수 있다는 것입니다. 단점은 확정적인 예측값만을 사용할 경우, 모든 대체값이 예측선 상에 정확히 위치하게 되어 분산이 감소하는 경향이 있다는 것입니다. 이러한 문제를 해결하기 위해, 보다 현실적인 결과를 얻기 위해 확률적 요소(예: 잔차)를 추가하는 경우가 많습니다.

5. k-최근접 이웃(kNN) 결측치 대체
kNN 방법은 k개의 최근접 이웃의 평균(또는 투표)을 기반으로 결측값을 채웁니다. 근접도는 일반적으로 데이터 정규화 후 유클리드 거리 또는 다른 측정 지표를 사용하여 측정합니다. kNN 방법의 장점으로는 유연성과 비선형 관계를 가정할 수 있다는 점이 있습니다. 단점으로는 대규모 데이터 세트에서 계산 비용이 많이 들고, 변수의 스케일에 민감하며, 고차원 데이터에서 성능이 저하된다는 점(차원의 저주)이 있습니다.

독서  엑셀을 이용한 통계 데이터 처리

6. 기대-최대화(EM)
EM 추정법은 결측값을 잠재변수로 취급하여 모델 매개변수(예: 다변량 정규 데이터의 평균 및 공분산)를 추정합니다. E 단계에서는 현재 매개변수를 기반으로 결측값의 기대값을 반복적으로 계산하고, M 단계에서는 기대되는 "완전한" 데이터를 기반으로 매개변수를 업데이트합니다. EM 추정법은 특정 분포 가정에 대해 강건하지만, 복잡할 수 있으며 모델 가정의 정확성에 따라 결과가 달라집니다.

다중 대치법: 많은 경우에서 가장 신뢰할 수 있는 방법

7. 다중 대체(MI)
다중 대체(Multiple Imputation, MI)는 MAR(Missing At Random)에 대한 가장 원칙적인 접근 방식 중 하나로 여겨집니다. MI는 하나의 완전한 데이터 세트를 생성하는 대신, 불확실성을 반영하는 다양한 대체값을 가진 여러 개의 데이터 세트(예: 5~20개)를 생성합니다. 각 데이터 세트는 개별적으로 분석된 후, 루빈의 규칙(Rubin's rules)을 사용하여 결과를 결합함으로써 보다 타당한 추정치와 표준 오차를 얻습니다.

MI의 장점:
– 결측치 추정의 불확실성을 고려합니다.
– 통계적 추론(신뢰구간, 가설 검정)에 더 정확합니다.
– 다양한 유형의 변수에 유연하게 대응할 수 있습니다.

그 한계점은 다음과 같습니다:
– 구현 방식이 더 복잡해집니다.
– 적절한 가정과 결측치 대체 모델 명세가 필요합니다.
- MNAR에 결측값이 있는 경우, 표준 MI는 여전히 편향될 수 있습니다.

시계열 및 공간 데이터에 대한 결측치 대체

시계열 데이터에서 결측값은 이전 및 이후 값과 강한 상관관계를 갖는 경우가 많습니다. 이러한 경우 선형 보간법, 스플라인, 칼만 필터, ARIMA/상태 공간 모델과 같은 방법이 흔히 사용됩니다. 공간 데이터의 경우, 크리깅이나 공간 모델과 같은 접근 방식을 통해 지리적 근접성을 활용할 수 있습니다. 이러한 방법들은 시공간적 구조가 지배적일 때 효과적이지만, 급격한 변화(예: 경제적 충격)로 인해 단순 보간법이 오해를 불러일으킬 수 있으므로 주의해야 합니다.

결측치 대체 방법 선택에 있어서의 모범 사례

1. 결측치 탐색을 수행합니다. 결측값의 비율, 결측 패턴, 그리고 결측치가 특정 변수와 관련이 있는지 여부를 확인합니다.
2. 훈련 데이터와 테스트 데이터를 분리합니다. 데이터 유출을 방지하기 위해 훈련 데이터만을 사용하여 "학습"을 통해 결측치 대체를 수행한 다음, 이를 테스트 데이터에 적용합니다.
3. 변수의 유형을 고려하십시오. 수치형, 범주형, 순서형 또는 혼합형 등 유형에 따라 적절한 방법이 다릅니다.
4. 결측치 표시 변수 사용: 때때로 값이 결측되었다는 정보 자체가 예측에 도움이 될 수 있습니다. 표시 변수를 추가하면 예측 모델의 성능을 향상시킬 수 있습니다.
5. 결측치 대체 효과 평가: 결측치 대체 전후의 분포를 비교하고, 분산이 감소했는지 확인하며, 모델의 타당성을 검증합니다.
6. 추론을 위한 다중 대치 우선: 분석의 목표가 모수 추정 및 통계적 검정인 경우, 단일 대치보다 다중 대치가 더 적절한 경우가 많습니다.

독서  환경 통계

결론

결측치 대체는 현대 통계 워크플로우에서 결측 데이터 처리의 핵심 요소입니다. 평균/중앙값과 같은 간단한 방법은 기준선으로 사용하거나 결측치가 적은 경우에 유용할 수 있지만, 데이터 구조와 불확실성을 제대로 반영하지 못하는 경우가 많습니다. 회귀 분석, kNN, EM 알고리즘과 같은 모델 기반 방법은 변수 간의 관계를 활용하는 반면, 다중 대체는 불확실성을 고려하여 추론을 위한 견고한 틀을 제공합니다. 최적의 방법 선택은 결측치 발생 기전(MCAR/MAR/MNAR), 분석 목표(예측 vs. 추론), 데이터 특성(시계열, 공간, 혼합)에 따라 달라집니다. 적절한 접근 방식을 통해 결측치 대체는 분석의 정확성을 유지하고 더욱 신뢰할 수 있는 결론을 도출하는 데 도움이 됩니다.

댓글을 남겨주세요