결측치·이상치 처리 기준을 구체적으로 설명한다
설문 응답 데이터를 정제하면서 결측치가 30% 넘는 컬럼은 분석에서 제외하고, 그 이하인 경우 중앙값으로 대체하는 기준을 세웠습니다. 이상치는 단순히 값의 범위만 보지 않고, Python으로 분포를 시각화해 실제로 오입력인지 특이 케이스인지 먼저 확인했습니다. 이 과정에서 일부는 오입력이 아니라 실제 극단값이라는 것을 발견해 제외하지 않고 남겨뒀습니다. 정제는 기계적으로 지우는 것이 아니라 맥락을 함께 봐야 한다는 것을 배웠습니다.