결측치 처리 기준을 세운 프로젝트
공공 데이터를 활용한 프로젝트에서 약 12만 행의 데이터 중 특정 컬럼에 결측치가 30퍼센트 가까이 있었습니다. 단순 삭제 시 표본이 크게 줄어드는 문제가 있어, 저는 결측 패턴이 무작위인지 먼저 확인한 뒤 관련 변수의 중앙값으로 대체하는 방식을 선택했습니다. pandas의 groupby와 fillna를 조합해 그룹별 중앙값을 적용했고, 처리 전후 분포를 히스토그램으로 비교해 왜곡이 없는지 검증했습니다. 이 과정을 통해 전처리 방식 하나가 이후 모델 성능에 직접적인 영향을 준다는 것을 체감했습니다.