우문현답
愚 問 賢 答
회사별 면접직군별질문 가이드진행 방식
    홈›회사별›PTKOREA›데이터 분석가›질문 상세
    問
    PPTKOREA데이터 분석가경험·이력2026년 출제

    Python을 사용한 데이터 처리 경험에 대해 이야기해 주세요.

    답변 미리보기

    공공 데이터를 활용한 프로젝트에서 약 12만 행의 데이터 중 특정 컬럼에 결측치가 30퍼센트 가까이 있었습니다. 단순 삭제 시 표본이 크게 줄어드는 문제가…

    예상 답변 시간
    60초
    예상 꼬리질문
    3회
    난이도
    난이도 중
    출제 빈도
    보통
    INTERVIEWER'S INTENT · 면접관의 의도

    이 질문, 네 갈래로 뜯어봅니다.

    면접관이 이 한 문장으로 확인하려는 것들. 각 갈래를 알면 답의 뼈대가 잡혀요.

    問
    01
    전처리 문제를 구체적으로 짚는가
    결측치·이상치·중복 등 실제 어떤 문제를 다뤘는지 구체적으로 설명할 수 있는지를 본다.
    骨
    02
    라이브러리 활용이 실제 경험에 근거하는가
    pandas·numpy 등을 나열만 하는 것이 아니라 어떤 상황에 왜 썼는지 이해하고 있는지를 확인한다.
    語
    03
    전처리 판단 기준이 있는가
    결측치를 삭제할지 대체할지 등 선택의 이유를 설명할 수 있는지가 분석 역량을 가른다.
    本
    04
    전처리가 분석 결과에 미친 영향을 아는가
    전처리를 거친 것과 거치지 않은 것의 차이를 인지하고 있는지, 그 근거를 수치로 말할 수 있는지 본다.
    말로 해봐야 는다
    읽는 것과 말하는 건 다릅니다.
    이 질문, 소리 내어 답해 볼까요?
    PTKOREA 면접관 페르소나가 이 질문을 던지고, 당신의 답에 꼬리질문으로 되물어요.
    음성으로 답해보기
    결측치 처리 기준을 세운 프로젝트이상치 탐지와 정제 과정여러 소스 데이터 통합 전처리
    예시 답변 1

    결측치 처리 기준을 세운 프로젝트

    공공 데이터를 활용한 프로젝트에서 약 12만 행의 데이터 중 특정 컬럼에 결측치가 30퍼센트 가까이 있었습니다. 단순 삭제 시 표본이 크게 줄어드는 문제가 있어, 저는 결측 패턴이 무작위인지 먼저 확인한 뒤 관련 변수의 중앙값으로 대체하는 방식을 선택했습니다. pandas의 groupby와 fillna를 조합해 그룹별 중앙값을 적용했고, 처리 전후 분포를 히스토그램으로 비교해 왜곡이 없는지 검증했습니다. 이 과정을 통해 전처리 방식 하나가 이후 모델 성능에 직접적인 영향을 준다는 것을 체감했습니다.

    삭제 대신 대체를 선택한 이유와 검증 과정을 함께 설명해 판단 근거가 명확하다.
    예시 답변 2

    이상치 탐지와 정제 과정

    이커머스 리뷰 데이터를 분석하며 평점과 리뷰 길이 사이의 관계를 살펴본 적이 있습니다. 초기 산점도에서 극단적인 이상치가 다수 발견되어 분석 결과가 왜곡될 위험이 있었습니다. 저는 IQR 기준으로 이상치를 식별하고, 단순 제거 대신 실제 텍스트를 확인해 봇 계정으로 의심되는 데이터인지 먼저 판별한 뒤 제거했습니다. 그 결과 상관계수가 0.31에서 0.52로 뚜렷하게 개선됐습니다. 이 경험으로 이상치를 기계적으로 자르기보다 원인을 확인하는 것이 중요하다는 것을 배웠습니다.

    이상치를 무조건 제거하지 않고 원인을 확인한 절차가 분석적이다.
    예시 답변 3

    여러 소스 데이터 통합 전처리

    학교 프로젝트에서 서로 다른 형식의 CSV 파일 세 개를 병합해 분석해야 했던 적이 있습니다. 컬럼명 표기가 제각각이고 날짜 형식도 통일되어 있지 않아 병합 전 정제 작업이 가장 오래 걸렸습니다. 저는 컬럼명 매핑 딕셔너리를 만들고 datetime 변환을 일괄 적용해 형식을 통일한 뒤 merge를 진행했습니다. 이 과정에서 중복 행 240여 개를 발견해 제거했고, 최종 데이터의 신뢰도를 확보할 수 있었습니다. 분석보다 전처리에 더 많은 시간이 든다는 것을 체감한 경험이었습니다.

    여러 소스를 통합할 때의 실무적 어려움을 구체적으로 드러냈다.
    !
    위 답변은 여러 풀이 중 한 가지 예시입니다. 정답이 아니며, 외워서 그대로 말하면 면접관이 다음 질문을 그 자리에서 시작하는 경우가 많습니다. 본인의 프로젝트·기준·숫자로 다시 짜는 자리로만 쓰세요.
    ✕자주 빠지는 자리

    같은 실수가 반복돼요. 이것만 피해도 절반은 갑니다.

    • ✕사용한 라이브러리 이름만 나열하고 실제 처리 로직을 설명하지 않는다.
    • ✕결측치나 이상치를 왜 그렇게 처리했는지 근거 없이 관행적으로 했다고만 말한다.
    • ✕전처리가 분석 결과에 미친 영향을 수치로 제시하지 못한다.
    ▶이어질 꼬리질문

    진짜 면접은 두 번째 질문부터예요. 이 답 뒤에 따라올 법한 것들.

    壹결측치를 삭제하지 않고 대체하기로 판단한 기준은 무엇이었나요?
    대응데이터 손실과 왜곡 사이의 트레이드오프를 설명한다.
    貳전처리 과정에서 사용한 코드 중 가장 까다로웠던 부분은 무엇인가요?
    대응구체적 함수나 로직상의 어려움과 해결 방법을 든다.
    參전처리 전후로 분석 결과가 어떻게 달라졌는지 수치로 설명할 수 있나요?
    대응정량적 비교 근거를 명확히 제시한다.
    이제, 직접 답해볼 차례예요.
    눈으로 읽은 답은 면접장에서 나오지 않아요. PTKOREA 면접관과 이 질문으로 한 번 대화해 보세요.
    이 질문으로 모의면접 해보기
    또는, 다음 질문으로

    같은 흐름에서 자주 이어지는 질문들이에요.

    이지케어텍 · ML 엔지니어
    Python을 사용한 데이터 처리 및 전처리 경험에 대해 설명해 주세요.
    이 질문 보기
    토스 · BI 엔지니어
    Python을 활용하여 데이터를 처리한 경험에 대해 말씀해 주세요.
    이 질문 보기
    넛지헬스케어 · 데이터 분석가
    Python을 이용한 데이터 분석 경험에 대해 이야기해 주세요.
    이 질문 보기
    넛지헬스케어 · 데이터 분석가
    Python을 이용한 데이터 분석 경험에 대해 구체적으로 이야기해 주세요.
    이 질문 보기
    안내 · 이 페이지의 질문·답변·꼬리질문은 유사 직군 채용 시장의 공개된 면접 후기·커뮤니티 게시물을 분석해 구성한 학습 자료입니다. 실제 출제·회사 공식 입장과는 무관하며, 정정 요청 시 24시간 내 반영합니다. 자세히
    개인정보처리방침이용약관문의
    © 2026 우문현답. All rights reserved.
    이 페이지 목차
    01면접관의 의도02답변의 결03실수·꼬리질문04관련 질문
    말로 해봐야 는다
    이 질문, PTKOREA 면접관과
    음성으로 답해볼까요?
    모의면접 해보기
    첫 회 무료 · 종료 즉시 음성 폐기