우문현답
愚 問 賢 答
회사별 면접직군별진행 방식
    홈›회사별›쿠팡›데이터 사이언티스트›질문 상세
    問
    쿠쿠팡데이터 사이언티스트경험·이력2026년 출제

    대량의 데이터셋을 다룰 때, 어떤 방식으로 특징을 추출하고 모델을 구축하나요?

    답변 미리보기

    졸업 프로젝트에서 30만 행 이상의 유저 행동 로그 데이터를 다뤘습니다. 먼저 pandas로 결측값과 이상치를 제거하는 전처리를 했고, 상관관계 행렬과 SHAP…

    예상 답변 시간
    60~90초
    예상 꼬리질문
    3회
    난이도
    난이도 중상
    출제 빈도
    높음
    INTERVIEWER'S INTENT · 면접관의 의도

    이 질문, 네 갈래로 뜯어봅니다.

    면접관이 이 한 문장으로 확인하려는 것들. 각 갈래를 알면 답의 뼈대가 잡혀요.

    問
    01
    특징 추출 방법은 어떤가?
    특징 추출 방법에 대한 본인의 접근 방식이 답에 있어야 합니다. 없으면 면접관이 '어떤 기법을 사용하나요?'를 추가로 묻는 경우가 자주 보입니다.
    骨
    02
    모델 구축 경험은 있는가?
    모델 구축 경험에 대한 구체적인 사례가 답에 나타나야 합니다. 없으면 면접관이 '어떤 프로젝트에서 했나요?'를 덧붙여 질문하는 자리가 자주 보입니다.
    語
    03
    데이터 전처리는 어떻게 했는가?
    데이터 전처리 과정에 대한 설명이 답에 있어야 합니다. 없으면 면접관이 '어떤 방법으로 데이터를 정제했나요?'를 추가로 묻는 경우가 많습니다.
    本
    04
    결과 분석은 어떻게 진행했는가?
    결과 분석 방법에 대한 구체적인 설명이 답에 포함되어야 합니다. 없으면 면접관이 '어떤 지표를 사용했나요?'를 질문하는 자리가 자주 보입니다.
    말로 해봐야 는다
    읽는 것과 말하는 건 다릅니다.
    이 질문, 소리 내어 답해 볼까요?
    쿠팡 면접관 페르소나가 이 질문을 던지고, 당신의 답에 꼬리질문으로 되물어요.
    음성으로 답해보기
    특징 선택 실험 결과를 수치로 닫는 결약 84초텍스트 분류 과제에서 특징 선택 기준 변화로 성능 개선 결약 82초시계열 센서 데이터 특징 추출 → 고장 예측 → 현장 행동 변화 결약 85초
    예시 답변 1
    약 84초

    특징 선택 실험 결과를 수치로 닫는 결

    졸업 프로젝트에서 30만 행 이상의 유저 행동 로그 데이터를 다뤘습니다. 먼저 pandas로 결측값과 이상치를 제거하는 전처리를 했고, 상관관계 행렬과 SHAP 값을 써서 어떤 특징이 예측에 실제로 기여하는지를 확인했습니다. 처음엔 40개 특징을 전부 넣었는데 모델 성능이 오히려 낮아서, 중요도 하위 20개를 제거하고 나니 F1 스코어가 0.71에서 0.79로 올랐습니다.

    특징이 많을수록 좋다는 생각이 실제 실험에서 틀렸다는 걸 그때 확인했습니다. 결과 분석은 단일 지표보다 정밀도와 재현율을 함께 보는 방식을 택했고, 어떤 오분류 패턴이 반복되는지 혼동 행렬로 따로 분석했습니다.

    이 결의 특징
    40개에서 20개로 특성을 줄인 후 F1 점수가 0.71에서 0.79로 올라간 경험이 보입니다. 더 많은 데이터보다 맞는 데이터가 중요하다는 원칙을 몸으로 증명한 과정이 흔적으로 남아 있습니다.
    이 결이 통하는 자리
    특성 선택의 원리를 SHAP로 이해하고 있을 때 통합니다. 모델 성능과 해석 가능성을 동시에 높인 경험이 보이면 실무형 데이터 사이언티스트로 읽히는 결이 보입니다.
    B
    약 82초

    텍스트 분류 과제에서 특징 선택 기준 변화로 성능 개선 결

    수업 과제로 뉴스 기사 20만 건을 8개 카테고리로 분류하는 모델을 구축한 경험이 있습니다. 텍스트 데이터는 수치 데이터와 달리 전처리 단계에서 어떤 특징을 정의하느냐가 성능을 거의 결정한다는 걸 처음 실감했습니다. 처음엔 TF-IDF로 상위 빈도 단어를 특징으로 사용했는데, 카테고리 간 공통 단어가 많아 정확도가 낮았습니다. 단순 빈도 대신 카테고리별 고유 키워드에 집중하는 방향으로 특징 선택 기준을 바꾸니 정확도가 0.74에서 0.88로 올랐습니다. 이후 BERT 임베딩으로 전환했을 때는 맥락 정보를 특징으로 활용하는 효과를 수치로 직접 확인했고, 두 방법의 성능 차이가 모델 크기가 아니라 어떤 정보를 특징으로 보느냐의 차이에서 나온다는 것을 이해했습니다.

    모델 구축보다 특징 설계가 먼저라는 원칙이 그 과제에서 생겼습니다.

    이 결의 특징
    TF-IDF에서 출발해 카테고리별 핵심 단어를 다시 재정의한 재설계 과정이 보입니다. 0.74에서 0.88로의 도약 뒤에 있는 사고의 깊이와 분석 밀도가 드러납니다.
    이 결이 통하는 자리
    표준 방법에서 도메인 특화 방법으로의 전환 필요성을 스스로 발견했을 때 통합니다. BERT 도입을 고민했지만 특성 재정의로 충분했다는 판단이 보일 때 실용적 역량이 살아나는 결이 보입니다.
    C
    약 85초

    시계열 센서 데이터 특징 추출 → 고장 예측 → 현장 행동 변화 결

    인턴에서 공장 센서 데이터 약 50만 건으로 장비 고장 예측 모델을 만드는 작업을 맡았습니다. 시계열 데이터는 과거 패턴과 현재 상태를 연결하는 특징을 어떻게 추출하느냐가 핵심이었습니다. 슬라이딩 윈도우를 적용해 30분 구간별 평균, 표준편차, 최대값을 특징으로 만들었고, 순간값이 아닌 추세 변화량을 함께 넣었을 때 모델 정밀도가 눈에 띄게 올라갔습니다. 클래스 불균형 문제도 있었습니다.

    고장 사례가 전체의 2% 미만이어서 오버샘플링을 적용했고, 정확도 대신 재현율과 F1 점수를 기준 지표로 설정했습니다. 모델 배포 후 현장 엔지니어가 사전 점검에 들어가는 흐름이 만들어졌고, 실제 예방 조치가 이루어졌다는 피드백을 받았을 때 가장 보람이 컸습니다.

    예측 모델의 가치는 숫자가 아니라 사람이 행동을 바꿀 때 생긴다는 걸 그 프로젝트에서 배웠습니다.

    이 결의 특징
    50개 중 30개가 실제로 쓸모 있다는 발견에서, 시간계열 특성 중 상위권만 쓰기로 결정한 과정이 보입니다. 관계없는 특성을 제외하는 신중함이 흔적으로 남아 있습니다.
    이 결이 통하는 자리
    대폭적 감축 후에도 성능이 2% 이상 유지된다는 증거가 보일 때 통합니다. 모델 성능과 운영 효율의 균형을 찾는 사람으로 읽힐 때 시스템 사고가 살아나는 결이 보입니다.
    !
    위 답변은 여러 풀이 중 한 가지 예시입니다. 정답이 아니며, 외워서 그대로 말하면 면접관이 다음 질문을 그 자리에서 시작하는 경우가 많습니다. 본인의 프로젝트·기준·숫자로 다시 짜는 자리로만 쓰세요.
    ✕자주 빠지는 자리

    같은 실수가 반복돼요. 이것만 피해도 절반은 갑니다.

    • ✕떨어뜨린 옵션이 1개라도 있는가? "이게 답이었어요"만으로는 의사결정이 아니라 그냥 선택입니다.
    • ✕선택 기준이 그 프로젝트에 한정되는가? "성능이 좋아서"는 일반론, "우리 트래픽이 X 패턴이라서"가 본인의 답입니다.
    • ✕결과 숫자 1개를 정확히 말할 수 있는가? P95·QPS·적중률 — 무엇이든 1개. 숫자가 없으면 직감으로 한 일처럼 들리기 쉽습니다.
    • ✕지금 다시 한다면 어떻게 할지 답할 수 있는가? "잘했다"보다 "이건 다르게 했을 것 같다"가 더 깊은 인상을 남깁니다.
    ▶이어질 꼬리질문

    진짜 면접은 두 번째 질문부터예요. 이 답 뒤에 따라올 법한 것들.

    壹특징을 추출할 때 어떤 기준으로 선택하셨나요?
    貳모델 구축 과정에서 직면했던 어려움은 무엇이었나요?
    參데이터 전처리 과정에서 놓친 부분이 있다면 어떤 부분일까요?
    이제, 직접 답해볼 차례예요.
    눈으로 읽은 답은 면접장에서 나오지 않아요. 쿠팡 면접관과 이 질문으로 한 번 대화해 보세요.
    이 질문으로 모의면접 해보기
    또는, 다음 질문으로

    같은 흐름에서 자주 이어지는 질문들이에요.

    쿠팡 · 구매·SCM 일반
    과거에 어떤 방식으로 수요 예측 모델을 구축해본 경험이 있나요?
    이 질문 보기
    쿠팡 · 회계
    대량의 데이터 분석을 할 때 주로 사용하는 도구나 방법은 무엇인가요?
    이 질문 보기
    토스 · ML 엔지니어
    추천 모델을 구성할 때 어떤 데이터 기반으로 접근하셨는지 설명해 주실 수 있나요?
    이 질문 보기
    쿠팡 · 재무·회계 일반
    재무 모델을 개발할 때 어떤 데이터를 주로 활용하시나요?
    이 질문 보기
    안내 · 이 페이지의 질문·답변·꼬리질문은 유사 직군 채용 시장의 공개된 면접 후기·커뮤니티 게시물을 분석해 구성한 학습 자료입니다. 실제 출제·회사 공식 입장과는 무관하며, 정정 요청 시 24시간 내 반영합니다. 자세히
    개인정보처리방침이용약관문의
    © 2026 우문현답. All rights reserved.
    이 페이지 목차
    01면접관의 의도02답변의 결03실수·꼬리질문04관련 질문
    말로 해봐야 는다
    이 질문, 쿠팡 면접관과
    음성으로 답해볼까요?
    모의면접 해보기
    첫 회 무료 · 종료 즉시 음성 폐기