우문현답
愚 問 賢 答
회사별 면접직군별진행 방식
    홈›회사별›무신사›데이터 사이언티스트›질문 상세
    問
    무무신사데이터 사이언티스트직무 역량2026년 출제

    SQL이나 PySpark를 사용해 대규모 데이터를 처리한 경험에 대해 구체적으로 설명해 주세요.

    답변 미리보기

    Apache Spark를 활용한 대용량 데이터 처리 경험으로 일 30억 건 사용자 행동 로그 집계 파이프라인 구축을 주도한 적이 있습니다. 기존 Hive 기반…

    예상 답변 시간
    60~90초
    예상 꼬리질문
    3회
    난이도
    난이도 중상
    출제 빈도
    높음
    INTERVIEWER'S INTENT · 면접관의 의도

    이 질문, 네 갈래로 뜯어봅니다.

    면접관이 이 한 문장으로 확인하려는 것들. 각 갈래를 알면 답의 뼈대가 잡혀요.

    問
    01
    대용량 데이터 처리 경험은 있는가?
    대용량 데이터를 처리한 경험이 답에 있어야 합니다. 없으면 면접관이 '그럼 어떤 데이터를 다뤘나요?'를 추가로 묻는 경우가 자주 보입니다.
    骨
    02
    Apache Spark 활용 경험은 어떤가?
    Apache Spark를 사용한 경험이 있는지 확인하는 자리입니다. 없으면 면접관이 '다른 툴은 어떤 걸 사용했나요?'라는 질문을 던지는 경우가 많습니다.
    語
    03
    처리한 데이터의 규모는 어떤가?
    처리한 데이터의 규모에 대한 언급이 답에 있어야 합니다. 없으면 면접관이 '얼마나 큰 데이터였나요?'를 추가로 묻는 경우가 흔하게 보입니다.
    本
    04
    결과는 어떻게 분석했는가?
    처리 결과에 대한 분석 방법이 답에 포함된 흔적이 있어야 합니다. 없으면 면접관이 '어떻게 활용했나요?'를 추가로 묻는 경우가 자주 보입니다.
    말로 해봐야 는다
    읽는 것과 말하는 건 다릅니다.
    이 질문, 소리 내어 답해 볼까요?
    무신사 면접관 페르소나가 이 질문을 던지고, 당신의 답에 꼬리질문으로 되물어요.
    음성으로 답해보기
    Spark로 수십억 건 로그 집계 파이프라인 구축약 90초Spark Streaming으로 실시간 이상 탐지 구현약 90초Spark 성능 튜닝과 비용 최적화약 90초
    예시 답변 1
    약 90초

    Spark로 수십억 건 로그 집계 파이프라인 구축

    Apache Spark를 활용한 대용량 데이터 처리 경험으로 일 30억 건 사용자 행동 로그 집계 파이프라인 구축을 주도한 적이 있습니다. 기존 Hive 기반 집계는 완료까지 8시간이 걸렸고, 실시간 분석 요구에 대응이 어려웠습니다. PySpark로 파이프라인을 재작성하면서 파티셔닝 전략과 캐싱 최적화에 집중했습니다.

    Broadcast Join을 활용해 작은 차원 테이블 조인 시 셔플 비용을 제거했고, repartition()과 coalesce() 선택 기준을 팀 내 가이드라인으로 문서화했습니다. 결과적으로 집계 소요 시간이 8시간에서 35분으로 단축됐고, 이후 일별 집계 리포트를 오전 6시 이전 자동 생성하는 SLA를 달성했습니다. 분석 결과는 마케팅 팀의 채널 성과 분석에 직접 활용됐습니다.

    이 결의 특징
    Hive 집계가 8시간 걸리던 병목을 PySpark 재작성으로 푼 출발점이 또렷하고, Broadcast Join으로 작은 차원 테이블 조인의 셔플 비용을 제거한 최적화가 구체적입니다. repartition·coalesce 선택 기준을 팀 가이드라인으로 문서화한 대목이, 8시간→35분을 도구 교체가 아닌 튜닝의 결과로 읽히게 하는 결이 보입니다.
    이 결이 통하는 자리
    오전 6시 이전 자동 생성이라는 SLA로 결과를 닫고 마케팅 채널 분석에 직접 쓰인 흐름이 살아 있을 때 통합니다. 어느 연산이 왜 병목이었는지가 또렷한 자리에서 면접관의 꼬리질문이 줄어드는 결이 보입니다.
    예시 답변 2
    약 90초

    Spark Streaming으로 실시간 이상 탐지 구현

    Spark Structured Streaming을 활용해 실시간 거래 이상 탐지 시스템을 구축한 경험이 있습니다. 배치 기반 탐지는 탐지 지연이 최대 24시간에 달해 실시간 대응이 불가능한 문제가 있었습니다. Kafka → Spark Streaming → 알림 시스템 파이프라인을 설계하고, 윈도우 집계 기반 이상 점수 계산 로직을 Spark로 구현했습니다. 처리 규모는 초당 약 5만 건의 이벤트였고, watermark 설정으로 지연 도착 이벤트를 처리하는 로직을 추가했습니다. 스트리밍 잡의 체크포인트 설정과 장애 복구 전략을 설계하는 과정이 가장 어려웠고, 이를 통해 Spark의 exactly-once 처리 보장 메커니즘을 깊이 이해하게 됐습니다.

    이 결의 특징
    배치 기반 탐지 지연이 최대 24시간이라는 한계에서 Structured Streaming으로 옮긴 판단이 또렷합니다. 초당 5만 건 처리에 watermark로 지연 도착 이벤트를 다룬 대목과, 체크포인트·장애 복구를 설계하며 exactly-once 보장 메커니즘을 깊이 이해하게 됐다는 흐름이, 스트리밍을 표면이 아닌 내부까지 다룬 결로 읽히게 합니다.
    이 결이 통하는 자리
    가장 어려웠던 게 체크포인트·복구 설계였다는 솔직함이 살아 있을 때 통합니다. 처리량 수치와 내결함성 이해가 함께 닫히는 자리에서 신뢰가 생기는 결이 보입니다.
    예시 답변 3
    약 90초

    Spark 성능 튜닝과 비용 최적화

    Spark 클러스터에서 실행 비용을 50% 절감한 성능 튜닝 프로젝트를 경험한 적이 있습니다. 기존 잡이 과도한 리소스를 사용하면서도 처리 속도가 느린 문제가 있었고, 원인 분석부터 시작했습니다. Spark UI로 잡 실행 계획을 분석해 데이터 스큐(Skew)가 핵심 원인임을 파악했습니다. 특정 키에 데이터가 집중되는 문제를 salting 기법으로 해결하고, executor 메모리와 코어 수 설정을 실제 워크로드에 맞게 재조정했습니다. 처리 데이터 규모는 일 약 2TB였고, 튜닝 후 실행 시간 40% 단축과 클러스터 비용 50% 절감을 동시에 달성했습니다. 이 경험에서 Spark 성능은 코드보다 데이터 분포 이해에서 출발한다는 것을 배웠습니다.

    이 결의 특징
    리소스를 많이 쓰면서도 느린 잡의 원인을 Spark UI 실행 계획에서 데이터 스큐로 특정한 진단이 또렷합니다. salting으로 키 집중을 풀고 executor 메모리·코어를 워크로드에 맞춘 대목이, 시간 40% 단축과 비용 50% 절감을 동시에 만든 근거가 되는 결이 보입니다.
    이 결이 통하는 자리
    'Spark 성능은 코드보다 데이터 분포 이해에서 출발한다'는 결론이 스큐 진단이라는 구체로 받쳐질 때 통합합니다. 일 2TB라는 규모와 튜닝 효과가 인과로 묶이는 자리에서 면접관의 꼬리질문이 줄어드는 결이 보입니다.
    !
    위 답변은 여러 풀이 중 한 가지 예시입니다. 정답이 아니며, 외워서 그대로 말하면 면접관이 다음 질문을 그 자리에서 시작하는 경우가 많습니다. 본인의 프로젝트·기준·숫자로 다시 짜는 자리로만 쓰세요.
    ✕자주 빠지는 자리

    같은 실수가 반복돼요. 이것만 피해도 절반은 갑니다.

    • ✕떨어뜨린 옵션이 1개라도 있는가? "이게 답이었어요"만으로는 의사결정이 아니라 그냥 선택입니다.
    • ✕선택 기준이 그 프로젝트에 한정되는가? "성능이 좋아서"는 일반론, "우리 트래픽이 X 패턴이라서"가 본인의 답입니다.
    • ✕결과 숫자 1개를 정확히 말할 수 있는가? P95·QPS·적중률 — 무엇이든 1개. 숫자가 없으면 직감으로 한 일처럼 들리기 쉽습니다.
    • ✕지금 다시 한다면 어떻게 할지 답할 수 있는가? "잘했다"보다 "이건 다르게 했을 것 같다"가 더 깊은 인상을 남깁니다.
    ▶이어질 꼬리질문

    진짜 면접은 두 번째 질문부터예요. 이 답 뒤에 따라올 법한 것들.

    壹그 과정에서 마주한 가장 큰 어려움은 무엇이었나요?
    貳결과적으로 어떤 인사이트를 얻었나요?
    參다른 기술과 비교했을 때 Spark의 장점은 무엇인가요?
    이제, 직접 답해볼 차례예요.
    눈으로 읽은 답은 면접장에서 나오지 않아요. 무신사 면접관과 이 질문으로 한 번 대화해 보세요.
    이 질문으로 모의면접 해보기
    또는, 다음 질문으로

    같은 흐름에서 자주 이어지는 질문들이에요.

    당근마켓 · 데이터 분석가
    SQL이나 Python을 사용해 데이터를 처리한 경험에 대해 구체적으로 이야기해 주세요.
    이 질문 보기
    카카오모빌리티 · 정책·연구
    SQL이나 Python을 사용한 데이터 분석 경험에 대해 자세히 설명해 주세요.
    이 질문 보기
    여기어때 · 마케팅 일반
    SQL이나 Python을 사용한 데이터 분석 경험을 구체적으로 말씀해 주세요.
    이 질문 보기
    핀다 · 데이터 사이언티스트
    SQL, Python, Spark를 사용한 데이터 분석 경험에 대해 설명해 주세요.
    이 질문 보기
    안내 · 이 페이지의 질문·답변·꼬리질문은 유사 직군 채용 시장의 공개된 면접 후기·커뮤니티 게시물을 분석해 구성한 학습 자료입니다. 실제 출제·회사 공식 입장과는 무관하며, 정정 요청 시 24시간 내 반영합니다. 자세히
    개인정보처리방침이용약관문의
    © 2026 우문현답. All rights reserved.
    이 페이지 목차
    01면접관의 의도02답변의 결03실수·꼬리질문04관련 질문
    말로 해봐야 는다
    이 질문, 무신사 면접관과
    음성으로 답해볼까요?
    모의면접 해보기
    첫 회 무료 · 종료 즉시 음성 폐기