우문현답
愚 問 賢 答
회사별 면접직군별진행 방식
    홈›회사별›incross›백엔드›질문 상세
    問
    iincross백엔드경험·이력2026년 출제

    대용량 데이터 처리 경험이 있다면, 어떤 방식으로 데이터를 분석하고 처리했는지 이야기해 주세요.

    답변 미리보기

    졸업 프로젝트에서 웹 서버 로그 약 8천만 건을 분석하는 작업을 맡았습니다. 처음에 MySQL에 데이터를 단순히 넣고 집계 쿼리를 실행했더니 단순 GROUP…

    예상 답변 시간
    60~90초
    예상 꼬리질문
    3회
    난이도
    난이도 중상
    출제 빈도
    높음
    INTERVIEWER'S INTENT · 면접관의 의도

    이 질문, 네 갈래로 뜯어봅니다.

    면접관이 이 한 문장으로 확인하려는 것들. 각 갈래를 알면 답의 뼈대가 잡혀요.

    問
    01
    맥락 결을 짚는가?
    데이터·트래픽·기간 결을 짚는 흔적이 강합니다. 막연한 '경험 있다'만 답하면 면접관이 결을 다시 묻는 자리가 자주 보입니다.
    骨
    02
    구체 결이 있는가?
    스토리지·인덱스·캐시 결을 짚는 흔적이 답에 있어야 합니다. 한 결만 답하면 면접관이 결을 다시 캐는 결이 자주 통합합니다.
    語
    03
    본인 사례 결을 받치는가?
    구체 케이스·결과 결을 자기 언어로 짚는 흔적이 강하게 통합합니다. 이론만 답하면 면접관이 적용을 다시 묻는 자리가 강합니다.
    本
    04
    측정 결이 있는가?
    처리량·지연·재현 결을 짚는 흔적이 자주 통합합니다. 정성 평가만 답하면 면접관이 객관성을 다시 캐는 자리가 강합니다.
    말로 해봐야 는다
    읽는 것과 말하는 건 다릅니다.
    이 질문, 소리 내어 답해 볼까요?
    incross 면접관 페르소나가 이 질문을 던지고, 당신의 답에 꼬리질문으로 되물어요.
    음성으로 답해보기
    경험 중심 — 풀스캔으로 쿼리가 20분 걸리던 문제 해결약 120초경험 중심 — Kafka + DB 파이프라인을 처음 만든 프로젝트약 110초가정형 질문 — 소규모 경험 기반 1인칭 답변약 100초
    로그 1억 건 분석 — 집계 쿼리 최적화 경험
    약 120초

    경험 중심 — 풀스캔으로 쿼리가 20분 걸리던 문제 해결

    졸업 프로젝트에서 웹 서버 로그 약 8천만 건을 분석하는 작업을 맡았습니다. 처음에 MySQL에 데이터를 단순히 넣고 집계 쿼리를 실행했더니 단순 GROUP BY 쿼리 하나가 20분 이상 걸렸습니다.

    인덱스가 하나도 없었고, 매 쿼리마다 풀스캔을 하고 있었습니다. 자주 사용하는 집계 기준인 timestamp와 user_id에 복합 인덱스를 추가하니 같은 쿼리가 40초로 줄어들었습니다. 그러나 여전히 느려서 데이터를 일별로 파티셔닝하고, 오래된 데이터는 Parquet으로 변환하여 S3에 업로드하는 구조로 변경하였습니다.

    최종적으로 최근 30일 데이터 집계는 5초 이내로 처리할 수 있었습니다. 처음 20분에서 5초까지 줄이는 과정이 생각보다 여러 단계가 필요했고, 데이터가 많아지면 저장 구조 설계가 쿼리 성능에 직결된다는 것을 직접 체감하였습니다.

    이 결의 특징
    졸업 프로젝트에서 웹 서버 로그 약 8천만 건을 분석하는 작업을 맡았습니다. 처음에 MySQL에 데이터를 단순히 넣고 집계 쿼리를 실행했더니 단순 GROUP BY 쿼리 하나가 20분 이상 걸렸습니다. 인덱스가 하나도 없었고, 매 쿼리마다 풀스캔을 하고 있었습니다라는 흔적이 있습니다
    이 결이 통하는 자리
    인덱스가 하나도 없었고, 매 쿼리마다 풀스캔을 하고 있었습니다. 자주 사용하는 집계 기준인 `timestamp`와 `user_id`에 복합 인덱스를 추가하니 같은 쿼리가 40초로 줄어들었습니다. 최종적으로 최근 30일 데이터 집계는 5초 이내로 처리할 수 있었습니다. 처음 20분에서 5초까는 자리에서 통합니다
    실시간 클릭스트림 수집 시스템 구축 경험
    약 110초

    경험 중심 — Kafka + DB 파이프라인을 처음 만든 프로젝트

    인턴 때 사용자 클릭 이벤트를 실시간으로 수집하는 파이프라인 구축을 도왔어요. 이벤트가 초당 수백 건 들어오는 환경이었는데, 처음엔 바로 DB에 INSERT하는 방식으로 짰더니 피크 시간에 DB가 버티지 못했습니다.

    Kafka를 앞에 두고 컨슈머가 배치로 모아서 DB에 쓰는 구조로 바꿨어요. Kafka 파티션 수를 처음에 1로 잡아서 컨슈머가 병렬화가 안 됐던 실수도 했고, 파티션을 4개로 늘리고 나서야 병렬 처리가 됐습니다.

    변경 후 피크 시간에도 DB 부하가 안정됐고, 평균 수집 지연이 2초 이내로 유지됐어요. 처음 써보는 기술이라 설정 하나 잘못 잡아서 고생한 경험이지만, 메시지 큐를 앞에 두는 패턴이 얼마나 강력한지 직접 느꼈습니다.

    이 결의 특징
    인턴 때 사용자 클릭 이벤트를 실시간으로 수집하는 파이프라인 구축을 도왔어요. 이벤트가 초당 수백 건 들어오는 환경이었는데, 처음엔 바로 DB에 INSERT하는 방식으로 짰더니 피크 시간에 DB가 버티지 못했습니다. Kafka를 앞에 두고 컨슈머가 배치로 모아서 DB에 쓰는 구조로 바꿨어요라는 흔적이 있습니다
    이 결이 통하는 자리
    Kafka를 앞에 두고 컨슈머가 배치로 모아서 DB에 쓰는 구조로 바꿨어요. 변경 후 피크 시간에도 DB 부하가 안정됐고, 평균 수집 지연이 2초 이내로 유지됐어요. 처음 써보는 기술이라 설정 하나 잘못 잡아서 고생한 경험이지만, 메시지 큐를 앞에 두는 패턴이 얼마나 강력는 자리에서 통합니다
    대용량 경험 부족 — 소규모 데이터 처리 경험 기반 답변
    약 100초

    가정형 질문 — 소규모 경험 기반 1인칭 답변

    수천만 건 이상의 데이터를 다뤄본 경험은 없지만, 학교 프로젝트에서 약 500만 건 수준의 CSV 데이터를 처리한 적이 있어요.

    처음엔 pandas로 전체를 한 번에 읽으려다가 메모리가 터지는 문제가 생겼어요. chunksize=100000으로 나눠 읽도록 바꾸니 해결됐습니다. 단순한 방법이었지만 데이터가 메모리보다 크면 청크 단위로 처리해야 한다는 걸 그때 배웠어요.

    대용량 시스템을 제대로 구축하려면 분산 처리 프레임워크도 배워야 한다고 생각해서 Spark 기초를 공부 중이에요. 아직 직접 운영해본 경험은 없지만, 파티셔닝, 스키마 설계, 병렬 처리 세 가지가 핵심이 될 것 같다고 생각합니다.

    이 결의 특징
    수천만 건 이상의 데이터를 다뤄본 경험은 없지만, 학교 프로젝트에서 약 500만 건 수준의 CSV 데이터를 처리한 적이 있어요. 처음엔 pandas로 전체를 한 번에 읽으려다가 메모리가 터지는 문제가 생겼어요. `chunksize=100000`으로 나눠 읽도록 바꾸니 해결됐습니다라는 흔적이 있습니다
    이 결이 통하는 자리
    `chunksize=100000`으로 나눠 읽도록 바꾸니 해결됐습니다. 대용량 시스템을 제대로 구축하려면 분산 처리 프레임워크도 배워야 한다고 생각해서 Spark 기초를 공부 중이에요. 아직 직접 운영해본 경험은 없지만, 파티셔닝, 스키마 설계, 병렬 처리 세 가지가 핵심이 될 것 같다고 생각합니다는 자리에서 통합니다
    !
    위 답변은 여러 풀이 중 한 가지 예시입니다. 정답이 아니며, 외워서 그대로 말하면 면접관이 다음 질문을 그 자리에서 시작하는 경우가 많습니다. 본인의 프로젝트·기준·숫자로 다시 짜는 자리로만 쓰세요.
    ✕자주 빠지는 자리

    같은 실수가 반복돼요. 이것만 피해도 절반은 갑니다.

    • ✕떨어뜨린 옵션이 1개라도 있는가? "이게 답이었어요"만으로는 의사결정이 아니라 그냥 선택입니다.
    • ✕선택 기준이 그 프로젝트에 한정되는가? "성능이 좋아서"는 일반론, "우리 트래픽이 X 패턴이라서"가 본인의 답입니다.
    • ✕결과 숫자 1개를 정확히 말할 수 있는가? P95·QPS·적중률 — 무엇이든 1개. 숫자가 없으면 직감으로 한 일처럼 들리기 쉽습니다.
    • ✕지금 다시 한다면 어떻게 할지 답할 수 있는가? "잘했다"보다 "이건 다르게 했을 것 같다"가 더 깊은 인상을 남깁니다.
    ▶이어질 꼬리질문

    진짜 면접은 두 번째 질문부터예요. 이 답 뒤에 따라올 법한 것들.

    壹장애가 났을 때 어떻게 풀었나요?
    貳비용과 성능이 충돌하면 어떻게 풀까요?
    參체계를 다시 짠다면 무엇을 바꾸시겠어요?
    이제, 직접 답해볼 차례예요.
    눈으로 읽은 답은 면접장에서 나오지 않아요. incross 면접관과 이 질문으로 한 번 대화해 보세요.
    이 질문으로 모의면접 해보기
    또는, 다음 질문으로

    같은 흐름에서 자주 이어지는 질문들이에요.

    올거나이즈 · 백엔드
    대용량 데이터 처리 경험이 있다면 어떤 기술을 사용했고, 어떤 문제를 해결했는지 구체적으로 설명해 주세요.
    이 질문 보기
    토스 · 데이터·AI 일반
    대용량 데이터 처리 경험이 있다면, 어떤 도구와 방법을 사용했는지 구체적으로 설명해 주세요.
    이 질문 보기
    넛지헬스케어 · 데이터 분석가
    대용량 데이터 처리 경험이 있다면, 어떤 도구나 방법을 사용했는지 설명해 주세요.
    이 질문 보기
    토스 · 데이터 분석가
    대용량 데이터 처리 경험이 있다면, 어떤 도구나 방법론을 사용했나요?
    이 질문 보기
    안내 · 이 페이지의 질문·답변·꼬리질문은 유사 직군 채용 시장의 공개된 면접 후기·커뮤니티 게시물을 분석해 구성한 학습 자료입니다. 실제 출제·회사 공식 입장과는 무관하며, 정정 요청 시 24시간 내 반영합니다. 자세히
    개인정보처리방침이용약관문의
    © 2026 우문현답. All rights reserved.
    이 페이지 목차
    01면접관의 의도02답변의 결03실수·꼬리질문04관련 질문
    말로 해봐야 는다
    이 질문, incross 면접관과
    음성으로 답해볼까요?
    모의면접 해보기
    첫 회 무료 · 종료 즉시 음성 폐기