배치 처리 프레임워크 활용
일 평균 500만 건의 로그 데이터를 처리하기 위해 스파크 기반 배치 파이프라인을 구축한 경험이 있습니다. 초기에는 단일 노드로 처리해 완료까지 4시간이 걸렸는데, 파티셔닝 전략을 재설계해 병렬 처리를 적용한 뒤 처리 시간을 40분으로 단축했습니다. 대용량 처리에서는 도구 선택보다 데이터를 어떻게 분산시키는지가 더 중요하다는 것을 배웠습니다.
면접관이 이 한 문장으로 확인하려는 것들. 각 갈래를 알면 답의 뼈대가 잡혀요.
일 평균 500만 건의 로그 데이터를 처리하기 위해 스파크 기반 배치 파이프라인을 구축한 경험이 있습니다. 초기에는 단일 노드로 처리해 완료까지 4시간이 걸렸는데, 파티셔닝 전략을 재설계해 병렬 처리를 적용한 뒤 처리 시간을 40분으로 단축했습니다. 대용량 처리에서는 도구 선택보다 데이터를 어떻게 분산시키는지가 더 중요하다는 것을 배웠습니다.
서로 다른 세 개 시스템에서 수집되는 데이터를 하나의 웨어하우스로 통합하는 작업을 담당했습니다. 각 시스템마다 날짜 형식과 코드 체계가 달라 정합성 오류가 반복됐는데, 표준 변환 규칙을 문서화하고 검증 단계를 파이프라인에 추가한 뒤 오류 건수가 크게 줄었습니다. 통합의 핵심은 기술보다 데이터 표준을 맞추는 것이라고 생각합니다.
실시간성이 필요하지 않은 일별 집계 데이터는 배치로, 사용자 행동처럼 즉시 반영이 필요한 데이터는 스트리밍으로 나눠 처리하는 아키텍처를 설계한 경험이 있습니다. 모든 데이터를 스트리밍으로 처리하면 비용과 복잡도가 불필요하게 커진다고 판단해 이렇게 나눴는데, 이 결정 덕분에 인프라 비용을 아끼면서도 필요한 실시간성을 확보할 수 있었습니다.
같은 실수가 반복돼요. 이것만 피해도 절반은 갑니다.
진짜 면접은 두 번째 질문부터예요. 이 답 뒤에 따라올 법한 것들.