Spark를 활용한 대용량 로그 데이터 처리 경험을 설명한다
사용자 행동 로그 데이터가 일 평균 수천만 건씩 쌓이는 프로젝트에서 Spark를 활용해 배치 집계 파이프라인을 구축한 경험이 있습니다. 초기에는 단일 SQL 쿼리로 처리하려 했지만 처리 시간이 지나치게 길어져 Spark의 분산 처리 방식으로 전환했습니다. 파티셔닝 기준을 날짜와 사용자 그룹으로 나눠 처리 시간을 기존 대비 60% 단축할 수 있었습니다. 데이터 규모가 커지면 도구 선택 자체가 성능을 좌우한다는 것을 실감한 경험이었습니다.