시계열 분석으로 교통 패턴을 발굴한 사례
공공 데이터로 제공된 시간대별 교통량 데이터를 분석하는 프로젝트에서, 단순 평균이 아니라 시계열 분해를 통해 요일별·시간대별 반복 패턴과 특이 이상치를 분리했습니다. 명절 연휴처럼 반복되지 않는 이상치는 별도로 표시해 일반 패턴 분석에서 제외했고, 그 결과 출퇴근 시간대의 혼잡 패턴을 더 명확하게 파악할 수 있었습니다.
면접관이 이 한 문장으로 확인하려는 것들. 각 갈래를 알면 답의 뼈대가 잡혀요.
공공 데이터로 제공된 시간대별 교통량 데이터를 분석하는 프로젝트에서, 단순 평균이 아니라 시계열 분해를 통해 요일별·시간대별 반복 패턴과 특이 이상치를 분리했습니다. 명절 연휴처럼 반복되지 않는 이상치는 별도로 표시해 일반 패턴 분석에서 제외했고, 그 결과 출퇴근 시간대의 혼잡 패턴을 더 명확하게 파악할 수 있었습니다.
고객 리뷰 텍스트라는 비정형 데이터를 분석할 때, 먼저 형태소 분석으로 단어를 추출하고 TF-IDF로 각 리뷰의 핵심 키워드 가중치를 계산했습니다. 이후 키워드 빈도를 별점과 교차 분석해, 특정 키워드가 낮은 별점과 강하게 연관된다는 걸 발견했습니다. 단순 감정 분류보다 키워드 단위 분석이 실질적 개선점을 찾는 데 더 유용했습니다.
여러 국가의 사용자 행동 데이터를 함께 분석할 때 가장 주의한 점은 시간대와 문화적 소비 패턴 차이였습니다. 모든 국가 데이터를 UTC 기준으로만 보면 실제 현지 활동 시간대가 왜곡될 수 있어, 국가별 로컬 타임존으로 변환해 분석했습니다. 또한 특정 국가에서만 관측되는 명절 특수 패턴을 전체 트렌드에 섞지 않도록 국가별로 분리해 비교했습니다.
같은 실수가 반복돼요. 이것만 피해도 절반은 갑니다.
진짜 면접은 두 번째 질문부터예요. 이 답 뒤에 따라올 법한 것들.