Python 성능 한계를 겪고 최적화한 경험
개인 프로젝트로 대량의 CSV 로그 파일을 분석하는 스크립트를 Python으로 작성했습니다. 초기엔 pandas로 파일을 순차적으로 읽고 처리했는데, 50만 건 데이터에 40초 넘게 걸렸습니다. 프로파일링 결과 반복문 안에서 DataFrame을 매번 append하는 부분이 병목이었습니다. 리스트에 결과를 모았다가 마지막에 한 번에 DataFrame으로 변환하는 방식으로 바꾸고, 필요한 컬럼만 dtype을 지정해 메모리 사용도 줄였습니다. 그 결과 처리 시간이 6초로 줄었습니다.