모니터링 데이터를 기반으로 문제를 추적한 경험을 든다
클라우드 실습 환경에서 특정 서비스의 응답 지연이 반복되는 문제를 겪은 적이 있습니다. 저는 감으로 원인을 추측하지 않고 모니터링 대시보드의 로그를 시간순으로 확인했습니다.
결국 특정 시간대에 반복되는 자동화 스크립트가 리소스를 과도하게 사용하고 있다는 것을 발견했습니다. 스크립트 실행 주기를 조정해 문제를 해결했습니다.
운영 문제는 추측보다 데이터를 먼저 확인하는 것이 정확한 원인 파악의 시작이라고 배웠습니다.