우문현답
愚 問 賢 答
회사별 면접직군별진행 방식
    홈›회사별›토스›SRE›질문 상세
    問
    토토스SRE직무 역량2026년 출제

    서비스 가시성과 가용성을 확보하기 위해 어떤 메트릭을 수집하고, 알림 시스템을 어떻게 고도화할 수 있는지 구체적으로 이야기해보세요.

    답변 미리보기

    인턴 때 장애가 나야만 알 수 있는 구조로 운영되던 서비스를 맡았습니다. 에러가 나도 로그를 직접 찾아야 했고, 응답 시간 추이를 볼 방법이…

    예상 답변 시간
    90초
    예상 꼬리질문
    3회
    난이도
    난이도 중상
    출제 빈도
    높음
    INTERVIEWER'S INTENT · 면접관의 의도

    이 질문, 네 갈래로 뜯어봅니다.

    면접관이 이 한 문장으로 확인하려는 것들. 각 갈래를 알면 답의 뼈대가 잡혀요.

    問
    01
    어떤 메트릭을 제안하는가?
    서비스 가시성을 위한 메트릭을 제안한 흔적이 답에 있어야 합니다. 없으면 면접관이 '어떤 기준으로 선택했나요?'를 추가로 묻는 경우가 자주 보입니다.
    骨
    02
    가용성 확보 방법은 무엇인가?
    가용성을 확보하기 위한 구체적인 방법이 답에 포함된 흔적이 있어야 합니다. 없으면 면접관이 '어떤 경험이 있나요?' 같은 질문을 던지는 자리가 자주 보입니다.
    語
    03
    알림 시스템 고도화 전략은?
    알림 시스템을 고도화하기 위한 전략이 답에 있어야 합니다. 없으면 면접관이 '어떤 기술적 접근을 고려했나요?'를 추가로 묻는 자리가 흔하게 통합니다.
    本
    04
    실제 사례를 이야기했는가?
    실제 경험이나 사례를 언급한 흔적이 답에 있어야 합니다. 없으면 면접관이 '그 경험에서 무엇을 배웠나요?'를 묻는 자리에서 자주 나타납니다.
    말로 해봐야 는다
    읽는 것과 말하는 건 다릅니다.
    이 질문, 소리 내어 답해 볼까요?
    토스 면접관 페르소나가 이 질문을 던지고, 당신의 답에 꼬리질문으로 되물어요.
    음성으로 답해보기
    운영 지표가 없던 서비스에 처음으로 모니터링을 붙인 경험약 90초초기 알람이 너무 많아 팀이 무시하게 된 문제를 개선한 경험약 90초서비스 가용성 목표를 숫자로 정의하고 측정 체계를 만든 경험약 90초
    서비스 모니터링 첫 구축 경험
    약 90초

    운영 지표가 없던 서비스에 처음으로 모니터링을 붙인 경험

    인턴 때 장애가 나야만 알 수 있는 구조로 운영되던 서비스를 맡았습니다. 에러가 나도 로그를 직접 찾아야 했고, 응답 시간 추이를 볼 방법이 없었습니다.

    Prometheus로 에러율, 응답 시간 P50/P95, 활성 요청 수를 수집하고 Grafana 대시보드를 만들었습니다. 처음엔 알람 기준이 없어 에러가 1개만 나도 알람이 울려 팀이 알람 피로도를 호소했습니다. 에러율 기준으로 바꾸고 5분 집계 창을 두니 오탐이 줄었습니다.

    가용성 지표로는 업타임 체크를 1분 간격으로 추가해 서비스가 아예 내려간 경우를 즉시 감지하게 했습니다. 모니터링 이전엔 장애를 사용자가 먼저 알았는데, 이후엔 내부에서 먼저 인지하게 됐습니다. 가시성은 곧 대응 속도라는 걸 그때 배웠습니다.

    이 결의 특징
    Prometheus로 에러율·응답시간을 수집하다 알람 피로도가 발생해 5분 집계 창으로 조정하고, 업타임 체크를 1분 간격으로 추가한 구체적 과정이 담겨 있습니다. 사용자가 장애를 먼저 알던 구조를 바꾼 전환점이 뚜렷합니다.
    이 결이 통하는 자리
    알람 피로도가 실제로 어떤 형태로 나타났는지와 5분 집계로 조정한 근거가 남아 있을 때 통합니다. 가시성이 대응 속도라는 결론이 실제 개선에서 나온 것임이 드러나면 면접관이 신뢰하는 결이 보입니다.
    알람 고도화 경험
    약 90초

    초기 알람이 너무 많아 팀이 무시하게 된 문제를 개선한 경험

    팀 프로젝트에서 서비스 알람을 처음 붙였을 때 하루 50건 이상 알람이 울렸습니다. 모두 진짜 이상이 아니라 일시적 스파이크였는데, 팀이 알람을 보지 않게 됐습니다. 알람이 너무 많으면 없는 것과 같다는 걸 직접 경험했습니다.

    알람을 3등급으로 분류했습니다. 즉시 대응이 필요한 것은 슬랙 #alert-critical, 확인이 필요한 건 #alert-warning, 참고용은 대시보드에만 표시하는 방식으로 나눴습니다. 슬랙 알람 수가 하루 4건 이하로 줄었고, 그때부터 팀이 알람을 진지하게 보기 시작했습니다.

    알람 고도화에서 '어떤 상황에 누가 깨어나야 하는가'를 먼저 정하는 것이 핵심이라는 걸 배웠습니다. 기술보다 운영 시나리오 정의가 먼저라는 것이 지금도 제 기준입니다.

    이 결의 특징
    하루 50건 넘던 알람을 3등급으로 분류해 슬랙 알람을 하루 4건 이하로 줄인 구체적 수치가 담겨 있습니다. 알람이 많으면 없는 것과 같다는 관찰이 실제 경험에서 나온 지점이 뚜렷합니다.
    이 결이 통하는 자리
    50건에서 4건으로의 구체적 변화가 남아 있을 때 통합니다. 누가 깨어나야 하는지 먼저 정하는 게 핵심이라는 결론이 실제 등급 분류 작업에서 나온 것임이 드러나면 면접관이 확인하는 결이 보입니다.
    가용성 SLO 설정 경험
    약 90초

    서비스 가용성 목표를 숫자로 정의하고 측정 체계를 만든 경험

    사이드 프로젝트에서 '우리 서비스는 얼마나 안정적인가'를 수치로 말할 수 없는 상황이었습니다. 장애가 나면 '자주 나는 것 같다'고만 느꼈지 얼마나 자주인지 몰랐습니다.

    월간 가용성을 측정하기 시작했습니다. 헬스체크 엔드포인트를 1분마다 호출해 성공률을 기록하고, 월 기준 99.5% 목표를 세웠습니다. 첫 달 데이터가 98.1%로 나왔는데, 가장 큰 다운타임이 배포 중 재시작 시간이었습니다.

    무중단 배포 방식으로 전환하니 가용성이 99.7%로 올랐습니다. 수치가 없었다면 원인을 찾으러 갈 이유조차 없었을 것입니다. 가시성은 목표 수치를 세우는 것에서 시작한다는 걸 그때 처음 배웠습니다.

    이 결의 특징
    월간 가용성을 98.1%로 측정해 배포 중 재시작이 가장 큰 다운타임임을 발견하고, 무중단 배포로 전환해 99.7%까지 끌어올린 구체적 수치가 담겨 있습니다.
    이 결이 통하는 자리
    98.1%에서 99.7%로의 구체적 변화와 원인 분석이 남아 있을 때 통합니다. 수치가 없으면 원인을 찾을 이유조차 없다는 결론이 실제 측정에서 나온 것임이 드러나면 통하는 결이 보입니다.
    !
    위 답변은 여러 풀이 중 한 가지 예시입니다. 정답이 아니며, 외워서 그대로 말하면 면접관이 다음 질문을 그 자리에서 시작하는 경우가 많습니다. 본인의 프로젝트·기준·숫자로 다시 짜는 자리로만 쓰세요.
    ✕자주 빠지는 자리

    같은 실수가 반복돼요. 이것만 피해도 절반은 갑니다.

    • ✕떨어뜨린 옵션이 1개라도 있는가? "이게 답이었어요"만으로는 의사결정이 아니라 그냥 선택입니다.
    • ✕선택 기준이 그 프로젝트에 한정되는가? "성능이 좋아서"는 일반론, "우리 트래픽이 X 패턴이라서"가 본인의 답입니다.
    • ✕결과 숫자 1개를 정확히 말할 수 있는가? P95·QPS·적중률 — 무엇이든 1개. 숫자가 없으면 직감으로 한 일처럼 들리기 쉽습니다.
    • ✕지금 다시 한다면 어떻게 할지 답할 수 있는가? "잘했다"보다 "이건 다르게 했을 것 같다"가 더 깊은 인상을 남깁니다.
    ▶이어질 꼬리질문

    진짜 면접은 두 번째 질문부터예요. 이 답 뒤에 따라올 법한 것들.

    壹가용성 확보를 위해 어떤 구체적인 메트릭을 고려하셨나요?
    貳알림 시스템 고도화 시 어떤 변화가 필요하다고 생각하시나요?
    參서비스의 가시성 문제로 발생했던 사례가 있다면 말씀해주실 수 있나요?
    이제, 직접 답해볼 차례예요.
    눈으로 읽은 답은 면접장에서 나오지 않아요. 토스 면접관과 이 질문으로 한 번 대화해 보세요.
    이 질문으로 모의면접 해보기
    또는, 다음 질문으로

    같은 흐름에서 자주 이어지는 질문들이에요.

    토스 · 서비스 오너
    서비스 개선을 위해 어떤 데이터나 피드백을 활용했는지 예를 들어 설명해 주세요.
    이 질문 보기
    스마일게이트 · 서비스 오너
    서비스의 성과를 측정하기 위한 지표나 방법론에 대해 설명해 주세요.
    이 질문 보기
    삼성전자 · 공통직무·미지정
    서비스 성과 지표를 분석하고 추적하는 데 필요한 방법에 대해 설명해줄 수 있나요?
    이 질문 보기
    토스 · 인프라/클라우드
    서비스 안정성을 위한 모니터링 및 로깅 시스템을 구축한 경험이 있다면, 어떤 도구를 사용했는지와 그 이유를 말씀해 주세요.
    이 질문 보기
    안내 · 이 페이지의 질문·답변·꼬리질문은 유사 직군 채용 시장의 공개된 면접 후기·커뮤니티 게시물을 분석해 구성한 학습 자료입니다. 실제 출제·회사 공식 입장과는 무관하며, 정정 요청 시 24시간 내 반영합니다. 자세히
    개인정보처리방침이용약관문의
    © 2026 우문현답. All rights reserved.
    이 페이지 목차
    01면접관의 의도02답변의 결03실수·꼬리질문04관련 질문
    말로 해봐야 는다
    이 질문, 토스 면접관과
    음성으로 답해볼까요?
    모의면접 해보기
    첫 회 무료 · 종료 즉시 음성 폐기