우문현답
愚 問 賢 答
회사별 면접직군별진행 방식
    홈›회사별›넥스트증권›백엔드›질문 상세
    問
    넥넥스트증권백엔드직무 역량2026년 출제

    Prometheus와 Grafana를 사용한 Observability 경험에 대해 설명해 주세요.

    답변 미리보기

    인턴 때 추론 서버에 Prometheus를 붙이고 Grafana로 대시보드를 만들었습니다. 처음에는 단순히 메트릭이 보이는 것 자체에 만족했으나, 어느 날…

    예상 답변 시간
    60~90초
    예상 꼬리질문
    3회
    난이도
    난이도 중상
    출제 빈도
    높음
    INTERVIEWER'S INTENT · 면접관의 의도

    이 질문, 네 갈래로 뜯어봅니다.

    면접관이 이 한 문장으로 확인하려는 것들. 각 갈래를 알면 답의 뼈대가 잡혀요.

    問
    01
    서빙 모니터링을 어떻게 했는가?
    모델 서빙 모니터링을 위한 접근 방식이 답에 있어야 합니다. 없으면 면접관이 '어떤 도구를 사용했나요?'를 추가로 묻는 경우가 자주 보입니다.
    骨
    02
    Prometheus 활용 경험이 있는가?
    Prometheus의 활용 경험에 대한 흔적이 답에 있어야 합니다. 없으면 면접관이 '구체적으로 어떤 메트릭을 모니터링했나요?' 같은 질문을 던지는 자리가 자주 보입니다.
    語
    03
    Grafana를 어떻게 사용했는가?
    Grafana를 활용한 시각화 경험에 대한 언급이 답에 있어야 합니다. 없으면 면접관이 '대시보드를 어떻게 구성했나요?'라고 추가 질문을 할 가능성이 높습니다.
    本
    04
    모니터링 결과를 어떻게 활용했는가?
    모니터링 결과를 어떻게 활용했는지에 대한 설명이 답에 있어야 합니다. 없으면 면접관이 '결과를 바탕으로 어떤 조치를 취했나요?'를 추가로 묻는 경우가 많습니다.
    말로 해봐야 는다
    읽는 것과 말하는 건 다릅니다.
    이 질문, 소리 내어 답해 볼까요?
    넥스트증권 면접관 페르소나가 이 질문을 던지고, 당신의 답에 꼬리질문으로 되물어요.
    음성으로 답해보기
    경험 중심 — 응답 지연 발생 후 알림 규칙을 뒤늦게 세운 경험약 120초경험 중심 — 기본 메트릭 외 모델 전용 지표를 추가한 경험약 110초가정형 질문 — 소규모 실습 경험 기반 1인칭 답변약 100초
    추론 서버 레이턴시 이상 감지 — 알림 설정 경험
    약 120초

    경험 중심 — 응답 지연 발생 후 알림 규칙을 뒤늦게 세운 경험

    인턴 때 추론 서버에 Prometheus를 붙이고 Grafana로 대시보드를 만들었습니다. 처음에는 단순히 메트릭이 보이는 것 자체에 만족했으나, 어느 날 p95 레이턴시가 30분 넘게 500ms를 초과하고 있었는데 아무도 몰랐던 사건이 발생했습니다.

    알람 규칙이 없었던 것이 원인이었고, 이후에 AlertManager로 p95가 200ms를 2분 이상 초과하면 슬랙 알림이 오도록 설정했습니다. 알람을 너무 예민하게 잡으면 알림 피로가 생긴다고 들어서, 5분 평균 기준으로 조정했습니다.

    Grafana 대시보드에는 요청 수, 오류율, p50/p95/p99 레이턴시, GPU 메모리 사용률을 한 화면에 배치했습니다. 그 결과 이상 징후를 10분 내로 파악할 수 있게 되었고, 팀장님께서 이제 모니터링다운 모니터링이 되었다고 말씀하셨습니다.

    이 결의 특징
    인턴 때 추론 서버에 Prometheus를 붙이고 Grafana로 대시보드를 만들었습니다. 처음에는 단순히 메트릭이 보이는 것 자체에 만족했으나, 어느 날 p95 레이턴시가 30분 넘게 500ms를 초과하고 있었는데 아무도 몰랐던 사건이 발생했습니다라는 흔적이 있습니다
    이 결이 통하는 자리
    알람 규칙이 없었던 것이 원인이었고, 이후에 AlertManager로 p95가 200ms를 2분 이상 초과하면 슬랙 알림이 오도록 설정했습니다. Grafana 대시보드에는 요청 수, 오류율, p50/p95/p99 레이턴시, GPU 메모리 사용률을 한 화면에 배치했습니다. 그 결과는 자리에서 통합니다
    커스텀 메트릭 추가 — 입력 토큰 분포 추적
    약 110초

    경험 중심 — 기본 메트릭 외 모델 전용 지표를 추가한 경험

    졸업 프로젝트에서 LLM 서빙 서버를 운영할 때, Prometheus가 기본 제공하는 CPU/메모리 메트릭만으론 왜 가끔 응답이 오래 걸리는지 원인을 못 찾겠는 문제가 있었어요.

    의심한 건 입력 토큰 길이였어요. 그래서 prometheus_client 라이브러리로 요청별 입력 토큰 수를 히스토그램으로 직접 수집했습니다. Grafana에서 보니 토큰 500개 이상 구간이 전체 레이턴시 스파이크의 80%와 겹쳤어요.

    이후 토큰 1,000개 이상 요청은 별도 큐로 분리하는 로직을 추가했고, 일반 요청 레이턴시가 안정됐습니다. 모델 서빙은 인프라 메트릭만 보면 안 되고 입력 특성도 같이 모니터링해야 한다는 걸 이 경험에서 배웠어요.

    이 결의 특징
    졸업 프로젝트에서 LLM 서빙 서버를 운영할 때, Prometheus가 기본 제공하는 CPU/메모리 메트릭만으론 왜 가끔 응답이 오래 걸리는지 원인을 못 찾겠는 문제가 있었어요. 의심한 건 입력 토큰 길이였어요. 그래서 `prometheus_client` 라이브러리로 요청별 입력 토큰 수를 히스토그램으로 직접 수집했습니다라는 흔적이 있습니다
    이 결이 통하는 자리
    그래서 `prometheus_client` 라이브러리로 요청별 입력 토큰 수를 히스토그램으로 직접 수집했습니다. 이후 토큰 1,000개 이상 요청은 별도 큐로 분리하는 로직을 추가했고, 일반 요청 레이턴시가 안정됐습니다. 모델 서빙은 인프라 메트릭만 보면 안 되고 입력 특성도 같이 모니터링해야 한다는 걸 이 경험에서는 자리에서 통합니다
    Prometheus + Grafana 학습 — 개인 프로젝트 구성 경험
    약 100초

    가정형 질문 — 소규모 실습 경험 기반 1인칭 답변

    실제 모델 서빙 모니터링 경험은 많지 않지만, 개인 프로젝트에서 FastAPI 서버에 Prometheus를 붙이고 Grafana로 시각화해봤어요.

    prometheus_fastapi_instrumentator를 쓰니 코드 몇 줄로 기본 메트릭이 수집됐는데, 처음엔 어떤 메트릭이 의미 있는지 몰라서 대시보드에 50개 가까운 패널을 넣었어요. 보다보니 대부분 노이즈였고, 결국 요청 수, 오류율, 레이턴시 세 가지만 남겼습니다.

    모니터링에서 제일 어려운 건 무엇을 볼 것인가를 결정하는 것이라는 걸 그때 느꼈어요. 모델 서빙이라면 추가로 GPU 메모리 사용률과 모델 로드 시간은 기본으로 봐야 한다고 생각합니다. 실제 운영 환경에서 더 의미 있는 지표를 찾아가는 경험을 쌓고 싶어요.

    이 결의 특징
    실제 모델 서빙 모니터링 경험은 많지 않지만, 개인 프로젝트에서 FastAPI 서버에 Prometheus를 붙이고 Grafana로 시각화해봤어요. `prometheus_fastapi_instrumentator`를 쓰니 코드 몇 줄로 기본 메트릭이 수집됐는데, 처음엔 어떤 메트릭이 의미 있는지 몰라서 대시보드에 50개 가까운 패널을 넣었어요라는 흔적이 ...
    이 결이 통하는 자리
    `prometheus_fastapi_instrumentator`를 쓰니 코드 몇 줄로 기본 메트릭이 수집됐는데, 처음엔 어떤 메트릭이 의미 있는지 몰라서 대시보드에 50개 가까운 패널을 넣었어요. 보다보니 대부분 노이즈였고, 결국 요청 수, 오류율, 레이턴시 세 가지만 남겼습니다. 모델 서빙이라면 추가로 GPU 메모리 사용률과 모델 로드 시간은 기본으...
    !
    위 답변은 여러 풀이 중 한 가지 예시입니다. 정답이 아니며, 외워서 그대로 말하면 면접관이 다음 질문을 그 자리에서 시작하는 경우가 많습니다. 본인의 프로젝트·기준·숫자로 다시 짜는 자리로만 쓰세요.
    ✕자주 빠지는 자리

    같은 실수가 반복돼요. 이것만 피해도 절반은 갑니다.

    • ✕떨어뜨린 옵션이 1개라도 있는가? "이게 답이었어요"만으로는 의사결정이 아니라 그냥 선택입니다.
    • ✕선택 기준이 그 프로젝트에 한정되는가? "성능이 좋아서"는 일반론, "우리 트래픽이 X 패턴이라서"가 본인의 답입니다.
    • ✕결과 숫자 1개를 정확히 말할 수 있는가? P95·QPS·적중률 — 무엇이든 1개. 숫자가 없으면 직감으로 한 일처럼 들리기 쉽습니다.
    • ✕지금 다시 한다면 어떻게 할지 답할 수 있는가? "잘했다"보다 "이건 다르게 했을 것 같다"가 더 깊은 인상을 남깁니다.
    ▶이어질 꼬리질문

    진짜 면접은 두 번째 질문부터예요. 이 답 뒤에 따라올 법한 것들.

    壹모니터링 설정 시 어떤 기준으로 지표를 선택하셨나요?
    貳Prometheus와 Grafana를 선택한 이유는 무엇인가요?
    參이 모니터링을 통해 발견한 문제는 무엇이었나요?
    이제, 직접 답해볼 차례예요.
    눈으로 읽은 답은 면접장에서 나오지 않아요. 넥스트증권 면접관과 이 질문으로 한 번 대화해 보세요.
    이 질문으로 모의면접 해보기
    또는, 다음 질문으로

    같은 흐름에서 자주 이어지는 질문들이에요.

    넥스트증권 · 백엔드
    Prometheus와 Grafana를 사용하여 시스템의 Observability를 어떻게 개선했는지 예를 들어 설명해 주실 수 있나요?
    이 질문 보기
    HL그룹 · 백엔드
    ELK, Prometheus, Grafana 등을 활용한 모니터링 및 로그 분석 환경 구축 경험에 대해 설명해 주세요.
    이 질문 보기
    라인 · DBA
    Prometheus, Grafana, Ansible 사용 경험이 있다면 어떤 프로젝트에서 활용했는지 설명해 주세요.
    이 질문 보기
    토스 · ML 엔지니어
    모델 서빙 모니터링을 위해 Prometheus와 Grafana를 어떻게 활용했는지 설명해 주세요.
    이 질문 보기
    안내 · 이 페이지의 질문·답변·꼬리질문은 유사 직군 채용 시장의 공개된 면접 후기·커뮤니티 게시물을 분석해 구성한 학습 자료입니다. 실제 출제·회사 공식 입장과는 무관하며, 정정 요청 시 24시간 내 반영합니다. 자세히
    개인정보처리방침이용약관문의
    © 2026 우문현답. All rights reserved.
    이 페이지 목차
    01면접관의 의도02답변의 결03실수·꼬리질문04관련 질문
    말로 해봐야 는다
    이 질문, 넥스트증권 면접관과
    음성으로 답해볼까요?
    모의면접 해보기
    첫 회 무료 · 종료 즉시 음성 폐기