우문현답
愚 問 賢 答
회사별 면접직군별진행 방식
    홈›회사별›토스›ML 엔지니어›질문 상세
    問
    토토스ML 엔지니어상황·판단2026년 출제

    AI 모델의 품질, 지연 시간, 비용 간의 트레이드오프를 이해하고, 이를 해결한 경험이 있다면 설명해보세요.

    답변 미리보기

    AI 모델의 품질·지연·비용 트레이드오프를 실제 서비스에서 해결한 경험이 있습니다. 초기 프로토타입에서 GPT-4를 모든 요청에 사용했더니 월 API 비용이…

    예상 답변 시간
    90초
    예상 꼬리질문
    3회
    난이도
    난이도 중상
    출제 빈도
    높음
    INTERVIEWER'S INTENT · 면접관의 의도

    이 질문, 네 갈래로 뜯어봅니다.

    면접관이 이 한 문장으로 확인하려는 것들. 각 갈래를 알면 답의 뼈대가 잡혀요.

    問
    01
    트레이드오프를 이해했는가?
    AI 모델의 품질, 지연 시간, 비용 간의 트레이드오프를 이해하고 설명할 수 있는 흔적이 답에 있어야 합니다. 없으면 면접관이 '어떤 요소가 가장 중요했나요?'를 추가로 묻는 경우가 자주 보입니다.
    骨
    02
    해결 경험이 있는가?
    트레이드오프를 해결한 경험을 공유할 때 구체적인 사례가 포함된 흔적이 있어야 합니다. 없으면 면접관이 '그 과정에서 어떤 어려움이 있었나요?'를 질문할 가능성이 높습니다.
    語
    03
    결과를 어떻게 평가했는가?
    해결 후 결과를 어떻게 평가했는지에 대한 흔적이 답에 포함되어야 합니다. 없으면 면접관이 '성과는 어떻게 측정했나요?'를 추가로 묻는 경향이 있습니다.
    本
    04
    팀과 소통했는가?
    트레이드오프 해결 과정에서 팀과의 소통 방식에 대한 흔적이 있어야 합니다. 없으면 면접관이 '협업에서 어떤 역할을 했나요?'라는 질문을 던지는 자리가 자주 보입니다.
    말로 해봐야 는다
    읽는 것과 말하는 건 다릅니다.
    이 질문, 소리 내어 답해 볼까요?
    토스 면접관 페르소나가 이 질문을 던지고, 당신의 답에 꼬리질문으로 되물어요.
    음성으로 답해보기
    추론 비용 최적화로 GPT-4 → 소형 모델 단계화약 90초캐싱과 배치 처리로 지연·비용 동시 해결약 90초모델 양자화와 지연 SLA 기반 품질 기준 설정약 90초
    예시 답변 1
    약 90초

    추론 비용 최적화로 GPT-4 → 소형 모델 단계화

    AI 모델의 품질·지연·비용 트레이드오프를 실제 서비스에서 해결한 경험이 있습니다. 초기 프로토타입에서 GPT-4를 모든 요청에 사용했더니 월 API 비용이 예산의 5배를 초과했습니다. 트레이드오프 이해로 고품질이 실제로 필요한 요청(복잡한 추론·장문 생성)과 단순 분류·짧은 응답은 요구 수준이 다르다는 점을 파악했습니다.

    해결 방식으로 요청 복잡도를 분류하는 Router 모델을 추가하고, 단순 요청은 소형 모델, 복잡 요청만 대형 모델로 라우팅하는 계층적 구조를 설계했습니다. 팀과 함께 복잡도 판단 기준과 라우팅 임계값을 실험으로 결정했고, 각자 모델 벤치마킹과 비용 분석을 분담했습니다.

    평가로 품질 점수 하락이 2% 미만인 상태에서 비용을 70% 절감하는 결과를 달성했고, A/B 테스트로 사용자 만족도 변화가 없음을 확인했습니다.

    이 결의 특징
    모든 요청에 GPT-4를 써 예산 5배를 초과한 출발점이 또렷하고, 복잡 요청과 단순 분류의 요구 수준이 다르다는 분해가 명확합니다. Router로 요청을 계층화한 대목이, 품질 2% 이내·비용 70% 절감을 막연한 절약이 아니라 구조적 선택으로 읽히게 하는 결이 보입니다.
    이 결이 통하는 자리
    라우팅 임계값을 팀과 실험으로 정한 협업과 A/B로 만족도 무변화를 확인한 검증이 살아 있을 때 통합니다. 비용 절감을 품질 검증과 한 묶음으로 닫은 자리에서 면접관의 꼬리질문이 줄어드는 결이 보입니다.
    예시 답변 2
    약 90초

    캐싱과 배치 처리로 지연·비용 동시 해결

    캐싱과 배치 처리를 조합해 AI 모델의 지연과 비용을 동시에 최적화한 경험이 있습니다. 유사한 입력이 반복 요청될 때마다 매번 LLM 추론을 실행해 비용과 지연이 누적되는 문제가 있었습니다. 트레이드오프 이해로 캐싱은 비용·지연을 획기적으로 줄이지만 캐시 무효화 정책이 복잡해지고, 배치 처리는 지연을 높이는 대신 비용을 낮추는 선택임을 인식했습니다.

    해결 방식으로 Semantic Caching(의미적으로 유사한 쿼리를 동일 응답으로 처리)을 구현해 캐시 히트율을 높이고, 지연에 덜 민감한 백그라운드 작업은 배치 API로 전환했습니다. 팀과 캐시 유효기간·의미 유사도 임계값 최적값을 실험으로 함께 결정했습니다.

    평가로 캐시 히트율 43%, API 비용 55% 감소를 달성했고, P50 지연도 개선됐습니다.

    이 결의 특징
    캐싱은 무효화가 복잡해지고 배치는 지연을 키운다는 각 수단의 대가를 먼저 인정한 균형 감각이 또렷합니다. Semantic Caching으로 단순 일치를 넘어 히트율을 높인 대목이, 히트율 43%·비용 55% 감소를 기법 나열이 아닌 선택의 결과로 읽히게 하는 결이 보입니다.
    이 결이 통하는 자리
    지연에 덜 민감한 작업만 배치로 돌린 분기 판단이 또렷하고, 의미 유사도 임계값을 실험으로 맞춘 구체가 살아 있을 때 통합니다. 두 기법을 함께 쓴 이유가 분명한 자리에서 신뢰가 생기는 결이 보입니다.
    예시 답변 3
    약 90초

    모델 양자화와 지연 SLA 기반 품질 기준 설정

    모델 양자화와 SLA 기반 품질 기준 설정으로 지연·비용·품질 트레이드오프를 체계적으로 해결한 경험이 있습니다. 온프레미스 GPU 환경에서 최고 품질 모델은 지연이 너무 길고, 경량 모델은 품질이 기준 미달인 딜레마가 있었습니다. 트레이드오프 이해로 양자화가 모델 크기와 추론 속도를 개선하지만 태스크 유형에 따라 품질 손실이 크게 다르다는 점을 인식했습니다.

    해결 방식으로 먼저 비즈니스 팀과 협의해 SLA(지연 P99 < 300ms, 품질 스코어 ≥ 8.0/10)를 명확히 정의하고, 이를 기준으로 INT4 양자화 모델을 실측 평가했습니다. 팀과 함께 태스크별 품질 민감도를 측정해 민감한 태스크에만 FP16을 유지하는 혼합 정밀도 서빙 전략을 수립했습니다.

    평가로 평균 추론 지연 40% 단축, 비용 35% 절감을 달성하면서 품질 스코어는 기준 이상을 유지했습니다.

    이 결의 특징
    비즈니스 팀과 SLA(P99 300ms, 품질 8.0)를 먼저 못박고 그 기준으로 양자화를 평가한 순서가 또렷합니다. 태스크별 품질 민감도를 측정해 민감한 것만 FP16을 남긴 혼합 정밀도 판단이, 지연 40%·비용 35%를 품질 양보 없이 만든 근거가 되는 결이 보입니다.
    이 결이 통하는 자리
    기준을 임의로 정하지 않고 비즈니스 합의에서 끌어낸 흐름이 살아 있을 때 통합니다. 양자화가 태스크별로 손실이 다르다는 이해가 한 줄이라도 드러나는 자리에서 면접관의 꼬리질문이 줄어드는 결이 보입니다.
    !
    위 답변은 여러 풀이 중 한 가지 예시입니다. 정답이 아니며, 외워서 그대로 말하면 면접관이 다음 질문을 그 자리에서 시작하는 경우가 많습니다. 본인의 프로젝트·기준·숫자로 다시 짜는 자리로만 쓰세요.
    ✕자주 빠지는 자리

    같은 실수가 반복돼요. 이것만 피해도 절반은 갑니다.

    • ✕떨어뜨린 옵션이 1개라도 있는가? "이게 답이었어요"만으로는 의사결정이 아니라 그냥 선택입니다.
    • ✕선택 기준이 그 프로젝트에 한정되는가? "성능이 좋아서"는 일반론, "우리 트래픽이 X 패턴이라서"가 본인의 답입니다.
    • ✕결과 숫자 1개를 정확히 말할 수 있는가? P95·QPS·적중률 — 무엇이든 1개. 숫자가 없으면 직감으로 한 일처럼 들리기 쉽습니다.
    • ✕지금 다시 한다면 어떻게 할지 답할 수 있는가? "잘했다"보다 "이건 다르게 했을 것 같다"가 더 깊은 인상을 남깁니다.
    ▶이어질 꼬리질문

    진짜 면접은 두 번째 질문부터예요. 이 답 뒤에 따라올 법한 것들.

    壹이 세 가지 요소 중 어떤 것이 가장 중요했나요?
    貳그 과정에서 어떤 도전이 있었나요?
    參만약 다른 접근 방식을 선택했다면 결과가 어떻게 달라졌을까요?
    이제, 직접 답해볼 차례예요.
    눈으로 읽은 답은 면접장에서 나오지 않아요. 토스 면접관과 이 질문으로 한 번 대화해 보세요.
    이 질문으로 모의면접 해보기
    또는, 다음 질문으로

    같은 흐름에서 자주 이어지는 질문들이에요.

    토스 · ML 엔지니어
    AI 모델의 성능을 평가하고 개선하기 위한 정량적인 방법론에 대해 설명해보세요.
    이 질문 보기
    이스트소프트 · ML 엔지니어
    AI 모델의 성능과 운영 비용을 동시에 고려한 경험에 대해 이야기해 주세요.
    이 질문 보기
    유진그룹 · AI 리서처
    AI 모델의 성능을 어떻게 평가하고 개선할 수 있나요?
    이 질문 보기
    쿠팡 · 프로덕트 매니저
    AI 모델의 훈련과 미세 조정에 있어 어떤 경험을 가지고 있으며, 이를 어떻게 활용할 것인지 설명해 주세요.
    이 질문 보기
    안내 · 이 페이지의 질문·답변·꼬리질문은 유사 직군 채용 시장의 공개된 면접 후기·커뮤니티 게시물을 분석해 구성한 학습 자료입니다. 실제 출제·회사 공식 입장과는 무관하며, 정정 요청 시 24시간 내 반영합니다. 자세히
    개인정보처리방침이용약관문의
    © 2026 우문현답. All rights reserved.
    이 페이지 목차
    01면접관의 의도02답변의 결03실수·꼬리질문04관련 질문
    말로 해봐야 는다
    이 질문, 토스 면접관과
    음성으로 답해볼까요?
    모의면접 해보기
    첫 회 무료 · 종료 즉시 음성 폐기