우문현답
愚 問 賢 答
회사별 면접직군별진행 방식
    홈›회사별›카카오›AI 리서처›질문 상세
    問
    카카카오AI 리서처직무 역량2026년 출제

    SFT와 RL을 사용한 모델 성능 고도화에 대해 간단히 설명해 주실 수 있나요?

    답변 미리보기

    SFT(Supervised Fine-Tuning)를 활용해 법률 문서 요약 특화 모델을 개발한 경험이 있습니다. 범용 LLM이 법률 용어와 문장 구조를 제대로…

    예상 답변 시간
    60~90초
    예상 꼬리질문
    3회
    난이도
    난이도 중상
    출제 빈도
    높음
    INTERVIEWER'S INTENT · 면접관의 의도

    이 질문, 네 갈래로 뜯어봅니다.

    면접관이 이 한 문장으로 확인하려는 것들. 각 갈래를 알면 답의 뼈대가 잡혀요.

    問
    01
    SFT와 RL의 이해가 있는가?
    SFT와 RL의 기본 개념에 대한 이해가 답에 있어야 합니다. 없으면 면접관이 '각 기술의 차이는 무엇인가요?'를 추가로 묻는 경우가 자주 보입니다.
    骨
    02
    모델 성능 고도화 경험이 있는가?
    모델 성능 고도화를 위한 실제 경험이나 사례가 답에 포함된 흔적이 있어야 합니다. 없으면 면접관이 '구체적으로 어떤 방법을 사용했나요?'를 추가로 질문하는 자리가 자주 보입니다.
    語
    03
    데이터 분석의 중요성을 아는가?
    데이터 분석이 의사결정에 미치는 영향에 대한 인식이 답에 있어야 합니다. 없으면 면접관이 '왜 분석이 필요한가요?'를 묻는 경우가 흔하게 발생합니다.
    本
    04
    기술적 접근 방식은 무엇인가?
    SFT와 RL을 활용한 구체적 기술적 접근 방식이 언급된 흔적이 있어야 합니다. 없으면 면접관이 '구현 과정에서 어려움은 없었나요?'를 추가로 묻는 경우가 자주 보입니다.
    말로 해봐야 는다
    읽는 것과 말하는 건 다릅니다.
    이 질문, 소리 내어 답해 볼까요?
    카카오 면접관 페르소나가 이 질문을 던지고, 당신의 답에 꼬리질문으로 되물어요.
    음성으로 답해보기
    SFT로 도메인 특화 모델 미세조정약 90초RL(RLHF)로 응답 선호도 최적화약 90초SFT와 RL 병행 전략의 트레이드오프약 90초
    예시 답변 1
    약 90초

    SFT로 도메인 특화 모델 미세조정

    SFT(Supervised Fine-Tuning)를 활용해 법률 문서 요약 특화 모델을 개발한 경험이 있습니다. 범용 LLM이 법률 용어와 문장 구조를 제대로 처리하지 못해 요약 품질이 낮았고, 직접 도메인 데이터로 미세조정이 필요했습니다. (입력 문서, 기대 요약) 쌍 3천 건을 구축해 LoRA 방식으로 파라미터 효율적 파인튜닝을 진행했습니다.

    학습률 스케줄, 배치 크기, 에폭 수를 검증 손실 기준으로 튜닝했고, Overfitting 징후를 조기에 잡기 위해 Early Stopping을 설정했습니다. 최종 모델의 ROUGE-L이 베이스라인 대비 18% 향상됐고 법률 용어 오류가 절반으로 줄었습니다.

    SFT 접근 이유는 레이블 데이터가 충분하고 목표 출력 형식이 명확한 경우에 가장 효율적이기 때문입니다. 이 경험으로 데이터 품질이 모델 성능의 핵심임을 체감했습니다.

    이 결의 특징
    LoRA로 파라미터 효율적 파인튜닝을 진행했다는 구현 선택이 이 결을 '파인튜닝 해봤다'는 선언과 가릅니다. 학습률·배치·에폭을 검증 손실 기준으로 튜닝하고 Early Stopping을 설정했다는 흐름이 실험 설계 판단력을 드러내는 결이 자주 보입니다.
    이 결이 통하는 자리
    레이블 데이터가 충분한 도메인 특화 과제를 다루는 팀에서 통합니다. 'SFT 접근 이유'를 조건(레이블 충분 + 출력 형식 명확)과 함께 설명한 점이 판단 근거를 공유하는 결로 읽히고, 꼬리질문이 줄어드는 흔적이 보입니다.
    예시 답변 2
    약 90초

    RL(RLHF)로 응답 선호도 최적화

    RLHF(Reinforcement Learning from Human Feedback) 파이프라인을 구현해 모델 응답의 선호도를 높인 경험이 있습니다. SFT만으로는 응답이 길고 불필요한 내용이 많아 사용자 만족도가 낮았습니다. 이를 개선하기 위해 먼저 Reward Model을 학습했고, 두 응답을 인간 평가자가 비교하는 preference dataset 2천 건을 수집했습니다. 이후 PPO 알고리즘으로 정책 모델을 업데이트했고, KL 발산 페널티로 SFT 모델과의 분포 이탈을 제어했습니다. 결과적으로 사용자 선호율이 23%p 향상됐고 응답 간결성도 크게 개선됐습니다.

    RL 접근의 핵심 도전은 Reward Hacking 방지였고, 다양한 프롬프트 분포를 커버하는 평가셋 구성이 중요했습니다. 이 경험으로 LLM 후처리 파이프라인 설계 전반을 익혔습니다.

    이 결의 특징
    PPO와 KL 발산 페널티를 함께 언급한 점이 RL 이론적 이해를 드러내는 결입니다. Reward Hacking 방지를 '핵심 도전'으로 명명하고 평가셋 다양성 구성으로 연결한 흐름이 실전 경험의 밀도를 높이는 방식으로 작동합니다.
    면접관이 다음에 할 행동
    'KL 발산 계수는 어떻게 설정했고, 너무 크거나 작을 때 어떤 현상이 나타났나요?'를 이어받을 가능성이 높습니다. RLHF 구현 경험을 구체적으로 설명했기 때문에 하이퍼파라미터 조정 경험으로 심화 탐색이 이어지는 결이 자주 보입니다.
    예시 답변 3
    약 90초

    SFT와 RL 병행 전략의 트레이드오프

    SFT와 RL을 단계적으로 조합한 Post-training 전략을 실제 프로젝트에서 적용해 봤습니다. SFT 단독으로는 출력 형식은 맞추지만 창의성이 낮고, RL 단독으로는 불안정한 학습이 문제였습니다. 이를 해결하기 위해 SFT로 기초 패턴을 학습시키고, 이후 RL로 선호도와 안전성을 세밀하게 조율하는 2단계 파이프라인을 설계했습니다.

    SFT 단계에서는 고품질 데이터 선별 기준이 핵심이었고, 데이터 품질 > 데이터 양 원칙을 유지했습니다. RL 단계에서는 Reward Signal 설계가 가장 어려웠는데, 지나치게 단순한 보상이 모델을 편향시키는 현상을 직접 경험했습니다. 최종적으로 두 기법의 장점을 조합해 성능과 안전성을 동시에 끌어올렸습니다. 이 경험으로 Post-training 전략 선택 기준을 실전에서 다질 수 있었습니다.

    이 결의 특징
    SFT 단계에서 '데이터 품질 > 데이터 양' 원칙을 명시하고, RL 단계에서 Reward Signal 단순화가 편향을 일으킨다는 경험을 직접 언급한 흐름이 이 결의 밀도를 높입니다. 각 단계의 실패 포인트를 모두 짚은 구조가 2단계 파이프라인 설계 경험을 검증합니다.
    이 결이 통하는 자리
    SFT와 RL을 모두 써본 팀에서 방법론 선택 기준을 논의할 자리에서 통합니다. '장단점 조합'이 아닌 '각 단계의 실패 포인트를 알고 있는가'를 따지는 면접관 앞에서 이 결이 더 선명하게 작동하는 경향이 보입니다.
    !
    위 답변은 여러 풀이 중 한 가지 예시입니다. 정답이 아니며, 외워서 그대로 말하면 면접관이 다음 질문을 그 자리에서 시작하는 경우가 많습니다. 본인의 프로젝트·기준·숫자로 다시 짜는 자리로만 쓰세요.
    ✕자주 빠지는 자리

    같은 실수가 반복돼요. 이것만 피해도 절반은 갑니다.

    • ✕떨어뜨린 옵션이 1개라도 있는가? "이게 답이었어요"만으로는 의사결정이 아니라 그냥 선택입니다.
    • ✕선택 기준이 그 프로젝트에 한정되는가? "성능이 좋아서"는 일반론, "우리 트래픽이 X 패턴이라서"가 본인의 답입니다.
    • ✕결과 숫자 1개를 정확히 말할 수 있는가? P95·QPS·적중률 — 무엇이든 1개. 숫자가 없으면 직감으로 한 일처럼 들리기 쉽습니다.
    • ✕지금 다시 한다면 어떻게 할지 답할 수 있는가? "잘했다"보다 "이건 다르게 했을 것 같다"가 더 깊은 인상을 남깁니다.
    ▶이어질 꼬리질문

    진짜 면접은 두 번째 질문부터예요. 이 답 뒤에 따라올 법한 것들.

    壹이 방법을 선택한 이유는 무엇인가요?
    貳이 과정에서 어려웠던 점은 무엇이었나요?
    參이외에 다른 방법도 검토했나요?
    이제, 직접 답해볼 차례예요.
    눈으로 읽은 답은 면접장에서 나오지 않아요. 카카오 면접관과 이 질문으로 한 번 대화해 보세요.
    이 질문으로 모의면접 해보기
    또는, 다음 질문으로

    같은 흐름에서 자주 이어지는 질문들이에요.

    크라우드웍스 · 프로덕트 매니저
    SFT, RLHF, DPO 등 LLM 파인튜닝 데이터 구축 프로세스의 각 단계를 설명해 주세요.
    이 질문 보기
    안내 · 이 페이지의 질문·답변·꼬리질문은 유사 직군 채용 시장의 공개된 면접 후기·커뮤니티 게시물을 분석해 구성한 학습 자료입니다. 실제 출제·회사 공식 입장과는 무관하며, 정정 요청 시 24시간 내 반영합니다. 자세히
    개인정보처리방침이용약관문의
    © 2026 우문현답. All rights reserved.
    이 페이지 목차
    01면접관의 의도02답변의 결03실수·꼬리질문04관련 질문
    말로 해봐야 는다
    이 질문, 카카오 면접관과
    음성으로 답해볼까요?
    모의면접 해보기
    첫 회 무료 · 종료 즉시 음성 폐기