우문현답
愚 問 賢 答
회사별 면접직군별진행 방식
    홈›회사별›현대자동차›MLOps›질문 상세
    問
    현현대자동차MLOps직무 역량2026년 출제

    모방학습과 강화학습의 차이점에 대해 설명해보세요.

    답변 미리보기

    두 접근의 핵심 차이는 학습 신호의 출처라고 이해하고 있습니다. 모방학습(Imitation Learning) 은 전문가 데이터를 보고 같은 행동을 흉내내는…

    예상 답변 시간
    60~90초
    예상 꼬리질문
    3회
    난이도
    난이도 중상
    출제 빈도
    보통
    INTERVIEWER'S INTENT · 면접관의 의도

    이 질문, 네 갈래로 뜯어봅니다.

    면접관이 이 한 문장으로 확인하려는 것들. 각 갈래를 알면 답의 뼈대가 잡혀요.

    問
    01
    차이 결을 짚는가?
    보상·데이터·탐색 결을 짚는 흔적이 강합니다. 막연한 '다르다'만 답하면 면접관이 결을 다시 묻는 자리가 자주 보입니다.
    骨
    02
    구체 결이 있는가?
    전문가·시행착오·일반화 결을 짚는 흔적이 답에 있어야 합니다. 한 결만 답하면 면접관이 결을 다시 캐는 결이 자주 통합합니다.
    語
    03
    본인 시각 결을 받치는가?
    선호·트레이드오프 결을 짚는 흔적이 강하게 통합합니다. 중립만 답하면 면접관이 본인 결을 다시 묻는 자리가 강합니다.
    本
    04
    한계도 인정하는가?
    데이터·안전·대안 결을 짚는 흔적이 자주 통합합니다. 만점 평가만 답하면 면접관이 객관화를 다시 캐는 자리가 강합니다.
    말로 해봐야 는다
    읽는 것과 말하는 건 다릅니다.
    이 질문, 소리 내어 답해 볼까요?
    현대자동차 면접관 페르소나가 이 질문을 던지고, 당신의 답에 꼬리질문으로 되물어요.
    음성으로 답해보기
    학습 신호 차이 설명 → BC의 한계 경험 → 결합 방식 이해약 90초모방학습 초기 정책 + 강화학습 fine-tuning 조합 선호·탐색 비용 절감 결약 68초BC 분포 외 성능 급락 경험·covariate shift 한계 인정 + DAgger 방향 탐색 결약 71초
    모방학습 vs 강화학습 — 학습 신호의 출처
    약 90초

    학습 신호 차이 설명 → BC의 한계 경험 → 결합 방식 이해

    두 접근의 핵심 차이는 학습 신호의 출처라고 이해하고 있습니다. 모방학습(Imitation Learning) 은 전문가 데이터를 보고 같은 행동을 흉내내는 방식이라, 보상 설계 없이 시작할 수 있다는 장점이 있습니다. 반면 강화학습(RL)은 환경과 상호작용하며 보상을 최대화하는 방향으로 학습해, 전문가 데이터 없이도 최적 정책을 탐색할 수 있습니다. 직접 구현한 건 Behavior Cloning 방식이었는데, 전문가 분포를 벗어나는 상황에서 오류가 누적되는 compounding error 문제를 경험했습니다. 두 방법을 결합한 DAgger 같은 접근이 실용적인 이유도 그 경험을 통해 이해하게 됐습니다.

    이 결의 특징
    두 접근의 핵심 차이는 학습 신호의 출처라고 이해하고 있습니다. 모방학습(Imitation Learning) 은 전문가 데이터를 보고 같은 행동을 흉내내는 방식이라, 보상 설계 없이 시작할 수 있다는 장점이 있습니다. 반면 `강화학습(RL)`은 환경과 상호작용하며 보상을 최대화하는 방향으로 학습해, 전문가 데이터 없이도 최적 정책을 탐색할 수 있습니다
    이 결이 통하는 자리
    직접 구현한 건 `Behavior Cloning` 방식이었는데, 전문가 분포를 벗어나는 상황에서 오류가 누적되는 compounding error 문제를 경험했습니다. 두 방법을 결합한 DAgger 같은 접근이 실용적인 이유도 그 경험을 통해 이해하게 됐습니다는 자리에서 통합니다
    예시 답변 2
    약 68초

    모방학습 초기 정책 + 강화학습 fine-tuning 조합 선호·탐색 비용 절감 결

    두 방법 중 저는 데이터가 있는 상황이라면 모방학습으로 초기 정책을 만든 뒤 강화학습으로 개선하는 방식을 선호합니다. 강화학습 단독으로 처음부터 시작하면 초기 탐색 비용이 너무 크고 안전하지 않은 행동이 먼저 나오는 경험을 했기 때문입니다.

    모방학습으로 전문가 시연을 먼저 학습시키면 초기 정책이 이미 "그럭저럭 작동하는 수준"에서 시작합니다. 이후 강화학습으로 fine-tuning하면 전문가가 커버하지 못한 상황까지 점진적으로 확장할 수 있었습니다.

    이 경험으로 두 방법은 경쟁이 아니라 순서가 있는 도구라는 걸 배웠습니다. 처음부터 강화학습만 쓰는 것보다 모방으로 시작점을 만드는 것이 실제로 효율적이었습니다.

    이 결의 특징
    두 방법 중 저는 데이터가 있는 상황이라면 모방학습으로 초기 정책을 만든 뒤 강화학습으로 개선하는 방식을 선호합니다. 강화학습 단독으로 처음부터 시작하면 초기 탐색 비용이 너무 크고 안전하지 않은 행동이 먼저 나오는 경험을 했기 때문입니다라는 흔적이 있습니다
    이 결이 통하는 자리
    모방학습으로 전문가 시연을 먼저 학습시키면 초기 정책이 이미 "그럭저럭 작동하는 수준"에서 시작합니다. 이 경험으로 두 방법은 경쟁이 아니라 순서가 있는 도구라는 걸 배웠습니다. 처음부터 강화학습만 쓰는 것보다 모방으로 시작점을 만드는 것이 실제로 효율적이었습니다는 자리에서 통합니다
    예시 답변 3
    약 71초

    BC 분포 외 성능 급락 경험·covariate shift 한계 인정 + DAgger 방향 탐색 결

    모방학습 중에서 Behavioral Cloning을 써봤을 때 훈련 분포 바깥의 상황에서 성능이 급격히 떨어지는 경험을 했습니다. 훈련 데이터에 없는 방향에서 입력이 들어오면 에이전트가 엉뚱한 행동을 선택하는 covariate shift 문제가 생겼습니다.

    이 한계를 인식하고 DAgger처럼 실행 중 전문가 개입으로 추가 데이터를 수집하는 방향을 탐색했습니다. BC의 분포 외 취약성을 줄이려면 온라인으로 데이터를 보완하는 루프가 필요하다는 걸 알게 됐습니다.

    이 경험으로 모방학습은 수집된 전문가 데이터의 품질과 범위에 성능이 크게 달려 있고, 그것이 가장 큰 한계라는 걸 배웠습니다. 데이터가 커버하지 않는 상황은 학습이 안 됩니다.

    이 결의 특징
    모방학습 중에서 Behavioral Cloning을 써봤을 때 훈련 분포 바깥의 상황에서 성능이 급격히 떨어지는 경험을 했습니다. 훈련 데이터에 없는 방향에서 입력이 들어오면 에이전트가 엉뚱한 행동을 선택하는 covariate shift 문제가 생겼습니다라는 흔적이 있습니다
    이 결이 통하는 자리
    이 한계를 인식하고 DAgger처럼 실행 중 전문가 개입으로 추가 데이터를 수집하는 방향을 탐색했습니다. 이 경험으로 모방학습은 수집된 전문가 데이터의 품질과 범위에 성능이 크게 달려 있고, 그것이 가장 큰 한계라는 걸 배웠습니다. 데이터가 커버하지 않는 상황은 학는 자리에서 통합니다
    !
    위 답변은 여러 풀이 중 한 가지 예시입니다. 정답이 아니며, 외워서 그대로 말하면 면접관이 다음 질문을 그 자리에서 시작하는 경우가 많습니다. 본인의 프로젝트·기준·숫자로 다시 짜는 자리로만 쓰세요.
    ✕자주 빠지는 자리

    같은 실수가 반복돼요. 이것만 피해도 절반은 갑니다.

    • ✕떨어뜨린 옵션이 1개라도 있는가? "이게 답이었어요"만으로는 의사결정이 아니라 그냥 선택입니다.
    • ✕선택 기준이 그 프로젝트에 한정되는가? "성능이 좋아서"는 일반론, "우리 트래픽이 X 패턴이라서"가 본인의 답입니다.
    • ✕결과 숫자 1개를 정확히 말할 수 있는가? P95·QPS·적중률 — 무엇이든 1개. 숫자가 없으면 직감으로 한 일처럼 들리기 쉽습니다.
    • ✕지금 다시 한다면 어떻게 할지 답할 수 있는가? "잘했다"보다 "이건 다르게 했을 것 같다"가 더 깊은 인상을 남깁니다.
    ▶이어질 꼬리질문

    진짜 면접은 두 번째 질문부터예요. 이 답 뒤에 따라올 법한 것들.

    壹병행 적용은 어떻게 보세요?
    貳정확과 안전이 충돌하면 어떻게 풀까요?
    參본 직무에 어떻게 적용하시겠어요?
    이제, 직접 답해볼 차례예요.
    눈으로 읽은 답은 면접장에서 나오지 않아요. 현대자동차 면접관과 이 질문으로 한 번 대화해 보세요.
    이 질문으로 모의면접 해보기
    또는, 다음 질문으로

    같은 흐름에서 자주 이어지는 질문들이에요.

    태광그룹 · 교육기획·콘텐츠
    강의 역량을 어떻게 강화해왔는지 구체적인 방법을 설명해 주세요.
    이 질문 보기
    SPC · 교육·HRD
    회사 교육과 학교 교육의 차이점에 대해 말씀해주세요.
    이 질문 보기
    카카오모빌리티 · 데이터 사이언티스트
    실제 서비스에 강화학습 알고리즘을 적용한 경험이 있다면, 그 과정과 결과에 대해 설명해 주실 수 있나요?
    이 질문 보기
    네이버 · AI 리서처
    Overfitting과 Underfitting의 차이, 그리고 각각의 대응 방안을 설명해주세요.
    이 질문 보기
    안내 · 이 페이지의 질문·답변·꼬리질문은 유사 직군 채용 시장의 공개된 면접 후기·커뮤니티 게시물을 분석해 구성한 학습 자료입니다. 실제 출제·회사 공식 입장과는 무관하며, 정정 요청 시 24시간 내 반영합니다. 자세히
    개인정보처리방침이용약관문의
    © 2026 우문현답. All rights reserved.
    이 페이지 목차
    01면접관의 의도02답변의 결03실수·꼬리질문04관련 질문
    말로 해봐야 는다
    이 질문, 현대자동차 면접관과
    음성으로 답해볼까요?
    모의면접 해보기
    첫 회 무료 · 종료 즉시 음성 폐기