우문현답
愚 問 賢 答
회사별 면접직군별진행 방식
    홈›회사별›카카오›AI 리서처›질문 상세
    問
    카카카오AI 리서처직무 역량2026년 출제

    고품질 데이터 수집과 전처리 과정에서 어떤 기준으로 데이터를 선정하고 처리하셨나요?

    답변 미리보기

    LLM Post-training 데이터를 구축할 때 데이터 품질 기준을 먼저 문서화하는 방식으로 접근합니다. 기준 없이 수집하면 양은 많아도 모델이 원하는…

    예상 답변 시간
    60~90초
    예상 꼬리질문
    3회
    난이도
    난이도 중상
    출제 빈도
    높음
    INTERVIEWER'S INTENT · 면접관의 의도

    이 질문, 네 갈래로 뜯어봅니다.

    면접관이 이 한 문장으로 확인하려는 것들. 각 갈래를 알면 답의 뼈대가 잡혀요.

    問
    01
    어떤 기준으로 선정했는가?
    데이터 선정 기준에 대한 명확한 설명이 답에 있어야 합니다. 없으면 면접관이 '그 이유는 무엇인가요?'를 추가로 묻는 경우가 자주 보입니다.
    骨
    02
    어떤 전처리 과정을 거쳤는가?
    전처리 과정에서의 구체적인 단계가 답에 있어야 합니다. 없으면 면접관이 '어떤 방법을 사용했나요?' 같은 질문을 던지는 자리가 자주 보입니다.
    語
    03
    결과는 어땠는가?
    데이터 처리 후의 결과나 인사이트가 언급된 흔적이 있어야 합니다. 없으면 면접관이 '어떤 성과가 있었나요?'를 추가로 묻는 경우가 많습니다.
    本
    04
    도전 과제는 무엇이었는가?
    프로젝트에서 직면한 도전 과제와 그 대처 방안이 답에 포함된 흔적이 있어야 합니다. 없으면 면접관이 '어떤 어려움이 있었나요?'를 추가로 묻는 경우가 자주 보입니다.
    말로 해봐야 는다
    읽는 것과 말하는 건 다릅니다.
    이 질문, 소리 내어 답해 볼까요?
    카카오 면접관 페르소나가 이 질문을 던지고, 당신의 답에 꼬리질문으로 되물어요.
    음성으로 답해보기
    LLM 학습 데이터 품질 기준 수립약 90초멀티모달 학습 데이터 전처리 파이프라인약 90초RL 학습용 Preference 데이터 수집 기준약 90초
    예시 답변 1
    약 90초

    LLM 학습 데이터 품질 기준 수립

    LLM Post-training 데이터를 구축할 때 데이터 품질 기준을 먼저 문서화하는 방식으로 접근합니다. 기준 없이 수집하면 양은 많아도 모델이 원하는 방향으로 학습되지 않는 문제가 반복됩니다. 저는 유창성, 사실성, 지시 준수율, 안전성 4개 축으로 기준을 세우고, 각 축마다 자동 필터와 사람 검토 기준을 병행해 적용했습니다. 수집 단계에서는 출처 다양성을 확보하기 위해 도메인별 비율 쿼터를 설정했고, 중복 제거를 위해 MinHash LSH를 활용했습니다. 전처리에서는 HTML 노이즈 제거, 인코딩 정규화, 길이 필터를 순차 적용했습니다. 결과적으로 데이터 양은 30% 줄었지만 학습 후 모델 품질이 오히려 높아졌습니다.

    핵심 교훈은 데이터 품질 기준은 모델 목표와 함께 설계돼야 한다는 점입니다.

    이 결의 특징
    유창성·사실성·지시 준수율·안전성 4축 기준을 문서화하고 자동 필터와 사람 검토를 병행했다는 설계가 이 결의 특징입니다. MinHash LSH 중복 제거와 도메인별 비율 쿼터가 구체적인 구현 경로로 연결되어 꼬리질문이 줄어드는 경향이 보입니다.
    이 결이 통하는 자리
    LLM 학습 데이터 파이프라인을 설계해본 팀에서 통합니다. '데이터 양은 30% 줄었지만 품질이 올랐다'는 수치가 기준 설계의 효과를 역설적으로 증명하는 방식으로 작동해, 선정 기준 자체에 관심이 있는 면접관에게 신뢰를 쌓는 결이 자주 보입니다.
    예시 답변 2
    약 90초

    멀티모달 학습 데이터 전처리 파이프라인

    이미지-텍스트 멀티모달 학습 데이터 전처리 경험을 말씀드리겠습니다. 웹 크롤링으로 수집한 데이터는 이미지 품질, 텍스트 노이즈, 이미지-텍스트 정합성 세 가지 문제를 동시에 가지고 있었습니다. 선정 기준으로는 이미지 해상도 최소 256px, 텍스트 길이 10~500자, CLIP 유사도 0.3 이상을 적용했습니다. 전처리 파이프라인은 이미지 리사이징 → 텍스트 정규화 → CLIP 필터링 → 중복 제거 순서로 구성했고, 분산 처리(Ray)로 속도를 확보했습니다. 도전 과제는 NSFW 이미지 필터였는데, 오탐율을 낮추기 위해 임계값 튜닝에 많은 시간을 썼습니다. 결과적으로 원본 대비 40% 데이터로 동등한 모델 성능을 달성했습니다.

    핵심은 필터 기준이 너무 엄격하면 다양성이 사라져 모델이 편향된다는 트레이드오프를 인식하는 것이었습니다.

    이 결의 특징
    CLIP 유사도 0.3 이상, 해상도 256px 이상, 텍스트 10~500자라는 구체적 컷오프가 선정 기준 축을 직접 채웁니다. NSFW 필터 오탐율 조정에 '많은 시간을 썼다'는 진술이 도전 과제 축을 자연스럽게 드러내는 결이 보입니다.
    면접관이 다음에 할 행동
    '필터 기준이 너무 엄격하면 다양성이 사라진다고 했는데, 실제로 편향이 나타난 사례가 있었나요?'를 이어받을 가능성이 높습니다. 트레이드오프를 인식하고 있다고 밝혔기 때문에 실제 편향 대처 경험으로 심화 탐색이 이어지는 결이 자주 보입니다.
    예시 답변 3
    약 90초

    RL 학습용 Preference 데이터 수집 기준

    RL(강화학습) 학습용 Preference 데이터를 수집하고 전처리한 경험이 있습니다. 단순히 많은 데이터를 모으기보다 어노테이터 간 일치율(Inter-annotator Agreement)을 기준으로 데이터 품질을 관리했습니다. 선정 기준으로는 Cohen's Kappa 0.6 이상인 쌍만 학습에 활용하고, 의견이 갈리는 케이스는 별도 검토 큐로 분리했습니다. 수집 단계에서는 다양한 난이도, 주제, 답변 스타일이 골고루 포함되도록 stratified sampling을 적용했습니다. 전처리에서는 편향 탐지를 위해 응답 길이·형식 선호가 내용 선호를 오염시키지 않도록 길이 균형화 후처리를 했습니다. 이 기준 적용 후 Reward Model의 일반화 성능이 크게 향상됐습니다.

    핵심 교훈은 Preference 데이터의 품질이 Reward Model의 신뢰성을 결정한다는 것입니다.

    이 결의 특징
    Cohen's Kappa 0.6을 기준으로 어노테이터 일치율을 관리하고, 의견이 갈리는 케이스를 별도 검토 큐로 분리한 운영 구조가 이 결의 핵심입니다. 길이 균형화 후처리가 '형식 선호가 내용 선호를 오염시킨다'는 문제 인식에서 나온 점이 데이터 편향 감수성을 드러냅니다.
    이 결이 통하는 자리
    Preference 데이터 품질 관리를 직접 다루는 팀에서 통합니다. Stratified sampling 설계와 어노테이터 간 일치율 기준이 함께 등장하는 구조가 '수집-품질-학습' 전 과정을 이해하는 결로 읽히고, 이후 탐색이 줄어드는 흔적이 보입니다.
    !
    위 답변은 여러 풀이 중 한 가지 예시입니다. 정답이 아니며, 외워서 그대로 말하면 면접관이 다음 질문을 그 자리에서 시작하는 경우가 많습니다. 본인의 프로젝트·기준·숫자로 다시 짜는 자리로만 쓰세요.
    ✕자주 빠지는 자리

    같은 실수가 반복돼요. 이것만 피해도 절반은 갑니다.

    • ✕떨어뜨린 옵션이 1개라도 있는가? "이게 답이었어요"만으로는 의사결정이 아니라 그냥 선택입니다.
    • ✕선택 기준이 그 프로젝트에 한정되는가? "성능이 좋아서"는 일반론, "우리 트래픽이 X 패턴이라서"가 본인의 답입니다.
    • ✕결과 숫자 1개를 정확히 말할 수 있는가? P95·QPS·적중률 — 무엇이든 1개. 숫자가 없으면 직감으로 한 일처럼 들리기 쉽습니다.
    • ✕지금 다시 한다면 어떻게 할지 답할 수 있는가? "잘했다"보다 "이건 다르게 했을 것 같다"가 더 깊은 인상을 남깁니다.
    ▶이어질 꼬리질문

    진짜 면접은 두 번째 질문부터예요. 이 답 뒤에 따라올 법한 것들.

    壹데이터 선정 기준은 어떤 것들이 있었나요?
    貳처리 과정에서 어려움은 없었나요?
    參다른 데이터 처리 방법은 고려해보셨나요?
    이제, 직접 답해볼 차례예요.
    눈으로 읽은 답은 면접장에서 나오지 않아요. 카카오 면접관과 이 질문으로 한 번 대화해 보세요.
    이 질문으로 모의면접 해보기
    또는, 다음 질문으로

    같은 흐름에서 자주 이어지는 질문들이에요.

    에이메드 · 공통직무·미지정
    데이터 품질 확보를 위해 어떤 수집 기준과 검증 프로세스를 정의할 수 있나요?
    이 질문 보기
    와이즐리컴퍼니 · 품질관리
    품질 기준을 정량화하기 위해 어떤 데이터 분석 기법을 사용할 수 있을까요?
    이 질문 보기
    CJ올리브영 · 프로덕트 매니저
    온라인몰 상품 데이터의 품질을 관리하기 위해 어떤 기준을 두고 작업하였나요?
    이 질문 보기
    스마일게이트 · 데이터·AI 일반
    과거 프로젝트에서 데이터의 품질을 보장하기 위해 어떤 조치를 취했나요?
    이 질문 보기
    안내 · 이 페이지의 질문·답변·꼬리질문은 유사 직군 채용 시장의 공개된 면접 후기·커뮤니티 게시물을 분석해 구성한 학습 자료입니다. 실제 출제·회사 공식 입장과는 무관하며, 정정 요청 시 24시간 내 반영합니다. 자세히
    개인정보처리방침이용약관문의
    © 2026 우문현답. All rights reserved.
    이 페이지 목차
    01면접관의 의도02답변의 결03실수·꼬리질문04관련 질문
    말로 해봐야 는다
    이 질문, 카카오 면접관과
    음성으로 답해볼까요?
    모의면접 해보기
    첫 회 무료 · 종료 즉시 음성 폐기