우문현답
愚 問 賢 答
회사별 면접직군별진행 방식
    홈›회사별›SK inc.(AX)›풀스택›질문 상세
    問
    SSK inc.(AX)풀스택직무 역량2026년 출제

    AI/ML 파이프라인 설계와 관련해, 데이터 수집과 정제 과정에서 어떤 방법론을 사용했는지 설명해줄 수 있나요?

    답변 미리보기

    AI/ML 파이프라인의 데이터 수집은 Apache Airflow로 스케줄링하고, 각 소스(API·DB·S3)별 커넥터를 DAG 태스크로 분리해 장애 격리가…

    예상 답변 시간
    60~90초
    예상 꼬리질문
    3회
    난이도
    난이도 중상
    출제 빈도
    높음
    INTERVIEWER'S INTENT · 면접관의 의도

    이 질문, 네 갈래로 뜯어봅니다.

    면접관이 이 한 문장으로 확인하려는 것들. 각 갈래를 알면 답의 뼈대가 잡혀요.

    問
    01
    데이터 수집 방법은 무엇인가?
    데이터 수집 과정에서 어떤 방법론을 적용했는지의 흔적이 답에 있어야 합니다. 없으면 면접관이 '어떻게 데이터를 확보했나요?'를 추가로 묻는 경우가 자주 보입니다.
    骨
    02
    정제 과정에서의 접근법은?
    데이터 정제 과정에서 채택한 접근법이 답에 드러나야 합니다. 없으면 면접관이 '어떤 기준으로 데이터를 정제했나요?'를 물어보는 자리가 자주 보입니다.
    語
    03
    AI/ML 파이프라인 설계 경험은?
    AI/ML 파이프라인 설계 경험의 흔적이 답에 있어야 합니다. 없으면 면접관이 '이와 관련된 프로젝트는 없었나요?'를 추가로 묻는 경우가 많습니다.
    本
    04
    사용한 도구나 기술은?
    데이터 수집 및 정제에 사용한 도구나 기술의 언급이 있어야 합니다. 없으면 면접관이 '어떤 기술을 사용했나요?'를 물어보는 자리가 자주 보입니다.
    말로 해봐야 는다
    읽는 것과 말하는 건 다릅니다.
    이 질문, 소리 내어 답해 볼까요?
    SK inc.(AX) 면접관 페르소나가 이 질문을 던지고, 당신의 답에 꼬리질문으로 되물어요.
    음성으로 답해보기
    Airflow DAG + Great Expectations 정제 파이프라인약 90초스트리밍 데이터 수집 — Kafka + Flink약 90초멀티소스 데이터 수집 정규화 — 크롤링+API+DB약 90초
    예시 답변 1
    약 90초

    Airflow DAG + Great Expectations 정제 파이프라인

    AI/ML 파이프라인의 데이터 수집은 Apache Airflow로 스케줄링하고, 각 소스(API·DB·S3)별 커넥터를 DAG 태스크로 분리해 장애 격리가 되도록 설계했습니다. 정제 단계에서는 Great Expectations으로 스키마 유효성, 결측치 비율, 분포 이상을 자동 검증했고, 임계값 초과 시 파이프라인을 멈추고 슬랙 알림을 보내도록 했습니다. 피처 스토어(Feast)에 정제된 데이터를 적재해 학습·서빙 환경에서 동일한 피처를 사용하도록 단일화했습니다. 이 구조로 데이터 관련 모델 품질 이슈가 분기별 8건에서 1건 이하로 줄었습니다. 파이프라인 설계 시 재현 가능성과 관찰 가능성을 최우선에 두는 것이 핵심이라는 기준이 생겼습니다.

    이 결의 특징
    수집을 Airflow로 스케줄링하되 소스별 커넥터를 DAG 태스크로 분리해 장애 격리를 노린 설계가 또렷합니다. 정제 단계에서 Great Expectations로 스키마·결측·분포를 자동 검증하고 임계 초과 시 파이프라인을 멈춰 알림을 보낸 대목이, 데이터 품질 이슈 분기 8건→1건을 관찰 가능성 설계의 결과로 읽히게 하는 결이 보입니다.
    이 결이 통하는 자리
    Feast로 정제 데이터를 적재해 학습·서빙이 동일 피처를 쓰게 한 단일화가 살아 있을 때 통합합니다. '재현 가능성과 관찰 가능성을 최우선에 둔다'는 기준이 검증 자동화로 받쳐지는 자리에서 면접관의 꼬리질문이 줄어드는 결이 보입니다.
    예시 답변 2
    약 90초

    스트리밍 데이터 수집 — Kafka + Flink

    실시간 추천 모델을 위한 파이프라인에서 Kafka → Flink → Feature Store 흐름으로 스트리밍 데이터를 수집했습니다. Flink 잡에서 슬라이딩 윈도우 집계로 최근 1시간 사용자 행동을 실시간 피처로 변환했고, 이상치 이벤트는 별도 dead-letter 토픽으로 격리해 추후 분석에 활용했습니다. 정제 기준은 도메인 전문가와 함께 사업 규칙 문서를 작성해 코드와 문서를 동기화했습니다. 배치·스트리밍 파이프라인이 공존해 동일 피처의 배치·스트리밍 결과를 비교하는 검증 단계를 추가했고, 오차가 2% 이내일 때만 스트리밍 값을 서빙에 사용했습니다. 이 경험으로 스트리밍 파이프라인은 정합성 검증이 배치보다 훨씬 복잡하다는 점을 체감했습니다.

    이 결의 특징
    Kafka→Flink→Feature Store 흐름에서 슬라이딩 윈도우로 최근 1시간 행동을 실시간 피처로 변환하고 이상치는 dead-letter 토픽으로 격리한 점이 또렷합니다. 배치·스트리밍 결과를 비교해 오차 2% 이내일 때만 스트리밍 값을 서빙에 쓴 대목이, 정합성 검증을 정면으로 다룬 결로 읽히게 합니다.
    이 결이 통하는 자리
    정제 기준을 도메인 전문가와 사업 규칙 문서로 코드·문서를 동기화한 흐름이 살아 있을 때 통합합니다. '스트리밍은 정합성 검증이 배치보다 훨씬 복잡하다'는 체감이 배치·스트리밍 비교로 받쳐지는 자리에서 신뢰가 생기는 결이 보입니다.
    예시 답변 3
    약 90초

    멀티소스 데이터 수집 정규화 — 크롤링+API+DB

    여러 이종 소스에서 데이터를 수집하는 파이프라인을 설계할 때, 저는 수집·변환·적재 단계를 명확히 분리하는 원칙을 따릅니다. 웹 크롤링은 Playwright+BeautifulSoup으로, REST API는 httpx 비동기 클라이언트로, DB는 psycopg3으로 수집해 각각 원본 레이어에 그대로 보존했습니다. 정제는 공통 스키마로 변환 후 Pandera로 타입·범위 검증을 수행하고, 오류 행은 격리 테이블에 따로 적재해 수동 검토 대기 상태로 관리했습니다. 파이프라인 전 단계에 데이터 볼륨 모니터링을 붙여 전날 대비 50% 이상 감소 시 경보를 울리게 했습니다. 이 구조에서 데이터 품질 문제의 90%가 수집 단계에서 발생한다는 것을 통계로 확인했습니다.

    이 결의 특징
    수집·변환·적재를 명확히 분리하는 원칙 아래 크롤링·API·DB를 각기 다른 도구로 받아 원본 레이어에 그대로 보존한 점이 또렷합니다. 정제 후 Pandera로 타입·범위를 검증하고 오류 행을 격리 테이블로 따로 적재해 수동 검토 대기로 둔 대목이, 품질 관리를 단계 분리로 구조화한 결로 읽히게 합니다.
    이 결이 통하는 자리
    볼륨 모니터링으로 전날 대비 50% 이상 감소 시 경보를 울린 장치가 살아 있을 때 통합합니다. '품질 문제의 90%가 수집 단계에서 발생한다'는 통계적 확인이 단계 분리와 묶이는 자리에서 면접관의 꼬리질문이 줄어드는 결이 보입니다.
    !
    위 답변은 여러 풀이 중 한 가지 예시입니다. 정답이 아니며, 외워서 그대로 말하면 면접관이 다음 질문을 그 자리에서 시작하는 경우가 많습니다. 본인의 프로젝트·기준·숫자로 다시 짜는 자리로만 쓰세요.
    ✕자주 빠지는 자리

    같은 실수가 반복돼요. 이것만 피해도 절반은 갑니다.

    • ✕떨어뜨린 옵션이 1개라도 있는가? "이게 답이었어요"만으로는 의사결정이 아니라 그냥 선택입니다.
    • ✕선택 기준이 그 프로젝트에 한정되는가? "성능이 좋아서"는 일반론, "우리 트래픽이 X 패턴이라서"가 본인의 답입니다.
    • ✕결과 숫자 1개를 정확히 말할 수 있는가? P95·QPS·적중률 — 무엇이든 1개. 숫자가 없으면 직감으로 한 일처럼 들리기 쉽습니다.
    • ✕지금 다시 한다면 어떻게 할지 답할 수 있는가? "잘했다"보다 "이건 다르게 했을 것 같다"가 더 깊은 인상을 남깁니다.
    ▶이어질 꼬리질문

    진짜 면접은 두 번째 질문부터예요. 이 답 뒤에 따라올 법한 것들.

    壹이 과정에서 어떤 어려움이 있었나요?
    貳다른 접근 방법도 고려했었나요?
    參이 과정에서 팀원과의 협업은 어땠나요?
    이제, 직접 답해볼 차례예요.
    눈으로 읽은 답은 면접장에서 나오지 않아요. SK inc.(AX) 면접관과 이 질문으로 한 번 대화해 보세요.
    이 질문으로 모의면접 해보기
    또는, 다음 질문으로

    같은 흐름에서 자주 이어지는 질문들이에요.

    SK inc.(AX) · 풀스택
    AI/ML 파이프라인을 설계할 때 가장 중요하다고 생각하는 요소는 무엇인가요?
    이 질문 보기
    GS리테일 · 데이터 엔지니어
    AI/LLM 데이터 파이프라인 최적화를 위해 어떤 전략을 사용했는지 설명해 주세요.
    이 질문 보기
    피처링 · MLOps
    AI/ML 학습 데이터셋을 설계하고 구축한 경험에 대해 구체적으로 설명해 주세요.
    이 질문 보기
    GS리테일 · 데이터 엔지니어
    AI 모델이 활용 가능한 데이터 공급 파이프라인을 설계할 때 가장 중요하게 생각하는 요소는 무엇인가요?
    이 질문 보기
    안내 · 이 페이지의 질문·답변·꼬리질문은 유사 직군 채용 시장의 공개된 면접 후기·커뮤니티 게시물을 분석해 구성한 학습 자료입니다. 실제 출제·회사 공식 입장과는 무관하며, 정정 요청 시 24시간 내 반영합니다. 자세히
    개인정보처리방침이용약관문의
    © 2026 우문현답. All rights reserved.
    이 페이지 목차
    01면접관의 의도02답변의 결03실수·꼬리질문04관련 질문
    말로 해봐야 는다
    이 질문, SK inc.(AX) 면접관과
    음성으로 답해볼까요?
    모의면접 해보기
    첫 회 무료 · 종료 즉시 음성 폐기