우문현답
愚 問 賢 答
회사별 면접직군별질문 가이드진행 방식
    홈›회사별›SK inc.(AX)›풀스택›질문 상세
    問
    SSK inc.(AX)풀스택직무 역량2026년 출제

    AI/ML 파이프라인 설계와 관련해, 데이터 수집과 정제 과정에서 어떤 방법론을 사용했는지 설명해줄 수 있나요?

    답변 미리보기

    AI/ML 파이프라인의 데이터 수집은 Apache Airflow로 스케줄링하고, 각 소스(API·DB·S3)별 커넥터를 DAG 태스크로 분리해 장애 격리가…

    예상 답변 시간
    60~90초
    예상 꼬리질문
    3회
    난이도
    난이도 중상
    출제 빈도
    높음
    INTERVIEWER'S INTENT · 면접관의 의도

    이 질문, 네 갈래로 뜯어봅니다.

    면접관이 이 한 문장으로 확인하려는 것들. 각 갈래를 알면 답의 뼈대가 잡혀요.

    問
    01
    데이터 수집 방법은 무엇인가?
    데이터 수집 과정에서 어떤 방법론을 적용했는지의 흔적이 답에 있어야 합니다. 없으면 면접관이 '어떻게 데이터를 확보했나요?'를 추가로 묻는 경우가 자주 보입니다.
    骨
    02
    정제 과정에서의 접근법은?
    데이터 정제 과정에서 채택한 접근법이 답에 드러나야 합니다. 없으면 면접관이 '어떤 기준으로 데이터를 정제했나요?'를 물어보는 자리가 자주 보입니다.
    語
    03
    AI/ML 파이프라인 설계 경험은?
    AI/ML 파이프라인 설계 경험의 흔적이 답에 있어야 합니다. 없으면 면접관이 '이와 관련된 프로젝트는 없었나요?'를 추가로 묻는 경우가 많습니다.
    本
    04
    사용한 도구나 기술은?
    데이터 수집 및 정제에 사용한 도구나 기술의 언급이 있어야 합니다. 없으면 면접관이 '어떤 기술을 사용했나요?'를 물어보는 자리가 자주 보입니다.
    말로 해봐야 는다
    읽는 것과 말하는 건 다릅니다.
    이 질문, 소리 내어 답해 볼까요?
    SK inc.(AX) 면접관 페르소나가 이 질문을 던지고, 당신의 답에 꼬리질문으로 되물어요.
    음성으로 답해보기
    Airflow DAG + Great Expectations 정제 파이프라인약 90초스트리밍 데이터 수집 — Kafka + Flink약 90초멀티소스 데이터 수집 정규화 — 크롤링+API+DB약 90초
    예시 답변 1
    약 90초

    Airflow DAG + Great Expectations 정제 파이프라인

    AI/ML 파이프라인의 데이터 수집은 Apache Airflow로 스케줄링하고, 각 소스(API·DB·S3)별 커넥터를 DAG 태스크로 분리해 장애 격리가 되도록 설계했습니다. 정제 단계에서는 Great Expectations으로 스키마 유효성, 결측치 비율, 분포 이상을 자동 검증했고, 임계값 초과 시 파이프라인을 멈추고 슬랙 알림을 보내도록 했습니다. 피처 스토어(Feast)에 정제된 데이터를 적재해 학습·서빙 환경에서 동일한 피처를 사용하도록 단일화했습니다. 이 구조로 데이터 관련 모델 품질 이슈가 분기별 8건에서 1건 이하로 줄었습니다. 파이프라인 설계 시 재현 가능성과 관찰 가능성을 최우선에 두는 것이 핵심이라는 기준이 생겼습니다.

    이 결의 특징
    수집을 Airflow로 스케줄링하되 소스별 커넥터를 DAG 태스크로 분리해 장애 격리를 노린 설계가 또렷합니다. 정제 단계에서 Great Expectations로 스키마·결측·분포를 자동 검증하고 임계 초과 시 파이프라인을 멈춰 알림을 보낸 대목이, 데이터 품질 이슈 분기 8건→1건을 관찰 가능성 설계의 결과로 읽히게 하는 결이 보입니다.
    이 결이 통하는 자리
    Feast로 정제 데이터를 적재해 학습·서빙이 동일 피처를 쓰게 한 단일화가 살아 있을 때 통합합니다. '재현 가능성과 관찰 가능성을 최우선에 둔다'는 기준이 검증 자동화로 받쳐지는 자리에서 면접관의 꼬리질문이 줄어드는 결이 보입니다.
    예시 답변 2
    약 90초

    스트리밍 데이터 수집 — Kafka + Flink

    실시간 추천 모델을 위한 파이프라인에서 Kafka → Flink → Feature Store 흐름으로 스트리밍 데이터를 수집했습니다. Flink 잡에서 슬라이딩 윈도우 집계로 최근 1시간 사용자 행동을 실시간 피처로 변환했고, 이상치 이벤트는 별도 dead-letter 토픽으로 격리해 추후 분석에 활용했습니다. 정제 기준은 도메인 전문가와 함께 사업 규칙 문서를 작성해 코드와 문서를 동기화했습니다. 배치·스트리밍 파이프라인이 공존해 동일 피처의 배치·스트리밍 결과를 비교하는 검증 단계를 추가했고, 오차가 2% 이내일 때만 스트리밍 값을 서빙에 사용했습니다. 이 경험으로 스트리밍 파이프라인은 정합성 검증이 배치보다 훨씬 복잡하다는 점을 체감했습니다.

    이 결의 특징
    Kafka→Flink→Feature Store 흐름에서 슬라이딩 윈도우로 최근 1시간 행동을 실시간 피처로 변환하고 이상치는 dead-letter 토픽으로 격리한 점이 또렷합니다. 배치·스트리밍 결과를 비교해 오차 2% 이내일 때만 스트리밍 값을 서빙에 쓴 대목이, 정합성 검증을 정면으로 다룬 결로 읽히게 합니다.
    이 결이 통하는 자리
    정제 기준을 도메인 전문가와 사업 규칙 문서로 코드·문서를 동기화한 흐름이 살아 있을 때 통합합니다. '스트리밍은 정합성 검증이 배치보다 훨씬 복잡하다'는 체감이 배치·스트리밍 비교로 받쳐지는 자리에서 신뢰가 생기는 결이 보입니다.
    예시 답변 3
    약 90초

    멀티소스 데이터 수집 정규화 — 크롤링+API+DB

    여러 이종 소스에서 데이터를 수집하는 파이프라인을 설계할 때, 저는 수집·변환·적재 단계를 명확히 분리하는 원칙을 따릅니다. 웹 크롤링은 Playwright+BeautifulSoup으로, REST API는 httpx 비동기 클라이언트로, DB는 psycopg3으로 수집해 각각 원본 레이어에 그대로 보존했습니다. 정제는 공통 스키마로 변환 후 Pandera로 타입·범위 검증을 수행하고, 오류 행은 격리 테이블에 따로 적재해 수동 검토 대기 상태로 관리했습니다. 파이프라인 전 단계에 데이터 볼륨 모니터링을 붙여 전날 대비 50% 이상 감소 시 경보를 울리게 했습니다. 이 구조에서 데이터 품질 문제의 90%가 수집 단계에서 발생한다는 것을 통계로 확인했습니다.

    이 결의 특징
    수집·변환·적재를 명확히 분리하는 원칙 아래 크롤링·API·DB를 각기 다른 도구로 받아 원본 레이어에 그대로 보존한 점이 또렷합니다. 정제 후 Pandera로 타입·범위를 검증하고 오류 행을 격리 테이블로 따로 적재해 수동 검토 대기로 둔 대목이, 품질 관리를 단계 분리로 구조화한 결로 읽히게 합니다.
    이 결이 통하는 자리
    볼륨 모니터링으로 전날 대비 50% 이상 감소 시 경보를 울린 장치가 살아 있을 때 통합합니다. '품질 문제의 90%가 수집 단계에서 발생한다'는 통계적 확인이 단계 분리와 묶이는 자리에서 면접관의 꼬리질문이 줄어드는 결이 보입니다.
    !
    위 답변은 여러 풀이 중 한 가지 예시입니다. 정답이 아니며, 외워서 그대로 말하면 면접관이 다음 질문을 그 자리에서 시작하는 경우가 많습니다. 본인의 프로젝트·기준·숫자로 다시 짜는 자리로만 쓰세요.
    ✕자주 빠지는 자리

    같은 실수가 반복돼요. 이것만 피해도 절반은 갑니다.

    • ✕고른 것만 말하고 있지 않은가? 검토했다 접은 선택지가 하나라도 나와야 판단으로 읽힙니다.
    • ✕판단 기준이 그 상황에 붙어 있는가? "더 좋아서"는 일반론이고, 그때의 조건을 짚은 말이 본인의 답입니다.
    • ✕결과를 확인한 방법이 있는가? 수치든 주변 반응이든, 무엇을 보고 됐다고 판단했는지가 빠지면 막연해집니다.
    • ✕지금 다시 한다면 무엇을 바꿀지 답할 수 있는가? "잘했다"보다 "이건 다르게 했을 것 같다"가 더 깊게 남습니다.
    ▶이어질 꼬리질문

    진짜 면접은 두 번째 질문부터예요. 이 답 뒤에 따라올 법한 것들.

    壹이 과정에서 어떤 어려움이 있었나요?
    대응어려움 극복 경험을 답하는 결이 흔하게 통합니다. 해결 방법과 배운 점을 함께 짚는 답이 강합니다.
    貳다른 접근 방법도 고려했었나요?
    대응대안 검토 여부를 답하는 결이 자주 보입니다. 선택하지 않은 방법의 장단점을 설명하는 것이 중요합니다.
    參이 과정에서 팀원과의 협업은 어땠나요?
    대응협업의 구체적인 경험을 답하는 결이 강합니다. 팀원 간 소통 방식이나 역할 분담을 강조하는 답이 자주 보입니다.
    이제, 직접 답해볼 차례예요.
    눈으로 읽은 답은 면접장에서 나오지 않아요. SK inc.(AX) 면접관과 이 질문으로 한 번 대화해 보세요.
    이 질문으로 모의면접 해보기
    또는, 다음 질문으로

    같은 흐름에서 자주 이어지는 질문들이에요.

    SK inc.(AX) · 풀스택
    AI/ML 파이프라인을 설계할 때 가장 중요하다고 생각하는 요소는 무엇인가요?
    이 질문 보기
    GS리테일 · 데이터 엔지니어
    AI/LLM 데이터 파이프라인 최적화를 위해 어떤 전략을 사용했는지 설명해 주세요.
    이 질문 보기
    피처링 · MLOps
    AI/ML 학습 데이터셋을 설계하고 구축한 경험에 대해 구체적으로 설명해 주세요.
    이 질문 보기
    GS리테일 · 데이터 엔지니어
    AI 모델이 활용 가능한 데이터 공급 파이프라인을 설계할 때 가장 중요하게 생각하는 요소는 무엇인가요?
    이 질문 보기
    안내 · 이 페이지의 질문·답변·꼬리질문은 유사 직군 채용 시장의 공개된 면접 후기·커뮤니티 게시물을 분석해 구성한 학습 자료입니다. 실제 출제·회사 공식 입장과는 무관하며, 정정 요청 시 24시간 내 반영합니다. 자세히
    개인정보처리방침이용약관문의
    © 2026 우문현답. All rights reserved.
    이 페이지 목차
    01면접관의 의도02답변의 결03실수·꼬리질문04관련 질문
    말로 해봐야 는다
    이 질문, SK inc.(AX) 면접관과
    음성으로 답해볼까요?
    모의면접 해보기
    첫 회 무료 · 종료 즉시 음성 폐기