모델 티어링 최적화
여러 기능을 제공하는 서비스를 설계하면서, 모든 요청에 고성능 모델을 쓰는 것은 비용 효율이 떨어진다고 판단해 요청의 복잡도에 따라 모델을 다르게 호출하는 구조를 설계했습니다. 단순 분류 작업은 경량 모델로, 복잡한 추론이 필요한 작업만 고성능 모델로 라우팅하는 방식을 적용했고, 이를 통해 전체 API 비용을 약 40퍼센트 절감할 수 있었습니다. 모든 문제에 같은 크기의 도구를 쓸 필요가 없다는 것을 그 과정에서 배웠습니다.