OCR 기반 영수증 추출 모델 + 전처리 품질 개선 + 데이터 증강 중심으로 푸는 결
학부 졸업 프로젝트로 영수증 이미지에서 품목과 금액을 추출하는 모델을 만들었습니다. OCR 기반 전처리와 BERT 계열 모델을 써서 텍스트를 구조화하는 방식이었습니다. 처음에는 인식 정확도가 60% 초반에 머물렀는데, 분석해보니 영수증 폰트와 배경 노이즈가 다양해서 전처리 단계의 품질이 낮았던 게 주 원인이었습니다. 이미지 이진화 파라미터를 조정하고 훈련 데이터를 3배 증강했더니 정확도가 82%까지 올라갔습니다. 프로젝트를 마치면서 느낀 건, AI 모델보다 데이터 품질과 전처리 설계가 성능을 더 크게 좌우한다는 점이었습니다. 모델 성능보다 데이터 품질과 전처리 설계가 결과를 더 많이 좌우한다는 걸 그 프로젝트에서 처음 실감했습니다. 좋은 모델보다 좋은 데이터가 먼저라고 지금도 생각합니다.