강화학습 프로젝트를 역할·지표 중심으로 설명하기
물류 로봇 경로 최적화를 위한 강화학습 프로젝트에서 보상 함수 설계와 학습 튜닝을 맡았습니다. 초기 보상 설계가 지역 최적해에 빠지는 문제가 있어, 거리 보상과 충돌 페널티 비중을 여러 차례 조정하며 평균 경로 길이를 15퍼센트 단축했습니다. 학습이 5만 에피소드에서도 수렴하지 않는 문제를 겪었을 때는 학습률 스케줄링을 도입해 안정화했습니다. 이 과정에서 보상 설계가 결과를 좌우한다는 것을 체감했습니다.