Deep Learning + AI

원핫인코딩이 특히 불리한 경우

내인생왜이래 2026. 7. 25. 15:00
반응형

 

1. 카디널리티가 매우 높은 범주
   고유값이 수천~수만 개면 차원이 폭증하고, 희소·메모리·학습 비용이 커집니다. (예: user_id, product_sku, zip code)

2. 범주에 순서가 있는 경우
   `낮음 < 중간 < 높음`처럼 순서가 의미 있으면 원핫은 그 관계를 버리고, 서열/정수 인코딩이 더 낫습니다.

3. 트리 기반 모델  
   XGBoost, LightGBM, Random Forest 등은 원핫보다 라벨/카테고리 네이티브 처리가 보통 더 잘 맞고, 원핫은 분할 효율을 떨어뜨릴 수 있습니다.

4. 범주 간 유사도가 중요한 경우  
   `서울`≈`경기`, `개`≈`강아지`처럼 의미가 가깝다면 원핫은 전부 직교로 취급합니다. 임베딩·타깃 인코딩이 더 적합합니다.

5. 새 범주가 자주 생기는 경우  
   학습 때 없던 값이 나오면 컬럼이 안 맞거나 전부 0이 됩니다. 온라인/스트리밍 데이터에 취약합니다.

6. 선형 모델 + 완전한 더미 변수  
   모든 범주를 다 넣으면 다중공선성(더미 변수 함정)이 생깁니다. 보통 한 범주는 기준(drop)으로 둡니다.

요약: 고유값이 많거나, 순서·유사도가 있거나, 트리/임베딩이 더 자연스러운 설정이면 원핫을 피하는 편이 좋습니다.

반응형