Deep Learning + AI
원핫인코딩이 특히 불리한 경우
내인생왜이래
2026. 7. 25. 15:00
반응형
1. 카디널리티가 매우 높은 범주
고유값이 수천~수만 개면 차원이 폭증하고, 희소·메모리·학습 비용이 커집니다. (예: user_id, product_sku, zip code)
2. 범주에 순서가 있는 경우
`낮음 < 중간 < 높음`처럼 순서가 의미 있으면 원핫은 그 관계를 버리고, 서열/정수 인코딩이 더 낫습니다.
3. 트리 기반 모델
XGBoost, LightGBM, Random Forest 등은 원핫보다 라벨/카테고리 네이티브 처리가 보통 더 잘 맞고, 원핫은 분할 효율을 떨어뜨릴 수 있습니다.
4. 범주 간 유사도가 중요한 경우
`서울`≈`경기`, `개`≈`강아지`처럼 의미가 가깝다면 원핫은 전부 직교로 취급합니다. 임베딩·타깃 인코딩이 더 적합합니다.
5. 새 범주가 자주 생기는 경우
학습 때 없던 값이 나오면 컬럼이 안 맞거나 전부 0이 됩니다. 온라인/스트리밍 데이터에 취약합니다.
6. 선형 모델 + 완전한 더미 변수
모든 범주를 다 넣으면 다중공선성(더미 변수 함정)이 생깁니다. 보통 한 범주는 기준(drop)으로 둡니다.
요약: 고유값이 많거나, 순서·유사도가 있거나, 트리/임베딩이 더 자연스러운 설정이면 원핫을 피하는 편이 좋습니다.
반응형