회사가 각 광고의 색 구성을 고려하여 광고 캠페인의 성공을 예측하고 싶어 합니다. ML 엔지니어가 신경망 모델을 위해 데이터를 준비하고 있습니다. 데이터셋은 색상 정보를 카테고리형 데이터로 포함하고 있습니다. ML 엔지니어가 모델을 위해 사용해야 할 특성 공학 기법은 무엇입니까?
- A. 색상 카테고리에 label encoding을 적용합니다. 각 색상에 고유한 정수를 자동으로 할당합니다.
- B. 모든 색상 feature vector가 같은 길이를 가지도록 padding을 구현합니다.
- C. 색상 카테고리에 대해 차원 축소를 수행합니다.
- D. 색상 카테고리를 one-hot encode하여 색상 구성 feature를 이진 행렬로 변환합니다.✓ 정답
해설
【핵심 용어】 ▸ One-hot encoding — 카테고리형 변수를 이진 벡터로 변환. 각 카테고리마다 하나의 1과 나머지는 0. 신경망에 최적. ▸ Label encoding — 카테고리를 정수(0, 1, 2, ...)로 변환. 순서 관계 암시 가능 → 신경망에서 부적절 (색상은 순서 없음). ▸ Categorical feature — 순서 없는 카테고리 데이터. 신경망은 수치 입력 필요 → encoding 필수. ▸ Neural network input — 신경망은 연속 수치 값을 선호. 카테고리는 one-hot 형식이 표현력 좋음. 【정답 포인트】 ▸ 문제의 핵심: "neural network model" + "categorical color data" → 인코딩 필요 ▸ One-hot encoding은 신경망의 입력층에 최적화됨. 각 색상이 독립적 특성으로 취급 → 신경망이 색상 간 관계를 학습. ▸ 색상은 순서가 없는 명목형(nominal) 카테고리 → one-hot이 정확한 표현. 【오답 체크】 (A) Label encoding (정수 할당)은 신경망에 부적절. 정수 순서(0<1<2)가 모델에 암시적 순서 관계를 주게 됨. "빨강=0, 파랑=1, 초록=2"라고 하면 모델이 "파랑 > 빨강"이라고 학습할 우려. (B) Padding은 가변 길이 시퀀스(텍스트, 시계열)를 고정 길이로 맞추는 기법. 색상 데이터는 이미 고정 길이 벡터라 padding 불필요. (C) 차원 축소는 이미 수치형인 고차원 feature를 감소시킬 때 사용 (예: PCA). 색상 카테고리 수가 적으면(예: 10가지 색) one-hot 후 벡터 길이는 10 → 차원 축소 필요 없음. 【시험 포인트】 "categorical color data" + "neural network" → **One-hot encoding**. 신경망은 카테고리를 이진 벡터로 변환 선호. label encoding은 순서 관계 암시.