회사는 Amazon SageMaker AI에서 고양이와 개의 이미지를 구분하는 이미지 분류 모델을 학습하고 있습니다. 회사는 제3자 소스의 이미지를 사용하고 있습니다. 회사는 각 이미지에 첨부된 메타데이터 요약 파일에 올바른 레이블을 추가하여 고양이와 개의 이미지에 레이블을 지정해야 합니다. 회사는 고양이와 개의 이미지 수가 같도록 해야 합니다. 이 요구 사항을 충족하는 솔루션은 무엇입니까?
- A. SageMaker Clarify를 사용하여 클래스 불균형(CI)을 확인합니다. 값이 1에 가까우면 데이터셋이 균형을 이룹니다.
- B. SageMaker Clarify를 사용하여 클래스 불균형(CI)을 확인합니다. 값이 0에 가까우면 데이터셋이 균형을 이룹니다.✓ 정답
- C. SageMaker Data Wrangler를 사용하여 레이블의 비율 차이(DPL)를 확인합니다. 값이 1에 가까우면 데이터셋이 균형을 이룹니다.
- D. SageMaker Data Wrangler를 사용하여 레이블의 비율 차이(DPL)를 확인합니다. 값이 -1에 가까우면 데이터셋이 균형을 이룹니다.
해설
【핵심 용어】 ▸ Class Imbalance(CI) 메트릭 — 범위 [-1, 1], 0 = 완벽 균형, ±1 = 극심 불균형 ▸ SageMaker Clarify — 데이터 편향성 및 공정성 분석 도구 ▸ Balanced dataset — 클래스별 샘플 수 동등 【정답 포인트】 ▸ 균형 이미지 데이터셋 검증 → CI 메트릭 = 0 = 균형 ▸ CI 값 해석: CI → 0 = 균형, CI → ±1 = 불균형 ▸ "equal number" = CI ≈ 0 【오답 체크】 (A) CI ≈ 1: 극도로 한쪽 클래스에 치우친 상태(불균형) (C) DPL 메트릭: Data Wrangler의 메트릭이지만 편향성 감지용(불균형 감지 아님) (D) DPL ≈ -1: DPL은 그룹 간 차별 지표(여기서는 부적절) 【시험 포인트】 CI의 수학적 정의: CI = (n_major - n_minor) / (n_major + n_minor). 균형 데이터에서 n_major ≈ n_minor이므로 CI → 0. 이진 분류에서 0에 가까울수록 균형. Clarify는 공정성/편향 감지 표준 도구. 이미지 분류 데이터셋 검증에 필수.