한 회사가 신용카드 거래에 레이블을 지정하는 모델을 만들고 있습니다. 이 회사는 모델을 학습시킬 대량의 샘플 거래 데이터를 보유하고 있습니다. 대부분의 거래 데이터에는 레이블이 지정되어 있지 않습니다. 이 데이터에는 기밀 정보가 포함되어 있지 않습니다. 회사는 모델을 파인 튜닝하기 위해 레이블이 지정된 샘플 데이터를 확보해야 합니다. 이러한 요구 사항을 충족하는 솔루션은 무엇입니까? (두 개를 선택하세요.)
- A. 레이블이 지정되지 않은 데이터에 대해 배치 추론 작업을 실행합니다.
- B. PyTorch Distributed 라이브러리를 사용하여 데이터에 레이블을 지정하는 Amazon SageMaker AI 학습 작업을 실행합니다.
- C. Amazon Mechanical Turk 작업자와 함께 Amazon SageMaker Ground Truth 레이블 지정 작업을 사용합니다.✓ 정답
- D. 레이블이 지정된 샘플로 학습된 광학 문자 인식(OCR) 모델을 사용하여 레이블이 지정되지 않은 샘플에 레이블을 지정합니다.
- E. Amazon SageMaker AI 레이블 지정 작업을 실행합니다.✓ 정답
해설
【핵심 용어】 ▸ SageMaker Ground Truth — 사람 어노테이터(Mechanical Turk 등)로 데이터에 레이블링하는 관리형 라벨링 서비스 ▸ SageMaker(AI) labeling job — 관리형 데이터 라벨링 작업 ▸ Mechanical Turk — 크라우드소싱 인력 풀 【정답 포인트】 ▸ "레이블 없는 데이터에 레이블을 얻어야" + "기밀 아님" → 사람 기반 라벨링이 필요 ▸ C: Ground Truth + Mechanical Turk 인력으로 라벨링 ▸ E: SageMaker AI 라벨링 작업으로 레이블 데이터 생성 【오답 체크】 (A) 배치 추론은 예측을 생성할 뿐 정답 레이블을 만들지 않음. (B) PyTorch Distributed 학습 작업은 라벨링 도구가 아니라 모델 학습용. (D) OCR은 이미지 내 문자 인식용으로 거래 데이터 라벨링과 무관. 【시험 포인트】 "레이블 데이터 확보" → SageMaker Ground Truth / 라벨링 작업(사람 어노테이션).