한 기업이 Amazon S3에 Apache Parquet 형식으로 저장된 대규모 데이터셋을 분석해야 합니다. 기업은 일부 열에 원-핫 인코딩을 사용하려고 합니다. 기업은 데이터를 변환하기 위해 코드 불필요한 솔루션이 필요합니다. 솔루션은 모델 학습을 위해 변환된 데이터를 동일한 S3 버킷으로 다시 저장해야 합니다. 이 요구사항을 충족할 솔루션은 무엇입니까?
- A. AWS Glue DataBrew 프로젝트를 구성하여 데이터에 연결합니다. DataBrew 대화형 인터페이스를 사용하여 원-핫 인코딩 변환을 수행하는 레시피를 만듭니다. 변환을 적용하고 출력을 S3 버킷으로 다시 쓰는 작업을 만듭니다.✓ 정답
- B. 데이터를 가리키는 AWS Glue Data Catalog 테이블을 구성합니다. Amazon Athena를 사용하여 원-핫 인코딩 변환을 수행하는 SQL 명령을 작성합니다. Athena를 구성하여 쿼리 결과를 S3 버킷으로 다시 씁니다.
- C. 데이터를 가리키는 AWS Glue Data Catalog 테이블을 구성합니다. AWS Glue ETL 대화형 노트북을 만듭니다. 노트북을 사용하여 원-핫 인코딩 변환을 수행합니다. 구성된 셀을 실행하고 결과를 S3 버킷으로 다시 씁니다.
- D. Amazon Redshift 클러스터를 구성하여 Redshift Spectrum을 사용하는 데이터에 액세스합니다. SQL 명령을 사용하여 Amazon Redshift 내에서 원-핫 인코딩 변환을 수행합니다. Amazon Redshift를 구성하여 결과를 S3 버킷으로 다시 씁니다.
해설
【핵심 용어】 ▸ AWS Glue DataBrew — 시각적 데이터 준비 도구. 코드 불필요, 드래그-드롭으로 레시피 작성. 원-핫 인코딩 변환 기본 지원 ▸ One-Hot Encoding — 범주형 변수를 이진 열들로 변환 (예: "색상" → "색상_빨강", "색상_파랑" 열) 【정답 포인트】 ▸ '코드 불필요한(no-code) 솔루션' → DataBrew 선택 기준 ▸ DataBrew는 원-핫 인코딩 변환을 UI 레시피로 직접 지원 ▸ 대화형 인터페이스로 미리보기 후 작업 생성 ▸ 자동으로 S3 결과 저장 구성 가능 ▸ 비기술 사용자도 사용 가능한 완전 관리형 서비스 【오답 체크】 (B) Athena + SQL: 원-핫 인코딩을 SQL로 구현하기 어려움. CASE WHEN 조합으로 가능하지만 복잡 (C) Glue ETL Notebook: 코딩 필요 (PySpark). '코드 불필요' 요구사항 미충족 (D) Redshift + Spectrum: 클러스터 관리 오버헤드. 데이터 준비보다 분석용. 비용 높음 【시험 포인트】 코드 불필요 + 데이터 변환 → DataBrew. Glue 서비스 차이(DataBrew/ETL/Catalog) 이해.