한 회사는 비즈니스 인텔리전스 리포트를 처리하기 위한 새로운 데이터 파이프라인을 구축합니다. 사용자들은 리포트에서 데이터가 누락되었음을 알아챘습니다. 데이터 엔지니어는 데이터가 스토리지에 추가되기 전 단계에서 null 값을 포함하는 열에 대한 데이터 품질 검사와 참조 무결성 검사를 추가해야 합니다. 가장 적은 운영 오버헤드로 이 요구사항을 충족하는 솔루션은 무엇입니까?
- A. Amazon SageMaker Data Wrangler를 사용하여 데이터 품질 및 인사이트 리포트를 생성합니다.
- B. AWS Glue ETL 작업을 사용하여 데이터에 대한 데이터 품질 평가 변환을 수행합니다. 요청된 열에 대해 IsComplete 규칙을 사용합니다. 각 조인에 대해 ReferentialIntegrity 규칙을 사용합니다.✓ 정답
- C. AWS Glue ETL 작업을 사용하여 데이터에 대한 SQL 변환을 수행하여 요청된 열에 null 값이 포함되어 있는지 확인합니다. 두 번째 SQL 변환을 사용하여 참조 무결성을 확인합니다.
- D. Amazon SageMaker Data Wrangler와 사용자 정의 Python 변환을 사용하여 null 값 및 참조 무결성을 확인하는 사용자 정의 규칙을 생성합니다.
해설
【핵심 용어】 ▸ Glue ETL Evaluate Data Quality 변환 + DQDL 룰 — IsComplete (null 검사), ReferentialIntegrity (참조 무결성). 【정답 포인트】 ▸ null + 참조 무결성 + 최소 운영 = DQDL 표준 룰 두 개. 코드 작성 없음. 【오답 체크】 (A) Data Wrangler는 ML 데이터 준비. (C) SQL 변환 직접 작성 = 코드 부담. (D) Python 커스텀 변환도 코드 부담.