한 회사가 IoT 디바이스 플릿에서 많은 양의 데이터를 수집합니다. 데이터는 지속적인 Amazon EMR 클러스터에서 Hadoop Distributed File System(HDFS)의 최적화된 행 칼럼 형식(ORC) 파일로 저장됩니다. 회사의 데이터 분석 팀은 동일한 EMR 클러스터에 배포된 Apache Presto를 사용하여 SQL에서 데이터를 쿼리합니다. 쿼리는 많은 양의 데이터를 스캔하고 항상 15분 미만으로 실행되며 오후 5시~10시 사이에만 실행됩니다. 회사는 현재 솔루션과 관련된 높은 비용에 대해 걱정합니다. 솔루션 설계자는 SQL 데이터 쿼리를 허용하는 가장 비용 효율적인 솔루션을 제안해야 합니다. 어떤 솔루션이 이러한 요구 사항을 충족합니까?
- A. 데이터를 Amazon S3에 저장하고 Amazon Redshift Spectrum을 사용하여 데이터를 쿼리합니다.
- B. 데이터를 Amazon S3에 저장하고 AWS Glue Data Catalog 및 Amazon Athena를 사용하여 데이터를 쿼리합니다.✓ 정답
- C. 데이터를 EMR File System(EMRFS)에 저장하고 Amazon EMR에서 Presto를 사용하여 데이터를 쿼리합니다.
- D. 데이터를 Amazon Redshift에 저장하고 Amazon Redshift를 사용하여 데이터를 쿼리합니다.
해설
【핵심 용어】 ▸ Amazon Athena — Serverless SQL 쿼리 ▸ AWS Glue Data Catalog — 메타데이터 관리 ▸ S3 — 저비용 스토리지 【정답 포인트】 ▸ 비용 최소화 → Serverless Athena ▸ 간헐적 쿼리 (5PM-10PM) → 온디맨드 요금 ▸ 기존 ORC 파일 호환 → Glue Catalog ▸ EMR 클러스터 종료 가능 → 고정 비용 제거 【오답 체크】 (A) Redshift Spectrum은 클러스터 유지 필요 (C) 지속적 EMR 클러스터는 비용 높음 (D) Redshift는 데이터 로드 오버헤드 【시험 포인트】 Spot usage + Low frequency → Serverless Athena pattern