IoT 회사는 사용자의 수면에 대한 데이터를 수집하는 센서가 있는 매트리스를 출시하고 있습니다. 센서는 데이터를 Amazon S3 버킷으로 보냅니다. 센서는 각 매트리스에 대해 매일 밤 약 2MB 의 데이터를 수집합니다. 회사는 각 매트리스에 대한 데이터를 처리하고 요약해야 합니다. 결과는 가능한 한 빨리 제공되어야 합니다. 데이터 처리에는 1GB 의 메모리가 필요하며 30초 이내에 완료됩니다. 이러한 요구 사항을 가장 비용 효율적으로 충족하는 솔루션은 무엇입니까?
- A. Scala 작업에 AWS Glue 사용
- B. Apache Spark 스크립트와 함께 Amazon EMR 사용
- C. Python 스크립트와 함께 AWS Lambda 사용✓ 정답
- D. PySpark 작업과 함께 AWS Glue 사용
해설
【핵심 용어】 ▸ AWS Lambda — 최대 10GB 메모리, 최대 15분 실행, 초단위 과금 | AWS Glue — Spark 기반, 최소 실행 시간 1분, 분단위 과금 | Amazon EMR — 클러스터 기반, 시작 오버헤드 5~10분 【정답 포인트】 ▸ 2MB 데이터 + 1GB 메모리 + 30초 내 완료 → Lambda 최적 (소규모 워크로드) | 매일 밤 간헐적 처리 → 상시 실행 클러스터 불필요 | 비용 효율 → Lambda 초단위 과금 < Glue/EMR 분단위 | S3 이벤트 트리거 → Lambda 자동 호출 【오답 체크】 (A) Glue (Scala) — 분단위 최소 과금 + Spark 오버헤드 과도 | (B) EMR — 클러스터 시작 지연, 소규모 작업에 비효율 | (D) Glue (PySpark) — Spark 컴파일 오버헤드, 비용 대비 이점 없음 【시험 포인트】 ▸ '가능한 한 빨리' + '비용 효율' = Lambda 고려 | 2MB 소규모 데이터 = 대규모 클러스터 불필요 | S3 트리거 = Lambda 네이티브 통합 | Glue/EMR은 TB급 배치 처리 전문