회사가 Amazon S3 버킷에 저장된 .csv 파일의 데이터 양을 대폭 증가시켰습니다. 데이터 변환 스크립트와 쿼리가 이제 이전보다 훨씬 오래 걸립니다. ML 엔지니어는 쿼리 성능을 최적화하기 위한 솔루션을 구현해야 합니다. 어느 솔루션이 이 요구사항을 최소 운영 오버헤드로 충족합니까?
- A. AWS Lambda 함수를 구성하여 .csv 파일을 S3 버킷의 더 작은 객체로 분할합니다.
- B. AWS Glue 작업을 구성하여 문자열 타입 값이 있는 열을 제거하고 결과를 S3 버킷에 저장합니다.
- C. AWS Glue 추출, 변환 및 로드(ETL) 작업을 구성하여 .csv 파일을 Apache Parquet 형식으로 변환합니다.✓ 정답
- D. Amazon EMR 클러스터를 구성하여 S3 버킷의 데이터를 처리합니다.
해설
【핵심 용어】 ▸ Parquet — 칼럼 기반 저장 형식, 쿼리 성능 최적화에 탁월 ▸ AWS Glue ETL — 관리형 데이터 변환 서비스 【정답 포인트】 ▸ CSV는 전체 행을 읽어야 하므로 대용량 데이터 쿼리가 비효율적입니다. Parquet는 필요한 칼럼만 읽음으로써 IO를 50-90% 감소시킵니다. AWS Glue는 완전 관리형 서비스로 인프라 관리가 불필요합니다. 【오답 체크】 (A) 파일 분할은 성능 개선이 미미하며 데이터 형식 최적화가 아닙니다. (B) 칼럼 삭제는 쿼리 성능 근본 개선이 아니며 형식 최적화가 필요합니다. (D) EMR은 클러스터 관리가 필요하므로 운영 오버헤드가 높습니다. 【시험 포인트】 최소 오버헤드 + 쿼리 성능 → Glue ETL + Parquet 조합입니다.