한 회사가 PDF 문서에서 엔티티를 추출하여 분류 모델을 구축해야 합니다. 엔티티를 추출하고 저장하는 시간이 가장 적은 솔루션은 어느 것입니까?
- A. Amazon Comprehend를 사용하여 엔티티를 추출합니다. 출력을 Amazon S3에 저장합니다.✓ 정답
- B. Amazon SageMaker에서 오픈소스 AI 광학 문자 인식(OCR) 도구를 사용하여 엔티티를 추출합니다. 출력을 Amazon S3에 저장합니다.
- C. Amazon Textract를 사용하여 엔티티를 추출합니다. Amazon Comprehend를 사용하여 엔티티를 텍스트로 변환합니다. 출력을 Amazon S3에 저장합니다.
- D. Amazon Textract와 Amazon Augmented AI(Amazon A2I)를 통합하여 엔티티를 추출합니다. 출력을 Amazon S3에 저장합니다.
해설
【핵심 용어】 ▸ Amazon Textract — PDF/스캔 이미지에서 텍스트 추출하는 OCR 도구 ▸ Amazon Comprehend — 추출된 텍스트에서 엔티티 인식(NER) 수행 ▸ Amazon A2I — 휴먼 인-더-루프 검증(느림) 【정답 포인트】 "extract and store entities in the LEAST amount of time" → PDF에서 직접 엔티티 추출을 원한다면? Comprehend는 텍스트 입력으로 즉시 엔티티를 추출 가능. Textract는 OCR 전처리 단계이므로 불필요한 오버헤드. 직접 PDF 텍스트를 Comprehend에 전달하면 가장 빠름. 【오답 체크】 (B) 오픈소스 OCR + SageMaker — OCR 도구를 SageMaker에서 실행하는 관리 오버헤드, 엔티티 추출 추가 필요 (C) Textract + Comprehend 조합 — OCR(Textract)에서 텍스트 추출 후 Comprehend 호출은 2단계 처리로 시간 증가 (D) Textract + A2I — 휴먼 검증 루프가 포함되어 자동화된 시간이 아니라 사람 개입으로 시간 대폭 증가 【시험 포인트】 PDF에서 엔티티 추출 → PDF가 텍스트 기반이라면 Comprehend만으로 충분. Textract는 스캔 이미지 같은 OCR이 필요한 경우에만 사용. 문제에서 "entities in PDF"는 대개 텍스트 PDF를 의미하므로 Comprehend 직접 사용이 최적.