한 회사가 짧은 문서 요약을 생성하도록 Amazon Bedrock 파운데이션 모델(FM)을 파인 튜닝했습니다. 회사는 모델이 생성한 각 요약을 사람이 작성한 참조 요약과 비교하는 자동화된 지표를 원합니다. 어떤 지표가 이러한 요구 사항을 충족합니까?
- A. F1 점수
- B. Recall-Oriented Understudy for Gisting Evaluation (ROUGE)✓ 정답
- C. Perplexity
- D. Fréchet inception distance (FID)
해설
【핵심 용어】 ▸ ROUGE — 생성 요약과 인간 참조 요약 간 n-gram 겹침을 측정하는 요약 평가 표준 지표 ▸ F1 score — 분류 정밀도/재현율 조화평균 ▸ Perplexity — 언어모델 예측 불확실성 ▸ FID — 이미지 생성 품질 지표 【정답 포인트】 ▸ "모델 요약 vs 인간 참조 요약 자동 비교" → 요약 평가 표준인 ROUGE = B 【오답 체크】 (A) F1은 분류 성능 지표로 요약 텍스트 비교 표준이 아님. (C) Perplexity는 언어모델 유창성 지표이지 참조 대비 요약 평가가 아님. (D) FID는 이미지 생성 품질 측정 지표. 【시험 포인트】 요약 평가 = ROUGE, 번역 평가 = BLEU.