교육 앱에서 사용자가 텍스트 또는 질문 사진을 제출하면 서면 답변과 설명을 내려 한다. 어떤 모델 타입?
- A. Computer Vision
- B. Large Multi-modal Language Model✓ 정답
- C. Diffusion model
- D. Text-to-speech
해설
【핵심 용어】 ▸ Multi-modal LLM: 텍스트·이미지·오디오 등 여러 모달리티 동시 입력 처리 후 텍스트 출력 ▸ Modality: 데이터 타입(텍스트·이미지·음성 등)을 의미하는 AI 용어 ▸ Vision-Language Model: 이미지 이해 + 자연어 생성 통합(Claude 3 Vision·GPT-4V 사례) 【정답 포인트】 ▸ 입력: 텍스트 + 이미지(사진 속 질문) = 멀티모달 필요 ▸ 출력: 텍스트 답변·설명 = LLM 역할 ▸ 텍스트+이미지 QA: Multi-modal LLM 유일 선택지 【오답 체크】 (A) Computer Vision: 이미지 분류·객체 탐지로 텍스트 응답 생성 아님 / (C) Diffusion Model: 텍스트 설명으로부터 이미지 생성으로 역방향 / (D) Text-to-Speech: 텍스트를 음성으로 변환으로 서면 응답 아님 【시험 포인트】 ▸ 이미지 입력 + 텍스트 출력: Multi-modal LLM(교육·헬스케어 분야 빈출) ▸ Single Modality ≠ Multi-modal: 입출력 타입 개수로 구분