효율적인 멀티모달 대규모 언어 모델 연구
최근 멀티모달 대규모 언어 모델(MLLM)은 시각 질의응답 및 시각 이해·추론 분야에서 뛰어난 성능을 보였습니다. 그러나 방대한 모델 크기와 높은 학습 및 추론 비용은 학계와 산업 전반에 걸친 MLLM의 광범위한 적용을 저해하는 요인으로 작용했습니다. 특히 엣지 컴퓨팅 환경에서 효율적이고 경량화된 MLLM 연구의 잠재력은 매우 큽니다. 본 연구는 효율적인 MLLM의 현재 상태를 포괄적이고 체계적으로 검토합니다. 구체적으로 대표적인 효율적 MLLM의 발전 과정, 구조 및 전략에 대한 연구 현황, 그리고 다양한 응용 사례를 요약하여 제시합니다. 이러한 분석을 통해 현재 효율적인 MLLM 연구의 한계점을 명확히 파악하고, 향후 연구를 위한 유망한 방향성을 논의합니다. 이는 MLLM의 실용적 적용을 위한 중요한 기반을 제공할 것입니다.