효율적인 멀티모달 대규모 언어 모델 연구
Efficient multimodal large language models: a survey
Yizhang Jin, Jian Li, Tianjun Gu 외 5인·Visual Intelligence·발표 2025.12· 21 인용
최근 1년 21회 인용· 떠오르는 연구
한국어 핵심 요약
최근 멀티모달 대규모 언어 모델(MLLM)은 시각 질의응답 및 시각 이해·추론 분야에서 뛰어난 성능을 보였습니다. 그러나 방대한 모델 크기와 높은 학습 및 추론 비용은 학계와 산업 전반에 걸친 MLLM의 광범위한 적용을 저해하는 요인으로 작용했습니다. 특히 엣지 컴퓨팅 환경에서 효율적이고 경량화된 MLLM 연구의 잠재력은 매우 큽니다.
본 연구는 효율적인 MLLM의 현재 상태를 포괄적이고 체계적으로 검토합니다. 구체적으로 대표적인 효율적 MLLM의 발전 과정, 구조 및 전략에 대한 연구 현황, 그리고 다양한 응용 사례를 요약하여 제시합니다.
이러한 분석을 통해 현재 효율적인 MLLM 연구의 한계점을 명확히 파악하고, 향후 연구를 위한 유망한 방향성을 논의합니다. 이는 MLLM의 실용적 적용을 위한 중요한 기반을 제공할 것입니다.
섹션 미리보기
연구 배경
멀티모달 대규모 언어 모델(MLLM)은 시각 질의응답 등에서 뛰어난 성능을 보였으나, 막대한 모델 크기와 높은 비용으로 인해 광범위한 적용에 어려움을 겪고 있습니다. 특히 엣지 컴퓨팅 환경에서 효율적인 MLLM의 필요성이 증대되고 있습니다.
핵심 발견
본 연구는 효율적인 MLLM의 발전 과정, 구조 및 전략, 그리고 응용 사례를 체계적으로 분석합니다. 이를 통해 현재 연구의 한계를 파악하고, 미래 연구 방향을 제시하여 MLLM의 실용화에 기여합니다.
관련 컴퓨터 과학 논문
체화 인공지능을 위한 시각-언어-행동 모델 연구
2026·15
의료 영상 비전-언어 파운데이션 모델
2025·41
확산 모델 기반 이미지 증강 기술 동향
2025·48
거대 언어 모델 안전성 확보 방안
2025·51