ChatGPT와 같은 대규모 언어 모델(LLM)은 인공지능 분야의 중요한 진전을 나타내지만, 컴퓨팅, 메모리, 에너지, 재정 등 막대한 자원 소비 문제를 야기합니다. 특히 자원 제약이 있는 환경에서는 이러한 도전이 더욱 심화됩니다. 본 조사는 LLM의 자원 효율성을 높이기 위한 다양한 기술들을 체계적으로 검토하여 이 문제에 접근합니다.
저자들은 최적화 초점(컴퓨팅, 메모리, 에너지, 재정, 네트워크)과 LLM 생명주기(아키텍처 설계, 사전 학습, 미세 조정, 시스템 설계)에 따른 방법론을 분류합니다. 또한, 특정 자원 유형에 따른 효율성 기술의 미묘한 분류를 제시하여 다양한 자원과 최적화 기법 간의 복잡한 관계를 밝혀냅니다.
일관되고 공정한 비교를 위해 표준화된 평가 지표와 데이터셋을 제시합니다. 본 조사는 최신 기술 현황을 포괄적으로 조망하고 미개척 연구 분야를 식별함으로써, 연구자와 실무자가 지속 가능하고 효율적인 LLM을 개발하는 데 필요한 기초 자료를 제공합니다.
이 분야에 관심 있는 입문자들을 위해 기존 연구에 대한 체계적인 검토와 자원 효율적인 LLM에 대한 고도로 구조화된 분류 체계를 제공하며, 지속적으로 업데이트되는 논문 목록 웹사이트도 함께 공개합니다.
거대 언어 모델(LLM)의 발전에도 불구하고, 클라우드 단독 배포나 엣지 기기 압축은 지연 시간, 개인 정보 보호, 비용, 개인화 문제로 인해 한계에 부딪히고 있습니다. 본 연구는 클라우드 LLM과 엣지 소형 언어 모델(SLM)이 추론 및 학습 과정에서 협력하는 패러다임을 탐구합니다. 이를 위해 엣지-클라우드 협업 전략에 대한 통합 분류 체계를 제안합니다.
추론 단계에서는 작업 할당, 작업 분할, 혼합 기반 협업 방식을 작업 및 토큰 수준으로 분류하며, 적응형 스케줄링, 자원 인식 오프로딩, 추측 디코딩, 모듈러 라우팅 등을 포함합니다. 학습 단계에서는 파라미터 정렬, 가지치기, 양방향 증류, 소형 모델 기반 최적화 등 분산 적응 기술을 검토합니다.
나아가 데이터셋, 벤치마크, 배포 사례를 요약하고, 개인 정보 보호 기술과 수직적 응용 분야를 조명합니다. 이 연구는 LLM-SLM 협업을 위한 체계적인 기반을 구축하고, 효율적이고 확장 가능하며 신뢰할 수 있는 엣지-클라우드 인텔리전스를 위한 시스템-알고리즘 공동 설계를 연결하는 것을 목표로 합니다.
대규모 언어 모델(LLM)의 활용이 증가함에 따라, 추론 시스템의 효율성 개선이 중요해지고 있습니다. 서버(예: GPU)에서 추론 작업을 스케줄링할 때 배치(batching)는 여러 요청을 병렬로 처리하여 처리량을 극대화하는 핵심 단계입니다. 그러나 요청별 생성 길이의 편차가 커서 하드웨어 자원 활용도가 저하되는 문제가 발생합니다. 이는 배치 내 가장 긴 요청이 완료될 때까지 다음 배치를 처리할 수 없기 때문입니다.
본 연구는 이러한 문제를 큐잉 이론 관점에서 정형화하고, 정적 배치(static-batching) 프레임워크 내에서 처리량 최적의 제어 정책을 설계하는 것을 목표로 합니다. 이를 위해 유사한 (예측) 실행 시간을 가진 요청들을 미리 정해진 여러 개의 빈(bin)으로 그룹화하는 간단하면서도 효과적인 방법인 멀티-빈 배치(Multi-Bin Batching)를 제안합니다.
이 방법은 정적 배치 프레임워크에서 LLM 추론 처리량을 향상시킬 수 있음을 이론적으로 증명합니다. 실제 LLM 추론 시나리오에서 정적 및 연속 배치(continuous-batching) 기준선과의 비교 실험을 통해, 멀티-빈 배치가 정적 배치 대비 처리량을 크게 개선함을 입증했습니다.
또한, 오라클 및 예측 길이 정보 하에서 네이티브 연속 배치와의 잔여 성능 격차를 정량화했습니다. 이 연구는 LLM 추론 시스템의 효율성을 높여 자원 활용도를 극대화하고, 실제 서비스 환경에서의 LLM 성능 향상에 기여할 수 있습니다.
파운데이션 모델(FM)은 재료 과학(MatSci) 분야에서 확장 가능하고 다목적이며 다중 모드 AI 시스템을 구현하여 과학적 발견의 변혁을 주도하고 있습니다. 기존의 좁은 범위의 머신러닝 모델과 달리, FM은 도메인 간 일반화 및 새로운 기능을 제공하여 다양한 데이터 유형과 스케일을 다루는 재료 과학 연구에 특히 적합합니다.
본 조사는 이 성장하는 분야를 지원하는 파운데이션 모델, 에이전트 시스템, 데이터셋 및 계산 도구에 대한 포괄적인 개요를 제공합니다. 데이터 추출, 해석 및 Q&A, 원자 시뮬레이션, 특성 예측, 재료 구조, 설계 및 발견, 공정 계획, 발견 및 최적화, 다중 스케일 모델링의 6가지 광범위한 응용 분야를 포괄하는 작업 중심 분류 체계를 제시합니다. 단일 모드 및 다중 모드 FM의 최신 발전과 새로운 대규모 언어 모델(LLM) 에이전트를 논의합니다.
또한, FM의 개발 및 연구 워크플로우 통합을 촉진하는 표준화된 데이터셋, 오픈 소스 도구 및 자율 실험 플랫폼을 검토합니다. 파운데이션 모델의 초기 성공을 평가하고 일반화 가능성, 해석 가능성, 데이터 불균형, 안전 문제 및 제한된 다중 모드 융합을 포함한 지속적인 한계를 식별합니다.
마지막으로, 확장 가능한 사전 학습, 지속적 학습, 데이터 거버넌스 및 신뢰성을 중심으로 미래 연구 방향을 제시합니다.
거대 언어 모델(LLM)은 자연어 처리 분야에 혁신을 가져왔지만, 편향에 취약하다는 중대한 문제가 있습니다. 본 종합 리뷰는 LLM 편향의 발생 원인부터 현재의 완화 전략까지 포괄적으로 탐구합니다.
편향을 내재적 및 외재적 범주로 나누고, 다양한 자연어 처리(NLP) 작업에서 나타나는 양상을 분석합니다. 또한, 데이터 수준, 모델 수준, 출력 수준 접근 방식을 포함한 다양한 편향 평가 방법을 비판적으로 검토하여 연구자들에게 견고한 편향 탐지 도구 키트를 제공합니다.
완화 전략은 모델 이전, 모델 내, 모델 이후 기술로 분류하여 효과와 한계를 조명합니다. 특히 헬스케어 및 형사 사법 시스템과 같은 실제 응용 분야에서 편향된 LLM이 야기할 수 있는 잠재적 피해를 강조하며 윤리적, 법적 함의를 논의합니다.
이 리뷰는 LLM 편향에 대한 현재 지식을 종합함으로써 공정하고 책임감 있는 인공지능(AI) 시스템 개발 노력에 기여합니다. 본 연구는 LLM 편향을 이해하고 평가하며 완화하는 데 전념하는 연구자와 실무자에게 포괄적인 자료가 되어, 더욱 공평한 AI 기술 발전을 촉진할 것입니다.