Caramel LabCaramel Lab
#

파운데이션 모델

5의 한국어 분석 — 최신순으로 정렬했어요

재료공학발표 2025.11· 191최근 1년 191

원자 재료화학 파운데이션 모델

원자 단위 물질 시뮬레이션은 화학 및 재료 과학의 근간을 이루지만, 기존 기계 학습(ML) 기반 힘장(force field)은 특정 시스템에 대한 개발 및 검증에 많은 노력이 필요하고, 화학 시스템 간 전이성(transferability)이 부족하다는 한계가 있었습니다. 이는 시뮬레이션의 적용 범위와 효율성을 저해하는 주요 문제였습니다. 본 연구에서는 공개 데이터셋으로 학습된 범용 원자 ML 모델을 제안합니다. 이 모델은 다양한 분자와 재료에 대해 안정적인 분자 동역학 시뮬레이션을 수행할 수 있습니다. 특히, MACE-MP-0 모델은 고체, 액체, 기체, 화학 반응, 계면 및 단백질 동역학 등 물리 과학의 광범위한 문제에서 정성적, 때로는 정량적으로도 높은 정확도를 보였습니다. 이 모델은 모든 원자 시스템에 즉시 적용 가능한 파운데이션 모델로 활용될 수 있으며, 필요한 경우 소수의 응용 분야별 데이터만으로도 ab initio 수준의 정확도를 달성하도록 미세 조정(fine-tuning)할 수 있습니다. 이는 안정적인 힘장 모델이 거의 모든 재료를 포괄할 수 있음을 입증한 것입니다. 이러한 파운데이션 모델은 숙련된 사용자에게는 신뢰할 수 있는 결과를 더 빠르게 제공하고, 초보자에게는 진입 장벽을 낮춰 원자 규모 모델링의 민주화를 앞당길 것으로 기대됩니다.

컴퓨터 과학발표 2025.11· 70최근 1년 70

병리 분석을 위한 멀티모달 파운데이션 모델

컴퓨터 병리학 분야는 자기 지도 학습을 통해 조직 병리 관심 영역(ROI)을 다재다능하고 전이 가능한 특징 표현으로 인코딩하는 파운데이션 모델의 발전으로 변화하고 있습니다. 그러나 이러한 발전이 환자 및 슬라이드 수준의 복잡한 임상 문제를 해결하는 데 적용되는 것은 질병별 코호트의 제한된 임상 데이터, 특히 희귀 질환에 대한 데이터 부족으로 인해 제약을 받습니다. 본 연구에서는 이러한 한계를 극복하기 위해 Transformer 기반의 병리 이미지 및 텍스트 정렬 네트워크(TITAN)를 제안합니다. TITAN은 335,645개의 전체 슬라이드 이미지와 해당 병리 보고서, 그리고 멀티모달 생성 AI 코파일럿이 생성한 423,122개의 합성 캡션을 활용하여 시각적 자기 지도 학습 및 시각-언어 정렬 방식으로 사전 학습된 멀티모달 전체 슬라이드 파운데이션 모델입니다. TITAN은 미세 조정이나 임상 레이블 없이도 범용 슬라이드 표현을 추출하고 병리 보고서를 생성할 수 있습니다. 이는 희귀 질환 검색 및 암 예후와 같이 자원이 제한된 임상 시나리오에서도 일반화 가능한 성능을 보여줍니다. 다양한 임상 작업에서 TITAN을 평가한 결과, 선형 프로빙, 소수 학습 및 제로샷 분류, 희귀암 검색, 교차 모달 검색, 병리 보고서 생성 등 다양한 머신러닝 설정에서 기존 ROI 및 슬라이드 파운데이션 모델을 능가하는 성능을 확인했습니다. 이 모델은 데이터가 부족한 시나리오, 예를 들어 희귀암 진단 및 생존 예측과 같은 경우에도 추가 미세 조정 없이 임상 작업을 수행하고 보고서를 생성할 수 있어, 환자 및 슬라이드 수준의 복잡한 임상 문제 해결에 크게 기여할 수 있습니다.

컴퓨터 과학발표 2025.08· 66최근 1년 66

웹 스케일 의료 데이터 활용 방사선과 범용 모델

본 연구는 방사선과 파운데이션 모델(RadFM) 개발의 가능성을 탐색한다. 이를 위해 데이터셋 구축, 모델 설계, 그리고 종합적인 평가의 세 가지 관점에서 접근했다. 연구팀은 1,300만 개의 2D 이미지와 61만 5천 개의 3D 스캔을 포함하는 4개의 멀티모달 데이터셋을 구축했으며, 기존 데이터셋과 통합하여 대규모 학습 데이터셋인 MedMD를 완성했다. 또한, 텍스트 입력과 2D 또는 3D 의료 스캔을 통합하여 진단, 시각 질의응답, 보고서 생성, 근거 기반 진단 등 다양한 방사선과 작업을 수행할 수 있는 새로운 모델 아키텍처를 제안한다. 기존 9개 데이터셋 외에 파운데이션 모델 평가를 위한 새로운 벤치마크인 RadBench를 제안하고, 자동 및 인간 평가를 수행했다. RadFM은 GPT-4V를 포함한 기존 멀티모달 파운데이션 모델을 능가하는 성능을 보였으며, 다양한 공개 벤치마크에서도 기존 SOTA(State-Of-The-Art) 기록을 경신했다. 이 연구는 텍스트와 2D/3D 의료 스캔을 통합하여 다양한 방사선과 작업을 수행하는 파운데이션 모델, 대규모 멀티모달 데이터셋, 그리고 포괄적인 벤치마크를 제시함으로써 범용 의료 파운데이션 모델 개발의 중요한 진전을 이뤘다.

컴퓨터 과학발표 2025.08· 23최근 1년 23

3D 의료 영상용 시각-언어 모델

최근 인공지능, 특히 시각-언어 파운데이션 모델(VLFMs)의 발전은 복잡한 3D 의료 영상 데이터로부터 방사선 보고서 생성을 자동화할 가능성을 보여줍니다. 본 연구는 VLFMs에 대한 23개 연구를 분석하여 모델 아키텍처, 기능, 훈련 데이터셋 및 평가 지표에 중점을 두었습니다. 연구 방법론은 VLFMs 관련 문헌을 체계적으로 검토하고, 각 연구의 핵심 요소를 비교 분석하는 방식으로 진행되었습니다. 이를 통해 방사선학 분야에서 AI의 진화 과정을 추적하고, 현재 기술 수준과 한계를 파악했습니다. 분석 결과, 일관되고 고품질의 보고서 생성에는 여전히 어려움이 있으며, 이를 극복하기 위해 다양하고 포괄적인 데이터셋과 표준화된 평가 지표의 필요성이 강조되었습니다. 현재 VLFMs는 초기 단계에 있으며, 실제 임상 적용을 위해서는 추가적인 개선이 요구됩니다. 본 연구는 방사선학 분야에서 VLFMs의 현재 상태를 종합적으로 이해하고, 향후 연구 방향을 제시하는 데 기여합니다. 이는 의료 영상 분석의 자동화 및 효율성 증진에 중요한 토대가 될 것입니다.

컴퓨터 과학발표 2025.06· 41최근 1년 41

의료 영상 비전-언어 파운데이션 모델

대규모 언어 모델과 비전-언어 모델(VLM)을 포함한 파운데이션 모델은 효율적이고 확장 가능하며 다중 모드 학습을 통해 인공지능 분야에 혁신을 가져왔습니다. 이러한 모델은 자기 지도 및 준 지도 학습의 발전을 활용하여 컴퓨터 비전과 자연어 처리를 통합함으로써 질병 분류, 분할, 교차 모드 검색, 자동 보고서 생성과 같은 복잡한 작업을 해결합니다. 의료 분야에서 파운데이션 모델은 다양한 의료 영상 모달리티 정보와 방사선 보고서 및 임상 기록의 텍스트 데이터를 결합하여 중요한 문제를 해결합니다. 이러한 통합은 진단 워크플로우를 간소화하고 정확도를 높이며 견고한 의사 결정을 가능하게 하는 도구 개발로 이어졌습니다. 본 리뷰는 2022년부터 2024년까지 의료 VLM의 최신 발전을 체계적으로 검토하며, 의료 영상 분야의 모달리티별 접근 방식과 맞춤형 응용에 중점을 둡니다. 주요 기여는 기존 모델을 분류하기 위한 구조화된 분류 체계, 훈련 및 평가에 필수적인 데이터셋에 대한 심층 분석, 그리고 실제 응용 사례 검토를 포함합니다. 이 연구는 또한 현재 진행 중인 과제를 다루고 의료 분야에서 파운데이션 모델의 접근성과 영향력을 높이기 위한 미래 방향을 제시합니다.

연구 트렌드로 돌아가기