Caramel LabCaramel Lab

2026년 32주차 · 급상승 연구 주제

생성적 적대 신경망 및 이미지 합성

컴퓨터 과학 · Generative Adversarial Networks and Image Synthesis

238%

1,1303,817
분야 평균 대비 +209%p

왜 지금 뜨나

사실적인 이미지 생성 기술이 발전하며 예술, 디자인, 가상현실 등 다양한 분야에서 활용 가능성이 커지고 있습니다. 실제와 구별하기 어려운 고품질 이미지 생성에 대한 수요가 높습니다.

출판량은 OpenAlex 전수 데이터를 최근 12개월과 직전 12개월로 나눠 비교한 값이에요. 분야 전체가 함께 커지는 착시를 빼기 위해 분야 중앙값 성장률을 차감한 초과 성장(+209%p)으로 순위를 매겼어요.

이 주제로 잡을 수 있는 연구 방향

학부·석사 수준에서 실제로 착수 가능한 스케일로 좁힌 방향이에요. 마음에 드는 걸 고르면 카라멜 조교가 이어서 구체화해 줘요.

이 주제 전체로 아이디에이션 시작

이 주제의 대표 논문

인용 속도와 최신성으로 고른 논문이에요. 한국어 요약을 먼저 보고, 원문은 8개 섹션 풀 분석으로 이어갈 수 있어요.

1

심층 오토인코더 신경망: 종합 분석

Deep Autoencoder Neural Networks: A Comprehensive Review and New Perspectives

오토인코더는 딥러닝의 핵심 기술로 자리매김하며 이미지 처리, 이상 탐지, 생성 모델링 등 다양한 분야에서 표현 학습 능력을 크게 향상시켰습니다. 본 논문은 오토인코더의 초기 개념부터 적대적 오토인코더, 컨볼루션 오토인코더, 변이형 오토인코더와 같은 고급 구현에 이르기까지 그 아키텍처를 포괄적으로 검토합니다. 각 오토인코더의 작동 메커니즘, 수학적 토대, 일반적인 응용 분야 및 생성 모델링에서의 역할을 심층적으로 분석합니다. 이를 통해 기존 지식을 통합하고 최신 발전 동향을 제시합니다. 본 연구는 현대 머신러닝 과제를 해결하는 데…

2025·71 인용

2

AI 생성 예술과 딥러닝: 발전과 전망

From Paintbrush to Pixel: A Review of Deep Neural Networks in AI-Generated Art

본 논문은 인공지능(AI) 생성 예술 분야에서 활용되는 다양한 딥러닝 신경망 아키텍처와 모델을 탐구한다. 고전적인 컨볼루션 네트워크부터 최신 확산 모델에 이르기까지, 이 분야의 주요 기술들을 심층적으로 분석한다. 각 신경망의 일반적인 구조와 작동 원리를 설명하고, DeepDream의 몽환적인 이미지부터 Stable Diffusion 및 DALL-E 3와 같은 최신 모델이 생성하는 매혹적인 이미지에 이르기까지 AI 생성 예술의 주요 발전 사례들을 제시한다. 또한, 이 모델들의 강점과 한계를 비교 분석하여 딥러닝 신경망이 단기간에 …

2026·32 인용

3

확산 모델 기반 이미지 생성 연구 동향

Comprehensive exploration of diffusion models in image generation: a survey

딥러닝 기술의 급속한 발전과 함께 확산 모델은 이미지, 오디오, 비디오 합성, 분자 설계, 텍스트 생성 등 다양한 분야에서 유망한 생성 모델로 부상했습니다. 독특한 생성 메커니즘과 뛰어난 품질 덕분에 여러 분야에서 가치 있는 도구로 활용되고 있습니다. 그러나 이미지 생성 분야에서 확산 모델의 광범위한 배포는 데이터 프라이버시, 보안, 예술 윤리와 같은 사회적 문제들을 야기하고 있습니다. 기존 연구들은 최신 확산 모델 기반 이미지 합성 기술과 잠재적 사회적 함의를 충분히 다루지 못하는 한계가 있습니다. 본 논문은 확산 모델의 배경…

2025·49 인용

4

확산 모델 기반 이미지 증강 기술 동향

Advances in diffusion models for image data augmentation: a review of methods, models, evaluation metrics and future research directions

이미지 데이터 증강은 컴퓨터 비전 분야에서 훈련 데이터셋의 다양성과 품질을 높여 머신러닝 모델의 성능과 견고성을 향상시키는 핵심 방법론입니다. 이는 또한 이미지의 맥락과 의미를 고려한 편집 및 수정에도 활용될 수 있습니다. 최근 생성형 인공지능 분야에서 가장 유망한 확산 모델(DMs)은 사실적이고 다양한 이미지를 생성하며 이미지 데이터 증강을 위한 강력한 도구로 부상했습니다. 본 연구는 이미지 증강을 위한 확산 모델 기반 접근 방식을 체계적이고 심층적으로 검토합니다. 먼저 확산 모델의 기본 원리, 모델 아키텍처 및 훈련 전략을 포…

2025·48 인용

5

딥페이크 생성 및 탐지 기술 현황 분석

Deepfake Generation and Detection: A Benchmark and Survey

딥페이크 기술은 사실적인 얼굴 이미지 및 비디오 합성을 목표로 하며, 엔터테인먼트, 영화 제작, 디지털 휴먼 모델링 등 광범위한 응용 잠재력을 지닌다. 최근 확산 모델의 등장으로 생성 품질이 크게 향상되며 연구의 새로운 물결을 일으켰다. 그러나 딥페이크의 오용 가능성(프라이버시 침해, 피싱 공격 등)에 대응하기 위해 탐지 기술 또한 지속적으로 발전하고 있다. 본 연구는 딥페이크 생성 및 탐지 분야의 최신 발전을 종합적으로 검토한다. 먼저, 태스크 정의를 통일하고, 데이터셋 및 평가 지표를 포괄적으로 소개하며, 기반 기술을 요약한다…

2026·15 인용

6

로봇 조작을 위한 확산 모델 연구

Diffusion models for robotic manipulation: a survey

확산 생성 모델은 이미지 및 비디오 생성과 같은 시각 영역에서 뛰어난 성능을 보였으며, 최근 로봇 조작 분야에서도 유망한 접근 방식으로 부상하고 있습니다. 이 모델들은 확률론적 프레임워크를 기반으로 다중 모드 분포를 모델링하고 고차원 입출력 공간에 대한 견고성을 제공합니다. 본 연구는 로봇 조작 분야의 최신 확산 모델을 종합적으로 검토합니다. 특히 파지 학습, 궤적 계획, 데이터 증강 등 다양한 응용 사례를 다룹니다. 장면 및 이미지 증강을 위한 확산 모델은 로봇 공학과 컴퓨터 비전의 교차점에 위치하며, 비전 기반 작업의 일반화 …

2025·23 인용

7

AI 음성 복제물 탐지 능력 부족

People are poorly equipped to detect AI-powered voice clones

생성형 인공지능(AI)의 급격한 발전은 텍스트, 오디오, 이미지, 비디오 등 다양한 형태의 콘텐츠가 인간이 생성한 콘텐츠를 모방하는 능력을 지속적으로 향상시키고 있습니다. 특히 음성 분야에서 AI 기술은 실제 사람의 목소리와 구별하기 어려울 정도로 정교해지고 있으며, 이는 사회적, 윤리적 문제를 야기할 수 있습니다. 본 연구는 일련의 지각 연구를 통해 AI 생성 음성의 사실성, 특히 신원 일치 및 자연스러움 측면을 평가했습니다. 참가자들에게 실제 음성과 AI 생성 음성을 들려주고, 두 음성의 동일성 여부와 AI 생성 여부를 판단하…

2025·41 인용

8

생성형 AI 심층 분석: 최신 동향 및 응용

Generative AI in depth: A survey of recent advances, model variants, and real-world applications

최근 딥러닝 기반 생성 모델, 특히 GAN, VAE, 확산 모델(DM)은 이미지 및 비디오 합성 등 다양한 분야에서 고품질 콘텐츠 생성에 핵심적인 역할을 하고 있습니다. 이러한 모델의 급속한 발전과 연구량 증가, 응용 분야 확장, 그리고 미해결 기술 과제로 인해 최신 동향을 파악하기가 점점 어려워지고 있습니다. 본 조사는 이러한 필요성을 해결하고자 합니다. 이 연구는 GAN, VAE, DM의 발전 과정을 이해하기 위한 포괄적인 분류 체계를 제시합니다. 다양한 변형 모델과 결합 접근 방식을 포함하여, 생성 결과물의 품질, 다양성, …

2025·21 인용

9

다중 데이터 양식 AI 생성 콘텐츠 연구

AI-Generated Content (AIGC) for Various Data Modalities: A Survey

AI 생성 콘텐츠(AIGC)는 AI 알고리즘을 활용하여 텍스트, 이미지, 비디오, 3D 에셋 등 다양한 미디어를 생성하는 기술입니다. 최근 머신러닝(ML) 및 딥러닝(DL) 분야의 발전과 광범위한 응용 가능성으로 인해 AIGC는 상당한 주목을 받고 있으며, 본 연구는 ML/DL 기반 AIGC의 발전을 종합적으로 검토합니다. AIGC 방법론은 이미지, 비디오, 텍스트, 3D 형상, 3D 장면, 3D 휴먼 아바타, 3D 모션, 오디오 등 다양한 데이터 양식에 맞춰 개발되었으며, 각 양식은 고유한 특성과 도전 과제를 제시합니다. 또한,…

2025·39 인용

10

LLM 기반 운전 영상 생성 월드 모델

DriveDreamer-2: LLM-Enhanced World Models for Diverse Driving Video Generation

자율주행 분야에서 월드 모델은 다중 시점 운전 영상 생성에 탁월한 성능을 보였으나, 맞춤형 영상 생성에는 한계가 있었습니다. 본 연구는 사용자 정의 운전 영상 생성을 위해 대규모 언어 모델(LLM)을 통합한 DriveDreamer-2를 제안합니다. DriveDreamer-2는 사용자 설명에 부합하는 궤적을 생성하는 궤적 생성 함수 라이브러리를 개발하고, 궤적에서 도로 구조를 학습하는 HDMap 생성기를 설계했습니다. 또한, 생성된 다중 시점 운전 영상의 시간적, 공간적 일관성을 강화하기 위해 통합 다중 시점 모델(UniMVM)을 …

2025·39 인용

11

멀티모달 딥페이크 탐지 강화

Enhancing multimodal deepfake detection with local–global feature integration and diffusion models

정교한 생성 기술로 오디오-시각 데이터 조작이 증가함에 따라 딥페이크 탐지는 중요한 과제가 되었습니다. 기존 방법은 주로 오디오-시각 특징을 이용한 립싱크 동기화에 초점을 맞추며, 컨볼루션 신경망(CNN)을 통한 지역 특징 추출에 의존합니다. 본 연구는 지역 및 전역 특징 통합을 통해 딥페이크 탐지를 강화하는 멀티모달 프레임워크를 제안합니다. 기존 파이프라인에 눈 움직임, 얼굴 영역 등 추가 시각 특징과 오디오 특징을 결합하여 교차 모달 의존성을 모델링합니다. CNN은 지역 특징을, 비전 트랜스포머(ViT)는 시각 및 오디오 양식…

2025·37 인용

12

대형 컨볼루션 커널 기반 범용 표현 학습

Scaling Up Your Kernels: Large Kernel Design in ConvNets Toward Universal Representations

본 논문은 현대 컨볼루션 신경망(ConvNets) 설계에서 대형 컨볼루션 커널 활용 패러다임을 제안한다. 여러 개의 작은 커널을 쌓는 대신 소수의 대형 커널을 사용하는 것이 더 우수한 설계 전략이 될 수 있음을 규명하였다. 우리는 대형 커널 ConvNets의 효율성과 성능을 최적화하는 아키텍처 설계 가이드라인을 제시한다. 특히, 대형 커널 ConvNets를 위해 고안된 체계적인 아키텍처 설계 원칙을 제공하는 UniRepLKNet 아키텍처를 제안한다. 이 아키텍처는 깊은 레이어 스태킹 없이도 광범위한 공간 정보를 포착하는 대형 커널…

2025·18 인용

13

VAE, GAN, 확산 모델 기반 과학 이미지 생성

Synthetic Scientific Image Generation with VAE, GAN, and Diffusion Model Architectures

생성형 AI는 과학 이미징 분야에 새로운 가능성을 제시하며 다양하고 복잡한 이미지 데이터를 합성하는 강력한 도구로 부상했습니다. 본 연구는 과학 이미지 합성을 목적으로 Variational Autoencoder (VAE), Generative Adversarial Network (GAN), Diffusion Model 등 주요 생성 모델 아키텍처를 포괄적으로 비교 분석합니다. 각 모델의 기본 원리, 최신 아키텍처 발전, 실제 적용 시 장단점을 검토했습니다. 암석 및 복합 섬유의 microCT 스캔, 식물 뿌리 고해상도 이미지 등 …

2025·24 인용

14

저데이터 의료 영상 분할 위한 생성 AI

Generative AI enables medical image segmentation in ultra low-data regimes

의료 영상의 의미론적 분할은 질병 진단 및 치료 계획 수립에 필수적입니다. 딥러닝은 이 작업을 효과적으로 자동화하지만, 주석이 달린 분할 마스크의 희소성으로 인해 초저데이터 환경에서는 어려움을 겪습니다. 본 연구는 이러한 문제를 해결하기 위해 고품질 영상-마스크 쌍을 보조 훈련 데이터로 생성하는 생성 딥러닝 프레임워크를 제안합니다. 기존 생성 모델이 데이터 생성과 모델 훈련을 분리하는 것과 달리, 본 프레임워크는 다단계 최적화를 통해 종단간 데이터 생성을 수행합니다. 이는 분할 성능이 생성 과정을 유도하여, 분할 결과 개선에 최적…

2025·22 인용

이번 주 트렌드 전체 보기