Caramel LabCaramel Lab

2026년 32주차 · 급상승 연구 주제

머신러닝의 적대적 강건성

컴퓨터 과학 · Adversarial Robustness in Machine Learning

172%

1,6914,600
분야 평균 대비 +143%p

왜 지금 뜨나

인공지능 모델이 미세한 교란에도 오작동할 수 있다는 점이 밝혀지면서, 자율주행, 의료 등 민감한 분야에서 AI 시스템의 신뢰성과 보안을 확보하는 것이 매우 중요해졌습니다.

출판량은 OpenAlex 전수 데이터를 최근 12개월과 직전 12개월로 나눠 비교한 값이에요. 분야 전체가 함께 커지는 착시를 빼기 위해 분야 중앙값 성장률을 차감한 초과 성장(+143%p)으로 순위를 매겼어요.

이 주제로 잡을 수 있는 연구 방향

학부·석사 수준에서 실제로 착수 가능한 스케일로 좁힌 방향이에요. 마음에 드는 걸 고르면 카라멜 조교가 이어서 구체화해 줘요.

이 주제 전체로 아이디에이션 시작

이 주제의 대표 논문

인용 속도와 최신성으로 고른 논문이에요. 한국어 요약을 먼저 보고, 원문은 8개 섹션 풀 분석으로 이어갈 수 있어요.

1

검증 벤치마킹 표준 제안

The Verification Benchmarking Standard (Verification Intelligence series, Paper 11 of 12)

현재 인공지능(AI) 벤치마크는 시스템의 생성 능력, 즉 추론, 코드 품질, 언어 유창성 등을 주로 측정한다. 그러나 기업이 AI 시스템을 배포할 때 직면하는 재작업률, 검증 비용, 잘못된 완료 빈도, 그리고 검증된 정확한 결과물을 산출하는 데 드는 총비용과 같은 실질적인 문제들은 제대로 반영하지 못하고 있다. 본 논문은 이러한 생성 능력과 배포 신뢰성 간의 격차를 포착하기 위한 새로운 벤치마킹 표준을 제안한다. 이 표준은 일곱 가지 핵심 검증 지표를 중심으로 구축되어, AI 시스템의 실제 운영 환경에서의 성능을 종합적으로 평가한…

2026·31 인용

2

거대 언어 모델 안전성 확보 방안

Safeguarding large language models: a survey

거대 언어 모델(LLM) 분야의 급속한 발전과 함께, 윤리적 사용을 보장하기 위한 강력한 안전 메커니즘, 즉 '안전장치' 또는 '가드레일' 개발의 중요성이 커지고 있습니다. 본 논문은 이 핵심 메커니즘의 현재 상태를 체계적으로 문헌 검토하고, 주요 과제와 다양한 맥락의 윤리적 문제를 다루는 포괄적인 메커니즘으로 발전시킬 방안을 논의합니다. 먼저, 주요 LLM 서비스 제공업체와 오픈소스 커뮤니티가 활용하는 안전장치 메커니즘의 현황을 설명합니다. 이어서 환각, 공정성, 프라이버시 등 가드레일이 강화해야 할 바람직하거나 바람직하지 않은…

2025·51 인용

3

심층학습 불확실성 정량화 기법 연구

A Survey on Uncertainty Quantification Methods for Deep Learning

심층 신경망(DNN)은 컴퓨터 비전, 자연어 처리 등 다양한 분야에서 탁월한 성능을 보이지만, 예측의 정확도와 무관하게 과신하는 경향이 있어 자율주행, 의료 진단 등 고위험 응용 분야에서 심각한 문제를 야기할 수 있습니다. 이러한 문제 해결을 위해 DNN 예측의 신뢰도를 평가하는 불확실성 정량화(UQ) 연구의 중요성이 커지고 있습니다. 기존 UQ 연구들은 주로 신경망 아키텍처나 베이지안 공식에 따라 방법론을 분류하여, 각 방법이 다루는 불확실성 원천을 간과함으로써 실제 적용 시 적절한 기법 선택에 어려움이 있었습니다. 본 연구는 …

2025·31 인용

4

딥러닝 모델 역공격 및 방어 연구

Deep learning model inversion attacks and defenses: a comprehensive survey

민감한 분야에 딥러닝이 빠르게 도입되면서 개인 데이터의 프라이버시와 무결성에 심각한 위협을 가하는 모델 역공격(MI) 취약점이 대두되고 있습니다. 생체 인식, 헬스케어, 금융 등 다양한 응용 분야에서 MI 공격이 증가함에 따라 그 메커니즘, 영향 및 방어 방법을 이해하는 것이 시급합니다. 본 연구는 MI 공격 및 방어 전략에 대한 체계적이고 심층적인 문헌 검토를 제공하여 기존 연구의 공백을 메우고자 합니다. MI 공격의 체계적인 분류법을 제시하고, 공격 기술과 방어 메커니즘에 대한 광범위한 조사를 수행합니다. 이를 통해 MI 공…

2025·43 인용

5

적대적 머신러닝: 위협과 방어 전략

Adversarial machine learning: a review of methods, tools, and critical industry sectors

인공지능(AI)의 급속한 발전은 이미지 인식, 자율주행 등 다양한 분야에서 고성능 모델을 탄생시켰습니다. 그러나 머신러닝(ML) 모델은 적대적 공격 및 데이터 오염에 취약하여 시스템 오작동 및 의사결정 오류를 초래할 수 있으며, 개인 데이터 사용으로 인한 프라이버시 침해 문제도 제기됩니다. 본 논문은 현대 AI 시스템의 적대적 머신러닝(AML) 환경을 견고성과 프라이버시라는 이중 관점에서 조망합니다. 연구는 포괄적인 분류 체계를 활용하여 적대적 공격 및 방어 기법을 탐구합니다. 이어서 견고성 벤치마크와 함께 ML 시스템 이해관계자…

2025·40 인용

6

의료 조언 LLM의 프롬프트 주입 취약성

Vulnerability of Large Language Models to Prompt Injection When Providing Medical Advice

대규모 언어 모델(LLM)이 헬스케어 분야에 통합되고 있으나, 악의적인 프롬프트 주입 공격에 대한 체계적인 평가가 부족했습니다. 본 연구는 상용 LLM이 안전하지 않은 의료 조언을 유도할 수 있는 프롬프트 주입 공격에 얼마나 취약한지 평가하고, 중간자(man-in-the-middle) 및 클라이언트 측 주입이 현실적인 공격 벡터임을 검증하는 것을 목표로 합니다. 2025년 1월부터 10월까지 표준화된 환자-LLM 대화를 사용한 시뮬레이션 연구를 수행했습니다. GPT-4o-mini, Gemini-2.0-flash-lite, Clau…

2025·21 인용

7

생성형 AI 기반 자율형 장애 복구 시스템

Autonomous Incident Remediation via GenAI-Assisted Runbooks

클라우드 인프라가 전 세계 디지털 운영의 핵심으로 자리 잡았지만, 복잡성 증가에 비해 신뢰성 엔지니어링은 뒤처져 있습니다. 관측 및 경고 시스템은 발전했으나, 장애 대응은 여전히 사람의 전문성에 크게 의존하여 탐지부터 자동 복구까지 상당한 격차가 발생하고, 이는 막대한 다운타임 비용과 운영 피로도로 이어집니다. 본 논문은 생성형 AI를 활용한 폐쇄 루프형 복구 프레임워크를 제안합니다. 이 프레임워크는 LLM 기반 진단, 정책 기반 실행, 안전성 검증 메커니즘을 통합하며, 지속적인 학습 피드백 주기를 통해 장애 해결의 진단, 실행,…

2025·20 인용

8

LLM 프롬프트 주입 공격 종합 분석

Prompt Injection Attacks in Large Language Models and AI Agent Systems: A Comprehensive Review of Vulnerabilities, Attack Vectors, and Defense Mechanisms

대규모 언어 모델(LLM)은 인공지능 응용 분야를 혁신했지만, 실제 시스템 통합 과정에서 프롬프트 주입 공격이라는 심각한 보안 취약점을 드러냈습니다. 본 연구는 2023년부터 2025년까지의 연구 45건, 산업 보안 보고서, 실제 공격 사례를 종합적으로 분석하여 이 문제를 다룹니다. 직접적인 탈옥(jailbreaking)과 외부 콘텐츠를 통한 간접 주입을 포함한 프롬프트 주입 기술의 분류 체계를 검토했습니다. AI 에이전트 시스템과 모델 컨텍스트 프로토콜(MCP)의 등장은 공격 표면을 크게 확장하여 도구 오염 및 자격 증명 탈취와…

2026·20 인용

9

C++17 기반 STA 제어 시뮬레이션

C++17 Staged Toy Simulation for STA Pre-Commitment Controllability

본 연구는 STA(Signal-Time-Authority) 시리즈의 두 번째 논문으로, 이전 논문에서 제시된 STA 사전 약정 제어 가능성 프레임워크를 C++17 기반의 합성 토이 시뮬레이션을 통해 검증합니다. 이 시뮬레이션은 제어 프레임워크의 실현 가능성과 효과를 탐색하기 위해 설계되었습니다. 연구는 Stage 1부터 Stage 8까지의 광범위한 결과를 통합합니다. 여기에는 반증(falsification), 구성 요소 제거(component ablation), 수정된 제거, 경계 민감도 분석, 인간 지연 시간 임계값, 안전 여유…

2026·10 인용

이번 주 트렌드 전체 보기