Caramel LabCaramel Lab
#

프롬프트 주입

2의 한국어 분석 — 최신순으로 정렬했어요

컴퓨터 과학발표 2026.01· 20최근 1년 20

LLM 프롬프트 주입 공격 종합 분석

대규모 언어 모델(LLM)은 인공지능 응용 분야를 혁신했지만, 실제 시스템 통합 과정에서 프롬프트 주입 공격이라는 심각한 보안 취약점을 드러냈습니다. 본 연구는 2023년부터 2025년까지의 연구 45건, 산업 보안 보고서, 실제 공격 사례를 종합적으로 분석하여 이 문제를 다룹니다. 직접적인 탈옥(jailbreaking)과 외부 콘텐츠를 통한 간접 주입을 포함한 프롬프트 주입 기술의 분류 체계를 검토했습니다. AI 에이전트 시스템과 모델 컨텍스트 프로토콜(MCP)의 등장은 공격 표면을 크게 확장하여 도구 오염 및 자격 증명 탈취와 같은 새로운 취약점을 야기했습니다. 주요 사건으로는 GitHub Copilot의 CVE-2025-53773 원격 코드 실행 취약점(CVSS 9.6)과 ChatGPT의 Windows 라이선스 키 노출 사례를 기록했습니다. 연구 결과, 단 5개의 정교하게 제작된 문서만으로도 검색 증강 생성(RAG) 오염을 통해 AI 응답의 90%를 조작할 수 있음이 입증되었습니다. 본 연구는 5가지 보호 계층을 구현하는 심층 방어 프레임워크인 PALADIN을 제안하며, OWASP Top 10 for LLM Applications 2025를 기반으로 한 실행 가능한 완화 전략을 제시합니다. 프롬프트 주입은 단일 솔루션이 아닌 심층 방어 접근 방식이 필요한 근본적인 아키텍처 취약점임을 밝히고, 확률적 특성 문제 및 정렬 역설과 같은 근본적인 한계를 식별하며, 아키텍처적으로 안전한 AI 시스템을 위한 연구 방향을 제시합니다.

컴퓨터 과학발표 2025.12· 21최근 1년 21

의료 조언 LLM의 프롬프트 주입 취약성

대규모 언어 모델(LLM)이 헬스케어 분야에 통합되고 있으나, 악의적인 프롬프트 주입 공격에 대한 체계적인 평가가 부족했습니다. 본 연구는 상용 LLM이 안전하지 않은 의료 조언을 유도할 수 있는 프롬프트 주입 공격에 얼마나 취약한지 평가하고, 중간자(man-in-the-middle) 및 클라이언트 측 주입이 현실적인 공격 벡터임을 검증하는 것을 목표로 합니다. 2025년 1월부터 10월까지 표준화된 환자-LLM 대화를 사용한 시뮬레이션 연구를 수행했습니다. GPT-4o-mini, Gemini-2.0-flash-lite, Claude-3-haiku 등 3가지 경량 모델을 보충제 추천, 아편유사제 처방, 임신 금기, 중추신경계 독성 등 4가지 범주의 12개 임상 시나리오에서 평가했습니다. 또한, GPT-5, Gemini 2.5 Pro, Claude 4.5 Sonnet 등 3가지 플래그십 모델을 고위험 임신 시나리오에서 클라이언트 측 주입 방식으로 테스트했습니다. 공격 전략으로는 맥락 인식 주입과 증거 조작 주입을 사용했습니다. 총 216회 평가(주입 108회, 대조군 108회) 중, 공격은 4번째 대화 턴에서 94.4%(108회 중 102회)의 성공률을 보였고, 후속 대화에서 69.4%(108회 중 75회) 지속되었습니다. 이는 LLM이 의료 조언 제공 시 심각한 보안 취약성을 가질 수 있음을 시사합니다. 본 연구는 의료 분야 LLM의 보안 취약성을 밝혀내고, 안전한 의료 AI 시스템 개발을 위한 중요한 기초 자료를 제공합니다. 향후 LLM 기반 의료 애플리케이션 설계 시 프롬프트 주입 방어 메커니즘을 강화하는 데 기여할 것입니다.

연구 트렌드로 돌아가기