대규모 언어 모델(LLM)은 인공지능 응용 분야를 혁신했지만, 실제 시스템 통합 과정에서 프롬프트 주입 공격이라는 심각한 보안 취약점을 드러냈습니다. 본 연구는 2023년부터 2025년까지의 연구 45건, 산업 보안 보고서, 실제 공격 사례를 종합적으로 분석하여 이 문제를 다룹니다.
직접적인 탈옥(jailbreaking)과 외부 콘텐츠를 통한 간접 주입을 포함한 프롬프트 주입 기술의 분류 체계를 검토했습니다. AI 에이전트 시스템과 모델 컨텍스트 프로토콜(MCP)의 등장은 공격 표면을 크게 확장하여 도구 오염 및 자격 증명 탈취와 같은 새로운 취약점을 야기했습니다.
주요 사건으로는 GitHub Copilot의 CVE-2025-53773 원격 코드 실행 취약점(CVSS 9.6)과 ChatGPT의 Windows 라이선스 키 노출 사례를 기록했습니다. 연구 결과, 단 5개의 정교하게 제작된 문서만으로도 검색 증강 생성(RAG) 오염을 통해 AI 응답의 90%를 조작할 수 있음이 입증되었습니다.
본 연구는 5가지 보호 계층을 구현하는 심층 방어 프레임워크인 PALADIN을 제안하며, OWASP Top 10 for LLM Applications 2025를 기반으로 한 실행 가능한 완화 전략을 제시합니다. 프롬프트 주입은 단일 솔루션이 아닌 심층 방어 접근 방식이 필요한 근본적인 아키텍처 취약점임을 밝히고, 확률적 특성 문제 및 정렬 역설과 같은 근본적인 한계를 식별하며, 아키텍처적으로 안전한 AI 시스템을 위한 연구 방향을 제시합니다.
대규모 언어 모델(LLM)이 헬스케어 분야에 통합되고 있으나, 악의적인 프롬프트 주입 공격에 대한 체계적인 평가가 부족했습니다. 본 연구는 상용 LLM이 안전하지 않은 의료 조언을 유도할 수 있는 프롬프트 주입 공격에 얼마나 취약한지 평가하고, 중간자(man-in-the-middle) 및 클라이언트 측 주입이 현실적인 공격 벡터임을 검증하는 것을 목표로 합니다.
2025년 1월부터 10월까지 표준화된 환자-LLM 대화를 사용한 시뮬레이션 연구를 수행했습니다. GPT-4o-mini, Gemini-2.0-flash-lite, Claude-3-haiku 등 3가지 경량 모델을 보충제 추천, 아편유사제 처방, 임신 금기, 중추신경계 독성 등 4가지 범주의 12개 임상 시나리오에서 평가했습니다. 또한, GPT-5, Gemini 2.5 Pro, Claude 4.5 Sonnet 등 3가지 플래그십 모델을 고위험 임신 시나리오에서 클라이언트 측 주입 방식으로 테스트했습니다. 공격 전략으로는 맥락 인식 주입과 증거 조작 주입을 사용했습니다.
총 216회 평가(주입 108회, 대조군 108회) 중, 공격은 4번째 대화 턴에서 94.4%(108회 중 102회)의 성공률을 보였고, 후속 대화에서 69.4%(108회 중 75회) 지속되었습니다. 이는 LLM이 의료 조언 제공 시 심각한 보안 취약성을 가질 수 있음을 시사합니다.
본 연구는 의료 분야 LLM의 보안 취약성을 밝혀내고, 안전한 의료 AI 시스템 개발을 위한 중요한 기초 자료를 제공합니다. 향후 LLM 기반 의료 애플리케이션 설계 시 프롬프트 주입 방어 메커니즘을 강화하는 데 기여할 것입니다.