거대 언어 모델(LLM) 분야의 급속한 발전과 함께, 윤리적 사용을 보장하기 위한 강력한 안전 메커니즘, 즉 '안전장치' 또는 '가드레일' 개발의 중요성이 커지고 있습니다. 본 논문은 이 핵심 메커니즘의 현재 상태를 체계적으로 문헌 검토하고, 주요 과제와 다양한 맥락의 윤리적 문제를 다루는 포괄적인 메커니즘으로 발전시킬 방안을 논의합니다.
먼저, 주요 LLM 서비스 제공업체와 오픈소스 커뮤니티가 활용하는 안전장치 메커니즘의 현황을 설명합니다. 이어서 환각, 공정성, 프라이버시 등 가드레일이 강화해야 할 바람직하거나 바람직하지 않은 속성을 평가, 분석 및 개선하는 기술을 다룹니다. 이를 바탕으로 이러한 통제를 우회하는 기술(공격), 공격을 방어하는 기술, 그리고 가드레일을 강화하는 기술을 검토합니다.
위에서 언급된 기술들은 현재의 연구 동향을 반영하지만, 기존 방법으로는 쉽게 해결하기 어려운 여러 과제 또한 존재합니다. 본 논문은 다학제적 접근, 신경-상징적 방법, 시스템 개발 수명 주기를 종합적으로 고려하여 포괄적인 가드레일을 구현하기 위한 비전을 제시합니다.
거대 언어 모델(LLM)의 환각 현상, 즉 유창하지만 사실과 다르거나 논리적으로 모순된 출력은 교육, 헬스케어, 법률, 과학 연구 등 다양한 분야에서 LLM 활용이 증가함에 따라 중요한 문제로 부상하고 있습니다. 본 연구는 LLM 환각 현상의 원인을 체계적으로 조사하고 분석합니다. 특히 환각이 프롬프트 전략의 미흡에서 비롯된 것인지, 아니면 모델 자체의 내재적 행동에서 기인하는 것인지를 판별하는 새로운 프레임워크를 제시합니다.
연구는 GPT-4, LLaMA 2, DeepSeek 등 최신 LLM들을 대상으로 다양한 통제된 프롬프트 조건 하에 TruthfulQA, HallucinationEval 같은 표준 벤치마크를 사용하여 사실성을 평가했습니다. 제안된 프레임워크는 프롬프트 민감도(PS)와 모델 가변성(MV) 지표를 정의하여, 프롬프트와 모델 내부 요인이 환각에 기여하는 정도를 정량화합니다.
광범위한 실험과 비교 분석을 통해 모델별 환각 발생, 심각성, 완화 방식에서 뚜렷한 패턴을 확인했습니다. 특히 CoT(Chain-of-Thought)와 같은 구조화된 프롬프트 전략은 프롬프트 민감도가 높은 시나리오에서 환각을 크게 줄이는 효과를 보였으나, 일부 경우에서는 모델의 본질적인 한계가 여전히 작용했습니다.
이러한 결과는 LLM의 신뢰성에 대한 이해를 심화하고, 프롬프트 엔지니어, 모델 개발자, AI 실무자에게 실질적인 통찰을 제공합니다. 또한 프롬프트 설계 및 모델 개발 파이프라인에서 환각을 줄이기 위한 모범 사례와 향후 연구 방향을 제시합니다.