Caramel LabCaramel Lab
#

추론 능력

2의 한국어 분석 — 최신순으로 정렬했어요

컴퓨터 과학발표 2025.09· 119최근 1년 119

사고의 환상: 대규모 추론 모델의 한계

최근 대규모 언어 모델(LLM)은 답변 도출 전 상세한 사고 과정을 생성하는 대규모 추론 모델(LRM)을 도입하며 추론 벤치마크에서 성능 향상을 보였습니다. 그러나 이러한 모델의 근본적인 능력, 스케일링 특성, 그리고 한계는 아직 충분히 이해되지 않고 있습니다. 기존 평가는 주로 최종 답변의 정확성에 초점을 맞추며 데이터 오염 문제와 추론 과정의 구조 및 품질에 대한 통찰력 부족이라는 한계를 가집니다. 본 연구는 이러한 간극을 체계적으로 탐구하기 위해 제어 가능한 퍼즐 환경을 활용했습니다. 이 환경은 일관된 논리 구조를 유지하면서 복잡성을 정밀하게 조작할 수 있게 하여, 최종 답변뿐만 아니라 내부 추론 과정까지 분석하여 LRM이 어떻게 ‘생각’하는지에 대한 통찰을 제공합니다. 다양한 퍼즐에 대한 광범위한 실험 결과, 최신 LRM은 특정 복잡성 수준을 넘어서면 정확도가 완전히 붕괴됨을 확인했습니다. 또한, 문제 복잡성이 증가함에 따라 추론 노력은 특정 지점까지 증가하다가 충분한 토큰 예산에도 불구하고 감소하는 직관에 반하는 스케일링 한계를 보였습니다. 표준 LLM과 LRM을 동일한 추론 연산량으로 비교한 결과, 세 가지 성능 구간이 식별되었습니다. 저복잡도 작업에서는 표준 모델이 LRM을 능가하고, 중복잡도 작업에서는 LRM의 추가적인 사고 과정이 이점을 보이며, 고복잡도 작업에서는 두 모델 모두 완전히 붕괴하는 양상을 보였습니다. LRM은 정확한 계산에 한계가 있으며, 명시적 알고리즘을 활용하지 못하고 퍼즐 전반에 걸쳐 일관성 없는 추론을 보였습니다. 본 연구는 추론 과정과 모델의 계산 행동을 심층적으로 분석하여 LRM의 강점과 한계를 밝혀냈습니다.

컴퓨터 과학발표 2025.09· 591최근 1년 590

강화 학습 기반 LLM 추론 능력 강화

인공지능 분야에서 일반 추론 능력은 오랜 난제였습니다. 최근 대규모 언어 모델(LLM)과 CoT(Chain-of-Thought) 프롬프팅 기법의 발전으로 기본적인 추론 작업에서 상당한 성과를 보였지만, 이는 방대한 양의 인간 주석 데이터에 크게 의존하며 복잡한 문제 해결에는 여전히 한계가 있었습니다. 본 연구는 인간이 직접 레이블링한 추론 궤적 없이 순수한 강화 학습(RL)만으로 LLM의 추론 능력을 효과적으로 향상시킬 수 있음을 보여줍니다. 제안된 RL 프레임워크는 자기 성찰, 검증, 동적 전략 적응과 같은 고급 추론 패턴의 자발적 발현을 촉진합니다. 그 결과, 훈련된 모델은 수학, 코딩 대회, STEM 분야와 같은 검증 가능한 작업에서 기존의 인간 주석 지도 학습 방식보다 우수한 성능을 달성했습니다. 또한, 이러한 대규모 모델에서 나타나는 추론 패턴은 소규모 모델의 추론 능력을 안내하고 향상시키는 데 체계적으로 활용될 수 있습니다.

연구 트렌드로 돌아가기