LLM 추론 모델의 '추론 노력'을 제어하는 방법

Controlling Reasoning Effort in LLMs

LLM 추론 모델의 '추론 노력'을 제어하는 방법

OpenAI의 o1 출시 이후 LLM 기반 추론 모델이 표준이 되었습니다. 이 글에서는 RLVR(verifiable rewards를 사용한 강화 학습)로 추론 모델을 훈련하는 방법과 추론 성능을 높이는 두 가지 방법(훈련 스케일링 및 추론 스케일링)을 설명합니다. 특히 <think> 토큰의 역할과 Qwen3의 thinking 모드 전환, 그리고 GPT-5.6과 같은 모델에서 여러 추론 노력 수준을 구현하는 방법을 자세히 다룹니다.

추론 모델이 실수를 인지하고 스스로 수정하는 순간을 '아하' 순간이라고 합니다.