1.7B 모델로 직접 만드는 의사결정 모델, 캘리브레이션이 관건
Build your own decision model
LLM의 출력 토큰을 제한해 단일 패스로 선택지를 고르는 의사결정 모델을 직접 구현하는 방법을 소개한다. Qwen3-1.7B로 CommonsenseQA에서 59.4% 정확도를 달성하고, 파인튜닝으로 62.4%까지 끌어올렸다. 하지만 모델은 0.9 이상의 확신을 보일 때 실제 정확도는 70%에 그치는 과신 문제를 드러냈다. 온도 스케일링으로 캘리브레이션을 적용해 기대 캘리브레이션 오차를 20.1%에서 2.9%로 낮추는 과정을 설명한다.
모델은 0.9~1.0 구간에서 극도로 과신하는 경향이 있지만, 실제로는 70%만 정답이다.