LLM이 5학년 수준 지식만 배우면 어떻게 될까?
What happens when an LLM never sees material beyond fifth grade?
LittleLearner는 88B 토큰의 커리큘럼 기반 데이터셋으로 훈련된 언어 모델 제품군으로, K-5 수준의 지식만 노출시켜 모델의 능력 한계를 연구합니다. 0.6B, 1.3B, 5B 규모의 모델을 처음부터 훈련시켰으며, 각각 필터링되지 않은 대조군과 비교했습니다. 실험 결과, 모델 확장, SFT+GRPO 후훈련, 문맥 내 학습 모두 커리큘럼 내 성능은 향상시키지만, 커리큘럼 밖의 능력은 개선하지 못했습니다. 이는 사전 훈련 데이터의 필터가 모델의 실질적인 능력 상한을 결정함을 시사합니다.
우리 실험에서 확장, SFT+GRPO 후훈련, 문맥 내 학습은 커리큘럼이 가르친 내용을 증폭시키지만, 그 어떤 것도 범위 밖 성능을 의미 있게 개선하지 못했으며, 이는 사전 훈련 필터가 유효 능력 상한을 설정함을 나타냅니다.