기존 언어 모델을 바이트 단위로 개조하는 '바이트화' 기법
Retrofitting language models to operate over bytes
서브워드 토큰화는 캐릭터 이해 부족, 영어 편중, 계산 비효율 등의 문제를 낳는다. 기존 바이트 수준 LLM은 처음부터 학습해야 해 실용화가 어려웠다. 연구진은 이미 학습된 서브워드 LLM을 전체 사전학습 예산의 1% 미만(491억 토큰)으로 바이트 수준으로 개조하는 '바이트화'를 제안한다. Olmo, Qwen, Llama를 개조한 Bolmo, Bwen, Blama는 동급 최고 성능을 내며, Bolmo 7B는 BLT 7B 대비 STEM 과제에서 16.5%p 향상됐다.
우리는 기존 서브워드 수준 LLM을 일반적인 사전학습 예산의 1% 미만(총 491억 토큰)을 사용해 바이트 수준으로 개조했다.