Bolmo 7B обходит BLT 7B на 16,5% в STEM, используя менее 1% бюджета предобучения
Retrofitting language models to operate over bytes
Исследователи предлагают метод «байтификации»: существующую LLM с субсловной токенизацией дообучают на байтовом уровне, затрачивая менее 1% типичного бюджета предобучения (49,1 млрд токенов). Полученные модели Bolmo 7B и 1B, Bwen 8B и Blama 8B достигают производительности, близкой к исходным субсловным моделям, и значительно превосходят предыдущие байтовые LLM. Например, Bolmo 7B показывает абсолютный прирост +16,5% на задачах STEM по сравнению с BLT 7B, обученной с нуля. Архитектура использует латентную токенизацию: байты агрегируются в патчи, обрабатываются трансформером и распаковываются обратно в байты.
Мы дообучили существующую субсловную LLM до байтового уровня, используя менее 1% типичного бюджета предобучения (49,1 млрд токенов).