Bolmo 7B обходит BLT 7B на 16,5% в STEM, используя менее 1% бюджета предобучения

Retrofitting language models to operate over bytes

Исследователи предлагают метод «байтификации»: существующую LLM с субсловной токенизацией дообучают на байтовом уровне, затрачивая менее 1% типичного бюджета предобучения (49,1 млрд токенов). Полученные модели Bolmo 7B и 1B, Bwen 8B и Blama 8B достигают производительности, близкой к исходным субсловным моделям, и значительно превосходят предыдущие байтовые LLM. Например, Bolmo 7B показывает абсолютный прирост +16,5% на задачах STEM по сравнению с BLT 7B, обученной с нуля. Архитектура использует латентную токенизацию: байты агрегируются в патчи, обрабатываются трансформером и распаковываются обратно в байты.

Мы дообучили существующую субсловную LLM до байтового уровня, используя менее 1% типичного бюджета предобучения (49,1 млрд токенов).

Ещё за этот день

2026-10-11