Bolmo 7B schlägt BLT 7B um 16,5 % in STEM – durch Byteification eines Subwort-Modells
Retrofitting language models to operate over bytes
Sprachmodelle arbeiten mit Subwort-Tokens, was zu Problemen bei Zeichenverständnis, wissenschaftlichen Daten und Mehrsprachigkeit führt. Byte-Level-Modelle trainieren meist von Grund auf und bleiben daher hinter der Subwort-Leistung zurück. Die neue Methode „Byteification“ wandelt ein bestehendes Subwort-LLM mit weniger als 1 % des üblichen Pretraining-Budgets in ein Byte-Modell um. Die so erzeugten Modelle Bolmo 7B, Bolmo 1B, Bwen 8B und Blama 8B übertreffen frühere Byte-Modelle deutlich und erreichen nahezu die Leistung ihrer Subwort-Quellmodelle.
Wir haben ein bestehendes Subwort-LLM mit weniger als 1 % eines typischen Pretraining-Budgets auf die Byte-Ebene umgerüstet.