Los modelos de lenguaje aprenden a operar directamente sobre bytes

Retrofitting language models to operate over bytes

Un nuevo método llamado byteification convierte LLMs basados en subword tokens en modelos que procesan bytes UTF-8, usando menos del 1% del presupuesto típico de preentrenamiento. A partir de Olmo 3, Qwen3 y Llama 3, los modelos resultantes (Bolmo, Bwen, Blama) superan a los byte-level LLMs anteriores y alcanzan un rendimiento cercano al de los modelos originales, con mejoras notables en tareas STEM y comprensión de caracteres.

La byteificación establece una conexión entre los LLMs existentes a nivel de subword y los LLMs a nivel de byte.

Más de este día

2026-10-11