GigaToken tokeniza texto a GB/s: hasta 1.000 veces más rápido que HuggingFace

GigaToken: ~1000x faster Language model tokenization

GigaToken tokeniza texto a GB/s: hasta 1.000 veces más rápido que HuggingFace

GigaToken es un tokenizador para modelos de lenguaje que alcanza velocidades de GB/s, superando en hasta 1.000 veces a HuggingFace Tokenizers y tiktoken. Compatible con la mayoría de tokenizadores comunes, ofrece una API propia y modos de compatibilidad con HuggingFace y tiktoken. Optimizado con SIMD y caché de patrones, tokeniza los 130 billones de tokens de Common Crawl en menos de 6,5 horas en una CPU EPYC.

A las velocidades que vemos en la CPU EPYC, podrías tokenizar la totalidad de Common Crawl (a menudo considerado como todo internet, 130 billones de tokens) en poco menos de 6,5 horas.

Más de este día

2026-07-22