GigaToken tokenisiert Sprachmodelle bis zu 1000x schneller

GigaToken: ~1000x faster Language model tokenization

GigaToken tokenisiert Sprachmodelle bis zu 1000x schneller

GigaToken ist ein Open-Source-Tokenizer, der die Tokenisierung von Sprachmodellen drastisch beschleunigt – bis zu 1000x schneller als HuggingFace Tokenizers und tiktoken. Er unterstützt gängige Tokenizer wie GPT-2, Llama und Qwen und lässt sich als Drop-in-Ersatz in bestehende Pipelines integrieren. Die Leistung wird durch SIMD-Optimierung, Caching und minimierte Python-Interaktion erreicht. Auf einem AMD EPYC können so 130 Billionen Tokens von Common Crawl in unter 6,5 Stunden verarbeitet werden.

At the rates we see on the EPYC CPU, you could tokenize the entirety of Common Crawl (often considered to be the entire internet, 130 trillion tokens) in just under 6.5 hours!

Mehr von diesem Tag

2026-07-22