GigaToken: 언어 모델 토크나이제이션을 최대 1000배 빠르게
GigaToken: ~1000x faster Language model tokenization
GigaToken은 HuggingFace Tokenizers 및 tiktoken의 드롭인 대체재로, 언어 모델 토크나이제이션을 GB/s 속도로 처리합니다. SIMD 및 사전 토크나이제이션 캐싱 최적화를 통해 GPT-2, Llama 3, Qwen 3 등 다양한 토크나이저에서 수백 배에서 수천 배의 속도 향상을 달성합니다. AMD EPYC 9565에서는 24.5 GB/s, Apple M4 Max에서는 8.8 GB/s의 처리량을 보여줍니다. Python API 및 HuggingFace/tiktoken 호환 모드를 제공합니다.
EPYC CPU에서 관찰된 속도라면, 종종 인터넷 전체로 여겨지는 Common Crawl 전체(130조 토큰)를 단 6.5시간 만에 토크나이즈할 수 있습니다.