GigaToken:让分词速度提升1000倍

GigaToken: ~1000x faster Language model tokenization

GigaToken:让分词速度提升1000倍

GigaToken 是一款全新的语言模型分词工具,声称比 HuggingFace 的 tokenizer 快约 1000 倍,处理速度可达 GB/s 级别。它支持广泛的 CPU 硬件和主流分词器,既提供与 HuggingFace Tokenizers 及 Tiktoken 兼容的模式,也提供性能极致的原生 API。通过深度优化 SIMD 指令、缓存策略并最小化 Python 交互开销,GigaToken 在 AMD EPYC 和 Apple M4 Max 等平台上均展现出惊人的吞吐量。这意味着像 Common Crawl 这样包含 130 万亿 token 的巨型数据集,在高性能服务器上仅需不到 6.5 小时即可完成分词,为大规模语言模型训练带来了革命性的效率提升。

在 EPYC CPU 的测试速率下,你可以在不到 6.5 小时内完成整个 Common Crawl 数据集的分词工作!

同日更多故事

2026-07-22