字节化大模型:LLM 的新进化路径
Retrofitting language models to operate over bytes
当前主流的大语言模型(LLM)依赖子词分词(subword tokenization),这限制了它们在字符级理解、代码及生物序列等科学数据上的表现,并导致对英语的隐性偏好。研究团队提出了一种名为“字节化”(byteification)的创新方法,无需从头训练,仅需不到1%的预训练预算,即可将现有的子词级LLM(如Olmo 3、Qwen3、Llama 3)改造为基于字节的模型。通过构建潜在的LTLM架构,新模型Bolmo 7B在STEM任务上比传统字节模型BLT 7B提升了16.5%,并在字符理解和特定编程场景中超越了对应的源模型。这一低成本路径为开发高性能字节级LLM提供了关键方向。
我们相信,字节化通过无需大量投资即可创建最先进的字节级大语言模型,提供了一个关键的研究方向。