既存のLLMをわずか1%の予算でbyte化、文字理解で元モデルを凌駕
Retrofitting language models to operate over bytes
多くのLLMはsubword tokenizationに依存し、文字レベルの理解やコード・生物配列の処理に弱点を抱える。本研究は、既存のsubwordモデルをbyteレベルに改造する「byteification」を提案。通常の事前学習予算の1%未満、49.1BトークンでOlmoやQwen、LlamaからBolmo 7B/1B、Bwen 8B、Blama 8Bを構築した。byte列をpatchに集約して処理するLTLMアーキテクチャにより、同規模の既存byteモデルを大きく上回り、文字理解では元のsubwordモデルさえ超える。
我々は、既存のsubwordレベルのLLMを、典型的な事前学習予算の1%未満(合計49.1Bトークン)でbyteレベルに改造した。
- armcat
token-free LLMについては膨大な研究がなされてきたのに、なぜか我々は依然としてtokenの領域で動いている。そこには何か理由があるのだろう。
Byte Latent Transformers (BLT): https://arxiv.org/abs/2412.09871
Charformer: https://arxiv.org/abs/2106.12672
- mrkn1
subword tokenizerはそもそもcausalじゃなかったのか、つまりBPEはずっと未来のbyteを覗き見していたのか!TIL
- serioussecurity
わあ、natureは出し抜かれたか。もっと自分の専門分野に近いところに留まっておくべきだったな。彼らはすでに、引き受けていた多くの応用AIの仕事に振り回されていたんだから。