既存のLLMをわずか1%の予算でbyte化、文字理解で元モデルを凌駕

Retrofitting language models to operate over bytes

多くのLLMはsubword tokenizationに依存し、文字レベルの理解やコード・生物配列の処理に弱点を抱える。本研究は、既存のsubwordモデルをbyteレベルに改造する「byteification」を提案。通常の事前学習予算の1%未満、49.1BトークンでOlmoやQwen、LlamaからBolmo 7B/1B、Bwen 8B、Blama 8Bを構築した。byte列をpatchに集約して処理するLTLMアーキテクチャにより、同規模の既存byteモデルを大きく上回り、文字理解では元のsubwordモデルさえ超える。

我々は、既存のsubwordレベルのLLMを、典型的な事前学習予算の1%未満(合計49.1Bトークン)でbyteレベルに改造した。
  1. armcat

    token-free LLMについては膨大な研究がなされてきたのに、なぜか我々は依然としてtokenの領域で動いている。そこには何か理由があるのだろう。

    Byte Latent Transformers (BLT): https://arxiv.org/abs/2412.09871

    Charformer: https://arxiv.org/abs/2106.12672

  2. mrkn1

    subword tokenizerはそもそもcausalじゃなかったのか、つまりBPEはずっと未来のbyteを覗き見していたのか!TIL

  3. serioussecurity

    わあ、natureは出し抜かれたか。もっと自分の専門分野に近いところに留まっておくべきだったな。彼らはすでに、引き受けていた多くの応用AIの仕事に振り回されていたんだから。

この日のほかの記事

2026-10-11