圧縮は予測である:LLMと圧縮アルゴリズムが同じ問題を解いている理由
Compression Is Prediction

圧縮と大規模言語モデル(LLM)は、本質的に同じ問題を解決しようとしている。この記事では、ランレングス符号化や算術符号化などの圧縮の基本を解説し、モデルがシンボルの確率を推定することでデータを効率的に符号化する仕組みを示す。さらに、エントロピーが圧縮率と予測精度の関係を決定づけることを説明し、LLMがテキストの次のトークンを予測する能力が、圧縮における確率モデルの役割と深く結びついていることを明らかにする。
圧縮子とLLMは、その核となる部分で、まったく同じ問題を解こうとしている。