gzipは言語モデルになれるのか?

Can gzip be a language model?

圧縮と予測は等価であるという理論に基づき、標準ライブラリのzlibだけでgzipを言語モデルとして使う試み。Shakespeareのコーパスでプライミングし、ビームサーチで圧縮率が最も高くなるバイト列を探索してテキストを生成する。出力は完全に coherent ではないものの、gzipがテキストの構造をある程度「理解」していることを示す。

すべての予測モデルは本質的に圧縮器であり、すべての圧縮アルゴリズムは予測モデルである。
  1. jll29

    はい、gzipを使ってテストファイルをトピックごとに分類できます。やり方は以下の通りです:

    gzip -9 sports.txt testfile.txt

    gzip -9 politics.txt testfile.txt

    gzip -9 business.txt testfile.txt

    (sports.txt、politics.txt、business.txtはそれぞれスポーツ、政治、ビジネスの分野に関するテキスト文書で、サイズは同じと仮定します)

    テストファイルは、最も小さい*.gzファイルが生成されたトピックに属します。

    ワイカト大学のWittenのグループがおそらく最初にこれに取り組んだ人たちでしょう。

    また、これに興味があればHutter Prizeもチェックしてみてください。

  2. _def

    面白い話題だけど、生成された記事のテキストが実際にはgzipを使っていない? なんだか妙に引っかかるな。

  3. Culonavirus

    これはWinrarがOpenAIよりも儲かっているのと完璧に一致する…偶然? そうは思わない!

  4. mg

    普通のテキストプロンプトを与えると、

    最もよく圧縮されるバイト列を

    検索してそのプロンプトを

    続けます。

    ちょっと待って、その検索がどれだけうまく行われたかをどうやって知るんだ? 探索空間の意味のある部分を検索する方法はない。

    つまり、この結果はgzipがテキストの続きの「もっともらしさテスター」としてどれだけ機能するかの下限を示すにすぎない。可能な系列の空間は、探索されたものより何桁も大きい。だから、もっとずっとよく圧縮される系列がそこにあるかもしれない。

    テキストにはビームサーチについて言及されているが、テキストのgzip圧縮性に関して、ビームサーチが大域的最適解を見つける性能についての議論は見当たらない?

  5. GodelNumbering

    3blue1brownがこのトピックについてシリーズをやっていました:https://www.youtube.com/watch?v=l6DKRf-fAAM https://www.youtube.com/watch?v=GlYgs6v2YfU (もう1本公開される予定だと思います)

  6. montebicyclelo

    これは面白いですが、歴史的に人々はこのようなモデルやn-gram言語モデルが大規模ニューラルネットワークモデルに近いと言い過ぎてきました。とはいえ、確かに関連性はあります。

  7. colinmarc

    これは動画圧縮でも機能するのだろうか? 動画コーデックは多くの意味をエンコードしている。例えば、画面上のオブジェクトの動きを追跡するためにモーションベクトルを使う。

  8. adityaathalye

    言語そのものが圧縮だと思うので、このarxiv論文は納得できる。

    すなわち、もし言語が(思考や文化、存在から存在へのコミュニケーションの暗黙の何かなどの)圧縮であるなら、定義上、言語モデリングもまた圧縮でなければならない。

    ただし、言語は任意に損失のある圧縮器であり、その「圧縮-予測等価性」は不確定で不安定である。なぜなら言語は絶えず共進化しており、文化の関数として、あるいは文化への応答として、また文化に影響を与えるものとして変化するからだ。

    したがって、(あらゆる種類の言語の)言語モデルの主観的・客観的な良さは、せいぜい言語コーパス自体の圧縮-予測等価性によって上限が定められるだろう。そしてそれは、言語コーパスがあらゆる点で完璧であると仮定した場合の話だ——つまり、言語で表現可能なすべての知識を捉え、常にすべての言語表現と進化の生きた進化と同期している場合(すなわち、LLMのトレーニングはバッチジョブではなく、リアルタイムの現在進行形のプロセスである)。

    例えば、素人の私の目には、証明の数学言語は主観的解釈の曖昧さを積極的に排除するように見える。理想的には、証明はステップを追えるどんな読者によっても、読むたびに全く同じ結論に導くべきである。また、証明は形式的で明示的で不可侵で内部整合的な公理と結果の集合の残りが成り立つ場合にのみ成り立つ。

    したがって、証明の数学的散文は、開かれた問いを […] へと導く機械的手続きとして最適化されているため、理にかなっている。

この日のほかの記事

2026-09-22