¿Puede gzip ser un modelo de lenguaje?
Can gzip be a language model?
El autor explora la equivalencia entre compresión y predicción: todo compresor esconde un modelo de probabilidad. Usando gzip (en realidad zlib) y búsqueda por haz sobre secuencias de bytes, logra generar texto que, sin ser coherente, captura algo del estilo de Shakespeare. El código, en Python puro, está en GitHub.
cada modelo de predicción es inherentemente un compresor, y todos los algoritmos de compresión son modelos de predicción.