压缩即预测:LLM 与压缩器的底层秘密

Compression Is Prediction

压缩即预测:LLM 与压缩器的底层秘密

最近我在研究数据压缩时,发现了一个令人拍案叫绝的事实:压缩器和大型语言模型(LLM)本质上是在解决同一个问题。文章通过拆解压缩器的三大核心组件——变换、模型和熵编码器,揭示了压缩技术如何利用数据冗余进行“预测”。特别是算术编码(Arithmetic coding)部分,展示了如何将整段数据压缩为单个数字。当数据分布越集中,预测越准确,压缩率就越高。这不仅是信息论中香农熵(Shannon entropy)的体现,更让我们意识到,无论是 gzip 还是现代 AI,其核心逻辑都是对未来的精准预判。

压缩器和大型语言模型在本质上,都在试图解决完全相同的问题。
  1. farfatched

    不对;这里还有更多的细微差别,区分这一点很重要。

    只有当数据分布完全代表所有未来问题时,压缩在功能上才等同于预测。如果你想要泛化能力,情况就会发生巨大变化——因为测试分布可能截然不同,即使它们的支撑集(support)相同!例如:你在训练数据中观察到一个罕见的边缘情况,(有损)压缩可能会直接忽略它。但如果你希望在该特定空间部分实现泛化——要么是因为对手在测试你,要么是为了在设计自由度上选择构建那个特定角落——那么你不只需要数据压缩,还需要在该测试分布峰值所在的角落具备良好的预测性能。

    假设训练数据分布正是你未来唯一关心的分布,这实际上隐含地承担了“压缩等于预测”这一论断中的大部分繁重工作。我很恼火这句话被不加思考地像宣言一样反复重复。

    训练数据分布本身并没有什么自然之处,尤其是当数据生成过程是探索性的,而下游应用却是利用性的时候。

同日更多故事

2026-08-11