缩小嵌入向量:Matryoshka 与 PCA 对决
Honey, I shrunk the embeddings: Matryoshka vs. PCA

随着 LLM 应用普及,向量数据库的存储与检索成本日益凸显。Matryoshka Representation Learning (MRL) 虽能压缩维度,但我好奇传统的主成分分析 (PCA) 是否表现更佳。我在八个 BEIR 数据集上对比了 OpenAI 的 text-embedding-3-small、Alibaba 的 qwen3-embedding-8b 以及未使用 MRL 训练的 text-embedding-ada-002。实验发现,在维度压缩至 256 以下时,PCA 往往能保留更多检索质量,甚至在非 MRL 模型上表现优异。更令人惊喜的是,PCA 对拟合数据量的要求极低,且跨域拟合在中等压缩率下依然有效。这意味着,对于许多场景,简单的 PCA 或许是比 MRL 截断更经济高效的降维方案。
好消息是,对于像我这样懒惰的人来说,拟合样本的大小影响比我预期的要小得多,而且跨域拟合在中等压缩率下依然表现稳健。