PCA schlägt Matryoshka: Einfache Dimensionsreduktion übertrifft modernes MRL

Honey, I shrunk the embeddings: Matryoshka vs. PCA

PCA schlägt Matryoshka: Einfache Dimensionsreduktion übertrifft modernes MRL

Ein Experiment vergleicht Matryoshka Representation Learning (MRL) mit Principal Component Analysis (PCA) zur Dimensionsreduktion von Embeddings. Über acht BEIR-Datensätze und drei Modelle (text-embedding-3-small, qwen3-embedding-8b, text-embedding-ada-002) zeigt sich: PCA erhält bei kleineren Dimensionen oft mehr Retrieval-Qualität als MRL-Truncation, selbst bei Modellen ohne MRL-Training. Auch ein Out-of-Domain-Fit funktioniert erstaunlich gut. Die Ergebnisse legen nahe, dass PCA eine praktikable, flexiblere Alternative zu MRL sein kann.

Die Hypothese, dass PCA nur wegen MRL funktioniert, scheint angesichts der Tatsache unwahrscheinlich, dass sogar PCA auf dem Nicht-MRL-Modell die Truncation auf dem MRL-Modell bei diesen Dimensionen schlägt (59 % vs. 46 % bei 32 Dimensionen).
  1. hanneshdc

    Gute Benchmarks!

    > Man kann das noch weiter treiben, indem man Quantisierung mit Trunkierung oder PCA kombiniert. Die resultierenden Vektoren können dramatisch kleiner sein und dennoch eine überraschende Menge an Retrieval-Qualität bewahren.

    Kontraintuitiverweise kann die Quantisierung auch mit einem zufälligen Rotationsschritt vor der Quantisierung kombiniert werden. Eine zufällige Rotation verteilt die Informationen über mehr Dimensionen und ermöglicht eine aggressivere Quantisierung ohne Genauigkeitsverlust. Ironischerweise fast das Gegenteil von PCA.

    Ich frage mich allerdings, ob das hier relevant ist. Es beruht darauf, dass die Embeddings eine "Struktur" haben, d.h. dass die Hauptkomponenten entlang der Basisvektoren zeigen, was bei Text-Embeddings möglicherweise nicht der Fall ist.

    Quelle: https://research.google/blog/turboquant-redefining-ai-effici...

  2. stephantul

    Schön! Ich habe an etwas Ähnlichem gearbeitet und ähnliche Ergebnisse erzielt.

    In meinen Experimenten habe ich viele Embedding-Modelle verwendet, und die Ergebnisse waren bei weitem nicht so einheitlich wie diese Kurve, nur damit du es weißt. Ich habe allerdings keine API-basierten Modelle verwendet.

    Ich habe auch über genau diesen Vergleich geschrieben, als ich PCA und MRL zur Quantisierung statischer Modelle verwendet habe, siehe: https://stephantul.github.io/blog/mrl-pca/

  3. purplemoonx

    Man trainiert das Modell mit dem Verlust, der gleichzeitig auf mehrere Präfixlängen angewendet wird: die ersten 64 Dimensionen, die ersten 128 und so weiter. Das lehrt das Modell, die wichtigsten Informationen am Anfang des Vektors zu packen, wie eine Reihe von verschachtelten Matroschka-Puppen.

    Das ist faszinierend, wenn es so gut funktioniert, wie die Experimente vermuten lassen. Zum Beispiel: Wie schneidet es im Vergleich zu klassischen Bildresize-Algorithmen wie Seam Carving oder Inpainting ab: https://en.wikipedia.org/wiki/Seam_carving, https://en.wikipedia.org/wiki/Inpainting

    (Kann man das überhaupt vergleichen?)

    Kompression/Verlust und das Gegenteil – Hochskalieren und Überglätten – sind faszinierend, denn wenn dort auch nur die winzigste Innovation passiert, verbessert sich über Nacht die gesamte andere Technologie, und eine Reihe neuer Technologien wird möglich.

Mehr von diesem Tag

2026-08-09