SamsungLabs quantisiert LLMs auf 0,1 Bit pro Gewicht

Sub-1-Bit LLM Compression via Latent Factorization

Die offizielle Implementierung von LittleBit (NeurIPS 2025) und LittleBit-2 (ICML 2026) komprimiert große Sprachmodelle in den Sub-1-Bit-Bereich. Dazu wird jede dichte Gewichtsmatrix in niedrigrangige latente Faktoren zerlegt, diese werden binarisiert, und lernbare Skalen stellen die Magnitude wieder her. LittleBit-2 behebt eine Fehlausrichtung der latenten Geometrie durch Internal Latent Rotation mit Joint Iterative Quantization (Joint-ITQ) und ist per --use_itq aktivierbar, ohne zusätzlichen Inferenz-Overhead.

LittleBit-2 modifiziert nur die Initialisierung; die eingesetzte faktorisierte Schicht bleibt unverändert.
  1. hgoel

    Ich verstehe, dass das Interesse an diesen extremen Quants daher rührt, dass man die Fähigkeiten maximieren will, die der Durchschnittsnutzer in dieser Ära absurd teurer Speicher aus einem lokalen LLM herausholen kann, aber ich frage mich, ob das vielleicht die falsche Achse ist?

    Wir haben verschiedene Optimierungen in Richtung Streaming gesehen, die im lokalen KI-Bereich viel wirkungsvoller waren, z. B. MoE-Modelle, bei denen die weniger beschäftigten Experten in langsamen RAM ausgelagert oder sogar ganz entfernt werden, Engram-Tabellen, die von NVMe gelesen werden können, anstatt im RAM herumzuliegen usw.

    Vielleicht wäre der Trick bei diesen extremen Quants, die Gesamtparameterzahl zu erhöhen, während man einzelne Gewichte quantisiert, sodass vielleicht die Anzahl der aktiven Parameter sinkt, oder das Streaming von Gewichten aus RAM oder Disk effizienter wird, oder sich das Cache-Verhalten verbessert? Sagen wir, man ersetzt eine einzelne 4bit/Gewicht-Matmul durch 3 1bit/Gewicht-Operationen, die ein viel näher am Ergebnis liegendes Resultat liefern als eine einzelne 1bit/Gewicht-Matmul.

  2. augment_me

    Die Leistung geht bei Wikitext-2 von 80 % auf 47 % zurück. Außerdem gibt es keine Vergleiche mit FP4-Lösungen, die auf demselben Datensatz 80 % Leistung mit einem Budget von 4,25–4,5 Bit halten oder übertreffen können.

    Ich denke, die sinnvollere Sache hier wäre eine hybride Lösung, die auf Sub-Bit-Darstellungen heruntergeht, wenn die Informationsdarstellung sie nicht benötigt (zum Beispiel spätere Schichten), und dabei die Aufgabenleistung beibehält.

  3. cpldcpu

    Ich verstehe die Besessenheit mit niedriger Bit-Quantisierung, aber es ist empirisch ziemlich offensichtlich, dass es nicht möglich ist, Modelle auf weniger als 4 Bit pro Gewicht zu komprimieren, ohne schwere Verluste an Fähigkeiten².

    Als Experiment mag es nett sein, aber es ist offensichtlich ein sehr ineffizienter Weg für das Modelltraining: all die Flops für ein gesättigtes Modell auszugeben, nur um seine Fähigkeiten zu beschneiden.

    ²Warum das so ist, dazu habe ich wenige Erklärungen gesehen. Aber die empirischen Belege sind da.

Mehr von diesem Tag

2026-10-08