Samsung Labs comprime LLMs por debajo de 1 bit por peso sin cambiar la arquitectura
Sub-1-Bit LLM Compression via Latent Factorization
LittleBit, de SamsungLabs, factoriza cada matriz de pesos en factores latentes de bajo rango, los binariza y recupera la magnitud con escalas aprendidas, logrando compresión extrema de 1.0 a 0.1 bits por peso. LittleBit-2 (ICML 2026) añade una rotación latente interna con Joint-ITQ para alinear los factores SVD con el hipercubo binario antes del QAT; se activa con --use_itq y no añade coste en inferencia. Compatible con Llama, Qwen, Gemma, Phi y OPT.
LittleBit-2 modifica únicamente la inicialización; la capa factorizada desplegada permanece igual.
- hgoel
Entiendo que el interés en estos cuantos extremos proviene de querer maximizar la capacidad que el usuario promedio puede obtener de un LLM local en esta era de memoria ridículamente cara, pero me pregunto si quizás esto está apuntando al eje equivocado.
Hemos estado viendo varias optimizaciones hacia el streaming, que han sido mucho más impactantes en el espacio de la IA local, por ejemplo, modelos MoE donde los expertos menos ocupados se descargan a RAM lenta o incluso se podan por completo, tablas de engramas que se pueden leer desde NVMe en lugar de estar en RAM, etc.
Quizás el truco con estos cuantos extremos sería aumentar el recuento total de parámetros mientras se cuantizan los pesos individuales, de modo que quizás el recuento de parámetros activos disminuya, o el streaming de pesos desde RAM o disco se vuelva más eficiente, o mejore el comportamiento de la caché. Digamos, reemplazar una única matmul de 4 bits/peso con 3 operaciones de 1 bit/peso que produzcan un resultado mucho más cercano que una única matmul de 1 bit/peso.
- augment_me
El rendimiento pasa del 80% al 47% en Wikitext-2. Además, no hay comparaciones con soluciones FP4 que son capaces de mantener o superar el rendimiento en el mismo conjunto de datos al 80% con un presupuesto grande de 4.25-4.5.
Creo que algo más significativo aquí sería una solución híbrida que bajara a representaciones sub-bit cuando la representación informativa no lo necesita (por ejemplo, capas posteriores) que aún mantenga el rendimiento de la tarea.
- cpldcpu
Entiendo la obsesión con la cuantización de bits bajos, pero es empíricamente bastante evidente que no es posible comprimir modelos a menos de 4 bits por peso sin una grave pérdida de capacidades².
Puede ser agradable como experimento, pero obviamente es una ruta muy ineficiente para el entrenamiento de modelos: gastar todos los flops en un modelo saturado solo para podar sus capacidades.
²En cuanto a por qué, he visto pocas explicaciones. Pero la evidencia empírica está ahí.