SamsungLabs, LLM을 0.1비트까지 압축하는 LittleBit 공개
Sub-1-Bit LLM Compression via Latent Factorization
SamsungLabs가 NeurIPS 2025와 ICML 2026에 발표한 LittleBit 프로젝트를 GitHub에 공개했다. 이 기법은 각 가중치 행렬을 저랭크 잠재 인수로 분해하고 이진화해 가중치당 0.1비트까지 압축하면서도 추론 시 원래 모델 구조를 유지한다. 후속작 LittleBit-2는 SVD 기반 잠재 인수를 이진 초입방체에 정렬하는 Joint-ITQ 초기화를 도입해 성능을 개선했으며, --use_itq 옵션으로 활성화할 수 있고 추가 추론 오버헤드가 없다. OPT, Llama, Phi-4, Qwen, Gemma 등 다양한 모델을 지원한다.
LittleBit은 각 밀집 가중치 행렬을 저랭크 잠재 인수로 분해하고, 그 인수를 이진화하며, 가벼운 학습 스케일을 통해 크기 정보를 복원함으로써 대규모 언어 모델을 1비트 미만 영역으로 압축한다.
HN 토론
22- hgoel
이런 극단적인 양자화에 대한 관심이, 터무니없이 비싼 메모리 시대에 일반 사용자가 로컬 LLM에서 얻을 수 있는 역량을 최대화하려는 데서 비롯된 건 이해합니다. 그런데 이게 어쩌면 잘못된 축을 겨냥하고 있는 건 아닐까요?
우리는 스트리밍을 향한 다양한 최적화를 봐 왔는데, 그게 로컬 AI 분야에서 훨씬 더 큰 영향을 미쳤습니다. 예를 들어 덜 바쁜 expert들을 느린 RAM으로 오프로드하거나 아예 완전히 가지치기하는 MoE 모델, RAM에 상주하는 대신 NVMe에서 읽을 수 있는 engram 테이블 등이죠.
어쩌면 이런 극단적 양자화의 묘수는 개별 가중치를 양자화하면서 총 파라미터 수를 늘리는 것일 수도 있습니다. 그러면 활성 파라미터 수가 줄어들거나, RAM이나 디스크에서 가중치를 스트리밍하는 게 더 효율적이 되거나, 캐시 동작이 개선될 수 있으니까요? 예컨대 단일 4bit/weight matmul을, 단일 1bit/weight matmul보다 훨씬 더 근접한 결과를 내는 3개의 1bit/weight 연산으로 대체하는 식으로요.
- augment_me
Wikitext-2에서 성능이 80%에서 47%로 떨어집니다. 또한 같은 데이터셋에서 80% 성능을 유지하거나 능가하면서 4.25-4.5 big 예산을 쓰는 FP4 솔루션과의 비교도 없습니다.
제 생각에 여기서 더 의미 있는 것은, 정보 표현이 필요하지 않을 때(예를 들어 뒤쪽 레이어) sub-bit 표현으로 내려가면서도 작업 성능은 유지하는 하이브리드 솔루션일 겁니다.
- cpldcpu
저비트 양자화에 대한 집착은 이해합니다만, 심각한 성능 손실 없이 모델을 가중치당 4비트 미만으로 압축하는 것은 불가능하다는 게 경험적으로 꽤 명백합니다².
실험으로는 좋을 수 있지만, 모델 학습에는 분명히 매우 비효율적인 경로입니다: 포화된 모델에 모든 flops를 쏟아붓고 나서 그 역량을 가지치기하는 셈이니까요.
²왜 그런지에 대해서는 설명을 거의 본 적이 없습니다. 하지만 경험적 증거는 존재합니다.