SamsungLabs, LLM을 0.1비트까지 압축하는 LittleBit 공개

Sub-1-Bit LLM Compression via Latent Factorization

SamsungLabs가 NeurIPS 2025와 ICML 2026에 발표한 LittleBit 프로젝트를 GitHub에 공개했다. 이 기법은 각 가중치 행렬을 저랭크 잠재 인수로 분해하고 이진화해 가중치당 0.1비트까지 압축하면서도 추론 시 원래 모델 구조를 유지한다. 후속작 LittleBit-2는 SVD 기반 잠재 인수를 이진 초입방체에 정렬하는 Joint-ITQ 초기화를 도입해 성능을 개선했으며, --use_itq 옵션으로 활성화할 수 있고 추가 추론 오버헤드가 없다. OPT, Llama, Phi-4, Qwen, Gemma 등 다양한 모델을 지원한다.

LittleBit은 각 밀집 가중치 행렬을 저랭크 잠재 인수로 분해하고, 그 인수를 이진화하며, 가벼운 학습 스케일을 통해 크기 정보를 복원함으로써 대규모 언어 모델을 1비트 미만 영역으로 압축한다.
  1. hgoel

    이런 극단적인 양자화에 대한 관심이, 터무니없이 비싼 메모리 시대에 일반 사용자가 로컬 LLM에서 얻을 수 있는 역량을 최대화하려는 데서 비롯된 건 이해합니다. 그런데 이게 어쩌면 잘못된 축을 겨냥하고 있는 건 아닐까요?

    우리는 스트리밍을 향한 다양한 최적화를 봐 왔는데, 그게 로컬 AI 분야에서 훨씬 더 큰 영향을 미쳤습니다. 예를 들어 덜 바쁜 expert들을 느린 RAM으로 오프로드하거나 아예 완전히 가지치기하는 MoE 모델, RAM에 상주하는 대신 NVMe에서 읽을 수 있는 engram 테이블 등이죠.

    어쩌면 이런 극단적 양자화의 묘수는 개별 가중치를 양자화하면서 총 파라미터 수를 늘리는 것일 수도 있습니다. 그러면 활성 파라미터 수가 줄어들거나, RAM이나 디스크에서 가중치를 스트리밍하는 게 더 효율적이 되거나, 캐시 동작이 개선될 수 있으니까요? 예컨대 단일 4bit/weight matmul을, 단일 1bit/weight matmul보다 훨씬 더 근접한 결과를 내는 3개의 1bit/weight 연산으로 대체하는 식으로요.

  2. augment_me

    Wikitext-2에서 성능이 80%에서 47%로 떨어집니다. 또한 같은 데이터셋에서 80% 성능을 유지하거나 능가하면서 4.25-4.5 big 예산을 쓰는 FP4 솔루션과의 비교도 없습니다.

    제 생각에 여기서 더 의미 있는 것은, 정보 표현이 필요하지 않을 때(예를 들어 뒤쪽 레이어) sub-bit 표현으로 내려가면서도 작업 성능은 유지하는 하이브리드 솔루션일 겁니다.

  3. cpldcpu

    저비트 양자화에 대한 집착은 이해합니다만, 심각한 성능 손실 없이 모델을 가중치당 4비트 미만으로 압축하는 것은 불가능하다는 게 경험적으로 꽤 명백합니다².

    실험으로는 좋을 수 있지만, 모델 학습에는 분명히 매우 비효율적인 경로입니다: 포화된 모델에 모든 flops를 쏟아붓고 나서 그 역량을 가지치기하는 셈이니까요.

    ²왜 그런지에 대해서는 설명을 거의 본 적이 없습니다. 하지만 경험적 증거는 존재합니다.

이 날의 다른 글

2026-10-08