SamsungLabsがLLMを0.1ビットまで圧縮するLittleBitを公開
Sub-1-Bit LLM Compression via Latent Factorization
SamsungLabsがNeurIPS 2025採択のLittleBitとICML 2026採択のLittleBit-2の公式実装をGitHubで公開した。重み行列を低ランク潜在因子に分解して二値化し、軽量な学習済みスケールで大きさを復元することで、1重みあたり0.1ビットという極限圧縮を実現。推論時のアーキテクチャは変えず、LittleBit-2では初期化段階でJoint-ITQを適用し潜在空間の幾何ずれを解消する。OPTやLlama、Qwen、Gemmaなどに対応する。
LittleBit-2 modifies initialization only; the deployed factorized layer remains the same.
HNでの議論
22- hgoel
これらの極端な量子化への関心が、法外に高価なメモリの時代に、平均的なユーザーがローカルLLMから得られる能力を最大化したいという願望から来ているのは理解していますが、これはもしかすると間違った軸を狙っているのではないかと思います。
私たちはストリーミングに向けた様々な最適化を見てきましたが、それらはローカルAIの領域ではるかに影響力がありました。例えば、忙しくないエキスパートを遅いRAMにオフロードしたり、完全にプルーニングしたりするMoEモデル、RAMに常駐させる代わりにNVMeから読み取ることができるエングラムテーブルなどです。
おそらくこれらの極端な量子化のトリックは、個々の重みを量子化しながら総パラメータ数を増やし、アクティブなパラメータ数が減るようにしたり、RAMやディスクからの重みのストリーミングがより効率的になったり、キャッシュの挙動が改善したりするのではないでしょうか?例えば、単一の4bit/重みの行列乗算を、単一の1bit/重みの行列乗算よりもはるかに近い結果を生み出す3つの1bit/重み演算に置き換える、といったことです。
- augment_me
Wikitext-2で性能が80%から47%に低下します。また、同じデータセットで80%の性能を維持または超えるFP4ソリューションとの比較もありません。4.25-4.5の大きな予算でです。
ここでより意味のあるのは、情報表現がそれを必要としない場合(例えば後方の層)にサブビット表現まで下げつつ、タスク性能を維持するハイブリッドソリューションではないでしょうか。
- cpldcpu
低ビット量子化への執着は理解できますが、能力の深刻な損失なしにモデルを重みあたり4ビット未満に圧縮することが不可能であることは経験的に明らかです²。
実験としては面白いかもしれませんが、モデルトレーニングにとって明らかに非常に非効率な道です。飽和したモデルにすべてのFLOPSを費やし、その能力を刈り込むだけなのですから。
²なぜそうなるのかについては、ほとんど説明を見たことがありません。しかし、経験的証拠は存在します。