SamsungLabs сжимает LLM до 0,1 бита на вес

Sub-1-Bit LLM Compression via Latent Factorization

SamsungLabs выпустила официальную реализацию LittleBit (NeurIPS 2025) и LittleBit-2 (ICML 2026) — методов сжатия LLM в режим менее одного бита на вес. Подход раскладывает плотные весовые матрицы на низкоранговые латентные факторы, бинаризует их и восстанавливает масштаб через обучаемые коэффициенты. LittleBit-2 добавляет инициализацию Joint-ITQ, выравнивающую латентную геометрию с бинарным гиперкубом до QAT, и не требует изменений при инференсе. Поддерживаются OPT, Llama, Phi-4, Qwen и Gemma.

LittleBit сжимает большие языковые модели в режим менее одного бита, раскладывая каждую плотную весовую матрицу на низкоранговые латентные факторы, бинаризуя эти факторы и восстанавливая информацию о масштабе через легковесные обучаемые коэффициенты.
  1. hgoel

    Я понимаю, что интерес к таким экстремальным квантованиям вызван желанием максимизировать возможности, которые средний пользователь может получить от локальной LLM в эту эпоху смехотворно дорогой памяти, но мне интересно, не нацелено ли это, возможно, не на ту ось?

    Мы наблюдаем различные оптимизации в сторону стриминга, которые оказались гораздо более значимыми в области локального ИИ, например, MoE-модели, где менее загруженные эксперты выгружаются в медленную RAM или даже полностью прунятся, engram-таблицы, которые можно читать из NVMe вместо того, чтобы держать их в RAM, и т.д.

    Может быть, трюк с этими экстремальными квантованиями заключался бы в увеличении общего числа параметров при квантовании отдельных весов, так чтобы, возможно, количество активных параметров снижалось, или стриминг весов из RAM или с диска становился более эффективным, или улучшалось поведение кэша? Скажем, замена одного матмула с 4 битами на вес на 3 операции с 1 битом на вес, которые дают гораздо более близкий результат, чем один матмул с 1 битом на вес.

  2. augment_me

    Производительность падает с 80% до 47% на Wikitext-2. Также нет сравнений с FP4-решениями, которые способны поддерживать или превышать производительность на том же датасете 80% при бюджете 4.25-4.5 бита.

    Я думаю, более осмысленной вещью здесь было бы гибридное решение, которое переходило бы к суббитовым представлениям, когда информационное представление в этом не нуждается (например, в поздних слоях), но при этом сохраняет производительность на задаче.

  3. cpldcpu

    Я понимаю одержимость низкобитным квантованием, но эмпирически совершенно очевидно, что невозможно сжать модели до менее чем 4 бит на вес без серьёзной потери возможностей².

    Как эксперимент это может быть и неплохо, но очевидно, что это очень неэффективный путь для обучения модели: тратить все флопы на насыщенную модель только для того, чтобы урезать её возможности.

    ²Что касается причин, я видел мало объяснений. Но эмпирические доказательства есть.

Ещё за этот день

2026-10-08