4-битный Qwen3.8 27B не уступает полной модели, 1-битный — коллапс
Benchmarking Qwen3.8 27B quantizations: 4-bit holds up, 1-bit collapses
Автор протестировал квантизации Qwen3.8 27B от Unsloth на бенчмарках GPQA Diamond, IFBench и Terminal-Bench 2.1. Полная модель BF16 весит 55 ГБ, а Q4_K_M (17 ГБ) показывает практически идентичные результаты, помещаясь в 24 ГБ видеопамяти. Даже 2-битная версия (10.7 ГБ) справляется с задачами, хотя и хуже. Однако при 1-битной квантизации (6.2 ГБ) модель деградирует до уровня случайных ответов, а длинные рассуждения только ухудшают результат. Автор также делится стоимостью запуска бенчмарков на арендованных GPU и советует выбирать максимальную квантизацию, которая влезает в память.
Сжатие в конце концов приводит к обрыву: при 1 бите модель показывает результаты на уровне случайных ответов в GPQA Diamond, а более длинные рассуждения делают только хуже.