Почему локальная LLM кажется глупее, чем она есть: эксперименты показывают, что дело не в модели
Why your local LLM feels dumber than it is

Автор разбирает, почему локально запущенные LLM часто ощущаются «тупее», чем в бенчмарках. На примере Qwen3.6-27B он показывает, что даже при одинаковых весах разные реализации — от бэкендов внимания до квантования KV-кэша — приводят к заметным расхождениям в логитах. Серия тестов выявляет, как выбор attention-бэкенда (FlashAttention 2, Flash Inference, Triton) и квантование KV-кэша (int8, int4) могут вызывать ошибки в вызовах инструментов, а квантование весов (FP8, INT8, NVFP4, AWQ) по-разному влияет на точность. Главный вывод: «глупость» часто связана не с моделью, а с особенностями вашего окружения.
Каждый экземпляр аппаратного и программного обеспечения, запускающий LLM сегодня, немного отличается — или сильно отличается, когда речь идет о некоторых случаях.
- big-chungus4
Я только что запустил qwen 3.8 27b mlx на своём MacBook Pro, и, честно говоря, я просто поражён тем, насколько она не глупая.
- jonplackett
Раздел про системные промпты и управление контекстным окном — в точку; большинство людей не осознают, насколько стандартное квантование в популярных раннерах ухудшает логику по сравнению с полным FP16. Мне было бы интересно узнать, бенчмаркал ли автор влияние сжатия KV-кэша на рассуждения с длинным контекстом, потому что обычно именно там моя локальная Llama 3 начинает разваливаться.
- heywoods
Во многом поэтому я придерживаюсь правила:
а) Не квантовать KV-кэш.
б) Не использовать квантования LLM хуже, чем лучшее доступное Q8 (например, самый большой файл GGUF от unsloth для такой модели, как qwen 3.8 27B). Я лучше подожду, но буду уверен, что она работает точнее.
- a11r
Даже 4-битное квантование Qwen3.8 27b неотличимо от Gemini 3.7 flash в наших внутренних тестах. С видеокартой RTX5090 и ninfer можно получить ~800 токенов в секунду при генерации (c=8) и ~140 токенов в секунду в однопоточном режиме.
- utopiah
Я гоняю Qwen3.8 aggressive uncensored Q4_K_P на 4090 в цикле по задачам CTF из CrackMe 2026.
Использую oh-my-pi в предварительно настроенном окружении, которое я тоже дал Qwen собрать.
Codex даже не стал смотреть на файлы — буквально, как только он прочитал что-то с CTF, он отключился. Даже не предложил переключиться на модель попроще.