Почему локальная LLM кажется глупее, чем она есть: эксперименты показывают, что дело не в модели

Why your local LLM feels dumber than it is

Почему локальная LLM кажется глупее, чем она есть: эксперименты показывают, что дело не в модели

Автор разбирает, почему локально запущенные LLM часто ощущаются «тупее», чем в бенчмарках. На примере Qwen3.6-27B он показывает, что даже при одинаковых весах разные реализации — от бэкендов внимания до квантования KV-кэша — приводят к заметным расхождениям в логитах. Серия тестов выявляет, как выбор attention-бэкенда (FlashAttention 2, Flash Inference, Triton) и квантование KV-кэша (int8, int4) могут вызывать ошибки в вызовах инструментов, а квантование весов (FP8, INT8, NVFP4, AWQ) по-разному влияет на точность. Главный вывод: «глупость» часто связана не с моделью, а с особенностями вашего окружения.

Каждый экземпляр аппаратного и программного обеспечения, запускающий LLM сегодня, немного отличается — или сильно отличается, когда речь идет о некоторых случаях.
  1. big-chungus4

    Я только что запустил qwen 3.8 27b mlx на своём MacBook Pro, и, честно говоря, я просто поражён тем, насколько она не глупая.

  2. jonplackett

    Раздел про системные промпты и управление контекстным окном — в точку; большинство людей не осознают, насколько стандартное квантование в популярных раннерах ухудшает логику по сравнению с полным FP16. Мне было бы интересно узнать, бенчмаркал ли автор влияние сжатия KV-кэша на рассуждения с длинным контекстом, потому что обычно именно там моя локальная Llama 3 начинает разваливаться.

  3. heywoods

    Во многом поэтому я придерживаюсь правила:

    а) Не квантовать KV-кэш.

    б) Не использовать квантования LLM хуже, чем лучшее доступное Q8 (например, самый большой файл GGUF от unsloth для такой модели, как qwen 3.8 27B). Я лучше подожду, но буду уверен, что она работает точнее.

  4. a11r

    Даже 4-битное квантование Qwen3.8 27b неотличимо от Gemini 3.7 flash в наших внутренних тестах. С видеокартой RTX5090 и ninfer можно получить ~800 токенов в секунду при генерации (c=8) и ~140 токенов в секунду в однопоточном режиме.

  5. utopiah

    Я гоняю Qwen3.8 aggressive uncensored Q4_K_P на 4090 в цикле по задачам CTF из CrackMe 2026.

    Использую oh-my-pi в предварительно настроенном окружении, которое я тоже дал Qwen собрать.

    Codex даже не стал смотреть на файлы — буквально, как только он прочитал что-то с CTF, он отключился. Даже не предложил переключиться на модель попроще.

Ещё за этот день

2026-08-22