Почему локальная LLM кажется глупее, чем она есть: эксперименты показывают, что дело не в модели
Why your local LLM feels dumber than it is

Автор разбирает, почему локально запущенные LLM часто ощущаются «тупее», чем в бенчмарках. На примере Qwen3.6-27B он показывает, что даже при одинаковых весах разные реализации — от бэкендов внимания до квантования KV-кэша — приводят к заметным расхождениям в логитах. Серия тестов выявляет, как выбор attention-бэкенда (FlashAttention 2, Flash Inference, Triton) и квантование KV-кэша (int8, int4) могут вызывать ошибки в вызовах инструментов, а квантование весов (FP8, INT8, NVFP4, AWQ) по-разному влияет на точность. Главный вывод: «глупость» часто связана не с моделью, а с особенностями вашего окружения.
Каждый экземпляр аппаратного и программного обеспечения, запускающий LLM сегодня, немного отличается — или сильно отличается, когда речь идет о некоторых случаях.