Qwen3.8 27B на Mac Studio: реальные цифры производительности
Run Qwen3.8 27B locally: real numbers from my Mac Studio

Автор десять дней использует Qwen3.8 27B на Mac Studio M3 Ultra как фонового ассистента для рутинных задач: дайджест RSS, сортировка PDF, суммаризация. Затем он провёл бенчмарки: модель генерирует ~14 ток/с через Ollama, вдвое медленнее предшественника qwen3.6:27b (28.6 ток/с), но отвечает на те же промпты втрое меньшим числом токенов, так что итоговое время ответа сопоставимо. Также протестирован 1-битный квант (6.7 ГБ): 27 ток/с, факты верны, но модель не может принять решение. Даны рекомендации по RAM и железу, включая Strix Halo, и инструкция по запуску с учётом необходимости свежих версий Ollama и llama.cpp.
Квантование не деградирует модель равномерно: факты выживают, решительность умирает.
- Youden
Я подумываю о покупке системы для локального запуска LLM, но цена за ту, что хорошо потянет Qwen3.8-27B, мягко говоря, отпугивает.
Вместо этого я смотрю на провайдеров инференса, которые используют TEE и E2EE, чтобы дать криптографические гарантии того, что мои промпты и ответы вижу только я и сам GPU.
Несмотря на их документацию и заверения о том, что означают эти гарантии, мне трудно дойти до того, чтобы реально доверить им секреты. Phala, например, похоже, обеспечивает E2EE только до шлюза, а затем пересылает промпты (возможно, сторонним) провайдерам.
Кто-нибудь уже проходил этот путь и нашёл провайдера, которому доверяет?
- Infernal
Меня очень удивляет, что вы видите вдвое меньшую производительность генерации у 3.8 по сравнению с 3.6 при том же размере параметров и квантовании (и такой же производительности prefill) — неужели в стеке просто есть оптимизация для 3.6, которая ещё не появилась для 3.8?
Интересно, удивлены ли другие этим apparent расхождением или у них есть готовое объяснение.
- Atreiden
Я сталкиваюсь с тем же поведением. Я пробовал кванты 4-8 бит и получаю 14-17 ток/с, при одном запуске, который достиг 19. Я с нетерпением жду поддержки dflash2 в Unsloth или LM Studio, так как, по слухам, это должно увеличить пропускную способность примерно до 30 ток/с, что является базовым уровнем для того, что я считаю хотя бы немного интерактивным.
Завидую людям с 5090, которые запускают ninfer и получают >100 ток/с. На таких скоростях это, по моему мнению, настоящая замена frontier.
- rbanffy
Весьма впечатляет, что Mac в итоге оказывается дешевле, чем коробки Strix Halo, по крайней мере здесь, в Ирландии. Mac Studio на 128 ГБ с M5 Max (Ultra может иметь только 96 или 256 ГБ) всё ещё стоит меньше, чем GMKtec EVO-X2 или Nvidia DGX Spark с сопоставимой производительностью. А в США так же?
- pwython
Да, Qwen3.8 было неинтересно использовать на моём M4 Max с 64 ГБ (хотя цифры у меня лучше этих), так что теперь мой новый ежедневный драйвер — Ornith-1.5-35B-A3B-MLX-4bit. Рекомендую попробовать, если у вас похожее железо, он определённо лучше, чем Qwen3.6 35b-a3b, который был моим фаворитом раньше.