Qwen3.8 27B на Mac Studio: реальные цифры производительности

Run Qwen3.8 27B locally: real numbers from my Mac Studio

Qwen3.8 27B на Mac Studio: реальные цифры производительности

Автор десять дней использует Qwen3.8 27B на Mac Studio M3 Ultra как фонового ассистента для рутинных задач: дайджест RSS, сортировка PDF, суммаризация. Затем он провёл бенчмарки: модель генерирует ~14 ток/с через Ollama, вдвое медленнее предшественника qwen3.6:27b (28.6 ток/с), но отвечает на те же промпты втрое меньшим числом токенов, так что итоговое время ответа сопоставимо. Также протестирован 1-битный квант (6.7 ГБ): 27 ток/с, факты верны, но модель не может принять решение. Даны рекомендации по RAM и железу, включая Strix Halo, и инструкция по запуску с учётом необходимости свежих версий Ollama и llama.cpp.

Квантование не деградирует модель равномерно: факты выживают, решительность умирает.
  1. Youden

    Я подумываю о покупке системы для локального запуска LLM, но цена за ту, что хорошо потянет Qwen3.8-27B, мягко говоря, отпугивает.

    Вместо этого я смотрю на провайдеров инференса, которые используют TEE и E2EE, чтобы дать криптографические гарантии того, что мои промпты и ответы вижу только я и сам GPU.

    Несмотря на их документацию и заверения о том, что означают эти гарантии, мне трудно дойти до того, чтобы реально доверить им секреты. Phala, например, похоже, обеспечивает E2EE только до шлюза, а затем пересылает промпты (возможно, сторонним) провайдерам.

    Кто-нибудь уже проходил этот путь и нашёл провайдера, которому доверяет?

  2. Infernal

    Меня очень удивляет, что вы видите вдвое меньшую производительность генерации у 3.8 по сравнению с 3.6 при том же размере параметров и квантовании (и такой же производительности prefill) — неужели в стеке просто есть оптимизация для 3.6, которая ещё не появилась для 3.8?

    Интересно, удивлены ли другие этим apparent расхождением или у них есть готовое объяснение.

  3. Atreiden

    Я сталкиваюсь с тем же поведением. Я пробовал кванты 4-8 бит и получаю 14-17 ток/с, при одном запуске, который достиг 19. Я с нетерпением жду поддержки dflash2 в Unsloth или LM Studio, так как, по слухам, это должно увеличить пропускную способность примерно до 30 ток/с, что является базовым уровнем для того, что я считаю хотя бы немного интерактивным.

    Завидую людям с 5090, которые запускают ninfer и получают >100 ток/с. На таких скоростях это, по моему мнению, настоящая замена frontier.

  4. rbanffy

    Весьма впечатляет, что Mac в итоге оказывается дешевле, чем коробки Strix Halo, по крайней мере здесь, в Ирландии. Mac Studio на 128 ГБ с M5 Max (Ultra может иметь только 96 или 256 ГБ) всё ещё стоит меньше, чем GMKtec EVO-X2 или Nvidia DGX Spark с сопоставимой производительностью. А в США так же?

  5. pwython

    Да, Qwen3.8 было неинтересно использовать на моём M4 Max с 64 ГБ (хотя цифры у меня лучше этих), так что теперь мой новый ежедневный драйвер — Ornith-1.5-35B-A3B-MLX-4bit. Рекомендую попробовать, если у вас похожее железо, он определённо лучше, чем Qwen3.6 35b-a3b, который был моим фаворитом раньше.

    https://huggingface.co/ornith-ai/Ornith-1.5-35B-A3B

Ещё за этот день

2026-08-28