Qwen3.8-Flash-Next: первый взгляд на архитектуру Qwen4

Qwen 3.8-Flash-Next releasing tomorrow (125B a6B)

Qwen3.8-Flash-Next: первый взгляд на архитектуру Qwen4

Qwen3.8-Flash-Next — это мультимодальная MoE-модель на базе архитектуры Qwen4 нового поколения. Выпуск этой модели раньше времени позволит сообществу подготовиться к грядущему семейству Qwen4. Ожидается, что модель станет доступна 26 августа 2026 года на странице ModelScope. Пользователи смогут получить доступ к открытой модели Qwen3.8-Flash-Next и её FP8-версии.

Мы выпускаем эти архитектурные достижения заранее, чтобы помочь сообществу подготовиться к предстоящему семейству моделей Qwen4.
  1. SwellJoe

    Наконец-то есть причина купить Strix Halo на 128 ГБ или GB10. Или причина присмотреться к новому Mac Studio.

    У меня есть Strix Halo и две видеокарты по 32 ГБ в десктопе, и последний почти всегда лучше для запуска локальных моделей, потому что он заметно быстрее из-за более высокой пропускной способности памяти. Просто не было моделей лучше, чем Qwen 27B или Gemma 31B, которые спокойно работают в 64 ГБ с большим контекстом.

    И MoE должна позволить работать на скорости, близкой к приемлемой.

  2. ddtaylor

    Мне очень нравятся модели Qwen, но создавать что-то на их основе через OpenRouter было мучительно.

    OpenRouter делает много отличной работы, и мне очень нравится возможность так легко использовать разные модели. Мне нравится, когда провайдер выводит из эксплуатации старую модель, которая всё ещё подходит для моих задач, и цена при этом намного ниже. Казалось бы, беспроигрышный вариант.

    Однако проблема в том, что у многих моделей Qwen почти нет мощностей или они настолько нестабильны, что буквально приходится засорять код чёрными и белыми списками провайдеров. OpenRouter пытается это решить, но эти попытки не работают. На самом деле у OpenRouter есть много действительно крутых вещей, которые задокументированы, но если читать код, то они ещё не реализованы или их на самом деле нет — что обидно.

    Я пытался связаться с ними в OpenRouter по этому поводу, и раньше мне было интересно с ними работать, но трудно достучаться до нужных людей, а они растут очень быстро. Думаю, поглощение Stripe в каком-то смысле ускорит эти проблемы. Не сомневаюсь, что они в конце концов решат все эти вопросы, и масштабироваться так быстро и так сильно действительно сложно, так что им респект, но путь был довольно паршивым и выбил из меня часть энтузиазма.

  3. notnullorvoid

    Будет интересно посмотреть, как это пересекается с движками инференса вроде FreeToken, которые улучшают распределение работы для MoE-моделей между CPU/RAM и GPU/VRAM.

    Если для того, чтобы конкурентоспособная модель быстро работала локально, достаточно б/у 3090 и немного DDR4, то, возможно, нас ждёт год локального ИИ.

    https://github.com/FlashML-org/FreeToken

  4. fcanesin

    Ссылка на HF: https://huggingface.co/Qwen/Qwen3.8-Flash-Next

  5. syntaxing

    Очень жду этого, 27B — это мучение на Strix Halo, а Laguna 2.1 может творить странные вещи с вызовами инструментов.

  6. vegnus

    У меня MacBook m1 max 64gb. Могу ли я что-то сделать, чтобы получить 3.8 27b со скоростью больше 10 ток/с, или мне остаётся только смириться? 3.6 a3b хороша, но не настолько.

  7. big-chungus4

    > Мы публикуем эти архитектурные улучшения заранее, чтобы сообщество могло подготовиться к грядущему полному семейству моделей Qwen4.

    Это даёт мне надежду, что «полное семейство» означает, что в него войдут и маленькие модели вроде 4B.

  8. Catloafdev

    Очень интересно, как это будет сравниваться с Deepseek v4 Flash. Полагаю, они бы не стали выпускать это, если бы оно было хуже.

Ещё за этот день

2026-08-25