Qwen3.8-Flash-Next: обучение в 9 раз дешевле при превосходстве в кодинге
Qwen3.8-Flash-Next: A New Architecture, Towards Ultimate Cost-Efficiency

Qwen открывает веса Qwen3.8-Flash-Next — мультимодальной MoE-модели, которая предвосхищает архитектуру Qwen4. В основе — гибрид Gated DeltaNet и Qwen Sparse Attention, а также новые механизмы: Gated Residual, N-gram Embedding и оптимизатор Muon. Модель с 125B параметров (6B активных) обучается примерно в 9 раз дешевле, чем Qwen3.7-Plus, но превосходит её в кодинге и офисных задачах. Поддерживает контекст до 262K токенов (расширяется до 1M), а в продакшене доступна как Qwen3.8-Flash по цене $0.16 за миллион входных токенов.
QSA сжимает последовательность в микро-блоки и оценивает важность контекста на уровне блоков, что снижает не только стоимость самого Attention, но и накладные расходы на индексацию.