Qwen3.8-Flash-Next: una nueva arquitectura que reduce el costo de entrenamiento a una novena parte

Qwen3.8-Flash-Next: A New Architecture, Towards Ultimate Cost-Efficiency

Qwen3.8-Flash-Next: una nueva arquitectura que reduce el costo de entrenamiento a una novena parte

Qwen3.8-Flash-Next, un modelo MoE multimodal de 125B parámetros (6B activos) con 51B adicionales de N-gram Embedding, presenta una arquitectura híbrida GDN + QSA que logra una aceleración de hasta 7.6x en Prefill y 4.9x en Decode con contexto de 1M tokens. Además, introduce Gated Residual y N-gram Embedding para mejorar la capacidad y estabilidad. El entrenamiento cuesta aproximadamente 1/9 comparado con Qwen3.7-Plus, y supera a Claude-Opus-4.6 en tareas de codificación y oficina. Los pesos están disponibles en Hugging Face y ModelScope, y la versión de producción Qwen3.8-Flash se ofrece a 0.16 USD por millón de tokens de entrada.

En resumen: GDN "recuerda" eficientemente, mientras que QSA "recupera" con precisión.

Más de este día

2026-08-26