Qwen 3.8-Flash-Next: el modelo multimodal MoE que prepara el terreno para Qwen4

Qwen 3.8-Flash-Next releasing tomorrow (125B a6B)

Qwen 3.8-Flash-Next: el modelo multimodal MoE que prepara el terreno para Qwen4

Qwen 3.8-Flash-Next es un modelo multimodal de arquitectura MoE construido sobre la próxima generación de la arquitectura Qwen4. Su lanzamiento, programado para el 26 de agosto de 2026, busca que la comunidad se prepare para la familia Qwen4. El modelo estará disponible en versiones estándar y FP8, y se podrá acceder a él desde la misma página de ModelScope.

Qwen3.8-Flash-Next es un modelo multimodal MoE construido sobre la arquitectura de próxima generación Qwen4.
  1. SwellJoe

    Finalmente, una razón para tener un dispositivo Strix Halo de 128GB o un GB10. O una razón para considerar el nuevo Mac Studio.

    Tengo un Strix Halo y dos GPUs de 32GB en mi escritorio, y esto último casi siempre es mejor para ejecutar modelos locales porque es bastante más rápido debido a su mayor ancho de banda de memoria. Simplemente no ha habido modelos que sean mejores que Qwen 27B o Gemma 31B, que se ejecutan cómodamente en 64GB con un contexto grande.

    Y, MoE debería hacer que se ejecute a una velocidad casi utilizable.

  2. ddtaylor

    Disfruto mucho los modelos Qwen, pero construir cosas sobre ellos con OpenRouter ha sido doloroso.

    OpenRouter hace un gran trabajo y realmente disfruto poder usar diferentes modelos tan fácilmente. Me gusta cuando un proveedor está eliminando gradualmente un modelo más antiguo que todavía funciona para mis necesidades y el precio es mucho más bajo. Parece una situación en la que todos ganan.

    Sin embargo, el problema es que muchos modelos Qwen tienen casi nada de capacidad o son tan inestables que literalmente tienes que llenar tu código con una lista negra/blanca de proveedores. OpenRouter tiene algunos intentos de resolver esto, pero no funcionan. De hecho, OpenRouter tiene muchas cosas geniales que están documentadas, pero si lees el código, aún no están implementadas o realmente no están ahí, lo cual es una pena.

    Intenté contactarlos en OpenRouter sobre esto y en el pasado me interesaba trabajar con ellos, pero es difícil comunicarse con las personas adecuadas y están creciendo muy rápido. Espero que ser adquiridos por Stripe acelere esos problemas de alguna manera. No tengo duda de que eventualmente resolverán todos estos problemas y escalar tanto y tan rápido es realmente difícil, así que felicitaciones para ellos, pero el camino ha sido bastante decepcionante y me ha quitado algo de entusiasmo.

  3. notnullorvoid

    Será interesante ver la intersección de esto con motores de inferencia como FreeToken que mejoran la distribución del trabajo para modelos MoE entre CPU/RAM y GPU/VRAM.

    Si todo lo que se necesita para que un modelo competitivo se ejecute localmente a buenas velocidades es una 3090 usada y algo de DDR4, entonces podríamos estar en el año de la IA local.

    https://github.com/FlashML-org/FreeToken

  4. fcanesin

    Enlace de HF: https://huggingface.co/Qwen/Qwen3.8-Flash-Next

  5. syntaxing

    Esperando esto con muchas ganas, 27B es un desafío con un Strix Halo y Laguna 2.1 puede hacer cosas estúpidas para las llamadas de herramientas.

  6. vegnus

    Tengo un MacBook M1 Max de 64GB. ¿Hay algo que pueda hacer para obtener 3.8 27b a más de 10 tok/s o estoy relegado? 3.6 a3b es bueno pero no es tan bueno

  7. big-chungus4

    > Estamos lanzando estas mejoras arquitectónicas por adelantado para que la comunidad pueda prepararse para la próxima familia completa de modelos Qwen4.

    Eso me da esperanza de que "familia completa" signifique que incluirá modelos más pequeños como 4B.

  8. Catloafdev

    Muy curioso por ver cómo se compara esto con Deepseek v4 Flash. Tengo que asumir que no lanzarían esto si fuera peor.

Más de este día

2026-08-25