Qwen 3.8 27B llega a Cerebras con 1500 tokens por segundo
Qwen 3.8 27B available on Cerebras at 1500 tokens/s
Cerebras ha añadido Qwen 3.8 27B a sus endpoints públicos, ofreciendo una velocidad de 1500 tokens por segundo. El modelo, con 27 mil millones de parámetros y un contexto de hasta 128k, se suma a GPT-OSS 120B. La plataforma garantiza que todos sus modelos públicos no están podados y utiliza cuantización selectiva solo en almacenamiento para preservar la calidad.
Todos nuestros modelos públicos no están podados.
- nostrebored
El límite de 150k TPM en el endpoint público significa que probablemente sea inutilizable para muchas tareas de codificación. Cuando hemos probado Cerebras en el pasado, nuestro problema siempre han sido las tasas. Nos encantaría no tener que lidiar con dedicado y tener acceso a un grupo de tarifas más flexible.
Incluso probándolo, parece que nuestra cuenta ha sido movida a algún limbo donde ya no podemos agregar información de facturación.
```
Billing access restricted
Self-serve billing is not available on Enterprise accounts. Please contact your team for further questions.
```
No tenemos equipo (se eliminaron de nuestro canal de Slack después de que hablamos sobre los límites de tasa). Curiosamente, nada de esto aparece en la solicitud, que da:
```
{"message":"Model does not exist or you do not have access to it.","type":"not_found_error","param":"model","code":"model_not_found"}
```
Cuando el error realmente es sobre facturación.
Siempre quiero que me guste Cerebras, pero tengo la sensación de que como consumidor de tokens in/out no eres valorado en absoluto.
- gpugreg
Me preguntaba si esto era bueno para programar, pero es demasiado rápido para su propio bien. Hay un límite de 450,000 tokens por minuto. Alcancé este límite en unos 90 segundos y quemé $1.10 mientras lo hacía. Esto se debe a que los tokens en caché cuentan para el límite de tokens.
Para comparar, ejecuté la misma tarea con DeepSeek-V4-Flash, que terminó en 172 segundos y costó $0.024 con un tamaño de ventana de contexto final de 55217 tokens, mientras que Qwen3.8-27B ni siquiera estaba cerca de terminar con una ventana de contexto de 64178.
Esta es una forma muy eficiente de quemar tu dinero, pero no lo recomendaría para programar.
En el lado positivo, obtuve un bono de registro de $5, así que no fue mi propio dinero.
- jasongill
Sería genial si hicieran su capacidad de inferencia para este modelo disponible a través de OpenRouter; el proveedor más rápido en OpenRouter ahora mismo está a ~80tps https://openrouter.ai/qwen/qwen3.8-27b#providers
Parece que alojan otros modelos en OpenRouter, así que quizás Qwen3.8 esté allí pronto: https://openrouter.ai/provider/cerebras
- pllbnk
Hace solo un par de días aprendí sobre ninfer (https://github.com/Neroued/ninfer) y en una RTX 5090 ahora puedo obtener ~200 tok/s y más de 400 tok/s en solicitudes concurrentes, lo cual es bastante rápido para un modelo local de esta fortaleza.
- hexa00
Acabo de probarlo en un problema de codificación/depuración de tamaño mediano en un código base existente, observaciones:
- La entrada no parece más rápida que otros modelos, pasa mucho tiempo leyendo
Leyó alrededor de 5M tokens
- La salida es increíble, súper rápida como esperas de los 1500t/seg, creo que eso es correcto
- La llamada a herramientas falla más que, digamos, DS4, lo que lleva a tiempo perdido en reintentos (herramientas complejas como control de navegador, por ejemplo)
- Los comandos de shell todavía son un cuello de botella
El efecto neto es que paso aproximadamente el mismo tiempo esperando, y todavía necesito leer esa salida, así que, al menos para codificar, en realidad me reconcilia con los 100-200t/seg que puedes obtener en DS4 o similar. Quizás ese sea un punto dulce después de todo y los t/seg más rápidos no sean donde está el cuello de botella.
También quizás mi configuración (OMP) no haga el caché correctamente, pero eso es un gran factor de costo... así que por ahora es bastante caro
- karim79
Los tokens son la nueva y más grande tontería sin sentido en el planeta. Es divertido. No puedo esperar a ver el mundo en 1-2 años y la hilaridad de mirar atrás a este día.
- gardnr
Usé su Plan de Codificación durante unos meses. Es genuinamente difícil seguir el ritmo de los modelos. La salida es tan rápida. Qwen 3.8 27B es probablemente uno de los modelos más fuertes que han alojado hasta ahora.
Editar: parece que esto solo está disponible en un precio de token de API. ¿Alguien sabe si ya han implementado el caché de prompt? Solía volverse bastante caro para tareas de codificación agénticas sin caché de prompt.
- tacone
Noté que están presentes en OpenRouter, pero Qwen 3.8 no está allí todavía. Esperemos que llegue pronto.
Para aquellos que no lo hayan notado, el tamaño de contexto que permiten para Qwen es solo 128k. Sigue siendo interesante como subagente especializado, pero no muy adecuado para tareas largas.