Qwen3.8 27B en mi Mac Studio: números reales de velocidad y RAM
Run Qwen3.8 27B locally: real numbers from my Mac Studio

Tras diez días usando Qwen3.8 27B como asistente local en un Mac Studio M3 Ultra, el autor comparte mediciones detalladas: genera a ~14 tokens/s, la mitad que su predecesor, pero responde en un tercio de los tokens, igualando el tiempo por respuesta. Prueba también el quant de 1 bit (6.7GB) a 27 tokens/s, que acierta datos pero es indeciso. Incluye tabla de requisitos de RAM y consejos para ejecutarlo con Ollama o llama.cpp, advirtiendo de la necesidad de versiones recientes.
La cuantización no degrada el modelo de manera uniforme: los hechos sobreviven, la determinación muere.
- Youden
He estado pensando en comprar un sistema para ejecutar LLMs localmente, pero el precio de uno que ejecute Qwen3.8-27B bien es bastante desalentador, por decir lo menos.
Lo que he estado mirando en su lugar son proveedores de inferencia que usan TEE y E2EE para proporcionar garantías criptográficas de que mis prompts y respuestas solo son visibles para mí y para la GPU misma.
A pesar de sus documentos y garantías de lo que significan sus garantías, me cuesta llegar a un punto en el que realmente me sienta cómodo confiándoles secretos. Phala, por ejemplo, parece ser E2EE solo hasta la puerta de enlace y luego reenvía los prompts a proveedores (potencialmente de terceros).
¿Alguien ha recorrido este camino y ha encontrado un proveedor con el que se sienta seguro?
- Infernal
Me sorprende mucho que estés viendo la mitad del rendimiento de generación de 3.6 con 3.8 en el mismo tamaño de parámetros y cuantización (y el mismo rendimiento de prefill también): ¿hay alguna optimización en la pila para 3.6 que aún no ha llegado para 3.8?
Tengo curiosidad si a otros también les sorprende esta aparente discrepancia o tienen una explicación lista.
- Atreiden
Estoy encontrando el mismo comportamiento. He probado cuantizaciones de 4-8 bits y obtengo 14-17 tok/s con una ejecución que alcanzó 19. Estoy esperando ansiosamente el soporte de dflash2 en Unsloth o LM Studio, ya que supuestamente eso debería aumentar el rendimiento a alrededor de 30tok/s, que es la línea base de lo que considero al menos algo interactivo.
Envidio a la gente con 5090 ejecutando ninfer y obteniendo >100tok/s. A esas velocidades es un verdadero reemplazo de frontera en mi opinión.
- rbanffy
Es bastante impresionante cómo el Mac termina siendo menos caro que los equipos Strix Halo, al menos aquí en Irlanda. Un Mac Studio de 128GB con un M5 Max (el Ultra solo puede tener 96 o 256GB) todavía cuesta menos que el "GMKtec EVO-X2" o el Nvidia DGX Spark con rendimiento similar. ¿Es lo mismo en los EE. UU.?
- pwython
Sí, Qwen3.8 no fue divertido de usar en mi M4 Max de 64GB tampoco (aunque mejor que estos números), así que mi nuevo conductor diario es Ornith-1.5-35B-A3B-MLX-4bit. Recomiendo probarlo si tienes hardware similar, definitivamente es mejor que Qwen3.6 35b-a3b que era mi opción anterior.