Qwen3.8 27B: la cuantización de 4 bits mantiene el rendimiento, la de 1 bit colapsa
Benchmarking Qwen3.8 27B quantizations: 4-bit holds up, 1-bit collapses
Un análisis exhaustivo de las cuantizaciones de Qwen3.8 27B revela que la versión de 4 bits (Q4_K_M, 17 GB) iguala al modelo completo en benchmarks como Terminal-Bench 2.1 y GPQA Diamond, cabiendo en una RTX 4090. Sin embargo, la cuantización de 1 bit (UD-IQ1_S, 6.2 GB) produce resultados cercanos al azar, y un razonamiento más prolongado empeora el desempeño. El autor, que gastó unos $3,000 en GPUs de Modal, también encontró que la cuantización de 2 bits funciona decentemente en tareas simples, pero falla en las complejas. En general, recomienda adoptar la cuantización de 4 bits para la mayoría de los casos.
En este caso, estos 28% restantes importan mucho.
- spider-mario
> Segundo, aparte del ruido (las barras son intervalos de confianza de Wilson al 95%, muy conservadores para el ruido de ejecución a ejecución), hay poca diferencia hasta 4 bits; solo el de 2 bits puntúa un poco más bajo.
Los intervalos de confianza no tienen nada que ver con la variación entre ejecuciones. Tienen poco que ver con lo que la gente suele atribuirles (https://link.springer.com/article/10.3758/s13423-015-0947-8), pero aún menos con la variación entre ejecuciones (https://link.springer.com/article/10.1007/s10654-016-0149-3, concepto erróneo 22).
- sharmajai
Esto confirma una teoría que tengo para explicar la pérdida mínima de calidad al usar cuantizaciones más bajas (uso IQ3_XXS con caché KV de 8 bits) y el nivel de pensamiento XHIGH (predeterminado).
Es bien sabido que, aunque la cuantización afecta la distribución de probabilidad de muestreo (dado el mismo contexto, cuál es el siguiente token más probable), Qwen 3.8 27b parece compensar eso simplemente pensando más y, como resultado, eventualmente completando la tarea (punto de referencia o no).
Así que, mientras el pensamiento (aunque más largo) sea sólido, esto lleva a la misma tasa de éxito (como se muestra en el artículo), pero potencialmente al costo de más tokens y, por lo tanto, más tiempo.
Creo que sería útil además graficar los tokens utilizados por cada cuantización, además de la tasa de éxito.
¡Gracias por hacer y compartir la investigación!
- purpleflame1257
Hay un hueco real aquí en Q3. Un punto de inflexión crítico aquí son las tarjetas de menos de 16 GB, que cubre la 5080, 5070 Ti, 5060ti y varias otras tarjetas de esta generación y la anterior. Sería instructivo ver dónde está la rodilla de calidad.
- alentred
Me interesaría mucho un punto de referencia similar para las cuantizaciones de *caché KV*.
A veces uso Qwen3.8 27B Q4_K_M para codificar y, por lo tanto, necesito un contexto relativamente largo. Me decidí por q8_0 porque es la única forma de que quepan el modelo + 100k tokens en 24GB de VRAM, pero aún me pregunto qué estoy perdiendo en calidad y qué otras opciones hay.
También escuché que la cuantización de la caché KV importa más con contextos más largos. Puede ser interesante comparar también esto: cómo se ve la calidad en diferentes combinaciones de cuantización del modelo × cuantización de la caché KV × tamaño del contexto.
- Farmadupe
Mmm, asumiendo que este artículo está escrito en parte por Claude y en parte por humanos, ¿alguien puede ayudarme a encontrar una regla general para "saber si vale la pena leer el artículo"?
Porque por un lado, la prosa y la presentación son dolorosas (narrar puntos irrelevantes, ejes X no lineales, etiquetas de gráficos ambiguas, etc.),
Pero por otro lado, el resultado que supongo que el autor quiere comunicar ("en estas evaluaciones, la calidad de generación parece bastante buena") suena digno de compartir.
Porque realmente lucho con esta pregunta en este momento. ¿Se me permite sacar una inferencia adversa de que "si el escrito presenta texto irrelevante junto a los datos, esto puede ser una señal de que el autor no entiende la tarea que intenta escribir"?