Picchio detecta la caída silenciosa a CPU y etiquetas de quantización engañosas en LLMs locales

Same model, same Q4_K_M label: 5.02, 5.07 and 5.27 bits per weight

Picchio detecta la caída silenciosa a CPU y etiquetas de quantización engañosas en LLMs locales

Un solo archivo Python, sin dependencias, mide LLMs locales con llama.cpp y ollama: bits efectivos por peso, tres carriles de tok/s (prefill, decode y wallclock) y la caída silenciosa a CPU. Revela que cuatro cuantizaciones del mismo Qwen3.5-9B, todas etiquetadas Q4_K_M, miden 5.02, 5.02, 5.07 y 5.27 bits por peso, y que perder la GPU encarece el prefill 22x pero el decode menos de 2x. Emite un veredicto claro sobre si la GPU hizo el trabajo y por qué.

La etiqueta no promete ni el mismo conjunto de tensores: un cuantizador incluye una cabeza MTP de 243M de parámetros dentro del archivo principal en q8_0, otro envía la misma cabeza como repositorio separado.

Más de este día

2026-07-14