Por qué tu LLM local parece más tonto de lo que es

Why your local LLM feels dumber than it is

Por qué tu LLM local parece más tonto de lo que es

Un análisis técnico demuestra que la implementación local de un LLM puede degradar su rendimiento debido a diferencias en hardware, software y cuantización. El autor compara backends de atención y cuantizaciones de KV-cache y pesos en Qwen3.6-27B, encontrando divergencias en los logits que provocan errores en la generación y llamadas a herramientas. Incluso con los mismos pesos, la elección del backend o la cuantización puede alterar el resultado. El artículo subraya la importancia de usar configuraciones adecuadas y benchmarks representativos para evaluar el rendimiento real.

Cada instancia de hardware y software que ejecuta un LLM hoy es un poco diferente, o mucho diferente en algunos casos.
  1. big-chungus4

    Acabo de conseguir qwen 3.8 27b mlx funcionando en mi Macbook Pro y, sinceramente, estoy bastante impresionado de lo poco tonto que es.

  2. heywoods

    La sección sobre los prompts del sistema y la gestión de la ventana de contexto es acertada; la mayoría de la gente no se da cuenta de cuánto degrada la lógica la cuantización por defecto en los runners populares en comparación con FP16 completo. Me encantaría ver si el autor ha comparado el impacto de la compresión de la caché KV en el razonamiento con contextos largos, ya que suele ser donde mi configuración local de Llama 3 empieza a fallar.

  3. jonplackett

    Mucho de esto es por lo que me ciño a la regla de:

    a) No cuantizar la caché KV

    b) No ejecutar cuantizaciones del LLM que sean peores que la mejor Q8 disponible (el archivo GGUF de unsloth de mayor tamaño posible para un modelo dado, como qwen 3.8 27B, por ejemplo). Prefiero que las cosas vayan lento pero tener la confianza de que está haciendo las cosas con más precisión.

  4. utopiah

    Incluso una cuantización de 4 bits de Qwen3.8 27b es indistinguible de Gemini 3.7 flash en nuestras pruebas internas. Con una tarjeta RTX5090 y ninfer, puedes obtener ~800 TPS de generación de tokens (c=8) y ~140 tokens por segundo en un solo flujo.

  5. a11r

    Estoy ejecutando Qwen3.8 agresivo sin censura Q4_K_P en una 4090 en un bucle contra los desafíos CTF de CrackMe 2026.

    Usando oh-my-pi en un entorno preconstruido que también dejé que Qwen construyera.

    Codex ni siquiera miraría los archivos; literalmente, en cuanto leyó algo con CTF se apagó. Ni siquiera ofreció recurrir a un modelo más tonto.

Más de este día

2026-08-22