Por qué tu LLM local parece más tonto de lo que es
Why your local LLM feels dumber than it is

Un análisis técnico demuestra que la implementación local de un LLM puede degradar su rendimiento debido a diferencias en hardware, software y cuantización. El autor compara backends de atención y cuantizaciones de KV-cache y pesos en Qwen3.6-27B, encontrando divergencias en los logits que provocan errores en la generación y llamadas a herramientas. Incluso con los mismos pesos, la elección del backend o la cuantización puede alterar el resultado. El artículo subraya la importancia de usar configuraciones adecuadas y benchmarks representativos para evaluar el rendimiento real.
Cada instancia de hardware y software que ejecuta un LLM hoy es un poco diferente, o mucho diferente en algunos casos.