Inteligencia frente a coste: los LLM caros no compensan

LLMs: Intelligence vs. Cost

Inteligencia frente a coste: los LLM caros no compensan

Un ingeniero de OpenTeams y mantenedor de Dask critica el gráfico de Inteligencia frente a coste de ArtificialAnalysis por su escala logarítmica, que oculta diferencias enormes de precio, y por usar precios oficiales de API, que perjudican a los modelos de pesos abiertos. Reelabora los datos con escala lineal, precios de OpenRouter y costes reales de ejecución local para modelos pequeños, revelando que los modelos de gama alta de Anthropic y OpenAI son hasta 160 veces más caros que alternativas chinas como GLM-5.3-Flash, que rinden lo suficiente para la mayoría de tareas. Incluye cálculos de coste eléctrico para modelos locales y advierte de rendimientos decrecientes: la inteligencia extra de los modelos caros solo la aprecian expertos en tareas muy complejas.

La inteligencia extra que se compra al vaciar la cartera obedece a la ley de rendimientos decrecientes: mientras que un ingeniero o científico de primer nivel probablemente apreciará lo mucho mejor que es Fable 5.1 (puntuación de inteligencia 66, 3,69 $ por tarea) comparado con GLM-5.3 (inteligencia 60, 0,49 $ — 7,5 veces más barato), la mayoría de la gente tendrá dificultades para hacerlo.
  1. oliwary

    ¡Esto se ve genial! También creo que la velocidad debería ser parte de la métrica (es decir, cuánto tarda el modelo en resolver realmente una tarea). Para mí, prefiero ejecutar modelos caros como Sol en razonamiento ligero, lo que normalmente me da buenas respuestas con respuestas rápidas.

    Para mi estilo de codificación (idas y venidas rápidas y correcciones) marca una gran diferencia si un modelo responde en 1-2 minutos en comparación con 5-10, y estoy feliz de pagar un poco más por eso.

  2. themgt

    Hay una diferencia inmensa en costo entre los modelos de última generación de Anthropic y OpenAI y los modelos chinos mucho más baratos... Cuánta inteligencia adicional compra el vaciar la cartera obedece a la ley de rendimientos decrecientes: mientras que un ingeniero o científico de primer nivel probablemente pueda apreciar cuánto mejor es Fable 5.1... la mayoría de la gente tendrá dificultades para hacerlo.

    Nebari está oficialmente listado como un producto JATIC como parte del conjunto de herramientas de próxima generación que respalda el desarrollo de IA del DoD.

    ¿Estamos oficialmente a ~un grado de Kevin Bacon del DoD respaldando la ejecución de modelos OSS chinos porque están autoalojados y somos todos demasiado tontos para notar la diferencia?

    https://openteams.com/open-source-isnt-the-real-risk-in-nati...

  3. datadrivenangel

    La queja sobre no poder cambiar entre lineal y log es válida, que es lo que hice para crear una aplicación de frontera 3D de velocidad/costo/calidad para una charla reciente en un meetup: https://www.williamangel.net/apps/model_performance.html

    Debido a que la velocidad es importante, ya que el razonamiento y el hardware determinan tanto el costo como la velocidad, es una compensación tridimensional.

Más de este día

2026-09-02