El costo de la inteligencia de IA cae 56 veces en seis meses

What Happens When the Cost of Intelligence Drops 100x

El costo de la inteligencia de IA cae 56 veces en seis meses

El nivel de inteligencia que costaba 1,22 dólares por tarea en febrero ahora cuesta 0,022 dólares, una caída de 56 veces en menos de seis meses, según datos de Artificial Analysis. El análisis de CatalystNeuro muestra que la frontera de Pareto de los modelos de IA se ha desplazado rápidamente, con modelos como GPT-5.6 Luna ofreciendo capacidades de nivel superior a precios mucho más bajos. La tasa de descenso se acelera, y una caída de 100 veces para un nivel de capacidad dado toma aproximadamente un año.

El techo desbloquea nuevos tipos de tareas; el suelo desbloquea volumen.
  1. Balooga

    Paradoja de Jevons [1]

    > cuando las mejoras tecnológicas que aumentan la eficiencia en el uso de un recurso conducen a un aumento, en lugar de una disminución, del consumo total de ese recurso.

    [1] - https://en.wikipedia.org/wiki/Jevons_paradox

    Las Vegas reemplazó la iluminación incandescente cara del Strip por equivalentes LED más baratos de operar. Pero los costos no bajaron porque pudieron añadir más luces y pantallas más grandes.

    Creo que lo mismo pasará con los tokens. A medida que el costo de los tokens baja, estos modelos consumirán más tokens.

  2. andai

    > Leer todo se convierte en la opción por defecto. A un centavo por documento, un modelo puede leer todos los artículos.

    Me encanta cómo en nuestros días "leer todo" significa "la computadora lo lee por mí".

    Espero que pronto la computadora pueda salir a andar en bicicleta y pasar tiempo con mi esposa.

  3. jbotdev

    Creo que la velocidad va a ser un factor más importante que el costo. Incluso proyectos donde "el dinero no es problema" a menudo chocan con una pared en los tiempos de respuesta de los LLM.

    Claro que puedes acelerar las cosas con trabajo paralelo bajo subagentes, pero como con la paralelización de tareas computacionales tradicionales, hay ganancias decrecientes.

    Sigo escuchando a gente decir que solo cambies tu forma de trabajar para confiar en agentes de larga duración y hacer multitarea, porque son demasiado lentos para trabajar de forma interactiva en muchos casos de uso. Creo que eso es doloroso en un mundo donde esperamos que los humanos aún guíen e interactúen fuertemente con los agentes en su trabajo diario.

  4. AnotherGoodName

    Creo que uno grande es la robótica. Un robot hoy puede doblar tu ropa. Tarda ~10 minutos por prenda. En serio. Toma mucho tiempo procesar la imagen, encontrar la esquina, mover la garra a la esquina de la camisa e intentar enderezarla antes de doblar.

    Los robots ahora generalmente se mueven a velocidades glaciales. Puede que hayas visto robots haciendo volteretas en entornos semcontrolados, pero mira lo lento que abren puertas, etc. El tiempo de procesamiento es un cuello de botella importante.

  5. newAccount2025

    Me encantan los modelos pequeños. Los modelos gemma4 26b/31b han sido profundamente impresionantes en tareas de análisis de prosa raras en las que estoy trabajando. Nova-micro es realmente tonto pero es extremadamente rápido cuando es lo suficientemente inteligente para hacer algo. Estoy tratando de ser disciplinado en poder evaluar calidad vs costo en todos lados para sistemas reales construidos sobre esto. Probablemente necesito salir de Bedrock porque le faltan muchos otros modelos pequeños que podrían ser buenos competidores.

  6. bdhdhduuyd

    Personalmente, todavía veo a los LLM como motores de búsqueda muy avanzados que carecen de inteligencia. Para mí, parece que el costo de obtener datos se reduce con los LLM, no el costo de la inteligencia. Quiero decir: le decimos al modelo lo que queremos lograr, y el modelo responde con los datos correctos en forma de código en segundos.

    Por eso los 'programadores de stackoverflow' tendrán dificultades para competir con los LLM, pero los ingenieros todavía son necesarios por su inteligencia.

    Bueno, eso es solo mi opinión.

  7. MichaelNolan

    100x parece una subestimación. Incluso sin mejoras en los modelos, deberíamos ver ese tipo de reducción. Mirando los márgenes de TSMC, los márgenes de Nvidia y los márgenes (supuestos) de OAI/Anth en inferencia, hay espacio para una reducción de 100x.

    Ahora mismo los tres están en niveles anormalmente altos. La competencia llegará para los tres.

  8. vanuatu

    Creo que lo que mucha gente no ve de la paradoja de Jevons es la elasticidad de la demanda del recurso subyacente.

    Los textiles tuvieron la paradoja de Jevons, y muchos más trabajadores textiles fueron empleados incluso mientras se creaban máquinas textiles, hasta que saturamos la demanda de ropa barata en el mundo y entonces los trabajadores textiles quedaron obsoletos (lo mismo con la agricultura y los caballos).

    El software está experimentando actualmente la paradoja de Jevons, pero es muy desconocido cuán alto es el techo de demanda de software. El desarrollo web podría estar condenado, pero el software en general creo que es probablemente ilimitado.

    La inteligencia también es probablemente ilimitada (por ahora el software y la inteligencia están muy estrechamente vinculados). Es muy posible que el gasto en tokens suba la curva para siempre.

Más de este día

2026-08-21