Si la IA escribiera un millón de tokens por segundo, el cuello de botella sería otro

What if AI worked at 1.000.000 tokens per seconds?

Si la IA escribiera un millón de tokens por segundo, el cuello de botella sería otro

¿Qué pasaría si la IA generara un millón de tokens por segundo? El artículo desglosa cuatro significados de esa cifra —capacidad, lectura, throughput agregado y escritura de un solo agente— y muestra que, incluso a esa velocidad, el trabajo real sigue limitado por pasos secuenciales como pruebas, validación o evidencia física. Con ejemplos como 1.000 finales de historias en un segundo, concluye que el juicio humano se vuelve el recurso escaso.

Cuando la generación se abarata, el juicio se vuelve precioso.
  1. gchamonlive

    No quiero criticar el artículo, pero un enfoque mucho más interesante con un LLM que funcionara a 1kk TPS sería la cantidad innumerable de aplicaciones en tiempo real que podrías construir con él.

    Me gusta la música electrónica, bailo mucho con ella. ¿Y si tuviera un LLM con suficiente throughput y baja latencia para hacer lo inverso, tomar mi baile y generar música?

    Seguimos atascados mirando las estrellas ante la inteligencia cognitiva artificial en bruto, pero el verdadero progreso llegará cuando dejemos de percibir estas cosas como una inteligencia externa y las veamos simplemente como una extensión de nosotros mismos.

  2. sixtyj

    El "si" es temporal. Más TPS es cuestión de tiempo. En un caso de uso así, el humano en el bucle será eliminado, ya que nadie, ni siquiera alguien con el reconocimiento más rápido, será la parte más lenta.

    ¿Cuántas industrias hay así? ¿Cuántos casos de uso son posibles?

    Si resuelves todo, ¿qué hará la gente? ¿Sentarse en la playa, sorbiendo bebidas?

    ¿Degradación masiva de los cerebros humanos y aumento de enfermedades neurodegenerativas a medida que el dispositivo no utilizado empiece a fallar?

    1.000.000 de TPS es bueno para algunos casos de uso, pero no está disponible públicamente…

  3. ed

    A 1m tps, los LLM podrían generar UIs en tiempo real (una página web de 5k tardaría 5ms). Las aplicaciones tendrán muy poco en común con los stacks actuales cuando eso ocurra. (Para empezar, el renderizado, el manejo de eventos y el almacenamiento de datos podrían pasar al contexto.)

Más de este día

2026-10-03