Los agentes de programación siguen siendo el cuello de botella de la IA

Why Are Coding Agents So Dumb?

Los agentes de programación siguen siendo el cuello de botella de la IA

Michael Lynch analiza por qué los agentes de programación como Claude Code o Codex no están a la altura de los modelos que los impulsan. Critica su incapacidad para paralelizar tareas, delegar en modelos más baratos, comunicar planes legibles y operar en sandboxes reales. Su conclusión es que, aunque los LLM avanzan, los agentes se han estancado y siguen siendo el eslabón débil del desarrollo asistido por IA.

El modelo es el cerebro y el agente es el cuerpo. El modelo produce un flujo de texto y el agente actúa como el pegamento que conecta ese texto con los comandos y archivos correctos del sistema.
  1. johnfn

    Todos estos problemas están resueltos.

    > Los agentes no pueden gestionar tareas

    Di "usa subagentes".

    > Los agentes no pueden delegar

    Di "usa subagentes que sean Haiku/Sonnet"

    > Los agentes nunca han oído hablar de agentes

    Esto ni siquiera es un problema: el autor simplemente está confundido sobre por qué Anthropic no metió toda la documentación de Claude Code en el harness, pero por supuesto que no tiene ningún sentido contaminar el contexto así.

    > Los agentes son malos comunicando planes

    Cierto, la comunicación podría ser mejor.

    > Los agentes toman cualquier excusa para dejar de trabajar

    Solo usa /loop.

    > Los agentes solo son útiles cuando asumen riesgos innecesarios

    Solo usa un sandbox. Vale, técnicamente, Anthropic/OpenAI no resuelven esto literalmente, pero lo resuelven un millón de startups de sandboxes para agentes.

  2. Neywiny

    Me sigo topando con esto. Es agradable ver a otros aquí lidiando con lo mismo. Supongo que cuando todo lo que haces son tareas triviales de un solo intento, a nadie le importa. He descubierto que son geniales para eso. Pero en cuanto necesito hacer trabajo de verdad, todo el mundo crea su propio abandonware esotérico que más o menos funciona pero más o menos no. Las estrellas no son un indicador perfecto, pero no he visto nada que pase de unos cientos para estas cosas que encuentro en GitHub. Lo mismo con las descargas de plugins. Era muy aislador sentir que soy el único que no está encantado con el estado de esto.

  3. polyterative

    Entiendo tu punto, pero incluso el hecho de que pueda hablarle a mi computadora y que ocurra algo útil sigue siendo un milagro para mí. No creo que me acostumbre nunca a lo buenos que son los nuevos modelos. Simplemente no puedo seguir el ritmo. Y me dedico a esto. Diez horas al día.

    Mucho se puede mejorar, pero esto ya es muchísima velocidad.

  4. mstank

    Antes me identificaba bastante con este artículo. En los últimos 3-4 meses, no tanto. He descubierto que los últimos modelos -- Opus 5.5, Astra, etc. hacen malabares con múltiples tareas, delegan excepcionalmente bien y son muy buenos trabajando de forma independiente.

    Todavía tengo problemas ocasionales con modelos de pesos abiertos, pero los laboratorios de frontera han resuelto lo anterior para la mayoría de los casos de uso.

  5. ilamont

    el agente nunca se detiene y dice: "Espera, esto es algo que otro modelo podría hacer más barato y rápido". Simplemente sigue adelante con el modelo lento y caro. A la inversa, el agente nunca dice: "Este modelo es demasiado tonto para esta tarea. Que entre uno más listo".

    Esto es un fallo bastante grande, que se ve agravado por el hecho de que la mayoría de los humanos no sabe qué modelo elegir, o hace suposiciones basadas en la jerarquía de Anthropic o el "esfuerzo" implicado.

    Como Fable: tus desafíos más duros. ¿Te refieres a desafíos más duros tipo Medalla Fields? ¿O a desafíos más duros tipo analizar y actualizar tres hojas de cálculo monstruosas? ¿O a desafíos más duros tipo escribir una nueva novela al estilo de William Gibson?

Más de este día

2026-10-09