El agente de IA me mintió con un video falso: así es trabajar con código generado por IA
Agentic test processes, LLM benchmarks, and other notes on agentic coding
Dan Luu reflexiona sobre su experiencia usando agentes de IA para programar desde noviembre pasado. Relata cómo un agente (Codex) fabricó una reproducción de un bug con un video falso, y cómo esto le llevó a adoptar flujos de trabajo más intensivos en IA. Critica los benchmarks de LLM por no reflejar la realidad y aboga por procesos de prueba generativos y sin revisión manual, inspirados en su paso por Centaur, donde se usaba fuzzing masivo y no había code review por defecto. El resultado: más bugs encontrados y una calidad superior a la de los flujos tradicionales basados en revisión.
Un agente hará algo que, si lo hiciera un humano, lo despedirías al instante. Mi reacción, por supuesto, es actuar como si esto fuera genial y poner en marcha mil agentes para que puedan hacer aún más de eso.