La tasa de vibraciones: cómo los codificadores de vibraciones agotan tus tokens de IA
The Vibe Tax

Un desarrollador experimentado despierta para descubrir que su agente de IA, Pol, ha consumido toda su cuota semanal de tokens en una noche. Al investigar, encuentra una carpeta de pruebas exhaustivas pero ninguna aplicación. El autor argumenta que los 'vibe coders' han entrenado a los LLM para sobre-orquestar y sobre-probar, agotando los recursos de todos los demás. Esta 'tasa de vibraciones' es el costo oculto que los desarrolladores tradicionales pagan por la eficiencia de los agentes de IA.
Una quema de 10 millones de tokens para asegurar que ningún humano tenga que enfrentar algún problema con la aplicación.
- ad_fontes
Siento que vivo en un universo paralelo cuando leo este tipo de publicaciones.
Mis agentes nunca han creado código que sea basura directamente y nunca he tirado a la basura una semana de tokens. Simplemente no puedo identificarme con todas las quejas constantes sobre la codificación asistida por IA.
Y mi proyecto más grande no es alguna aplicación de hola mundo. Es una aplicación de gestión financiera personal autoalojada y centrada en la privacidad que pretendo abrir en código abierto. Tiene unas 126k líneas de código contra 240k líneas de pruebas de regresión y 30k líneas de pipeline de CI/CD. Estoy haciendo pruebas de mutación 24x7 en un servidor dedicado contra el motor contable y los sistemas temporales. Incluso tengo agentes especializados haciendo auditorías contra los criterios de la Regulación Z (ley bancaria de EE. UU.) para que la aplicación modele el comportamiento requerido de los bancos.
La mayoría de mis quejas sobre todo son nimiedades, como la forma excesivamente verbosa y densa en que los LLM se comunican conmigo. O su predisposición a añadir, añadir y añadir más cosas cuando las prácticas de ingeniería adecuadas suelen ser más sobre restar (pero he construido salvaguardas de mitigación contra gran parte de eso).
- guybedo
No estoy seguro de por qué la gente espera que los agentes hagan todo perfectamente de una sola vez con solo un prompt.
Hay una razón por la que hablamos del ciclo de vida del desarrollo de software, diseño, arquitectura, pruebas... Es porque ha sido la forma más fiable de construir y lanzar software. No deberíamos esperar descartar esto y esperar que los agentes se desempeñen bien fuera de esto.
Estoy tratando a los agentes LLM como desarrolladores junior que casualmente tienen un vasto conocimiento de ingeniería de software. Como su líder de equipo, los hago pasar por ciclos de planificación, implementación y barrido de errores usando flujos de trabajo estrictos. Y funciona bastante bien, he estado trabajando en varios proyectos grandes (1M+ LOC en Java, TypeScript, C/C++) y por cualquier medida los proyectos están saludables. Claro que el código no es tan bonito, claro que yo habría escrito las cosas de manera diferente, pero es bastante bueno de todos modos.
Promoción descarada aquí: también he estado trabajando en https://kodfactory.com, la fábrica de código que he construido para trabajar en estos proyectos grandes con flujos de trabajo, revisiones, etc... Estoy limpiando las cosas para abrirlo en código abierto más tarde.
- supriyo-biswas
Siento esto, sí.
En efecto, siempre he querido un agente de programación en pareja, no un agente de programación de cero a uno. Desafortunadamente, los modelos de hoy en día son mayormente del último tipo y ha causado una gran disrupción en la forma en que trabajo. Preferiría mucho más un modelo pequeño que haga ediciones rápidas y específicas que yo le pida, en lugar de ingerir 20 archivos para hacer cambios, y luego empezar a escribir pruebas, etc.
- alehlopeh
Lo intenté, pero no estoy seguro de entender. ¿El impuesto de vibraciones es causado por el modelo que intenta hacer todo de una sola vez y hacerlo requiere pruebas innecesarias? ¿Cómo están entrenando los codificadores de vibraciones al modelo durante meses? ¿Te refieres a que sus sesiones y preferencias se están retroalimentando en el RL?
- danpalmer
Exagerado, pero estoy viendo indicios de esto: modelos que se niegan a trabajar en pareja con un ingeniero y confiar en su aporte, en lugar de exigir tener control total sobre algo. Amigos que vuelven de Fable/Opus 5 a Opus 4.8 solo para poder tener algo de aporte.
Anthropic especialmente ahora parece estar optimizando para hacer toda la tarea sin aporte. Eso está bien cuando esa es la única tarea, y está bien cuando no te importa cómo se hace la salchicha, pero no está bien para la ingeniería de software real.
- dzhar11
Este artículo refleja algo de mi experiencia con la codificación agéntica autónoma. He realizado varios experimentos con resultados similares: el agente quema todos mis tokens mientras hace muy poco progreso, o produce algo inaceptable.
Así que prefiero microgestionar el proceso paso a paso. Me toma más tiempo, pero el resultado está mucho, mucho más cerca de lo que realmente quería.
- markbao
Nunca he tenido un agente que falle en escribir la implementación real. ¿Lo ha hecho mal? Sí, pero no solo pruebas. Esto me suena a un caso raro que no se generaliza.
Si la idea general es que estos agentes escriben demasiadas pruebas, supongo que sí. 'Demasiadas pruebas' no me suena a un caso de fallo de ingeniería; típicamente el software ha tenido muy pocas pruebas. Además, mucho del poder de estos agentes es su capacidad de auto-verificar y corregir, de la cual el bucle de pruebas es parte.
Nadie te obliga a pagar este supuesto impuesto. Solo dile que no escriba pruebas.
- robertoallende
¡Ja!
Acabo de hacer lo que dice el artículo. Mi propio tablero Kanban de código abierto y lo publiqué hace un mes. Según las métricas, está yendo bien:
https://community.obsidian.md/plugins/fancy-kanban
Y también he hecho el rastreador de finanzas personales:
https://www.youtube.com/watch?v=qi4P4kL4IkQ
Ahora, una advertencia. No codifico con vibraciones con un prompt de una sola vez. Uso algo llamado Desarrollo Dirigido por Microgestión (MMDD) que busca ser lo opuesto al prompt de una sola vez: https://mmdd.dev/
Cuando leo artículos como estos, me sorprende que sea muy inusual para mí alcanzar los límites de tokens. Tengo cuentas estándar, no gasto más de $40 al mes en tokens.
Probablemente no pude encontrar la narrativa correcta para promover MMDD, o probablemente a nadie le importa y por eso caes fácilmente en narrativas clickbait para llamar la atención de la gente hoy en día.
No estoy justificando, solo intentando describir una percepción.