Ask HN: ¿Alguien está produciendo buen código con agentes de codificación?

Ask HN: Is anybody producing good code with coding agents?

Soy un ingeniero senior y escucho de colegas que la calidad del código generado por IA es terrible. Me agota revisar cambios incomprensibles y siento que pierdo el entendimiento del código base. ¿Alguien ha resuelto este problema? ¡Necesito ayuda!

Generalmente produzco casi el mismo código que escribiría yo mismo unas 5 veces más rápido con IA. No dejo que Claude Code se descontrole durante mucho tiempo y tenga un desastre que revisar. Le hago hacer pequeños fragmentos que puedo revisar rápidamente, le doy retroalimentación, itero, etc., hasta que me gusta el resultado, luego paso al siguiente paso. Esto lleva tiempo, por supuesto, pero he encontrado que es más rápido que revisar un gran desastre en una revisión de código.
¿Cuál es el problema de la solución propuesta? Ya no leer ni escribir código. Tener un arnés fuerte. Así es como mi equipo de ~30 ha estado operando en su mayor parte. El problema que intentábamos resolver nunca fue escribir código, era resolver problemas de negocio.
"Ya no entiendo el código. Funciona". Eso está bien... hoy. "Nunca necesitaré entender el código de nuevo" es una afirmación muy diferente. Si no entiendes el código, y el código no fue escrito por ningún humano, cuando finalmente te acorralen, ¿qué tan difícil será salir? ¿Será más fácil o más difícil que mantener el entendimiento durante todo el tiempo que tome llegar a ese punto? Puede que estés apostando tu empresa a la respuesta. ¿Qué tan seguro estás?
La forma en que lo he estado haciendo es usar LLMs para generar el código que no quiero escribir: prototipos, pruebas, benchmarks, código aislado, sencillo, casi de copiar y pegar. Todavía escribo mi propio código como antes porque disfruto hacerlo y porque tratar de entender y arreglar lo que un LLM genera y regenera es más difícil, tedioso y consume más tiempo que escribir el código como quiero hacerlo desde el principio.
Es un espectro. Para código mantenido por IA (como una GUI para visualizar datos de rendimiento), no me importa cómo se ve el código. Dejo que Claude o Codex se vuelvan locos y hago 100% vibe coding. Para código que me importa, audito cada fragmento a medida que se produce. Le doy pautas de estilo extensas y soy estricto con cosas como un ensayo de 20 líneas en un comentario. Para código crítico, escribo el código yo mismo y hago que un agente lo revise.
Estoy muy contento con mi configuración de opencode + open weight, el código es generalmente bastante bueno, pero gasto tokens haciendo que los agentes busquen patrones comunes de basura de IA. Está muy personalizado, reemplacé la mayoría de los sistemas internos con plugins, un conjunto de agentes personalizados en lugar de los integrados, diferentes familias de modelos para diferentes subtareas. (no dejo que Claude revise su propio código). Estoy trabajando en pulirlos y portar algunos más de mi propio arnés, luego los abriré. Mantente atento a una suite de plugins "better-opencode", me aseguraré de compartirla con HN :] A corto plazo, me gusta mucho la prosa de GLM 5.3 para explorar/revisar código, pruébalo, es más barato (modelo flash) y detecta todo tipo de errores de los grandes modelos de IA. Implementamos completamente nuestra revisión de PR personalizada en glm-5.3-flash la semana pasada. La mayoría de los desarrolladores todavía usan Claude, los estamos moviendo hacia fireworks y opencode. OpenCode Go es una excelente manera de probar modelos de peso abierto por $10 al mes.