Ask HN: Produziert irgendjemand guten Code mit Coding-Agents?

Ask HN: Is anybody producing good code with coding agents?

Ich höre von erfahrenen Engineers, dass die Qualität von KI-generiertem Code (Claude, agy, copilot, codex etwas besser) schlecht ist und das Lesen extrem anstrengend. Früher habe ich von erfahrenen Kollegen gelernt und war stolz auf Eleganz und Handwerkskunst; heute verbringe ich fast den ganzen Arbeitstag damit, mich durch verschachtelten Code mit Fußangeln zu quälen. Das Review von Claude-Merge-Requests dauert 5x länger, und ich verstehe kaum, was ich freigebe. Die vorgeschlagene Lösung scheint zu sein, „Level 4 Autonomie“ zu erreichen und keinen Code mehr zu lesen oder zu schreiben. Wer hat dieses Problem gelöst? Bitte helft!

Ich produziere mit KI in der Regel fast denselben Code, den ich selbst schreiben würde, nur etwa 5x schneller. Ich lasse Claude Code nicht einfach lange laufen und habe dann ein Chaos zum Reviewen. Ich lasse es kleine Häppchen machen, die ich schnell überprüfen kann, gebe Feedback, iteriere usw., bis mir die Ausgabe gefällt, dann gehe ich zum nächsten Schritt über. Das kostet natürlich Zeit, aber ich habe festgestellt, dass es schneller ist, als ein riesiges Chaos in einem Code-Review zu prüfen.
Was ist das Problem der vorgeschlagenen Lösung? Keinen Code mehr lesen/schreiben. Ein starkes Harness haben. So arbeitet mein Team von ~30 Leuten größtenteils. Das Problem, das wir lösen wollten, war nie Code zu schreiben, sondern Geschäftsprobleme zu lösen.
„Ich verstehe den Code nicht mehr. Er funktioniert.“ Das ist in Ordnung ... heute. „Ich werde den Code nie wieder verstehen müssen“ ist eine ganz andere Aussage. Wenn du den Code nicht verstehst und der Code von keinem Menschen geschrieben wurde, wie schwer wird es sein, wieder herauszukommen, wenn du irgendwann in die Enge getrieben wirst? Wird es einfacher oder schwieriger sein, als ein Verständnis aufrechtzuerhalten, bis du an diesen Punkt kommst? Du setzt möglicherweise deine Firma auf die Antwort. Wie sicher bist du dir?
Die Art und Weise, wie ich es mache, ist, LLMs zu nutzen, um den Code zu generieren, den ich nicht schreiben möchte: Prototypen, Tests, Benchmarks, isolierten, einfachen, fast Copy-Paste-Code. Ich schreibe meinen eigenen Code weiterhin wie zuvor, weil es mir Spaß macht und weil der Versuch, das zu verstehen und zu reparieren, was ein LLM generiert und neu generiert, schwieriger, mühsamer und zeitaufwändiger ist, als den Code von Anfang an so zu schreiben, wie ich es möchte.
Es ist ein Spektrum. Für KI-gepflegten Code (wie eine GUI zur Visualisierung von Performance-Daten) ist mir egal, wie der Code aussieht. Ich lasse Claude oder Codex einfach loslegen und 100% Vibe-Code. Für Code, der mir wichtig ist, prüfe ich jeden einzelnen Hunk, sobald er produziert wird. Ich gebe umfangreiche Style-Guidelines vor und gehe gegen Dinge wie einen 20-zeiligen Aufsatz in einem Kommentar vor. Für missionskritischen Code schreibe ich den Code selbst und lasse ihn von einem Agenten überprüfen.
Nachdem ich mich mehrmals bei wichtigen Projekten in eine Ecke gevibet habe, habe ich jetzt nur noch zwei Modi: clankermaxx für Code, der mir nicht wirklich wichtig ist (meistens Frontend React), und alles andere von Hand schreiben. Django für das Backend entfernt bereits den meisten Ballast, und von Hand zu schreiben bedeutet auch, dass ich tatsächlich verstehe, was vor sich geht. Funktioniert vorerst gut. Bei Tests bin ich noch unentschlossen: Ich schreibe sie nicht wirklich gern, aber die LLM-generierten Tests sind ziemlich schlecht, selbst die Frontier-Modelle mit xhigh Thinking. Ich generiere sie normalerweise, aber ich habe nicht wirklich Vertrauen, dass sie irgendetwas testen außer 1==1. Leider ist es schwer, die Zeit für manuelles Schreiben zu rechtfertigen.
Ich bin sehr zufrieden mit meinem opencode + open weight Setup, der Code ist im Allgemeinen ziemlich gut, aber ich verbrauche Tokens damit, Agenten nach üblichen KI-Schlampenmustern suchen zu lassen. Es ist stark angepasst, die meisten internen Systeme wurden durch Plugins ersetzt, eine Reihe eigener Agenten statt der eingebauten, verschiedene Modellfamilien für verschiedene Teilaufgaben. (Claude nicht seinen eigenen Code reviewen lassen) Ich arbeite daran, sie aufzupolieren und noch ein paar aus meinem eigenen Harness zu portieren, dann werde ich sie Open Source machen. Haltet Ausschau nach einer „better-opencode“-Plugin-Suite, ich werde sie sicher mit HN teilen :] Kurzfristig mag ich GLM 5.3 Prosa für Code-Exploration/Review sehr, probiert es aus, es ist günstiger (Flash-Modell) und fängt alle möglichen Fehler der großen KI-Modelle ab. Wir haben letzte Woche unser eigenes PR-Review auf glm-5.3-flash ausgerollt. Die meisten Entwickler sind noch auf Claude, wir bewegen sie in Richtung fireworks und opencode. OpenCode Go ist eine großartige Möglichkeit, Open-Weight-Modelle für 10 $/Monat auszuprobieren.