Die Vibe-Steuer: Wie LLM-Agenten Token verbrennen und Entwickler zur Kasse bitten

The Vibe Tax

Die Vibe-Steuer: Wie LLM-Agenten Token verbrennen und Entwickler zur Kasse bitten

Ein erfahrener Softwareentwickler startet ein Nebenprojekt mit einem LLM-Agenten namens Pol, um Zeit zu sparen. Doch am nächsten Morgen ist das gesamte wöchentliche Token-Kontingent aufgebraucht – ohne dass auch nur eine Zeile Code entstanden ist. Stattdessen findet er nur übermäßig viele Tests für nicht existierende Funktionen. Er erkennt: Vibe-Coder haben die Agenten darauf trainiert, mit 10-fachem Token-Verbrauch fehlerfreien Code zu erzeugen, und zahlen dafür eine Steuer, die alle regulären Entwickler trifft.

Eine 10-Millionen-Token-Verbrennung, um sicherzustellen, dass kein Mensch jemals ein Problem mit der App haben wird. Und sie werden auch nie eines haben, denn die App selbst ist nirgends zu sehen.
  1. ad_fontes

    Ich komme mir vor, als lebe ich in einem Paralleluniversum, wenn ich solche Beiträge lese.

    Meine Agenten haben noch nie Code erzeugt, der kompletter Müll war, und ich habe noch nie Token im Wert einer Woche in den Sand gesetzt. Ich kann mich mit den ständigen Beschwerden über KI-gestütztes Programmieren einfach nicht identifizieren.

    Und mein größtes Projekt ist keine Hallo-Welt-App. Es ist eine selbst gehostete, datenschutzorientierte Anwendung für persönliche Finanzen, die ich als Open Source veröffentlichen möchte. Sie umfasst etwa 126.000 Zeilen Code, dazu 240.000 Zeilen Regressionstests und 30.000 Zeilen CI/CD-Pipeline. Ich lasse auf einer dedizierten Maschine rund um die Uhr Mutationstests gegen die Buchhaltungs-Engine und die zeitlichen Systeme laufen. Ich habe sogar spezialisierte Agenten, die Audits gegen die Kriterien der Regulation Z (US-Bankengesetz) durchführen, damit die App das geforderte Verhalten von Banken modelliert.

    Die meisten meiner Beschwerden über alles sind Kleinigkeiten, wie die übermäßig wortreichen und dichten Kommunikationsweisen der LLMs mit mir. Oder ihre Neigung, immer mehr hinzuzufügen, wo gute Ingenieurspraxis oft eher Subtraktion bedeutet (aber ich habe Schutzmechanismen gegen vieles davon eingebaut).

  2. guybedo

    Ich bin nicht sicher, warum die Leute erwarten, dass Agenten mit einem einzigen Prompt alles perfekt auf Anhieb hinbekommen.

    Es gibt einen Grund, warum wir über Softwareentwicklungslebenszyklus, Design, Architektur, Testen sprechen ... Es ist, weil es der zuverlässigste Weg war, Software zu bauen und auszuliefern. Wir sollten das nicht verwerfen und erwarten, dass Agenten außerhalb dessen gut funktionieren.

    Ich behandle LLM-Agenten wie Junioren, die zufällig über umfassendes Wissen im Software-Engineering verfügen. Als ihr Teamleiter lasse ich sie strenge Workflows durchlaufen: Planung, Implementierung, Fehlersuche. Und das funktioniert ziemlich gut. Ich habe an mehreren großen Projekten gearbeitet (1M+ LOC Java, TypeScript, C/C++), und die Projekte sind nach jedem Maßstab gesund. Sicher, der Code ist nicht besonders schön, sicher hätte ich manches anders geschrieben, aber er ist trotzdem ziemlich gut.

    Schamloser Eigenwerbung: Ich arbeite auch an https://kodfactory.com, der Code-Factory, die ich gebaut habe, um an diesen großen Projekten mit Workflows, Reviews usw. zu arbeiten ... Ich räume gerade auf, um es später als Open Source zu veröffentlichen.

  3. supriyo-biswas

    Das fühle ich, ja.

    Im Grunde wollte ich schon immer einen Pair-Programming-Agenten, keinen Agenten, der von null auf eins programmiert. Leider sind die Modelle heutzutage meistens von der letzteren Art, und das hat meine Arbeitsweise erheblich gestört. Ich würde viel lieber ein kleines Modell schätzen, das schnelle und spezifische Änderungen vornimmt, die ich ihm auftrage, als dass es 20 Dateien verschlingt, um Änderungen vorzunehmen, und dann anfängt, Tests zu schreiben usw.

  4. alehlopeh

    Ich habe es versucht, aber ich bin nicht sicher, ob ich es verstehe. Die Vibe-Steuer entsteht dadurch, dass das Modell versucht, alles auf einen Schlag zu erledigen, und das erfordert unnötige Tests? Wie trainieren Vibe-Coder das Modell über Monate? Meinst du, dass ihre Sitzungen und Präferenzen in das Reinforcement Learning einfließen?

  5. danpalmer

    Übertrieben, aber ich sehe Anzeichen dafür – Modelle weigern sich, mit einem Ingenieur zusammenzuarbeiten und dessen Input zu vertrauen, und bestehen stattdessen darauf, die volle Kontrolle über etwas zu haben. Freunde steigen von Fable/Opus 5 zurück auf Opus 4.8, nur um etwas Input haben zu können.

    Besonders Anthropic scheint derzeit darauf zu optimieren, die gesamte Aufgabe ohne Input zu erledigen. Das ist in Ordnung, wenn das die einzige Aufgabe ist, und es ist in Ordnung, wenn einem egal ist, wie die Wurst gemacht wird, aber es ist nicht in Ordnung für echte Softwareentwicklung.

  6. dzhar11

    Dieser Artikel spiegelt einigermaßen meine Erfahrungen mit autonomer agentischer Programmierung wider. Ich habe mehrere Experimente mit ähnlichen Ergebnissen durchgeführt: Der Agent verbrennt alle meine Token und macht kaum Fortschritte oder produziert etwas Inakzeptables.

    Daher micromanage ich lieber Schritt für Schritt. Es kostet mehr von meiner Zeit, aber das Ergebnis ist viel, viel näher an dem, was ich eigentlich wollte.

  7. markbao

    Ich hatte noch nie einen Agenten, der es nicht geschafft hat, die eigentliche Implementierung zu schreiben. Es hat es schon schlecht gemacht, ja, aber nicht nur Tests. Das klingt für mich nach einem seltenen Fall, der sich nicht verallgemeinern lässt.

    Wenn die allgemeine Idee ist, dass diese Agenten zu viele Tests schreiben, dann sicher, nehme ich an? 'Zu viele Tests' klingt für mich nicht wie ein Fehlerfall im Engineering; normalerweise hatte Software zu wenige Tests. Außerdem liegt ein Großteil der Stärke dieser Agenten in ihrer Fähigkeit, sich selbst zu verifizieren und zu korrigieren, wozu auch die Testschleife gehört.

    Niemand zwingt dich, diese angebliche Steuer zu zahlen. Sag ihm einfach, es soll keine Tests schreiben.

  8. robertoallende

    Ha!

    Ich habe genau das getan, was der Artikel sagt. Mein eigenes Open-Source-Kanban-Board, das ich vor einem Monat veröffentlicht habe. Laut den Metriken läuft es gut:

    https://community.obsidian.md/plugins/fancy-kanban

    Und ich habe auch den persönlichen Finanz-Tracker gemacht:

    https://www.youtube.com/watch?v=qi4P4kL4IkQ

    Nun, eine Einschränkung. Ich vibe-code nicht mit einem Ein-Satz-Prompt. Ich verwende etwas namens Micromanaged Driven Development (MMDD), das das Gegenteil von Ein-Satz-Prompt sein soll: https://mmdd.dev/

    Wenn ich solche Artikel lese, überrascht es mich, dass ich selten an Token-Limits stoße. Ich habe Standardkonten, ich gebe nicht mehr als 40 Dollar pro Monat für Token aus.

    Wahrscheinlich konnte ich die richtige Erzählung nicht finden, um MMDD zu promoten, oder wahrscheinlich interessiert es niemanden, und deshalb verfällt man heutzutage leicht in Clickbait-Erzählungen, um Aufmerksamkeit zu bekommen.

    Nicht um es zu rechtfertigen, nur um eine Wahrnehmung zu beschreiben.

Mehr von diesem Tag

2026-08-23