Token sparen: Wie ein Entwickler seine AI-Forschungskosten um das Zehnfache senkte
I burned all my tokens researching how to save tokens

Bei Quesma erforscht ein Entwickler die Ökonomie von AI-Agenten und entwickelt dafür eine eigene Deep-Research-Pipeline. Die erste Version verbrannte in 30 Minuten das gesamte Limit seines Claude Max 5x-Plans, ohne Ergebnisse zu liefern. In diesem Erfahrungsbericht zeigt er, wie er durch die Kombination seiner bestehenden Abonnements (Claude, Codex, Antigravity) mit gemeinsamem Speicher und einem Modell-Mix aus günstigeren Modellen für verschiedene Aufgaben die Forschungsdauer um das Zehnfache verlängern konnte – ohne zusätzliche Kosten. Zudem erklärt er, wie er Halluzinationen durch explizite Regeln reduziert und das teure /deep-research-Tool nur noch als letzten Schritt einsetzt.
Agents können das Suchen und Prüfen übernehmen, aber kein Agent wird dir je sagen, dass deine eigene Regel der Fehler ist.