Spotify's Portal senkt meinen Claude-Code-Tokenverbrauch um 90 %

Portal by Spotify cut my Claude Code token usage by 90%

Spotify's Portal senkt meinen Claude-Code-Tokenverbrauch um 90 %

Die meisten Token, die KI-Codierungsagenten verbrauchen, fließen in I/O-Aufgaben, nicht in Denkprozesse. Spotify-Ingenieur Sorantis zeigt, wie er mit Portal by Spotify und den AiKA-Modi die teuren Frontier-Modelle entlastet: Ein Plugin namens „shunt“ leitet große Datei-Lesevorgänge und Boilerplate-Code-Generierung an günstigere Worker-Modelle wie Gemini 2.5 Flash weiter. Das Ergebnis: durchschnittlich 90 % weniger Token-Verbrauch bei Claude Code. Der Artikel erklärt die Architektur aus Hooks, Skripten und Skills, zeigt Grenzen auf (keine Delegation von Reasoning oder Editing) und betont, dass die Modi wiederverwendbar, teilbar und konfigurierbar sind – Modell-Routing wird so zum Konfigurationsproblem statt zur Infrastrukturaufgabe.

Die Modi entkoppeln die Routing-Entscheidung vom Worker: Das Plugin entscheidet, wann es delegiert, der Modus entscheidet, wie er antwortet.
  1. solenoid0937

    Das ist also nur die Delegation bestimmter Arbeiten an dümmere Modelle? Ich würde sicherlich nicht Gemini 2.5 Flash (!!?) zum Schreiben von Code verwenden, wie vorgeschlagen.

    Ich hatte noch nie Probleme mit Codex oder Claude beim Lesen massiver Dateien, sie sind wirklich gut bei präzisen Greps.

  2. jnwatson

    Es reduziert den Tokenverbrauch, weil sie einen anderen Dienst mit einem anderen Tokenbudget für die Lese-/Code-Schreibaufgaben verwenden.

    Du kannst das auch einfach an Subagenten mit Claude Code delegieren (allerdings hast du eine begrenztere Modellauswahl, es sei denn, du tauschst die billigeren Modelle über OpenRouter aus).

    Ich bin damit einverstanden, ein dummes Modell als intelligenten Grep zu verwenden, aber der ganze Sinn der Verwendung von Frontier-Modellen ist es, ihre Intelligenz für die schwierigen Dinge wie das Programmieren zu nutzen.

  3. faangguyindia

    In der Praxis funktioniert es nicht gut.

    Probier es selbst aus: Verwende ein großes Modell wie Opus oder Sol, um alles zu implementieren, indem du zuerst einen Plan mit dem Plan-Modus erstellst.

    Versuche dann, die Aufgabe auf billigere Modelle wie Luna Max oder Gemini Flash 3.8 zu verteilen.

    Während der Planung liest das große Modell bereits die relevanten Dateien im Kontext, während das Zuweisen eines Arbeitspakets an ein kleineres Modell selbst erfordert, dass das große Modell über die Aufgabenverteilung nachdenkt, überprüft usw.

    Sparst du also wirklich Tokens?

  4. shikck200

    Nebenbei bemerkt: BITTE entführt nicht das Scrollen. Das ist einfach eine schlechte, schlechte Sache. Bitte nicht.

  5. Banditoz

    Oh je, warum überschreibt diese Website das Scrollverhalten?

Mehr von diesem Tag

2026-09-05