Portal от Spotify сократил расход токенов Claude Code на 90%

Portal by Spotify cut my Claude Code token usage by 90%

Portal от Spotify сократил расход токенов Claude Code на 90%

Инженер Spotify делится опытом радикального сокращения расходов на токены при работе с ИИ-ассистентом Claude Code. Большая часть токенов уходит не на размышления, а на чтение файлов и генерацию шаблонного кода. Решение — два режима (mode) в Portal by Spotify: bulk-reader для массового чтения и code-writer для написания кода по образцу. Вместе с плагином shunt, который перехватывает вызовы Claude Code и направляет их в эти режимы, удалось добиться экономии до 90% токенов. При этом автор честно отмечает ограничения: нельзя делегировать редактирование кода и сложные рассуждения, а задержки при делегировании могут быть значительными.

Большая часть того, что ИИ-агент делает для меня, — это не мышление, а ввод-вывод: чтение пяти файлов, чтобы ответить на вопрос об одном методе, генерация тестового файла по тому же шаблону, что и двадцать соседних, обновление документации после встречи.
  1. solenoid0937

    Так это просто делегирование части работы более тупым моделям? Я бы точно не стал использовать Gemini 2.5 Flash (!!?) для написания кода, как предлагается. У меня никогда не было проблем с тем, что Codex или Claude читают огромные файлы, они отлично справляются с точными grep-ами.

  2. jnwatson

    Токены сокращаются потому, что они используют другой сервис с другим бюджетом токенов для задач чтения/написания кода. Можно также просто делегировать это субагентам в Claude Code (хотя выбор моделей там ограничен, если не менять на более дешёвые модели через OpenRouter). Я не против использования тупой модели как умного grep, но весь смысл использования передовых моделей в том, чтобы применять их интеллект для сложных задач, таких как программирование.

  3. faangguyindia

    На практике это плохо работает. Попробуйте сами: используйте большую модель, такую как Opus или Sol, чтобы реализовать всё, сначала составив план с помощью режима планирования. Затем попробуйте распределить задачу между более дешёвыми моделями, такими как Luna Max или Gemini Flash 3.8. Во время планирования большая модель уже читает релевантные файлы в контексте, а передача части работы маленькой модели сама по себе требует, чтобы большая модель обдумывала распределение задач, проверку и т.д. Так что действительно ли вы экономите токены?

  4. shikck200

    Кстати: ПОЖАЛУЙСТА, не перехватывайте прокрутку. Это просто очень плохая практика. Пожалуйста, не надо.

  5. Banditoz

    О боже, почему этот сайт переопределяет поведение прокрутки?

Ещё за этот день

2026-09-05