Portal от Spotify сократил расход токенов Claude Code на 90%
Portal by Spotify cut my Claude Code token usage by 90%

Инженер Spotify делится опытом радикального сокращения расходов на токены при работе с ИИ-ассистентом Claude Code. Большая часть токенов уходит не на размышления, а на чтение файлов и генерацию шаблонного кода. Решение — два режима (mode) в Portal by Spotify: bulk-reader для массового чтения и code-writer для написания кода по образцу. Вместе с плагином shunt, который перехватывает вызовы Claude Code и направляет их в эти режимы, удалось добиться экономии до 90% токенов. При этом автор честно отмечает ограничения: нельзя делегировать редактирование кода и сложные рассуждения, а задержки при делегировании могут быть значительными.
Большая часть того, что ИИ-агент делает для меня, — это не мышление, а ввод-вывод: чтение пяти файлов, чтобы ответить на вопрос об одном методе, генерация тестового файла по тому же шаблону, что и двадцать соседних, обновление документации после встречи.
- solenoid0937
Так это просто делегирование части работы более тупым моделям? Я бы точно не стал использовать Gemini 2.5 Flash (!!?) для написания кода, как предлагается. У меня никогда не было проблем с тем, что Codex или Claude читают огромные файлы, они отлично справляются с точными grep-ами.
- jnwatson
Токены сокращаются потому, что они используют другой сервис с другим бюджетом токенов для задач чтения/написания кода. Можно также просто делегировать это субагентам в Claude Code (хотя выбор моделей там ограничен, если не менять на более дешёвые модели через OpenRouter). Я не против использования тупой модели как умного grep, но весь смысл использования передовых моделей в том, чтобы применять их интеллект для сложных задач, таких как программирование.
- faangguyindia
На практике это плохо работает. Попробуйте сами: используйте большую модель, такую как Opus или Sol, чтобы реализовать всё, сначала составив план с помощью режима планирования. Затем попробуйте распределить задачу между более дешёвыми моделями, такими как Luna Max или Gemini Flash 3.8. Во время планирования большая модель уже читает релевантные файлы в контексте, а передача части работы маленькой модели сама по себе требует, чтобы большая модель обдумывала распределение задач, проверку и т.д. Так что действительно ли вы экономите токены?
- shikck200
Кстати: ПОЖАЛУЙСТА, не перехватывайте прокрутку. Это просто очень плохая практика. Пожалуйста, не надо.
- Banditoz
О боже, почему этот сайт переопределяет поведение прокрутки?