Spotify의 Portal로 Claude Code 토큰 사용량 90% 절감
Portal by Spotify cut my Claude Code token usage by 90%

AI 코딩 에이전트가 소비하는 토큰의 대부분은 추론이 아니라 단순 I/O 작업에 사용됩니다. Spotify 엔지니어는 Portal by Spotify의 AiKA Modes를 활용해 대량 파일 읽기나 반복적인 코드 생성 같은 단순 작업을 저비용 모델(Gemini 2.5 Flash)에 위임하는 라우팅 시스템 'shunt'를 구축했습니다. 그 결과 Claude Code의 토큰 사용량을 약 90% 줄였습니다. 이 글은 후킹과 스크립트, 스킬을 계층적으로 구성한 구현 방법과 벤치마크 결과, 그리고 편집이나 추론처럼 위임할 수 없는 작업의 한계를 설명합니다.
AI 코딩 에이전트가 하는 일의 대부분은 생각이 아니라 I/O다.
HN 토론
39- solenoid0937
그러니까 이건 특정 작업을 더 멍청한 모델에게 위임하는 거잖아? 나라면 코드 작성을 위해 Gemini 2.5 Flash(!!?)를 쓰지 않을 텐데. 나는 Codex나 Claude가 거대한 파일을 읽는 데 문제를 겪어본 적이 없어. 그들은 정밀한 grep에 정말 능숙해.
- jnwatson
토큰 사용량을 줄이는 이유는 읽기/코드 작성 작업에 다른 토큰 예산을 가진 다른 서비스를 사용하기 때문이야. Claude Code에서도 이 작업을 서브에이전트에게 위임할 수 있어 (OpenRouter를 통해 더 저렴한 모델로 교체하지 않는 한 모델 선택의 폭이 더 제한적이지만). 나는 멍청한 모델을 똑똑한 grep으로 사용하는 건 괜찮지만, 프론티어 모델을 사용하는 핵심 이유는 코딩 같은 어려운 작업에 그들의 지능을 활용하기 위해서야.
- faangguyindia
실제로는 잘 작동하지 않아. 직접 해봐. Opus나 Sol 같은 큰 모델을 사용해 plan 모드로 먼저 계획을 세워 모든 것을 구현해봐. 그런 다음 Luna Max나 Gemini Flash 3.8 같은 더 저렴한 모델에 작업을 분산해봐. 계획 단계에서 큰 모델은 이미 관련 파일을 컨텍스트에서 읽고 있어. 반면에 작은 모델에게 작업 조각을 주는 것 자체는 큰 모델이 작업 분배, 검토 등을 추론해야 한다는 것을 요구해. 그래서 정말 토큰을 절약할 수 있을까?
- shikck200
참고로: 제발 스크롤을 가로채지 마세요. 정말 정말 나쁜 짓이에요. 제발 하지 마세요.
- Banditoz
아이고, 왜 이 웹사이트는 스크롤 동작을 덮어쓰는 거지?