RTK가 토큰 절약을 주장하지만, 실제 비용 벤치마크는 다르다
RTK reports token savings, but our cost benchmarks disagree

RTK는 터미널 출력을 압축해 AI 코딩 비용을 줄인다고 알려졌지만, Terminal-Bench 2.1에서 1,740회 시도와 1,500달러 이상을 투입한 결과 Fable 5.0에서는 비용 절감이 단일 과제에 의존했고 DeepSeek V4 Pro 0813에서는 오히려 평균 17% 더 비쌌다. RTK가 보고하는 89% 토큰 절약은 실제 청구 토큰이 아닌 출력 바이트 기준이며, 에이전트의 추가 턴 비용을 반영하지 않는다.
RTK는 에이전트가 읽는 bash 출력을 최대 90%까지 줄인다. […] 하지만 이것이 청구서를 90% 줄이는 것과 같지는 않다.
HN 토론
60- aeneas_ory
이런 "핵"들은 전부 사기극이고, 우리 모두 어딘가 깊은 곳에서는 알고 있다고 생각한다. caveman이든 RTK든, 아니면 vibe-coded 생산성/토큰 비용 절감 핵/스킬/claude.md 같은 게 뭐든 간에 말이다.
내가 성공했던 방법은 (벤치마크는 좀 오래됐지만) 전용 로컬 코드 임베딩 모델로 코드베이스를 인덱싱하는 것이었다. CPU 쪽으로는 좀 비싸지만, 내 벤치마크에서는 토큰 사용량과 실제 소요 시간을 상당히 줄여줬다. 물론 항상 통계적 노이즈 + 호스트 시스템 부하에 따라 달라지고, 충분히 큰 벤치마크를 돌리는 건 그냥 너무 비싸서, 적당히 걸러 들어야 한다.
왜 효과가 있냐고? LLM은 기본적으로 단어/구문을 무식하게 훑어서 find/grep/pgrep/뭐든 간에 파이프로 넘긴다 (아니면 최근 여기서 논의된 것처럼 파이썬 스크립트를 작성하거나 - https://news.ycombinator.com/item?id=49654229). 시맨틱 검색은 유사성을 찾기 때문에 무식하게 훑는 일이 줄어든다. 물론 먼저 모든 걸 인덱싱해야 한다는 비용이 따른다.
프로젝트는 여기서 볼 수 있다: https://github.com/ory/lumen
- ProjectBarks
이런 도구 대부분은 그냥 허풍인 것 같다. Headroom과 RTK에서 수행된 벤치마크는 둘 다 실제 절감 효과가 없다는 걸 보여준다. 만약 이렇게 간단한 전처리 단계가 가능했다면, AI 랩들이 왜 그 최적화를 직접 업스트림하지 않았겠는가?
내 추측으로는 대부분 작동하지 않거나 모델의 동작을 훨씬 더 혼란스럽게 만든다. 정말로 독립적인 벤치마크가 좀 필요하다고 생각한다.
이런 종류의 도구에서 똑같은 문제를 보여주는 다른 사례들:
https://blog.jetbrains.com/ai/2026/07/rtk-claude-code-token-...
https://brandonbarker.me/writing/headroom-fewer-tokens-bigge...
- oefrha
rtk gain 출력을 한 번이라도 들여다본 사람이라면 벤치마크 필요 없이 완전히 뻔하다. 에이전트가
rtk command-that-prints-100k-tokens | tail -5
를 실행하면 rtk 없이는 5줄, 아마 100토큰 정도인데, rtk는 100k 절감을 보고한다. 물론 tail -5에 대해서는 모른다.
더 나쁜 건, rtk가 기본적으로 그 절감 통계를 영구 저장하기 때문에 샌드박싱이 깨진다. rtk를 접두어로 붙이면 때때로 무작위 자동 모드 거부가 발생하기도 한다 (이건 절감 통계 영구 저장을 비활성화하는 것과는 무관하다).
솔직히 CLI에 대해 조금이라도 아는 사람이 왜 rtk gain을 진지하게 받아들이는지 모르겠다. 터미널에서 거의 일해본 적 없는 vibe coder 무지한 사람들이 그 통계를 보고 기분 좋아지는 건가?
그래도 rtk는 반복되는 테스트 실행 출력 같은 걸 압축하는 데는 약간 유용하지만, 화이트리스트에 등록된 명령에만 사용해야 한다. 그들이 제안하는 것처럼 모든 걸 감싸는 건 그냥 멍청한 짓이다.
- kriskrunch
열린 질문인데, agent-rules.md에 있는 이 지시문은 어떻게 보이나?
"대용량/알 수 없는 명령 출력 제한: `COMMAND 2>&1 | head -c 4000`. 전체 로그, 테스트, 대용량 파일을 절대 스트리밍하지 말 것."
나는 RTK 대신 이걸 쓴다. 경험적으로 RTK는 비슷한 작업을 완료하는 데 에이전트가 더 오래 걸리게 만든다.
Ponytail과 Caveman은 어느 정도 도움이 되는 것 같다.
- stephantul
조금이라도 현실적인 사람이라면 대부분의 기술이 과대 광고를 하거나, 아주 유리한 조건에서 평가한다는 걸 알 것이다.
물론 좋은 일은 아니지만, 이런 일이 벌어지고 있다는 사실에 놀라는 척하는 건 좀 불필요하다고 느낀다.
그렇긴 해도: 대부분의 도구는 도움이 되지 않는다