RTK가 토큰 절약을 주장하지만, 실제 비용 벤치마크는 다르다

RTK reports token savings, but our cost benchmarks disagree

RTK가 토큰 절약을 주장하지만, 실제 비용 벤치마크는 다르다

RTK는 터미널 출력을 압축해 AI 코딩 비용을 줄인다고 알려졌지만, Terminal-Bench 2.1에서 1,740회 시도와 1,500달러 이상을 투입한 결과 Fable 5.0에서는 비용 절감이 단일 과제에 의존했고 DeepSeek V4 Pro 0813에서는 오히려 평균 17% 더 비쌌다. RTK가 보고하는 89% 토큰 절약은 실제 청구 토큰이 아닌 출력 바이트 기준이며, 에이전트의 추가 턴 비용을 반영하지 않는다.

RTK는 에이전트가 읽는 bash 출력을 최대 90%까지 줄인다. […] 하지만 이것이 청구서를 90% 줄이는 것과 같지는 않다.
  1. aeneas_ory

    이런 "핵"들은 전부 사기극이고, 우리 모두 어딘가 깊은 곳에서는 알고 있다고 생각한다. caveman이든 RTK든, 아니면 vibe-coded 생산성/토큰 비용 절감 핵/스킬/claude.md 같은 게 뭐든 간에 말이다.

    내가 성공했던 방법은 (벤치마크는 좀 오래됐지만) 전용 로컬 코드 임베딩 모델로 코드베이스를 인덱싱하는 것이었다. CPU 쪽으로는 좀 비싸지만, 내 벤치마크에서는 토큰 사용량과 실제 소요 시간을 상당히 줄여줬다. 물론 항상 통계적 노이즈 + 호스트 시스템 부하에 따라 달라지고, 충분히 큰 벤치마크를 돌리는 건 그냥 너무 비싸서, 적당히 걸러 들어야 한다.

    왜 효과가 있냐고? LLM은 기본적으로 단어/구문을 무식하게 훑어서 find/grep/pgrep/뭐든 간에 파이프로 넘긴다 (아니면 최근 여기서 논의된 것처럼 파이썬 스크립트를 작성하거나 - https://news.ycombinator.com/item?id=49654229). 시맨틱 검색은 유사성을 찾기 때문에 무식하게 훑는 일이 줄어든다. 물론 먼저 모든 걸 인덱싱해야 한다는 비용이 따른다.

    프로젝트는 여기서 볼 수 있다: https://github.com/ory/lumen

  2. ProjectBarks

    이런 도구 대부분은 그냥 허풍인 것 같다. Headroom과 RTK에서 수행된 벤치마크는 둘 다 실제 절감 효과가 없다는 걸 보여준다. 만약 이렇게 간단한 전처리 단계가 가능했다면, AI 랩들이 왜 그 최적화를 직접 업스트림하지 않았겠는가?

    내 추측으로는 대부분 작동하지 않거나 모델의 동작을 훨씬 더 혼란스럽게 만든다. 정말로 독립적인 벤치마크가 좀 필요하다고 생각한다.

    이런 종류의 도구에서 똑같은 문제를 보여주는 다른 사례들:

    https://blog.jetbrains.com/ai/2026/07/rtk-claude-code-token-...

    https://brandonbarker.me/writing/headroom-fewer-tokens-bigge...

  3. oefrha

    rtk gain 출력을 한 번이라도 들여다본 사람이라면 벤치마크 필요 없이 완전히 뻔하다. 에이전트가

    rtk command-that-prints-100k-tokens | tail -5

    를 실행하면 rtk 없이는 5줄, 아마 100토큰 정도인데, rtk는 100k 절감을 보고한다. 물론 tail -5에 대해서는 모른다.

    더 나쁜 건, rtk가 기본적으로 그 절감 통계를 영구 저장하기 때문에 샌드박싱이 깨진다. rtk를 접두어로 붙이면 때때로 무작위 자동 모드 거부가 발생하기도 한다 (이건 절감 통계 영구 저장을 비활성화하는 것과는 무관하다).

    솔직히 CLI에 대해 조금이라도 아는 사람이 왜 rtk gain을 진지하게 받아들이는지 모르겠다. 터미널에서 거의 일해본 적 없는 vibe coder 무지한 사람들이 그 통계를 보고 기분 좋아지는 건가?

    그래도 rtk는 반복되는 테스트 실행 출력 같은 걸 압축하는 데는 약간 유용하지만, 화이트리스트에 등록된 명령에만 사용해야 한다. 그들이 제안하는 것처럼 모든 걸 감싸는 건 그냥 멍청한 짓이다.

  4. kriskrunch

    열린 질문인데, agent-rules.md에 있는 이 지시문은 어떻게 보이나?

    "대용량/알 수 없는 명령 출력 제한: `COMMAND 2>&1 | head -c 4000`. 전체 로그, 테스트, 대용량 파일을 절대 스트리밍하지 말 것."

    나는 RTK 대신 이걸 쓴다. 경험적으로 RTK는 비슷한 작업을 완료하는 데 에이전트가 더 오래 걸리게 만든다.

    Ponytail과 Caveman은 어느 정도 도움이 되는 것 같다.

  5. stephantul

    조금이라도 현실적인 사람이라면 대부분의 기술이 과대 광고를 하거나, 아주 유리한 조건에서 평가한다는 걸 알 것이다.

    물론 좋은 일은 아니지만, 이런 일이 벌어지고 있다는 사실에 놀라는 척하는 건 좀 불필요하다고 느낀다.

    그렇긴 해도: 대부분의 도구는 도움이 되지 않는다

이 날의 다른 글

2026-09-11