Codex Bedrock, 캐시 통제 없어 요금 10배

Codex on AWS bedrock bug causing 10x charges

Codex Bedrock, 캐시 통제 없어 요금 10배

OpenAI Codex CLI의 네이티브 Amazon Bedrock 지원에서 GPT-5.6 Sol의 명시적 프롬프트 캐시 옵션을 설정할 수 없어 캐시 쓰기 비용이 급증하는 문제가 제기됐다. 이슈 작성자에 따르면 8월 5~8일 사이 3,656건의 요청에서 캐시 쓰기 토큰이 1억7194만 개에 달해 추정 비용 1182달러(약 158억원) 중 85%를 차지했다. Codex는 이미 세션 범위의 prompt_cache_key를 생성하지만 HTTP/WebSocket 요청에 prompt_cache_options와 prompt_cache_breakpoint 필드가 없어 Bedrock의 명시적 캐시를 사용할 수 없다. 한 사용자는 0.147.0 업그레이드 후 캐시 쓰기/읽기 비율이 0.08에서 8.84로 급증하고 일일 비용이 5배로 늘었다고 보고했으며, 0.146.0으로 롤백하자 비율이 0.025로 회복됐다. OpenAI 직원은 웹 검색 도구 활성화로 인한 캐시 미스 가능성을 언급하며 config에서 web_search = "disabled"로 설정하는 임시 해결책을 제시했다.

0.147.0으로 업그레이드한 후 캐시 쓰기 대 읽기 비율이 0.08에서 8.84로 증가했고 일일 비용이 이전의 최소 5배로 올랐습니다.
  1. amluto

    와, 저 스레드 전체가 거의 이해할 수 없을 정도인데, 아마도 적절한 감독 없이 AI가 생성한 것 같네요.

    여기 문서가 있습니다:

    https://developers.openai.com/api/docs/guides/prompt-caching...

    스레드에서는 Codex에 대해 기본 동작을 제대로 못하게 만드는 이상한 짓을 하는 것에 대한 설명이 거의 없고, 캐싱 모드를 설정하려는 건지 중단점을 설정하려는 건지 아니면 둘 다인지 헷갈리는 것 같습니다.

    어쨌든, 저는 이 동작 변화가 흥미롭다고 생각합니다. 5.5 이하에서는 캐시된 KV 시퀀스가 자신의 접두사를 쉽게 복원하는 데 사용될 수 있는 기존의 어텐션 방식을 사용했을 수도 있지만, 5.6에서는 선형 어텐션이나 LSTM 또는 다른 순환 방식을 사용하여 모델 상태를 단순히 잘라내는 것만으로는 되감을 수 없는 것 같습니다.

  2. ryanjshaw

    SOTA 비공개 AI에 접근할 수 있는 회사들이 채팅 앱처럼 단순한 것에서 이런 종류의 어리석은 버그를 계속 겪고 있다는 사실은, AI가 모든 소프트웨어 개발을 대체할 준비가 되었다고 주장하는 사람들에 대한 제 불신을 뒷받침해 줍니다.

  3. TheP1000

    AWS Bedrock에서 우리의 codex 읽기/쓰기 캐시 비율은 5% 미만이었습니다. 캐시 쓰기는 매우 비싼데 전혀 사용되지 않았습니다. 그 결과 Bedrock에서 codex가 캐싱 없음과 대량 쓰기로 인해 예상 비용의 약 10배가 발생했습니다.

    해결책은 이슈에서 저에게 해결된 것입니다:

    web_search = "disabled"

  4. spacedoutman

    codex 앱에도 뭔가 문제가 있습니다. 최근에 사용량이 미친 듯이 소진되고 있습니다.

  5. prtmnth

    오늘부터 Codex 사용량이 엄청나게 높게 느껴집니다. 그들은 [0] 이를 부인하고 있지만, 이 문제를 제기하기로 결정한 일화적인 사용자 수가 많다는 것은 (그 결과 X에서 트렌드가 되고 있음) 그 반대를 말해줍니다.

    [0] https://x.com/thsottiaux/status/2090675027670978569

이 날의 다른 글

2026-08-21