Codex en AWS Bedrock multiplica por 10 el coste por falta de control de caché
Codex on AWS bedrock bug causing 10x charges
Un informe de producción en el repositorio de Codex de OpenAI documenta que la integración nativa con Amazon Bedrock para el modelo GPT-5.6 Sol carece de controles explícitos de caché, lo que provoca un gasto elevado en tokens de escritura de caché. Entre el 5 y el 8 de agosto de 2026, 3.656 solicitudes generaron 171,94 millones de tokens de escritura de caché, con un coste estimado de 1.182,09 dólares, representando el 85% del gasto total estimado. Un usuario reportó que tras actualizar a la versión 0.147.0, la proporción de escritura a lectura de caché pasó de 0,08 a 8,84 y su coste diario se multiplicó al menos por cinco, revirtiendo al volver a la versión anterior. El problema se atribuye a la falta de opciones de caché explícitas en las solicitudes, y se sugiere deshabilitar la herramienta de búsqueda web como solución temporal.
La caché implícita de Mantle no avanzaba a través del historial de sesión creciente, lo que hacía que Codex escribiera repetidamente la mayor parte del prompt en lugar de leer el prefijo cacheado previamente.
- amluto
Vaya, todo ese hilo es casi incoherente, presumiblemente generado por una IA sin supervisión adecuada. Aquí están los docs: https://developers.openai.com/api/docs/guides/prompt-caching... El hilo explica poco sobre qué cosa rara están haciendo con Codex que hace que el comportamiento por defecto funcione mal, y parece que se están confundiendo entre si quieren configurar el modo de caché o el punto de interrupción o ambos. En cualquier caso, encuentro interesante el cambio de comportamiento. Me suena a que 5.5 y anteriores podrían haber estado usando un esquema de atención convencional donde una secuencia KV cacheada se puede usar fácilmente para restaurar un prefijo de sí misma, pero quizás 5.6 está usando atención lineal o LSTM u otro esquema recurrente donde no puedes rebobinar el estado del modelo simplemente truncándolo.
- ryanjshaw
El hecho de que empresas con acceso a IA de última generación no pública sigan teniendo este tipo de bugs tontos en algo tan simple como una app de chat me ayuda a validar mi incredulidad hacia la gente que afirma que la IA está lista para reemplazar todo el desarrollo de software.
- TheP1000
Nuestro codex en AWS Bedrock tenía una proporción de caché de lectura/escritura inferior al 5%. Las escrituras de caché son muy caras y nunca se usaban. Esto hace que codex en Bedrock cueste unas 10 veces más de lo que debería debido a la falta de caché y a las escrituras masivas. La solución en el issue que me funcionó fue: web_search = "disabled"
- spacedoutman
Algo está mal con la app de codex también, está quemando uso como loco últimamente.
- prtmnth
El uso de Codex se siente exorbitantemente alto desde hoy. Ellos [0] lo niegan, pero el número de usuarios anecdóticos que decidieron plantear esto como un problema (y como resultado está siendo tendencia en X) dice lo contrario. [0] https://x.com/thsottiaux/status/2090675027670978569