Как я сократил накладные расходы контекста на 80% в своём кодинг-агенте
I Cut 80%+ of Context Overhead in My Coding Agent

В современных AI-кодинг-агентах значительная часть контекстного окна тратится на статические описания инструментов ещё до начала работы. Автор провёл бенчмарки: в Codex при простом приветствии потребляется 14,5 тыс. токенов и 79 активных инструментов, в Antigravity — 19,9 тыс. токенов (13,8 тыс. — только схемы инструментов). Claude Code частично решает проблему через Deferred Tool Loading, но всё равно держит базовый оверхед. Автор предлагает два принципа: консолидация действий вместо CRUD-инструментов и динамическая активация инструментов в Pi. В результате удалось сократить накладные расходы более чем на 80%, оставив только 4 базовых инструмента и подгружая остальные по требованию.
Каждая схема инструмента отправляется по сети и загружается в контекстное окно LLM на каждом ходу.