Почему агенты тонут в собственной памяти: управление контекстом как архитектурная проблема
Agentic Context Management: Memory and Cost as Architecture Problems

Сбои production-агентов чаще связаны не с качеством рассуждений, а с неспособностью управлять контекстом: историями диалогов, большими промптами, определениями инструментов и растущими выводами. Авторы утверждают, что текущий подход — просто хранилище и поиск — слишком узок. Они предлагают дисциплину Agentic Context Management (ACM), разбитую на пять примитивов: архитектура, ingestion, scoping, anticipating и compacting & consolidation. Экономический анализ показывает: наивное накопление контекста ведёт к квадратичному росту затрат на токены, грубое суммаризирование — к линейному росту, но с потерей точности, и только валидированное сжатие даёт линейную стоимость с сохранением точности. Описана эталонная реализация Maximem Synap, достигшая 92% на LongMemEval и 93.2% на LoCoMo. Также обсуждаются неучтённые бенчмарками аспекты: задержка, эффективность токенов и устойчивость к «гниению контекста».
Наивное накопление контекста ведёт к квадратичному росту затрат на токены, грубое суммаризирование — к линейному росту, но с потерей точности, и только валидированное сжатие даёт линейную стоимость с сохранением точности.