Почему агенты тонут в собственной памяти: управление контекстом как архитектурная проблема

Agentic Context Management: Memory and Cost as Architecture Problems

Почему агенты тонут в собственной памяти: управление контекстом как архитектурная проблема

Сбои production-агентов чаще связаны не с качеством рассуждений, а с неспособностью управлять контекстом: историями диалогов, большими промптами, определениями инструментов и растущими выводами. Авторы утверждают, что текущий подход — просто хранилище и поиск — слишком узок. Они предлагают дисциплину Agentic Context Management (ACM), разбитую на пять примитивов: архитектура, ingestion, scoping, anticipating и compacting & consolidation. Экономический анализ показывает: наивное накопление контекста ведёт к квадратичному росту затрат на токены, грубое суммаризирование — к линейному росту, но с потерей точности, и только валидированное сжатие даёт линейную стоимость с сохранением точности. Описана эталонная реализация Maximem Synap, достигшая 92% на LongMemEval и 93.2% на LoCoMo. Также обсуждаются неучтённые бенчмарками аспекты: задержка, эффективность токенов и устойчивость к «гниению контекста».

Наивное накопление контекста ведёт к квадратичному росту затрат на токены, грубое суммаризирование — к линейному росту, но с потерей точности, и только валидированное сжатие даёт линейную стоимость с сохранением точности.
  1. nullbio

    Загрязнение и порча контекста, вероятно, важнее памяти, потому что факты обычно можно найти, если агент хорошо умеет следовать по хлебным крошкам. Но самый большой убийца — это порча кода. Агенты особенно хороши в смерти от тысячи порезов. Они реализуют что-то плохо, или неправильно, или вносят плохой паттерн в проект. Затем они продолжают усиливать эту плохость со временем, продолжая копировать из нее в последующей работе. Это распространяется как вирус. Держать эти семена подальше от проекта очень сложно, и вычищать порчу тоже очень сложно. Это также кажется трудной проблемой для решения, потому что следование существующей кодовой базе — это хорошо, когда код хорош, но плохо, когда он плох. Так что, по-видимому, решение означает больше размышлений и оценки для каждого вносимого изменения.

  2. samyakk

    ACM — это термин, который я искал, и ваша статья объясняет его ясно. В конечном счете, большинство проблем LLM — это проблемы контекста. Получение правильных знаний в его контекстное окно без его переполнения — это и есть настоящая инженерная работа для большинства агентов. И представленное вами решение выглядит многообещающим. И уплотнение с проверкой, и упреждающая выборка — это правильный путь. Я не хочу писать реализацию этого сам, и если Synap — это такая реализация, я хотел бы задать вам несколько вопросов: 1. Работает ли он с контекстом, который не является просто разговорами агента, а скорее документами? 2. Лучше ли он, чем RAG, на больших наборах данных? 3. Каковы варианты локального развертывания?

  3. respectattentio

    Мне нравится начинать с инженерии памяти, затем переходить к полной системе, а затем снижать затраты. Это позволяет раскрыть полный потенциал агентов.

Ещё за этот день

2026-08-26