Agentic Context Management: Warum KI-Agenten an ihrem eigenen Gedächtnis scheitern

Agentic Context Management: Memory and Cost as Architecture Problems

Agentic Context Management: Warum KI-Agenten an ihrem eigenen Gedächtnis scheitern

Produktionsreife KI-Agenten scheitern oft nicht an mangelnder Denkfähigkeit, sondern daran, ihren Kontext zu verwalten: wachsende Gesprächsverläufe, große Prompts und Tool-Ausgaben lassen Token-Kosten quadratisch steigen und führen zu Informationsverlust. Der Beitrag argumentiert, dass dies kein reines Speicherproblem ist, sondern ein Lebenszyklus- und Architekturproblem. Er führt fünf Grundprinzipien ein – Architektur, Aufnahme, Scoping, Antizipation und Kompaktierung – und zeigt mit der Referenzimplementierung Maximem Synap, wie lineare Kosten bei erhaltener Genauigkeit möglich sind (92 % bei LongMemEval, 93,2 % bei LoCoMo). Abschließend werden offene Benchmark-Dimensionen wie Latenz und Kontext-Rotation diskutiert.

Naive Kontextakkumulation lässt die Token-Kosten quadratisch mit der Gesprächslänge steigen, grobe Zusammenfassungen erkaufen lineare Kosten mit einem Genauigkeitsabsturz, und nur validierte Kompaktierung erreicht lineare Kosten bei erhaltener Wiedergabetreue.
  1. nullbio

    Kontextverschmutzung und -verfall sind wahrscheinlich wichtiger als das Gedächtnis, denn Fakten können normalerweise abgerufen werden, wenn der Agent gut darin ist, Brotkrumen zu folgen.

    Was auch der größte Killer ist, ist Code-Verfall. Agenten sind besonders gut im Tod durch tausend Schnitte. Sie implementieren etwas schlecht oder falsch oder führen ein schlechtes Muster in das Projekt ein. Dann verstärken sie diese Schlechtigkeit im Laufe der Zeit weiter, indem sie bei späteren Arbeiten davon kopieren. Es verbreitet sich wie ein Virus.

    Diese Keime aus dem Projekt herauszuhalten ist sehr schwierig, und das Aufräumen des Verfalls ist sehr schwierig. Es scheint auch ein schwer zu lösendes Problem zu sein, denn dem bestehenden Codebase zu folgen ist gut, wenn der Code gut ist, aber schlecht, wenn er schlecht ist. Scheinbar erfordert die Lösung also mehr Denken und Bewerten für jede Änderung, die vorgenommen wird.

  2. samyakk

    ACM, das ist der Begriff, nach dem ich gesucht habe – und euer Paper erklärt ihn klar. Am Ende sind die meisten LLM-Probleme Kontextprobleme. Das richtige Wissen in seinen Kontextfenster zu bekommen, ohne es zu überfüllen, ist die eigentliche technische Arbeit für die meisten Agenten. Und die Lösung, die ihr präsentiert, scheint vielversprechend.

    Sowohl Kompaktierung mit Validierung als auch prädiktives Abrufen sind der richtige Weg.

    Ich möchte das nicht selbst implementieren, und wenn Synap diese Implementierung ist, möchte ich ein paar Fragen stellen:

    1. Funktioniert es mit Kontext, der nicht nur aus Agentenkonversationen besteht, sondern eher aus Dokumenten?

    2. Ist es besser als RAG bei großen Datensätzen?

    3. Wie sehen die On-Premises-Optionen aus?

  3. respectattentio

    Ich beginne gerne mit Memory Engineering, dann erreiche ich das volle System und senke dann die Kosten. Das ermöglicht es, das volle Potenzial von Agenten auszuschöpfen.

Mehr von diesem Tag

2026-08-26