AI 에이전트 실패의 진짜 원인은 '맥락 관리'다: 메모리와 비용을 수명주기 문제로 재정의
Agentic Context Management: Memory and Cost as Architecture Problems

프로덕션 AI 에이전트의 실패는 추론 능력 부족보다 대화 기록, 대형 프롬프트, 도구 정의, 비대해지는 도구 출력 등 '맥락' 관리 실패에서 비롯됩니다. 기존 접근은 이를 저장·검색 문제로 보지만, 저자들은 에이전트가 무엇을 기억하고 잊을지 결정하는 전체 수명주기를 관리해야 한다고 주장합니다. 이 논문은 이를 Agentic Context Management(ACM)라 명명하고, 아키텍처링, 인제스팅, 스코핑, 안티시페이팅, 컴팩팅·통합의 5가지 기본 요소로 분해합니다. 또한 맥락 축적이 대화 길이에 따라 토큰 비용이 2차적으로 증가하는 반면, 검증된 압축은 정확도를 유지하며 선형 비용을 달성함을 경제적으로 입증합니다. 참조 구현인 Maximem Synap은 LongMemEval에서 92%, LoCoMo에서 93.2%를 기록했으며, 기존 벤치마크가 놓치는 지연 시간, 토큰 효율성, 맥락 부패 저항성 등의 차원을 제시합니다.
에이전트가 마음에 담고 있는 것을 적극적으로 관리하는 것은 단순한 저장소 문제가 아니라 수명주기 문제입니다: 무엇을 기억할지 결정하고, 추출하고 구조화하며, 데이터 유형별로 적절한 저장소를 선택하고, 통합하고 잊어버리면서 출처를 보존하고, 지금 무엇이 관련 있는지 결정하고, 다음에 무엇이 필요한지 예측하며, 중요한 것을 잃지 않으면서 맥락을 예산에 맞게 압축하는 것을 포괄합니다.
HN 토론
28- nullbio
맥락 오염과 부패는 아마도 메모리보다 더 중요할 것입니다. 사실은 에이전트가 단서를 잘 따라갈 수 있다면 보통 검색할 수 있기 때문입니다. 또한 가장 큰 문제는 코드 부패입니다. 에이전트는 특히 '천 번의 베임'으로 죽이는 데 능숙합니다. 그들은 무언가를 형편없이 구현하거나, 잘못 구현하거나, 프로젝트에 나쁜 패턴을 도입합니다. 그런 다음 후속 작업에서 계속 복사하면서 시간이 지남에 따라 그 나쁨을 증폭시킵니다. 바이러스처럼 퍼집니다. 이러한 씨앗을 프로젝트에서 멀리하는 것은 매우 어렵고, 부패를 청소하는 것도 매우 어렵습니다. 또한 기존 코드베이스를 따르는 것이 코드가 좋을 때는 좋지만 나쁠 때는 나쁘기 때문에 해결하기 어려운 문제로 보입니다. 따라서 겉보기에는 해결책은 모든 변경 사항에 대해 더 많은 사고와 평가를 하는 것을 의미합니다.
- samyakk
ACM, 그게 제가 찾던 용어입니다. 그리고 당신의 논문이 그것을 명확히 설명합니다. 결국, 대부분의 LLM 문제는 맥락 문제입니다. 올바른 지식을 맥락 창에 과도하게 채우지 않고 넣는 것이 대부분의 에이전트에게 실제 엔지니어링 노력입니다. 그리고 당신이 제시하는 해결책은 유망해 보입니다. 검증을 통한 압축과 예측 가져오기 모두가 올바른 방향입니다. 저는 이것을 직접 구현하고 싶지 않습니다. 그리고 Synap이 그 구현이라면 몇 가지 질문을 드리고 싶습니다: 1. 에이전트 대화뿐만 아니라 문서와 같은 맥락에서도 작동합니까? 2. 대규모 데이터셋에서 RAG보다 낫습니까? 3. 온프레미스 옵션은 어떤 모습입니까?
- respectattentio
저는 메모리 엔지니어링으로 시작한 다음 전체 시스템에 도달하고 비용을 줄이는 것을 선호합니다. 이를 통해 에이전트의 잠재력을 최대한 발휘할 수 있습니다.