Wie wir einem kleinen LLM beibrachten, 68 % des RAG-Kontexts wegzuwerfen

Pruning RAG context down to what the answer actually needs

Wie wir einem kleinen LLM beibrachten, 68 % des RAG-Kontexts wegzuwerfen

Kapa.ai, Anbieter von KI-Assistenten für technische Dokumentation, hat einen dritten Schritt zwischen Retriever und Generator eingeführt: Ein kleines, günstiges LLM bewertet alle abgerufenen Chunks gemeinsam und verwirft diejenigen, die die Antwort nicht benötigt. Das spart etwa 68 % des Kontexts, erhält 96 % des Recall und senkt die Kosten pro Abfrage um ein Drittel. Der Artikel erklärt, warum einfachere Ansätze wie Reranking-Scores oder Ankerdokumente scheitern, und beschreibt die Implementierung mit einer fünfstufigen Bewertungsskala.

Die eigentliche Frage ist nie, ob ein Chunk für sich genommen relevant ist, sondern ob er zu einer Menge gehört, die zusammen die Frage beantwortet.

Mehr von diesem Tag

2026-07-07