Un pequeño LLM elimina el 68% del contexto RAG y reduce costos
Pruning RAG context down to what the answer actually needs

Kapa.ai ha implementado un paso intermedio entre el recuperador y el generador en su pipeline RAG: un LLM pequeño y económico que evalúa la relevancia de cada fragmento de contexto y descarta los innecesarios. Este pruner reduce el contexto en un 68%, mantiene el 96% de la recuperación y recorta el costo por consulta en un tercio. El artículo explica por qué los enfoques basados en reranking no funcionan y cómo la evaluación conjunta de fragmentos permite una poda efectiva.
El verdadero problema no es si un fragmento es relevante por sí mismo, sino si pertenece a un conjunto que juntos responden a la pregunta.