kapa.ai、RAGコンテキストの68%を刈り込み、クエリコストを3分の1削減
Pruning RAG context down to what the answer actually needs

kapa.aiは、RAGパイプラインに「プルーナー」と呼ばれる小さなLLMを追加し、取得したチャンクの約68%を破棄しつつ、回答に必要なチャンクの約96%を保持することに成功しました。このプルーナーは、質問とすべてのチャンクを同時に評価し、5段階のスケールで各チャンクを採点します。これにより、クエリコストが約34%削減され、エージェントのコンテキスト管理も改善されました。従来のリランカーやアンカードキュメント方式の限界を克服したこのアプローチは、RAGの効率化に新たな道を示しています。
リランカーのスコアは順序であって、測定値ではありません。チャンクAがこのクエリでチャンクBに勝つと言っているだけで、それ以上のものではありません。