kapa.ai、RAGコンテキストの68%を刈り込み、クエリコストを3分の1削減

Pruning RAG context down to what the answer actually needs

kapa.ai、RAGコンテキストの68%を刈り込み、クエリコストを3分の1削減

kapa.aiは、RAGパイプラインに「プルーナー」と呼ばれる小さなLLMを追加し、取得したチャンクの約68%を破棄しつつ、回答に必要なチャンクの約96%を保持することに成功しました。このプルーナーは、質問とすべてのチャンクを同時に評価し、5段階のスケールで各チャンクを採点します。これにより、クエリコストが約34%削減され、エージェントのコンテキスト管理も改善されました。従来のリランカーやアンカードキュメント方式の限界を克服したこのアプローチは、RAGの効率化に新たな道を示しています。

リランカーのスコアは順序であって、測定値ではありません。チャンクAがこのクエリでチャンクBに勝つと言っているだけで、それ以上のものではありません。

この日のほかの記事

2026-07-07