LLM同士がテキストを介さず直接対話、KV-Cache融合で精度と速度を両立

Cache-to-Cache: Direct Semantic Communication Between Large Language Models

複数のLLMを組み合わせる際、従来はテキストを介して情報をやり取りしていたため、内部表現の豊かな意味情報が失われ、トークン単位の生成遅延も発生していた。本研究はKV-Cacheを通信媒体として着目し、ニューラルネットワークで送信側モデルのKV-Cacheを投影・融合して受信側モデルへ直接意味転送するCache-to-Cache(C2C)を提案。学習可能なゲーティング機構が恩恵を受ける層を選択する。実験では個別モデル比で平均精度6.4〜14.2%向上、テキスト通信比で約3.1〜5.4%上回り、レイテンシは平均2.5倍高速化した。

LLMはテキストを超えて通信できるのか?

この日のほかの記事

2026-09-18