LLM 之间不再用文本,直接 KV-Cache 对话

Cache-to-Cache: Direct Semantic Communication Between Large Language Models

现在的多 LLM 系统通常靠文本交流,这不仅丢失了丰富的语义信息,还带来了逐个 token 生成的延迟。这项研究提出了一种全新的 Cache-to-Cache(C2C)范式,让 LLM 之间直接通过 KV-Cache 进行语义通信。通过神经网络将源模型的 KV-cache 投影并融合到目标模型中,C2C 避免了显式的中间文本生成,直接利用双方深层的专业语义。实验表明,相比单一模型,C2C 的平均准确率提升了 6.4% 到 14.2%;与传统的文本通信相比,准确率又高出约 3.1% 到 5.4%,同时延迟降低了 2.5 倍。这意味着未来的 AI 协作将更高效、更智能。

Oracle 实验表明,丰富 KV-Cache 的语义可以在不增加缓存大小的情况下提升响应质量,这支持了 KV-Cache 作为模型间通信的有效媒介。

同日更多故事

2026-09-18