Cache-to-Cache: LLMs kommunizieren direkt über ihren KV-Cache

Cache-to-Cache: Direct Semantic Communication Between Large Language Models

Multi-LLM-Systeme kombinieren die Stärken verschiedener Modelle, doch die Kommunikation läuft bisher über Text – das kostet semantische Information und erzeugt Token-für-Token-Latenz. Cache-to-Cache (C2C) überträgt stattdessen den KV-Cache des Quellmodells direkt in den des Zielmodells: Ein neuronales Netz projiziert und fusioniert die Caches, ein lernbares Gating wählt die profitierenden Ziel-Layer. Das bringt 6,4–14,2 % höhere Genauigkeit als Einzelmodelle, rund 3,1–5,4 % mehr als Textkommunikation und im Schnitt 2,5-fache Geschwindigkeit.

Können LLMs jenseits von Text kommunizieren?

Mehr von diesem Tag

2026-09-18