Los LLM se comunican sin texto: el KV-Cache como canal directo entre modelos
Cache-to-Cache: Direct Semantic Communication Between Large Language Models
Los sistemas multi-LLM actuales obligan a los modelos a comunicarse mediante texto, lo que destruye información semántica y añade latencia token a token. Cache-to-Cache (C2C) propone proyectar y fusionar el KV-Cache del modelo fuente con el del modelo destino, con un mecanismo de gating que elige las capas receptoras. El resultado: entre 6,4% y 14,2% más de precisión que los modelos individuales, 3,1-5,4% por encima de la comunicación por texto y un 2,5x menos de latencia. Publicado en ICLR'26.
¿Pueden los LLM comunicarse más allá del texto?