Los LLM se comunican sin texto: el KV-Cache como canal directo entre modelos

Cache-to-Cache: Direct Semantic Communication Between Large Language Models

Los sistemas multi-LLM actuales obligan a los modelos a comunicarse mediante texto, lo que destruye información semántica y añade latencia token a token. Cache-to-Cache (C2C) propone proyectar y fusionar el KV-Cache del modelo fuente con el del modelo destino, con un mecanismo de gating que elige las capas receptoras. El resultado: entre 6,4% y 14,2% más de precisión que los modelos individuales, 3,1-5,4% por encima de la comunicación por texto y un 2,5x menos de latencia. Publicado en ICLR'26.

¿Pueden los LLM comunicarse más allá del texto?

Más de este día

2026-09-18