Cache-to-Cache: LLM общаются напрямую через KV-кэш, минуя текст
Cache-to-Cache: Direct Semantic Communication Between Large Language Models
Мульти-LLM системы выигрывают от объединения разных моделей, но обычно общаются текстом, что теряет семантику и замедляет генерацию. Авторы предлагают Cache-to-Cache (C2C): нейросеть проецирует и сливает KV-кэш исходной модели с целевой, а обучаемый гейтинг выбирает слои для передачи. C2C даёт на 6.4–14.2% выше точности, чем отдельные модели, превосходит текстовое общение на 3.1–5.4% и ускоряет отклик в среднем в 2.5 раза. Код доступен на GitHub.
Могут ли LLM общаться не только текстом?