LLM이 텍스트를 건너뛰고 KV-Cache로 직접 대화한다

Cache-to-Cache: Direct Semantic Communication Between Large Language Models

여러 LLM을 함께 쓰면 단일 모델로는 얻기 어려운 성능과 효율을 확보할 수 있지만, 기존 방식은 모델 간 소통을 텍스트로만 처리해 내부 표현의 풍부한 의미가 손실되고 토큰 단위 생성 지연이 발생한다. 이에 연구진은 KV-Cache를 매개로 한 직접 의미 전달 패러다임 Cache-to-Cache(C2C)를 제안한다. 신경망이 소스 모델의 KV-Cache를 투영·융합하고, 학습 가능한 게이팅이 캐시 수신에 유리한 타깃 레이어를 선택한다. 실험에서 C2C는 개별 모델보다 평균 정확도 6.4~14.2% 높았고, 텍스트 통신보다 약 3.1~5.4% 우수하면서 지연 시간은 평균 2.5배 단축됐다.

우리는 이렇게 묻는다. LLM은 텍스트를 넘어서 소통할 수 있는가?

이 날의 다른 글

2026-09-18