Kimi Linear, 전방위 성능과 효율성을 동시에 달성한 새로운 아키텍처

Kimi Linear: An Expressive, Efficient Attention Architecture (2025)

Kimi Linear, 전방위 성능과 효율성을 동시에 달성한 새로운 아키텍처

저희는 Kimi Linear라는 하이브리드 선형 어텐션 아키텍처를 소개합니다. 이 모델은 짧은 문맥부터 긴 문맥, RL 스케일링까지 다양한 시나리오에서 기존 풀 어텐션을 능가합니다. 핵심인 Kimi Delta Attention(KDA)은 제한된 메모리를 더 효과적으로 활용하며, 특수화된 알고리즘을 통해 KV 캐시 사용량을 최대 75% 줄이고 디코딩 속도를 6 배까지 높였습니다.

Kimi Linear는 더 긴 입력과 출력 길이를 가진 작업 포함하여, 모든 성능과 효율성 측면에서 풀 어텐션 아키텍처를 대체할 수 있는 드롭인 솔루션이 될 수 있습니다.
  1. senko

    오래된 내용이지만 여전히 관련이 있습니다. 최근 발표된 Kimi K3 논문 [0] 을 읽어보시면, 여기에서 논의된 Kimi Linear 를 기반으로 크게 확장하고 네이티브 비전 및 RL 개선 등 다양한 기능을 추가한 것을 확인할 수 있습니다.

    [0] https://arxiv.org/abs/2607.24653

  2. bratao

    이 모델을 사용하여 내부 모델을 만들기 시작했는데, 곧이어 Gated Deltanet 2 가 출시되었습니다 (https://arxiv.org/abs/2605.22791). 이는 표현력 측면에서 진화된 것 같습니다. 그리고 저희 테스트 결과 실제로 훨씬 더 좋습니다.

  3. pooyamo

    해당 분야 전문가들 중 이 질문을 아시는 분 계신가요? 프런티어 모델에서 목격하는 지능이 아키텍처가 확장되었을 때에만 나타나는 'emergent(새로 등장하는)' 현상인지?

    같은 아키텍처를 가진 100 만 파라미터 모델은 기본적인 퍼즐도 풀지 못하는데, 갑자기 1 조 파라미터 모델은 Jacobian 추측에 대한 반례를 만들어내니 이상하지 않나요?

    제 지식 범위 내에서는 알고리즘 개발의 기본 원칙 중 하나가 복잡한 문제에 대해 무작정 브루트 포스로 해결책을 찾을 수 없다는 것이었는데, 예를 들어 단순한 정렬 알고리즘에 더 많은 처리 능력을 투입한다고 해서 퀵소트를 이길 수는 없습니다. 하지만 현대 LLM 현상에서는 사람들이 확장 경쟁에 치열하게 뛰어들어, 경험적으로 실험하며 동일한 알고리즘/아키텍처가 해결책을 찾아낼 것이라고 희망하고 있는 것처럼 보입니다.

  4. oakpond

    "추가 연구를 지원하기 위해 KDA 커널과 vLLM 구현을 오픈소스로 공개하며, 사전 학습 및 지시 학습 모델 체크포인트를 배포합니다."

    정말 훌륭합니다.

  5. delichon

    Kimi 의 성공이 디스틸레이션 공격 때문이라고 믿고 싶다면, 이 내용은 무시하세요.

이 날의 다른 글

2026-07-29