중국이 공짜로 공개한 KV 캐시 최적화, 서방 AI 기업들이 조용히 가져다 쓰다
The AI Race Just Got Awkward

Anthropic은 중국 연구소들이 자사 모델을 증류한다고 비판해 왔지만, 최근 DeepSeek이 공개한 KV 캐시 최적화 기술은 장문 컨텍스트에서 메모리 사용량을 437배 줄였다. 이 기술을 적용한 Claude Opus 5.5와 GPT-6.1 Sol은 캐시 읽기 비용을 각각 60%, 80% 인하했다. 중국이 왜 이런 혁신을 무료로 공개했는지는 의문이다.
그래서 중국 연구소들은 서방의 적자 투성이 연구소들에 구명줄을 던져준 셈인데, 나는 그 이유를 전혀 모르겠다.
HN 토론
410- cmiles8
중국 연구소들이 Anthropic의 모델을 그냥 증류(distillation)해서 만드는 게 왜 문제인가? Anthropic의 모델들도 다른 사람들 작업을 증류한 것 아닌가?
Anthropic이 '내가 말한 대로 하라, 내가 하는 대로 하지는 말라'고 우는 것처럼 느껴진다.
- slowin
나는 또한 미국 기반 AI 기업들이 만들려고 하는 폐쇄된 정원(walled gardens)에 대한 우회 방법을 제공해 준 중국 연구소들에 감사한다.
혹시 증류 데이터셋이 공개된 게 있는지 아는 사람 있나? 이런 것들이 BitTorrent로 배포되는 걸 보고 싶다. AI는 민주화되어야 하고 소수 사기업의 손에 고립되어서는 안 된다고 생각한다.
- bwest87
가장 좋은 설명은 LLM을 전반적으로 상품화(commoditize)하는 것이 중국 공산당의 목표라는 것이다. 왜냐하면 LLM은 궁극적으로 제조업(중국이 지배하는)에 대한 보완재가 될 것이고, 항상 '보완재를 상품화하라'는 원칙을 따르고 싶기 때문이다.
이것이 그들이 폭넓게 오픈소스화하는 이유를 설명해 준다고 본다. 호의에서가 아니다. 이 경쟁에 많은 플레이어가 있도록 하고 미국 연구소들에 너무 많은 권력이 축적되지 않도록 하려는 중국 정부의 전략적 수다(미국 연구소들이 그 과정에서 이득을 보더라도).
- listless
중국 AI 모델들이 이렇게 뛰어나다는 게 정말 감사하다. 나는 인류가 매일 불필요하게 겪는 수많은 질병을 치료하고 싶다. 그러려면 지금보다 더 강력한 모델이 필요하고, 중국이 우리가 최대한 빠르게 이 일을 밀어붙이는 데 필요한 경쟁을 제공하고 있다.
'최대한 빠르게 간다'는 게 지금 가장 인기 있는 입장이 아니라는 건 안다. 하지만 나는 10%의 종말 시나리오보다 우리가 할 수 있는 선한 일에 훨씬 더 관심이 있다. 나는 소아 뇌암 자선단체에서 자원봉사를 하고 있고, 또 한 명의 네 살배기가 죽는 걸 보고 싶지 않다. 이걸 막기 위해서라면 무엇이든 감수할 의향이 있다.
- reedf1
나는 지난 2주 넘게 5090에서 Qwen 3.8 27b(Opus 4.6급 모델)를 로컬로 170 tokens/s로 돌리고 있다. 9개월 전의 프런티어 모델이 소비자용 하드웨어에서 돌아가는 것이다. 증류와 프루닝이 1년 뒤 우리를 어디까지 데려갈지 누가 알겠나.
- reticulates
"그래서 중국 연구소들이 서방의 적자 연구소들에게 구명줄을 던져준 건데, 나는 그 이유를 전혀 모르겠다."
의도한 건 아니겠지만, 이건 사실 서방 연구소들에게 꽤나 나쁘다.
전체 부양 서사는 "이들의 매출이 얼마나 성장하는지 보라! 1년도 안 되어 $10bn에서 $100bn ARR로! 이건 수조 달러 규모 IPO가 될 것이다!"였고, $100bn에서 $500bn, $500bn에서 $1tn으로 이어지는 외삽된 미래 성장이 미래 투자를 정당화했다... 하지만 그 매출은 추론(inference)이 비쌌기 때문에 발생한 것이었다.
IPO 전에는 매출 성장 스토리가 전부다. 매출이 $100bn에서 $50bn으로 떨어지면, 지금 흑자라 하더라도 OpenAI와 Anthropic에게는 매우 매우 나쁜 평판이고, 성장 서사를 완전히 파괴한다.
- eggbrain
성능 최적화는 서방 연구소들만 돕는 게 아니라, 더 강력하고 유용한 LLM을 로컬에서 돌리는 데도 도움이 된다.
로컬 LLM이 충분히 '좋아지면', 사람들은 곧 ChatGPT와 Claude 구독료를 내지 않게 될 것이고, 이는 이들의 매출에 타격을 준다.
- user43928
> 이 모든 것은 서방 AI 기업들이 이제 추론 마진이 극도로 좋다는 뜻일 것이다.
> 그래서 중국 연구소들이 서방의 적자 연구소들에게 구명줄을 던져준 건데, 나는 그 이유를 전혀 모르겠다.
추론이 수익성이 없었다는 건 널리 퍼진 미신이다.
Kimi K3에 기반한 분석은 OpenAI와 Anthropic의 마진이 95%를 훨씬 웃돈다고 시사한다: https://inferencex.semianalysis.com/run/kimi-k3-on-b200
지난 몇 달 동안 나는 OpenAI가 추론 효율성에서 여러 번 돌파구를 만들었다는 뉴스를 봤다.
미국 선도 연구소들이 자체 최적화를 갖고 있지 않다거나, 이 특정 최적화를 DeepSeek로부터 배웠다고 믿을 이유가 없다.
- rglover
> 그래서 중국 연구소들이 서방의 적자 연구소들에게 구명줄을 던져준 건데, 나는 그 이유를 전혀 모르겠다.
"그러므로 전투의 전문가는 적을 움직이게 하고, 적에게 움직이지 않는다."
그들은 증류를 통해 과도한 학습 비용을 피하는 영리한 방법을 알아냈다. 이는 프런티어 연구소들이 더 빠르게 움직이고, 더 나은 모델을 내놓도록(망신과 '뒤처짐'을 피하기 위해—그러면서 비용의 대부분을 떠안으면서) 강제한다. 그 사이 그들은 계속 증류하거나 다른 기법을 적용할 수 있다—문제의 프런티어 연구소들이 몹시 싫어할 테지만.
체크메이트다.
- wren6991
"우리의 안전장치는 우리 모델이 승인되지 않은 사이버보안 작업을 하는 것을 막는다"와 "중국 모델이 사이버보안 작업에서 더 나아지는 이유는 증류 때문이다"를 동시에 믿는 데 필요한 이중사고는 정말 꽤 웃기다.