로컬 LLM이 더 멍청해 보이는 이유: KV 캐시 양자화가 40K 토큰 후에 IQ를 떨어뜨린다

Why your local LLM feels dumber than it is

로컬 LLM이 더 멍청해 보이는 이유: KV 캐시 양자화가 40K 토큰 후에 IQ를 떨어뜨린다

로컬 LLM이 공식 벤치마크보다 성능이 떨어지는 이유를 하드웨어·소프트웨어 구현 차이에서 찾는 실험 시리즈. Qwen3.6-27B를 BF16 기준으로, 어텐션 백엔드(FlashAttention 2, Flash Inference, Triton)와 KV 캐시 양자화(INT8, INT4), 가중치 양자화(FP8, INT8, NVFP4, AWQ)를 비교한 결과, 어텐션 백엔드만 바꿔도 토큰 선택이 달라지고, KV 캐시를 INT4로 줄이면 도구 호출 오류가 발생했다. 가중치 양자화는 W8A16이 가장 원본에 가까웠다. 결론: 로컬 구현의 '멍청함'은 모델 자체보다 추론 엔진의 수치적 불일치에서 비롯된다.

당신의 로컬 구현은 형편없다. 하지만 괜찮다. 다른 모든 사람의 구현도 마찬가지니까.
  1. big-chungus4

    방금 Macbook Pro에서 qwen 3.8 27b mlx를 실행해봤는데, 솔직히 그렇게 멍청하지 않다는 것에 꽤 놀랐습니다.

  2. jonplackett

    시스템 프롬프트와 컨텍스트 창 관리에 관한 섹션은 정확합니다. 대부분의 사람들은 인기 있는 러너의 기본 양자화가 전체 FP16에 비해 논리를 얼마나 저하시키는지 깨닫지 못합니다. 저자는 KV 캐시 압축이 더 긴 컨텍스트 추론에 미치는 영향을 벤치마크했는지 궁금합니다. 일반적으로 제 로컬 Llama 3 설정이 무너지기 시작하는 지점이 그 부분인 것 같아서요.

  3. utopiah

    이러한 이유로 저는 다음 규칙을 고수합니다:

    a) KV 캐시를 양자화하지 않는다

    b) 사용 가능한 최상의 Q8보다 나쁜 LLM 양자화를 실행하지 않는다 (예: qwen 3.8 27B와 같은 특정 모델에 대한 가장 큰 파일 크기의 unsloth GGUF). 느리게 실행되더라도 더 정확하게 작업을 수행한다는 확신을 갖고 싶습니다.

  4. a11r

    내부 테스트에서 Qwen3.8 27b의 4비트 양자화조차 Gemini 3.7 flash와 구별할 수 없습니다. RTX5090 카드와 ninfer를 사용하면 약 800 TPS 토큰 생성(c=8)과 단일 스트림에서 초당 약 140 토큰을 얻을 수 있습니다.

  5. heywoods

    저는 4090에서 Qwen3.8 aggressive uncensored Q4_K_P를 2026 CrackMe CTF 챌린지에 대해 루프로 실행하고 있습니다.

    oh-my-pi를 사전 구축된 환경에서 사용하는데, 그 환경도 Qwen이 구축하도록 했습니다.

    Codex는 파일을 보지도 않았습니다. 문자 그대로 CTF가 포함된 것을 읽자마자 종료되었습니다. 더 멍청한 모델로 대체할 제안조차 하지 않았습니다.

이 날의 다른 글

2026-08-22