로컬 LLM이 더 멍청해 보이는 이유: KV 캐시 양자화가 40K 토큰 후에 IQ를 떨어뜨린다

Why your local LLM feels dumber than it is

로컬 LLM이 더 멍청해 보이는 이유: KV 캐시 양자화가 40K 토큰 후에 IQ를 떨어뜨린다

로컬 LLM이 공식 벤치마크보다 성능이 떨어지는 이유를 하드웨어·소프트웨어 구현 차이에서 찾는 실험 시리즈. Qwen3.6-27B를 BF16 기준으로, 어텐션 백엔드(FlashAttention 2, Flash Inference, Triton)와 KV 캐시 양자화(INT8, INT4), 가중치 양자화(FP8, INT8, NVFP4, AWQ)를 비교한 결과, 어텐션 백엔드만 바꿔도 토큰 선택이 달라지고, KV 캐시를 INT4로 줄이면 도구 호출 오류가 발생했다. 가중치 양자화는 W8A16이 가장 원본에 가까웠다. 결론: 로컬 구현의 '멍청함'은 모델 자체보다 추론 엔진의 수치적 불일치에서 비롯된다.

당신의 로컬 구현은 형편없다. 하지만 괜찮다. 다른 모든 사람의 구현도 마찬가지니까.

이 날의 다른 글

2026-08-22