Qwen3.8 27B 양자화 벤치마크: 4비트는 원본 수준, 1비트는 붕괴

Benchmarking Qwen3.8 27B quantizations: 4-bit holds up, 1-bit collapses

Qwen3.8 27B 양자화 벤치마크: 4비트는 원본 수준, 1비트는 붕괴

Qwen3.8 27B 모델의 다양한 양자화 수준(GGUF)을 GPQA Diamond, IFBench, Terminal-Bench 2.1 벤치마크로 평가한 결과, 4비트 Q4_K_M(17GB)은 BF16 원본과 거의 동일한 성능을 보였고, 2비트 UD-Q2_K_XL(10.7GB)도 상당한 성능을 유지했습니다. 그러나 1비트 UD-IQ1_S(6.2GB)는 GPQA Diamond에서 랜덤 추측 수준으로 떨어졌으며, 추론 길이가 길어질수록 성능이 더 악화되었습니다. 이 글은 실제 GPU 비용과 실행 설정의 중요성도 다룹니다.

양자화 손상은 비선형적입니다. 처음에는 측정 가능한 변화가 없다가, 작은 하락이 이어지고, 마지막에는 붕괴가 일어납니다.
  1. spider-mario

    [1] spider-mario:

    > 둘째, 노이즈 외에는(막대는 Wilson 95% 신뢰 구간으로, 실행 간 노이즈에 대해 매우 보수적임), 4비트까지는 차이가 거의 없고 2비트만 점수가 약간 낮습니다.

    신뢰 구간은 실행 간 변동과 아무 관련이 없습니다. 사람들이 일반적으로 신뢰 구간에 부여하는 의미와도 거의 관련이 없지만(https://link.springer.com/article/10.3758/s13423-015-0947-8 ), 실행 간 변동과는 훨씬 더 관련이 없습니다(https://link.springer.com/article/10.1007/s10654-016-0149-3 오해 22).

  2. sharmajai

    [2] sharmajai:

    이 결과는 낮은 양자화 수준(IQ3_XXS와 8비트 KV 캐시를 사용합니다)과 XHIGH(기본) 사고 수준을 사용할 때 품질 손실이 최소화되는 이유에 대한 제 이론을 확인해 줍니다.

    양자화가 샘플링 확률 분포에 영향을 미친다는 것은 잘 알려져 있지만(같은 맥락에서 어떤 다음 토큰이 가장 확률이 높은지), Qwen 3.8 27b는 단순히 더 많이 사고함으로써 이를 상쇄하고 결과적으로 (벤치마크든 아니든) 작업을 결국 완료하는 것으로 보입니다.

    따라서 사고가 (더 길더라도) 건전하기만 하면, 이는 (기사에서 보여주듯이) 동일한 성공률로 이어지지만 잠재적으로 더 많은 토큰과 시간을 소비할 수 있습니다.

    성공률 외에도 각 양자화의 사용 토큰 수를 함께 차트로 표시하는 것이 더 유용할 것 같습니다.

    연구를 수행하고 공유해 주셔서 감사합니다!

  3. purpleflame1257

    [3] purpleflame1257:

    Q3에는 실제 구멍이 있습니다. 여기서 중요한 분기점은 16GB 미만 카드로, 5080, 5070 Ti, 5060ti 및 이번 세대와 지난 세대의 다른 여러 카드를 포함합니다. 품질의 무릎이 어디인지 확인하는 것이 도움이 될 것입니다.

  4. alentred

    [4] alentred:

    *KV 캐시* 양자화에 대한 유사한 벤치마크에 매우 관심이 있습니다.

    저는 때때로 코딩을 위해 Qwen3.8 27B Q4_K_M을 사용하므로 상대적으로 긴 컨텍스트가 필요합니다. q8_0으로 결정했는데, 24GB VRAM에 모델과 100k 토큰을 맞추는 유일한 방법이기 때문입니다. 하지만 품질에서 무엇을 잃고 있는지, 다른 옵션이 무엇인지 여전히 궁금합니다.

    또한 KV 캐시 양자화가 더 긴 컨텍스트에서 더 중요하다는 이야기를 들었습니다. 이것도 벤치마킹하는 것이 흥미로울 수 있습니다: 모델 양자화 × KV 캐시 양자화 × 컨텍스트 크기의 다양한 조합에서 품질이 어떤지.

  5. Farmadupe

    [5] Farmadupe:

    음, 이 글이 부분적으로는 Claude가 쓰고 부분적으로는 사람이 썼다고 가정할 때, "글이 읽을 가치가 있는지 어떻게 알 수 있는지"에 대한 경험 법칙을 찾는 데 도움을 줄 수 있는 사람이 있나요?

    한편으로는 산문과 표현이 고통스럽기 때문입니다(무관한 요점 서술, 비선형 X축, 모호한 차트 레이블 등).

    하지만 다른 한편으로는, 저자가 전달하려는 것으로 추정되는 결과("이 평가에서 생성 품질이 꽤 좋아 보인다")는 공유할 가치가 있어 보입니다.

    왜냐하면 저는 현재 이 질문으로 정말 고민하고 있기 때문입니다. "글에 데이터와 함께 무관한 텍스트가 나란히 제시된다면, 이는 저자가 작성하려는 작업을 이해하지 못한다는 신호일 수 있다"는 불리한 추론을 해도 될까요?

이 날의 다른 글

2026-09-08