Qwen3.8 27B를 Mac Studio에서 로컬로 실행해보니: 실제 수치
Run Qwen3.8 27B locally: real numbers from my Mac Studio

Mac Studio M3 Ultra에서 Qwen3.8 27B를 10일간 사용한 경험을 바탕으로, Ollama와 llama.cpp에서의 실제 성능을 측정했습니다. Q4_K_M 양자화 기준 생성 속도는 초당 약 14토큰으로 이전 모델(qwen3.6)의 절반 수준이지만, 답변에 사용하는 토큰 수가 3분의 1 수준이라 최종 답변 시간은 비슷합니다. 1비트 양자화는 빠르지만(초당 27토큰) 결정력이 부족합니다. 또한 RAM 요구사항, 실행 방법, 그리고 최신 빌드가 필요한 이유를 설명합니다.
양자화는 모델을 균등하게 저하시키지 않습니다. 사실은 살아남고, 결정력은 죽습니다.
HN 토론
77- Youden
로컬에서 LLM을 실행할 시스템을 사려고 생각 중인데, Qwen3.8-27B를 잘 돌릴 만한 시스템 가격이 솔직히 좀 부담스럽네요.
대신에 제가 찾아본 건 TEE와 E2EE를 사용해서 내 프롬프트와 응답이 나와 GPU 자체에게만 보인다는 암호학적 보증을 제공하는 추론 제공업체들입니다.
문서와 그 보증의 의미에 대한 설명에도 불구하고, 실제로 그들에게 비밀을 맡겨도 된다고 편안하게 느끼는 지점에 도달하는 게 어렵네요. 예를 들어 Phala는 게이트웨이까지만 E2EE인 것 같고, 이후에는 프롬프트를 (잠재적으로 제3자) 제공업체로 전달할 겁니다.
이 길을 가보신 분 중에 안전하다고 느끼는 제공업체를 찾으신 분 계신가요?
- Infernal
같은 파라미터 크기와 양자화에서 3.8이 3.6의 생성 성능의 절반밖에 안 나오는 걸 보니 정말 놀랍네요 (게다가 프리필 성능도 동일하다니) - 혹시 3.6용 스택 어딘가에 아직 3.8에는 적용되지 않은 최적화가 있는 건가요?
다른 분들도 이 명백한 차이에 놀라셨는지, 아니면 바로 설명할 수 있는 분이 계신지 궁금하네요.
- Atreiden
저도 같은 현상을 겪고 있습니다. 4-8비트 양자화를 시도해봤는데 한 번은 19 tok/s를 달성했지만 14-17 tok/s가 나옵니다. Unsloth나 LM Studio에서 dflash2 지원을 기다리고 있는데, 아마도 처리량을 약 30tok/s로 늘려줄 거라고 합니다. 그 정도면 제가 생각하기에 어느 정도 대화형이라고 할 수 있는 기준입니다.
ninfer로 100tok/s 이상을 내는 5090을 가진 분들이 부럽네요. 그 속도라면 진정한 프론티어 대체품이라고 생각합니다.
- rbanffy
적어도 아일랜드에서는 Mac이 Strix Halo 박스보다 저렴하게 끝나는 게 꽤 인상적이네요. M5 Max를 탑재한 128GB Mac Studio (Ultra는 96GB 또는 256GB만 가능)는 비슷한 성능의 "GMKtec EVO-X2"나 Nvidia DGX Spark보다 여전히 저렴합니다. 미국에서도 같은가요?
- pwython
네, 저도 64GB M4 Max에서 Qwen3.8이 재미없었습니다 (이 수치보다는 나았지만), 그래서 제 새로운 데일리 드라이버는 Ornith-1.5-35B-A3B-MLX-4bit입니다. 비슷한 하드웨어를 쓰신다면 한번 시도해보시길 권합니다. 제가 이전에 주로 쓰던 Qwen3.6 35b-a3b보다 확실히 낫습니다.