M4 Pro Mac mini에서 로컬 LLM 서버를 30분 만에 구축하는 방법
My local model setup on an M4 Pro Mac Mini

M4 Pro Mac mini(48GB RAM)에서 로컬 LLM 서버를 운영하는 저자의 경험담. Qwen3.6-35B-A3B-OptiQ-4bit와 Gemma-4-E4B-it-OptiQ-4bit 모델을 oMLX 서버로 실행하고, Tailscale로 iPhone, MacBook 등과 연결해 Hermes 에이전트, Apollo, Raycast, Pi 등에서 활용한다. 클라우드 API의 비용 변동, 데이터 프라이버시, AI 주권 문제를 피하고, 비용 예측 가능성, 낮은 지연 시간, 오프라인 동작, 무제한 사용 등의 이점을 강조한다. MoE 모델의 메모리 요구사항을 계산하는 방법과 모델 교체의 용이성도 설명한다.
클라우드 API는 임대된 땅입니다. 그들은 가격을 바꾸거나, 사용 한도에 도달하게 하거나, 뒤에서 서비스되는 모델을 마음대로 바꿀 수 있습니다.