M4 Pro Mac mini: Mein lokales LLM-Setup mit Qwen3.6-35B-A3B

My local model setup on an M4 Pro Mac Mini

M4 Pro Mac mini: Mein lokales LLM-Setup mit Qwen3.6-35B-A3B

Ein Entwickler beschreibt, wie er auf seinem M4 Pro Mac mini mit 48 GB RAM einen lokalen LLM-Server einrichtet. Der Stack umfasst Qwen3.6-35B-A3B-OptiQ-4bit als Hauptmodell, Gemma-4-E4B-it-OptiQ-4bit für einfache Aufgaben, den Inferenzserver oMLX und Tailscale für die Vernetzung. Er erklärt die Vorteile lokaler Modelle: Kostenkontrolle, Datenschutz, geringe Latenz, Offline-Fähigkeit und keine Rate-Limits. Zudem erläutert er die RAM-Anforderungen von MoE-Modellen und wie man Modelle einfach austauschen kann.

Cloud-APIs sind gemietetes Land – sie können ihre Preise ändern, deine Nutzungslimits treffen oder das Modell hinter den Kulissen austauschen, wann immer sie wollen.

Mehr von diesem Tag

2026-09-01