llama.cpp: Lokale KI auf jeder Hardware – vom Laptop bis zum Cluster

llama.cpp, das beliebte Framework für lokale KI-Inferenz, präsentiert sich mit neuen Funktionen: Über `llama serve` und das `pi-llama`-Plugin lässt sich ein lokaler Coding-Agent starten, der automatisch das lokale Modell erkennt – ganz ohne Konfiguration oder API-Keys. Die Dateien bleiben auf dem eigenen Rechner. Zudem betont das Projekt seine breite Hardware-Unterstützung: Von Apple Silicon über NVIDIA RTX bis hin zu AMD MI300 und Intel Arc läuft dieselbe Binärdatei mit handoptimierten Kernen auf jeder GPU und CPU.
Dateien bleiben auf Ihrem Rechner, Anfragen verlassen ihn nie.