AirLLM: 70B-LLM-Inferenz auf einer einzigen 4-GB-GPU
AirLLM 70B inference with single 4GB GPU

AirLLM reduziert den Speicherbedarf für LLM-Inferenz drastisch, sodass 70B-Modelle auf einer einzelnen 4-GB-GPU laufen – ohne Quantisierung, Distillation oder Pruning. Möglich wird das durch das Streamen einzelner Schichten auf die GPU. So laufen sogar 405B Llama 3.1 auf 8 GB, DeepSeek-V3 (671B) auf ~12 GB und Kimi K3 (2.8T) auf unter 4 GB, da spärliche MoE-Modelle Experten einzeln streamen. Das Projekt unterstützt nahezu alle gängigen offenen LLMs über eine einheitliche AutoModel-Schnittstelle.
AirLLM dramatically reduces inference memory usage, letting 70B large language models run on a single 4GB GPU card — without quantization, distillation, or pruning.