AirLLM ejecuta modelos de 70B en una GPU de 4GB sin cuantización

AirLLM 70B inference with single 4GB GPU

AirLLM ejecuta modelos de 70B en una GPU de 4GB sin cuantización

AirLLM reduce drásticamente el uso de memoria en inferencia, permitiendo ejecutar modelos de lenguaje de 70B en una sola GPU de 4GB, sin cuantización, destilación ni poda. Incluso puede ejecutar Llama 3.1 de 405B en 8GB, DeepSeek-V3 de 671B en ~12GB, y Kimi K3 de 2.8T en menos de 4GB. Esto es posible porque los modelos MoE dispersos transmiten un experto a la vez en lugar de una capa completa. El proyecto es de código abierto y compatible con casi todos los modelos populares.

AirLLM solo mantiene una capa en la GPU a la vez, por lo que la VRAM necesaria depende del tamaño de la capa del modelo, no de su tamaño total.

Más de este día

2026-08-03