4GB GPUで70B LLM推論を実現するAirLLM

AirLLM 70B inference with single 4GB GPU

4GB GPUで70B LLM推論を実現するAirLLM

AirLLMは、モデルを層ごとに分割し、一度に1層だけをGPUにロードすることで、メモリ使用量を劇的に削減。量子化や蒸留、プルーニングなしで、4GB GPUで70Bモデル、8GBで405B Llama 3.1、約12GBでDeepSeek-V3(671B)を実行可能。さらに、スパースMoEモデルではエキスパート単位でストリーミングするため、最大級のオープンソースモデルKimi K3(2.8T)も4GB未満で動作。AutoModel APIで主要なオープンLLMをサポートし、モデル圧縮による最大3倍の高速化も実現。

AirLLMは、推論時のメモリ使用量を劇的に削減し、量子化、蒸留、プルーニングなしで、70B規模の大規模言語モデルを単一の4GB GPUカードで実行できるようにします。

同じ日のその他の記事

2026-08-03