单张 4GB 显卡运行 70B 大模型

AirLLM 70B inference with single 4GB GPU

单张 4GB 显卡运行 70B 大模型

AirLLM 打破了大模型推理的硬件壁垒,让 70B 参数量的模型能在单张 4GB 显卡上流畅运行,且无需量化、蒸馏或剪枝。其核心在于稀疏 MoE 模型的逐专家流式加载技术,仅将当前 token 路由到的专家层载入显存。这一突破不仅支持 Llama 3.1 405B 在 8GB 显存下运行,甚至能让 2.8T 参数的 Kimi K3 在不足 4GB 的显存中启动。配合块级量化压缩技术,AirLLM 还能将推理速度提升 3 倍,同时几乎不损失精度,让普通开发者也能在消费级硬件上体验顶级大模型。

AirLLM 大幅降低了推理内存占用,让 70B 大语言模型能在单张 4GB 显卡上运行,且无需量化、蒸馏或剪枝。

同日更多故事

2026-08-03