单张 4GB 显卡运行 70B 大模型
AirLLM 70B inference with single 4GB GPU

AirLLM 打破了大模型推理的硬件壁垒,让 70B 参数量的模型能在单张 4GB 显卡上流畅运行,且无需量化、蒸馏或剪枝。其核心在于稀疏 MoE 模型的逐专家流式加载技术,仅将当前 token 路由到的专家层载入显存。这一突破不仅支持 Llama 3.1 405B 在 8GB 显存下运行,甚至能让 2.8T 参数的 Kimi K3 在不足 4GB 的显存中启动。配合块级量化压缩技术,AirLLM 还能将推理速度提升 3 倍,同时几乎不损失精度,让普通开发者也能在消费级硬件上体验顶级大模型。
AirLLM 大幅降低了推理内存占用,让 70B 大语言模型能在单张 4GB 显卡上运行,且无需量化、蒸馏或剪枝。
HN 评论区
83- imenani
对于任何好奇“这到底有多慢?”的人:
据我所知,Kimi K3 在 RTX 6000 Ada (48GB) 上运行需要 292 秒/个 token。
- roger_
最近看到很多这类“用 1GB 内存运行 1TB 模型”的项目。大多数看起来都是凭感觉写的代码(vibe coded),恐怕很难长期维护。
希望能有一个真正有潜力的赢家脱颖而出。
- seu
我很欣赏这种“末日逼近”的氛围迫使大家拼命压榨性能。希望这也能促使人们重新思考模型架构,从而用更少的资源实现同样的效果。
- xg15
只要你愿意等得够久,任何前沿模型都能在你的 PC 上跑起来……
- cpfohl
我仍然有点困惑,这到底带来了什么新东西。
假设我想运行一个全尺寸的开权模型。我有一台配备 128GB 内存的 M3 Max 笔记本。
这基本上就是按需加载和卸载层吗?所以我还是得把整个模型下载到磁盘上,只是 RAM 需求大幅降低了?README 里提到仍需连接 HuggingFace,这让我觉得也许你甚至不需要下载完整的模型?