单张 4GB 显卡运行 70B 大模型

AirLLM 70B inference with single 4GB GPU

单张 4GB 显卡运行 70B 大模型

AirLLM 打破了大模型推理的硬件壁垒,让 70B 参数量的模型能在单张 4GB 显卡上流畅运行,且无需量化、蒸馏或剪枝。其核心在于稀疏 MoE 模型的逐专家流式加载技术,仅将当前 token 路由到的专家层载入显存。这一突破不仅支持 Llama 3.1 405B 在 8GB 显存下运行,甚至能让 2.8T 参数的 Kimi K3 在不足 4GB 的显存中启动。配合块级量化压缩技术,AirLLM 还能将推理速度提升 3 倍,同时几乎不损失精度,让普通开发者也能在消费级硬件上体验顶级大模型。

AirLLM 大幅降低了推理内存占用,让 70B 大语言模型能在单张 4GB 显卡上运行,且无需量化、蒸馏或剪枝。
  1. imenani

    对于任何好奇“这到底有多慢?”的人:

    据我所知,Kimi K3 在 RTX 6000 Ada (48GB) 上运行需要 292 秒/个 token。

    https://github.com/lyogavin/airllm/releases/tag/v3.1.0

  2. roger_

    最近看到很多这类“用 1GB 内存运行 1TB 模型”的项目。大多数看起来都是凭感觉写的代码(vibe coded),恐怕很难长期维护。

    希望能有一个真正有潜力的赢家脱颖而出。

  3. seu

    我很欣赏这种“末日逼近”的氛围迫使大家拼命压榨性能。希望这也能促使人们重新思考模型架构,从而用更少的资源实现同样的效果。

  4. xg15

    只要你愿意等得够久,任何前沿模型都能在你的 PC 上跑起来……

  5. cpfohl

    我仍然有点困惑,这到底带来了什么新东西。

    假设我想运行一个全尺寸的开权模型。我有一台配备 128GB 内存的 M3 Max 笔记本。

    这基本上就是按需加载和卸载层吗?所以我还是得把整个模型下载到磁盘上,只是 RAM 需求大幅降低了?README 里提到仍需连接 HuggingFace,这让我觉得也许你甚至不需要下载完整的模型?

同日更多故事

2026-08-03