colibrì: 在消费级电脑运行超大规模模型

Show HN: Getting GLM 5.2 running on my slow computer

colibrì: 在消费级电脑运行超大规模模型

这是一个用纯 C 语言编写的微型引擎,能在仅 25GB 内存的消费级电脑上流畅运行 GLM-5.2(744B 参数 MoE 模型)。它通过零依赖设计和从磁盘流式加载专家模块的技术,将庞大的模型拆分处理:核心部分驻留内存,其余专家按需读取。无需 GPU 或 Python 环境,支持原生 MTP 推测解码和智能缓存,让普通开发者也能在本地体验前沿大模型的强大能力。

Tiny engine, immense model. 用微型引擎驾驭庞大模型,让价值低于一张 H100 显卡的普通电脑也能正确回答前沿大模型的问题。
  • 有评论者指出,该项目的核心机制本质上是将 LRU page cache 和 readahead 技术应用于从磁盘流式加载 21,504 个专家模型参数,这与操作系统处理 mmap 数据库的成熟方案原理一致。
  • 一位在 Threadripper PRO 5975WX 上实测的用户反馈,运行 gpt-oss 120b 模型时冷启动速度仅为 0.44 tok/s,远低于官方文档估计,且模型在处理复杂提示时容易陷入循环,表明当前作为本地开发工具尚不成熟。
  • 有观点认为,旧款 Cascade Lake 服务器凭借 INT8 量化和巨大的内存带宽(约 282 GB/s),其推理吞吐量可能接近 AMD Ryzen Strix Halo 或 Apple M5 Pro,但能支持更大规模的 LLM。
  • 针对硬件升级,评论提到现代 Mini-PC 通过同时读取 PCIe 5.0 和 PCIe 4.0 SSD 可实现约 20 GB/s 的读取速度,理论上能将推理速度提升至 1 token/s,远超作者原系统。
  • 关于成本效益,有从业者对比指出,对于部分企业而言,每月 €2300 租用配备 768 GB RAM 和 Blackwell 6000 Max Q GPU 的服务器,比一次性投入 €40k 购买硬件并支付托管费用更具吸引力。

同日更多故事

2026-07-09