Shoehorn: 让任意大模型完美适配本地内存

Show HN: Shoehorn – Quantize any model down to run on your machine

Shoehorn: 让任意大模型完美适配本地内存

Shoehorn 彻底改变了语言模型在本地运行的方式。它不再依赖预设的量化方案,而是根据你实际的硬件内存,动态计算并分配每个张量的混合精度,确保模型利用率高达 99.99%。无论是通过浏览器扫描 Hugging Face 上的热门模型,还是通过本地 UI 一键部署,Shoehorn 都能让你在不浪费任何内存预算的前提下,流畅运行原本无法加载的大模型。

Shoehorn 从你实际拥有的内存出发,扣除推理所需,通过求解每个张量的混合精度分配方案,将预算利用率提升至小数点后四位,有时甚至精确到字节。

同日更多故事

2026-08-18