Shoehorn: 让任意大模型完美适配本地内存
Show HN: Shoehorn – Quantize any model down to run on your machine

Shoehorn 彻底改变了语言模型在本地运行的方式。它不再依赖预设的量化方案,而是根据你实际的硬件内存,动态计算并分配每个张量的混合精度,确保模型利用率高达 99.99%。无论是通过浏览器扫描 Hugging Face 上的热门模型,还是通过本地 UI 一键部署,Shoehorn 都能让你在不浪费任何内存预算的前提下,流畅运行原本无法加载的大模型。
Shoehorn 从你实际拥有的内存出发,扣除推理所需,通过求解每个张量的混合精度分配方案,将预算利用率提升至小数点后四位,有时甚至精确到字节。
- hmokiguess
- mbuchel-hn
这个和 airllm 的工作原理类似吗?我想知道它如何处理在 8GB 预算下量化 kimi k3 这类情况,还是说这目前还不是你们打算解决的问题?
- jaylane
试了一下,但根据我得到的模型大小结果,服务器启动时出现了内存不足的错误