Shoehorn - Quantize any model to fit your machine
Show HN: Shoehorn – Quantize any model down to run on your machine

Shoehornは、あなたのマシンのメモリに合わせて言語モデルを量子化するツールです。プリセットの量子化はハードウェアを無視しているため、メモリを無駄にしたり、ロード時に失敗したりします。Shoehornは実際のメモリから推論に必要な分を差し引き、テンソルごとに混合精度を割り当てて、予算の99.99%以上を効率的に使用します。ブラウザで動作するUIでモデルを選択し、ワンボタンでフィットさせ、チャットを開始できます。llama.cppをバックエンドとして使用し、HomebrewまたはCargoでインストール可能です。
Shoehornは、あなたが実際に持っているメモリから始めて、推論に必要な分を差し引き、テンソルごとに混合精度を割り当てることで、予算の99.99%以上を効率的に使用します。