Shoehorn - Quantize any model to fit your machine
Show HN: Shoehorn – Quantize any model down to run on your machine

Shoehornは、あなたのマシンのメモリに合わせて言語モデルを量子化するツールです。プリセットの量子化はハードウェアを無視しているため、メモリを無駄にしたり、ロード時に失敗したりします。Shoehornは実際のメモリから推論に必要な分を差し引き、テンソルごとに混合精度を割り当てて、予算の99.99%以上を効率的に使用します。ブラウザで動作するUIでモデルを選択し、ワンボタンでフィットさせ、チャットを開始できます。llama.cppをバックエンドとして使用し、HomebrewまたはCargoでインストール可能です。
Shoehornは、あなたが実際に持っているメモリから始めて、推論に必要な分を差し引き、テンソルごとに混合精度を割り当てることで、予算の99.99%以上を効率的に使用します。
- akshay_akula
これは興味深い。https://github.com/JustVugg/colibri のようなものとどう連携できるのだろうか。
- hmokiguess
https://github.com/AlexsJones/llmfit を思い出させる。
- jedbrooke
提案されるモデルのいくつかには笑ってしまうよ。例えば:
> AnkitAI/Parable-Qwen3-4B-Claude-Fable-5-GGUF
Fable 5 をたったの4Bに収めたって言うのかい?