Shoehorn - Quantize any model to fit your machine

Show HN: Shoehorn – Quantize any model down to run on your machine

Shoehorn - Quantize any model to fit your machine

Shoehorn ist ein Tool, das Sprachmodelle exakt an den verfügbaren Speicher anpasst. Statt voreingestellter Quantisierungen, die entweder Qualität verschwenden oder nicht passen, misst Shoehorn den tatsächlich verfügbaren Speicher, subtrahiert den Bedarf der Inferenz und löst eine gemischte Präzisionszuweisung pro Tensor, die bis zu 99,99 % des Budgets nutzt. Die lokale Web-App streamt den Fit, zeigt die Nutzung als Maßband und bietet einen Chat-Button. Einfach installieren, Modell wählen, loslegen – für maximale Qualität auf Ihrer Hardware.

Shoehorn startet von dem Speicher, den Sie tatsächlich haben, subtrahiert, was die Inferenz selbst benötigt, und löst eine gemischte Präzisionszuweisung pro Tensor, die innerhalb eines Rundungsfehlers des Restbetrags landet – routinemäßig werden 99,99 % des Budgets genutzt, manchmal bis auf das Byte.

Mehr von diesem Tag

2026-08-18