Shoehorn - Quantize any model to fit your machine

Show HN: Shoehorn – Quantize any model down to run on your machine

Shoehorn - Quantize any model to fit your machine

Shoehorn은 사용자의 실제 메모리 용량에 맞춰 모든 언어 모델을 양자화하는 도구입니다. 기존의 사전 설정 양자화는 하드웨어를 무시하여 메모리를 낭비하거나 로드 시 실패할 수 있지만, Shoehorn은 추론에 필요한 메모리를 제외한 예산을 계산하고 텐서별 혼합 정밀도 할당을 통해 예산의 99.99% 이상을 사용합니다. 브라우저에서 모델을 검색하고, 로컬 앱에서 원버튼으로 피팅을 시작하며, 채팅까지 바로 이어집니다. llama.cpp를 백엔드로 사용하며, Homebrew나 Cargo로 간편하게 설치할 수 있습니다.

Shoehorn은 실제 메모리에서 시작하여 추론에 필요한 부분을 빼고, 반올림 오차 내에서 예산을 정확히 채우는 텐서별 혼합 정밀도 할당을 계산합니다. 일상적으로 예산의 99.99%를 사용하며, 때로는 바이트 단위까지 정확히 맞춥니다.

이 날의 다른 글

2026-08-18