Maple-Preview – Open-Source 20B-A1B Reasoning LLM
Show HN: Maple-Preview – ternary 20B MoE running at 120 tok/s on a iPhone
Maple-Preview ist ein Open-Source-20B-A1B-LLM mit Ternärgewichten, das für effizientes On-Device-Reasoning entwickelt wurde. Es erreicht 127 Tokens pro Sekunde auf einem iPhone und 218 Tokens pro Sekunde auf einem Mac mini M4 – bis zu 16-mal schneller als vergleichbare Modelle. Mit einem Checkpoint von nur 5,31 GB und einem Kontext von 131.072 Token löst es IMO-Niveau-Probleme und setzt neue Maßstäbe in Sachen Geschwindigkeit und Effizienz. Das Modell unterstützt On-Device-Adaption und passt sich durch „Dreaming“ an Nutzerpräferenzen an. Verfügbar auf DeepGrove.
Wir glauben, dass die Präzision, mit der ein Modell läuft, die Präzision sein sollte, mit der es lernt – Maple-Preview zeigt, dass niedrige Präzision keinen Kompromiss bedeuten muss.