Maple-Preview - Modelo de razonamiento ternario 20B que corre a 127 tok/s en iPhone
Show HN: Maple-Preview – ternary 20B MoE running at 120 tok/s on a iPhone
Maple-Preview es un modelo de lenguaje de razonamiento de código abierto con pesos ternarios de 20B-A1B, diseñado para ejecutarse eficientemente en dispositivos cotidianos. Alcanza velocidades de 127 tokens por segundo en un iPhone, 13 veces más rápido que otros modelos eficientes, y resuelve problemas de nivel IMO. Su arquitectura, entrenada nativamente en baja precisión, permite una adaptación en el dispositivo, aprendiendo preferencias del usuario de manera personalizada. Con un tamaño de solo 5.31 GB y un contexto de 131,072 tokens, Maple-Preview ofrece un rendimiento competitivo con modelos mucho más grandes, marcando un nuevo punto en la frontera de eficiencia y capacidad.
Creemos que la precisión a la que un modelo se ejecuta debería ser la precisión a la que aprende.