Maple-Preview - Ternary 20B MoE running at 120 tok/s on iPhone
Show HN: Maple-Preview – ternary 20B MoE running at 120 tok/s on a iPhone
Maple-Preview는 DeepGrove가 개발한 오픈소스 20B-A1B ternary-weight 추론 LLM입니다. 이 모델은 동급 최고 수준의 성능을 자랑하며, Mac mini M4에서 200+ tokens/s, iPhone에서 127 tokens/s의 속도로 실행됩니다. IMO 수준의 문제를 해결할 수 있으며, 5.31GB의 가벼운 체크포인트와 131,072 토큰의 컨텍스트를 지원합니다. Maple-Preview는 하드웨어 인지 아키텍처 설계와 네이티브 저비트 폭 학습을 통해 효율성과 성능을 동시에 달성했습니다. 또한, 온디바이스 적응 기능을 통해 사용자 선호도를 학습하고 개인화된 응답을 제공합니다.
우리는 모델이 실행되는 정밀도가 곧 학습되는 정밀도여야 한다고 믿습니다. DeepGrove에서 우리는 저비트 폭을 일급 시민으로 취급하며, 효율적인 모델이 어떻게 학습하는지 연구합니다. Maple-Preview는 네이티브하게 훈련된 ternary-weight 네트워크로, 저비트 폭이 타협을 의미하지 않는다는 것을 보여줍니다.