Prism ML, 9배 작아진 27B 모델로 성능 98.2% 유지

Bonsai 2 27B: Near-Lossless Compression in a 9x Smaller Footprint

Prism ML, 9배 작아진 27B 모델로 성능 98.2% 유지

Prism ML이 Qwen3.8 27B를 기반으로 한 Ternary Bonsai 2 27B를 공개했다. 삼진 가중치와 FP16 그룹 스케일링으로 가중치당 1.76비트를 구현해 전체 모델 크기를 5.9GB로 줄였으며, 원본 대비 9배 이상 작으면서도 벤치마크 성능의 98.2%를 유지한다. 262K 토큰 컨텍스트와 멀티모달 입력을 지원하고 Apache 2.0 라이선스로 배포된다. RTX 5090에서 초당 143토큰, M5 Max에서 46.8토큰을 처리하며, RTX 4090 기준 8B 풀정밀도 모델보다 에너지 효율이 40% 높다.

앞으로 중요한 질문은 모델이 얼마나 뛰어난가뿐 아니라, 주어진 메모리·연산·전력 예산 안에서 얼마나 많은 유용한 지능을 전달할 수 있는가가 될 것이다.

이 날의 다른 글

2026-09-17