Needle 2 - 14MBの超軽量エージェントLLM
Show HN: Cactus Needle 3: 8-29MB automation models can match DeepSeek V4 Flash
Needle 2は、4500万パラメータながら14MBの単一バイナリに収まり、28MBのRAMで動作するオープンなツール呼び出し・デバイス操作・構造化抽出モデルです。Cactus Quantsによる2bit量子化と独自エンジンで、Raspberry Pi 5上で毎秒500トークンのデコードを実現。Meta Quest 3SやApple Vision Pro、200ドル以下のスマートフォン、さらにはESP32-S3のようなマイコンでも動作します。FunctionGemma 270MやLFM2.5 230Mと同等の性能を5〜70倍小さいサイズで発揮し、クラウドに依存しないプライベートで即時的なオンデバイスAIを提供します。Apache 2.0ライセンスで、Hugging Faceから重みを取得可能。自分のMacやPCで数分から数時間でファインチューニングもできます。
画面のないPebble Index Ringでは、話しかけたアクションが毎回必ず実行されなければなりません。私たちはクラウドに頼らず、Cactus Needleをアプリ内でローカルに実行しています。モデルのフットプリントは非常に小さく、パフォーマンスは決して期待を裏切りません。