Lumabri - Run huge MoE models on a P2P swarm
Show HN: Lumabri – Run Moe Models on a P2P Swarm with Colibri
Lumabri permite ejecutar modelos de mezcla de expertos (MoE) de gran tamaño desde un enjambre de pares, sin necesidad de GPU. Un solo equipo comparte el modelo y cualquier otra máquina puede chatear con él: los bytes necesarios se descargan bajo demanda y se almacenan en un espejo local, de modo que la segunda pregunta se responde a velocidad local. El motor, escrito en C puro y sin dependencias, funciona igual en CPU que en GPU, y la salida es idéntica. Cualquier máquina puede unirse, ya sea para chatear, donar disco o donar cómputo, lo que democratiza el acceso a modelos grandes. La configuración es sencilla: basta con ejecutar 'lumabri serve' en la máquina con el modelo y 'lumabri chat' en las demás. Además, soporta múltiples modelos en un mismo enjambre y redes privadas con token.
Una red sin GPU es una red funcional; las redes que agrupan GPUs reclutan a unos pocos, mientras que lumabri recluta a todos.