Petals: ejecuta LLMs en casa, estilo BitTorrent

Run large language models at home, BitTorrent‑style

Petals: ejecuta LLMs en casa, estilo BitTorrent

Petals es un proyecto de código abierto que permite ejecutar grandes modelos de lenguaje en casa, como Llama 3.1 (hasta 405B), Mixtral (8x22B), Falcon (40B+) o BLOOM (176B), usando una GPU de consumo o Google Colab. La clave es que cargas solo una parte del modelo y te unes a una red de personas que sirven las otras partes, logrando hasta 6 tokens/segundo en Llama 2 (70B) y 4 tokens/segundo en Falcon (180B), suficiente para chatbots y aplicaciones interactivas. Además, ofrece la flexibilidad de PyTorch y Transformers, permitiendo métodos de fine-tuning y muestreo personalizados, rutas personalizadas a través del modelo y acceso a estados ocultos, algo que las APIs tradicionales no ofrecen.

Obtienes las comodidades de una API con la flexibilidad de PyTorch y 🤗Transformers.

Más de este día

2026-07-23