Petals: BitTorrent 방식으로 집에서 대형 언어 모델을 실행한다
Run large language models at home, BitTorrent‑style

Petals는 소비자용 GPU나 Google Colab만으로 Llama 3.1(최대 405B), Mixtral(8x22B), Falcon(40B+) 등 대형 언어 모델을 실행하고 미세 조정할 수 있게 해주는 분산 네트워크다. 모델의 일부만 로드한 후 다른 사용자들이 서빙하는 나머지 부분에 연결되는 방식으로, Llama 2(70B) 기준 초당 최대 6토큰, Falcon(180B) 기준 4토큰의 속도로 챗봇 등 대화형 앱을 구동하기에 충분하다. 또한 PyTorch와 Hugging Face Transformers의 유연성을 그대로 제공하여, 커스텀 파인튜닝이나 샘플링, 모델 내부 상태 접근 등 API 이상의 자유도를 누릴 수 있다.
모델의 일부만 로드한 후, 나머지 부분을 서빙하는 사람들의 네트워크에 합류하게 됩니다.