Petals – Run LLMs at home, BitTorrent-style
Petals — проєкт для запуску великих мовних моделей (Llama 3.1 до 405B, Mixtral 8x22B, Falcon, BLOOM) вдома через розподілену мережу в стилі BitTorrent. Користувач завантажує частину моделі на свій GPU або Google Colab і приєднується до мережі, де інші обслуговують решту шарів, що дає змогу виконувати інференс (до 6 токенів/с для Llama 2 70B) і файнтюнити модель. Проєкт поєднує зручність API з гнучкістю PyTorch та Transformers.
Стабільність такого підходу сильно залежить від кількості та надійності учасників мережі.