Это преобразованная модель инструкций Llama 3.1 405B в формат Distributed Llama. Модель квантована в формат Q40. Из-за ограничений Huggingface модель разделена на 56 частей. Перед использованием необходимо соединить детали между собой. Для запуска этой модели вам необходимо примерно 240 ГБ ОЗУ на одном устройстве или примерно 240 ГБ ОЗУ, распределенной между 2, 4, 8 или 16 устройствами, подключенными в кластер (подробнее, как это сделать, вы можете найти здесь). 1. ⏬ Загрузите модель. У вас есть два варианта: загрузить этот репозиторий и объединить все части вместе с помощью команды cat. Загрузите модель с помощью сценария launch.py из распределенного репозитория Llama: python launch.py llama31405binstructq40 4. ⏬ Загрузите распределенный репозиторий Llama. 5. 🔨 Сборка распределенной Llama: перед загрузкой этой модели необходимо принять лицензию Llama 3.1.
Модальности:
Генерация текста
Области применения:
Следование инструкциям
Задача: Генерация текста
Автор: b4rtaz
Теги: distributed-llama, distributed-inference
Лайков: 4 | Загрузок: 0
Описание основано на материалах HuggingFace. Перевод выполнен автоматически.