Llama 2 — это набор предварительно обученных и точно настроенных генеративных текстовых моделей масштаба от 7 до 70 миллиардов параметров. Это репозиторий предварительно обученной модели 7B, преобразованной в формат Hugging Face Transformers. Эта модель представляет собой 4-битную квантованную модель AWQ размером 128 групп. Для получения дополнительной информации о квантовании AWQ нажмите здесь. Эта модель была успешно протестирована на драйвере CUDA v530.30.02 и среде выполнения v11.7 с Python v3.10.11. Обратите внимание, что для AWQ требуются графические процессоры NVIDIA с вычислительными возможностями версии 8.0 или выше. Для пользователей Docker образ nvcr.io/nvidia/pytorch:23.06-py3 представляет собой среду выполнения версии 12.1, но в остальном аналогичен приведенной выше конфигурации и также проверен на работоспособность. Модель была квантована с помощью метода AWQ. Если вы считаете AWQ полезным или актуальным для вашего исследования, пожалуйста, процитируйте статью:
Модальности:
Генерация текста
Области применения:
Диалог / чат
Задача: Генерация текста
Автор: abhinavkulkarni
Теги: llama, facebook, meta, llama-2, AWQ, en, text-generation-inference
Лайков: 6 | Загрузок: 16
Описание основано на материалах HuggingFace. Перевод выполнен автоматически.