Llama 2 (7B) настроен на основе набора данных испанских инструкций Clibrain и оптимизирован с использованием GPTQ. Llama 2 — это набор предварительно обученных и точно настроенных генеративных текстовых моделей масштаба от 7 до 70 миллиардов параметров. Это репозиторий предварительно обученной модели 7B. Методы квантования обычно относятся к одной из двух категорий: 1. Квантование после обучения (PTQ). Мы квантоваем предварительно обученную модель, используя умеренные ресурсы, такие как набор калибровочных данных, и несколько часов вычислений. 2. Обучение с учетом квантования (QAT). Квантование выполняется перед обучением или дальнейшей точной настройкой. GPTQ попадает в категорию PTQ, и это особенно интересно для массивных моделей, для которых полное обучение модели или даже точная настройка могут быть очень дорогими. В частности, GPTQ использует смешанную схему квантования int4/fp16, где веса квантуются как int4, а активации остаются в float16. Во время вывода веса деквантуются на лету, а фактические вычисления выполняются в float16. — Экономия памяти близка к x4 для квантования int4, поскольку деквантование происходит рядом с вычислительным блоком в объединенном ядре, а не в глобальной памяти графического процессора. — Потенциальное ускорение благодаря…
Модальности:
Генерация текста
Области применения:
Следование инструкциям
Задача: Генерация текста
Автор: clibrain
Теги: llama, quantization, gptq, es, text-generation-inference, 4-bit
Лайков: 9 | Загрузок: 15
Описание основано на материалах HuggingFace. Перевод выполнен автоматически.