Официальное квантование мета-ламы/Мета-ламы-3-8B с использованием PV-Tuning поверх AQLM. Для этого квантования мы использовали одну кодовую книгу из 16 бит для групп по 8 весов. Обратите внимание, что большая часть этой модели представляет собой 16-битные матрицы вложений/логитов. Вы можете значительно уменьшить объем модели, квантовав эти матрицы, например. используя форматы битов и байтов LLM.int8 или NF4. Это не требует дополнительного обучения. Чтобы узнать больше о выводе, а также о том, как самостоятельно квантовать модели, обратитесь к официальному репозиторию GitHub. Исходный код PV-Tuning можно найти в ветке AQLM@pv-tuning.
Модальности:
Генерация текста
Области применения:
Диалог / чат
Задача: Генерация текста
Автор: ISTA-DASLab
Теги: llama, facebook, meta, llama-3, conversational, text-generation-inference, endpoints_compatible, aqlm
Лайков: 4 | Загрузок: 18
Описание основано на материалах HuggingFace. Перевод выполнен автоматически.