— Архитектура модели: Meta-Llama-3 — Ввод: Текст — Вывод: Текст — Оптимизация модели: — Квантование веса: INT8 — Варианты предполагаемого использования: Предназначен для коммерческого и исследовательского использования на английском языке. Подобно Meta-Llama-3-8B-Instruct, эти модели предназначены для ассистентского чата. — Вне сферы применения: использование любым способом, нарушающим применимые законы или правила (включая законы о соблюдении торговых норм). Использование на языках, отличных от английского. — Дата выпуска: 02.07.2024 — Версия: 1.0 — Лицензия(и): Llama3 — Разработчики моделей: Neural Magic Quantized version of Meta-Llama-3-8B-Instruct. Он достигает среднего балла 68,69 по тесту OpenLLM (версия 1), тогда как неквантовая модель достигает 68,54. Эта модель была получена путем квантования весов типа данных Meta-Llama-3-8B-Instruct to INT8. Эта оптимизация уменьшает количество бит на параметр с 16 до 8, уменьшая размер диска и требования к памяти графического процессора примерно на 50%. Только веса линейных операторов в блоках трансформаторов квантуются. Применяется симметричное квантование по каналам, в котором линейное масштабирование на выходное измерение отображает INT8 и представления с плавающей точкой квантованных весов. AutoGPTQ…
Модальности:
Генерация текста
Области применения:
Диалог / чат Следование инструкциям
Задача: Генерация текста
Автор: RedHatAI
Теги: llama, conversational, en, text-generation-inference, endpoints_compatible, 8-bit, gptq
Лайков: 3 | Загрузок: 256
Описание основано на материалах HuggingFace. Перевод выполнен автоматически.