— Архитектура модели: Meta-Llama-3 — Входные данные: текст — Выходные данные: текст — Оптимизация модели: — Квантование активации: INT8 — Квантование веса: INT8 — Варианты предполагаемого использования: Предназначен для коммерческого и исследовательского использования на нескольких языках. Как и Мета-Ллама-3.1-8Б, эта модель предназначена для общения в режиме помощника. — За пределами области применения: использование любым способом, нарушающим применимые законы и правила (включая законы о торговом регулировании). — Дата выпуска: 31 июля 2024 г. — Версия: 1.0 — Лицензия(и): Llama3.1 — Разработчики модели: Neural Magic Квантованная версия Meta-Llama-3.1-8B. Он достигает среднего балла 62,71 в тесте OpenLLM (версия 1), тогда как неквантованная модель достигает 63,03. Эта модель была получена путем квантования весов Meta-Llama-3.1-8B к типу данных INT8. Эта оптимизация уменьшает количество бит, используемых для представления весов и активаций, с 16 до 8, уменьшая требования к памяти графического процессора (приблизительно на 50%) и увеличивая пропускную способность вычислений при умножении матриц (примерно в 2 раза). Весовое квантование также снижает требования к размеру диска примерно на 50%. Квантуются только веса и активации линейных операторов внутри блоков преобразователей. Веса квантованы…
Модальности:
Генерация текста
Задача: Генерация текста
Автор: RedHatAI
Теги: llama, int8, vllm, quantized, 8-bit, en, de, fr
Лайков: 5 | Загрузок: 416
Описание основано на материалах HuggingFace. Перевод выполнен автоматически.