— Архитектура модели: Meta-Llama-3.1 — Входные данные: текст — Выходные данные: текст — Оптимизация модели: — Весовое квантование: FP8 — Квантование активации: FP8 — Варианты предполагаемого использования: Предназначено для коммерческого и исследовательского использования на нескольких языках. Как и Мета-Ллама-3.1-8Б, эта модель является базовой версией. — За пределами области применения: использование любым способом, нарушающим применимые законы и правила (включая законы о торговом регулировании). Используйте на языках, отличных от английского. — Дата выпуска: 23 июля 2024 г. — Версия: 1.0 — Лицензия(и): llama3.1 — Разработчики модели: Neural Magic Квантованная версия Meta-Llama-3.1-8B. Он достигает среднего балла 65,90 в тесте OpenLLM (версия 1), тогда как неквантованная модель достигает 66,47. Эта модель была получена путем квантования весов и активаций Meta-Llama-3.1-8B в тип данных FP8, готовых для вывода с помощью vLLM, созданного из исходного кода. Эта оптимизация уменьшает количество бит на параметр с 16 до 8, уменьшая размер диска и требования к памяти графического процессора примерно на 50%. Квантуются только веса и активации линейных операторов внутри блоков преобразователей. Применяется симметричное потензорное квантование, при котором одно линейное масштабирование отображает…
Модальности:
Генерация текста
Задача: Генерация текста
Автор: RedHatAI
Теги: llama, fp8, vllm, en, de, fr, it, pt
Лайков: 10 | Загрузок: 243,387
Описание основано на материалах HuggingFace. Перевод выполнен автоматически.