— Архитектура модели: Gemma 2 — Входные данные: текст — Выходные данные: текст — Оптимизация модели: — Весовое квантование: FP8 — Квантование активации: FP8 — Варианты предполагаемого использования: Предназначено для коммерческого и исследовательского использования на английском языке. Как и gemma-2-9b-it, эта модель предназначена для общения в режиме помощника. — За пределами области применения: использование любым способом, нарушающим применимые законы и правила (включая законы о торговом регулировании). Используйте на языках, отличных от английского. — Дата выпуска: 08.07.2024 — Версия: 1.0 — Проверено на: RHOAI 2.20, RHAIIS 3.0, RHELAI 1.5 — Лицензии: gemma — Разработчики моделей: Neural Magic (Red Hat) Квантованная версия gemma-2-9b-it. Он достигает среднего балла 73,49 в тесте OpenLLM (версия 1), тогда как неквантованная модель достигает 73,23. Эта модель была получена путем квантования весов и активаций gemma-2-9b-it до типа данных FP8, готового к выводу с vLLM >= 0,5.1. Эта оптимизация уменьшает количество бит на параметр с 16 до 8, уменьшая размер диска и требования к памяти графического процессора примерно на 50%. Квантуются только веса и активации линейных операторов внутри блоков преобразователей. Применяется симметричное потензорное квантование, при котором…
Модальности:
Генерация текста
Области применения:
Диалог / чат
Задача: Генерация текста
Автор: RedHatAI
Теги: gemma2, gemma, fp8, vllm, conversational, text-generation-inference, en, endpoints_compatible
Лайков: 5 | Загрузок: 967
Описание основано на материалах HuggingFace. Перевод выполнен автоматически.