— Архитектура модели: Llama — Входные данные: текст — Выходные данные: текст — Оптимизация модели: — Квантование активации: INT8 — Квантование веса: INT8 — Варианты предполагаемого использования: Предназначено для коммерческого и исследовательского использования нескольких языков. Как и Llama-3.3-70B-Instruct, эта модель предназначена для общения в режиме помощника. — За пределами области применения: использование любым способом, нарушающим применимые законы и правила (включая законы о торговом регулировании). — Дата выпуска: 20.01.2025 — Версия: 1.0 — Проверено на: RHOAI 2.20, RHAIIS 3.0, RHELAI 1.5 — Разработчики модели: Neural Magic Quantized версия Llama-3.3-70B-Instruct. Он оценивался по нескольким задачам для оценки его качества по сравнению с некваватизированной моделью, включая множественный выбор, математические рассуждения и генерацию открытого текста. Llama-3.3-70B-Instruct-quantized.w8a8 достигает 99,4% восстановления для OpenLLM v1 (с использованием подсказок Meta, если они доступны) и 100% для HumanEval и HumanEval+ pass@1. Эта модель была получена путем квантования весов и активаций Llama-3.3-70B-Instruct к типу данных INT8. Эта оптимизация уменьшает количество бит, используемых для представления весов и активаций, с 16 до 8, уменьшая требования к памяти графического процессора (на…
Модальности:
Генерация текста
Области применения:
Диалог / чат Следование инструкциям
Задача: Генерация текста
Автор: RedHatAI
Теги: llama, facebook, meta, llama-3, int8, vllm, chat, neuralmagic
Лайков: 13 | Загрузок: 2,415
Описание основано на материалах HuggingFace. Перевод выполнен автоматически.