Авторы: Ашвини Кумар Джиндал, Паван Кумар Раджпут, Анкур Парих, Акшита Сухлеча 🤗 Блог с объявлениями об объятиях: https://huggingface.co/blog/akjindal53244/llama31-storm8b Эта модель была получена путем квантования весов и активаций типа данных Llama-3.1-Storm-8B в FP8 с использованием этого сценарий, готовый к выводу с помощью vLLM. Эта оптимизация уменьшает количество бит на параметр с 16 до 8, уменьшая размер диска и требования к памяти графического процессора примерно на 50%. Квантуются только веса и активации линейных операторов внутри блоков преобразователей. Применяется симметричное потензорное квантование, при котором одно линейное масштабирование отображает представления FP8 квантованных весов и активаций. LLM Compressor используется для квантования 512 последовательностей UltraChat. Мы представляем модель Llama-3.1-Storm-8B, которая значительно превосходит модели Llama-3.1-8B-Instruct и Hermes-3-Llama-3.1-8B от Meta AI в различных тестах, как показано на графике сравнения производительности в следующем разделе. Наш подход состоит из трех ключевых шагов: 1. Самокурирование: мы применили два метода самокурирования, чтобы выбрать примерно 1 миллион высококачественных примеров из пула примерно в 2,8…
Модальности:
Генерация текста
Области применения:
Логика и рассуждение Диалог / чат
Задача: Генерация текста
Автор: akjindal53244
Теги: llama, llama-3.1, fp8, conversational, instruction following, reasoning, function calling, en
Лайков: 14 | Загрузок: 14
Описание основано на материалах HuggingFace. Перевод выполнен автоматически.