facebook/MobileLLM-ParetoQ-600M-BF16 - Каталог нейросетей
Генерация текста

facebook/MobileLLM-ParetoQ-600M-BF16

Добавлено:
facebook/MobileLLM-ParetoQ-600M-BF16

Квантованные модели MobileLLM представлены в документе «ParetoQ: Законы масштабирования при чрезвычайно низкобитном квантовании LLM». Архитектура модели: ParetoQ — это первая унифицированная структура, которая облегчает строгое сравнение параметров 1-битного, 1,58-битного, 2-битного, 3-битного и 4-битного квантования. Оптимизируя схемы обучения и уточняя функции квантования, ParetoQ превосходит все предыдущие методы, адаптированные к определенной разрядности. В частности, 1,58-битная модель ParetoQ LLaMA-3 8B сокращает разрыв в производительности до полной точности на относительно 37,8% по сравнению с 1,58-битной моделью LLaMA-3 8B 1-битной Era, используя при этом только 30% обучающих токенов. Благодаря баллам SoTA, полученным с помощью ParetoQ, мы можем улучшить анализ закона масштабирования. Рисунок (a) (b) демонстрирует, что суб4-битное квантование, включая двоичное, троичное, 2-битное и 3-битное, часто превосходит 4-битное квантование. Примечательно, что 2-битные и троичные модели находятся на границе Парето. Принимая во внимание удобство использования оборудования и скорость работы в реальном времени, мы обычно рекомендуем изучить 2-битное квантование для приложений на устройстве. Чтобы загрузить предварительно обученную модель для дальнейшей точной настройки или оценки: обратите внимание, что токенизатор по умолчанию не содержит…

Модальности:
Генерация текста

Области применения:
Диалог / чат


Задача: Генерация текста
Автор: facebook
Теги: llama, facebook, meta, pytorch — paretoq, conversational, en, text-generation-inference, endpoints_compatible
Лайков: 7  |  Загрузок: 0

Открыть на HuggingFace →

Описание основано на материалах HuggingFace. Перевод выполнен автоматически.