inclusionAI/Ring-mini-linear-2.0-GPTQ-int4 - Каталог нейросетей
Генерация текста

inclusionAI/Ring-mini-linear-2.0-GPTQ-int4

Добавлено:
inclusionAI/Ring-mini-linear-2.0-GPTQ-int4

Чтобы обеспечить развертывание Ring-Linear-2.0 на устройствах с ограниченным объемом памяти, мы выпускаем квантованные веса с использованием формата GPTQ INT4. Кроме того, мы оцениваем производительность онлайн-квантования FP8 моделей Ring-Linear-2.0, которая близко приближается к точности BF16. Поскольку на данном этапе запрос на включение (PR) не был отправлен сообществу vLLM, подготовьте среду, выполнив следующие действия. Сначала создайте среду Conda с Python 3.10 и CUDA 12.8. Наконец, установите совместимые версии преобразователей после установки vLLM: мы оцениваем квантовые модели INT4 и FP8, используя несколько наборов данных. Квантование FP8 применяется с помощью аргумента quantization=»fp8″ в SGLang или vLLM.

Модальности:
Генерация текста

Области применения:
Диалог / чат


Задача: Генерация текста
Автор: inclusionAI
Теги: bailing_moe_linear, conversational, custom_code, en, compressed-tensors
Лайков: 11  |  Загрузок: 25

Открыть на HuggingFace →

Описание основано на материалах HuggingFace. Перевод выполнен автоматически.