Чтобы обеспечить развертывание Ring-Linear-2.0 на устройствах с ограниченным объемом памяти, мы выпускаем квантованные веса с использованием формата GPTQ INT4. Кроме того, мы оцениваем производительность онлайн-квантования FP8 моделей Ring-Linear-2.0, которая близко приближается к точности BF16. Поскольку на данном этапе запрос на включение (PR) не был отправлен сообществу vLLM, подготовьте среду, выполнив следующие действия. Сначала создайте среду Conda с Python 3.10 и CUDA 12.8. Наконец, установите совместимые версии преобразователей после установки vLLM: мы оцениваем квантовые модели INT4 и FP8, используя несколько наборов данных. Квантование FP8 применяется с помощью аргумента quantization=»fp8″ в SGLang или vLLM.
Модальности:
Генерация текста
Области применения:
Диалог / чат
Задача: Генерация текста
Автор: inclusionAI
Теги: bailing_moe_linear, conversational, custom_code, en, compressed-tensors
Лайков: 11 | Загрузок: 25
Описание основано на материалах HuggingFace. Перевод выполнен автоматически.