Эта модель была получена путем квантования весов и активаций типа данных Bielik-11B-v2.6-Instruct to FP8, готового к выводу с vLLM >= 0,5,0 или SGLang. AutoFP8 используется для квантования. Эта оптимизация уменьшает количество бит на параметр с 16 до 8, уменьшая размер диска и требования к памяти графического процессора примерно на 50%. Только веса и активации линейных операторов в блоках трансформаторов квантуются. Применяется симметричное квантование на тензор, в котором одно линейное масштабирование отображает представления FP8 квантованных весов и активаций. Вычисление FP8 поддерживается на графических процессорах Nvidia с вычислительной способностью > 8,9 (Ada Lovelace, Hopper). ОТКАЗ ОТ ОТВЕТСТВЕННОСТИ: Имейте в виду, что квантованные модели показывают сниженное качество ответа и возможные галлюцинации! Эта модель может быть эффективно развернута с использованием бэкенда vLLM, как показано в примере ниже. vLLM aslo поддерживает OpenAI-совместимое обслуживание. Подробнее — в документации. Затем вы можете отправить HTTP-запрос или использовать API, совместимый с OpenAI. Разработано: SpeakLeash
Модальности:
Генерация текста
Области применения:
Диалог / чат Следование инструкциям
Задача: Генерация текста
Автор: speakleash
Теги: llama, finetuned, gguf, 8bit, conversational, pl, text-generation-inference, compressed-tensors
Лайков: 4 | Загрузок: 511
Описание основано на материалах HuggingFace. Перевод выполнен автоматически.