Эта модель была получена путем квантования весов и активаций Bielik-4.5B-v3.0-Instruct для типа данных FP8, готового к выводу с помощью vLLM >= 0.5.0 или SGLang. AutoFP8 используется для квантования. Эта оптимизация уменьшает количество бит на параметр с 16 до 8, уменьшая размер диска и требования к памяти графического процессора примерно на 50%. Квантуются только веса и активации линейных операторов внутри блоков преобразователей. Применяется симметричное потензорное квантование, при котором одно линейное масштабирование отображает представления FP8 квантованных весов и активаций. Вычисления FP8 поддерживаются на графических процессорах Nvidia с вычислительной мощностью > 8,9 (Ада Лавлейс, Хоппер). ОТКАЗ ОТ ОТВЕТСТВЕННОСТИ: Имейте в виду, что квантованные модели демонстрируют пониженное качество отклика и возможные галлюцинации! Эту модель можно эффективно развернуть с помощью серверной части vLLM, как показано в примере ниже. vLLM также поддерживает обслуживание, совместимое с OpenAI. Более подробную информацию смотрите в документации. Затем вы можете отправить HTTP-запрос или использовать API, совместимый с OpenAI. Разработано: SpeakLeash & ACK Cyfronet AGH Язык: польский Тип модели: только причинный декодер Количество от: Bielik-4.5B-v3.0-Instruct Тонкая настройка от: Bielik-4.5B-v3 …
Модальности:
Генерация текста
Области применения:
Диалог / чат Следование инструкциям
Задача: Генерация текста
Автор: speakleash
Теги: llama, finetuned, gguf, 8bit, conversational, pl, text-generation-inference, compressed-tensors
Лайков: 5 | Загрузок: 396
Описание основано на материалах HuggingFace. Перевод выполнен автоматически.