Чат и поддержка: сервер Discord TheBloke Хотите внести свой вклад? Страница TheBloke на Patreon Работа TheBloke в области LLM щедро поддерживается грантом от Андреессена Горовица (a16z) — Создатель модели: Cognitive Computations — Исходная модель: Dolphin 2.7 Mixtral 8X7B. Этот репозиторий содержит файлы моделей AWQ для Dolphin 2.7 Mixtral 8X7B от Cognitive Computations. Эти файлы были квантованы с использованием оборудования, любезно предоставленного Massed Compute. Для вывода AutoAWQ установите AutoAWQ 0.1.8 или более позднюю версию. Поддержка через Transformers также доступна, но в настоящее время требуется установка Transformers с Github: pip3 install git+https://github.com/huggingface/transformers.git TGI: я тестировал версию 1.3.3, и она нормально загрузила модель, но мне не удалось получить какие-либо выходные данные. Требуется дальнейшее тестирование/отладка. (Дайте мне знать, если он у вас заработает!) AWQ — это эффективный, точный и невероятно быстрый метод квантования с низким весом, в настоящее время поддерживающий 4-битное квантование. По сравнению с GPTQ он обеспечивает более быстрый вывод на основе преобразователей с эквивалентным или лучшим качеством по сравнению с наиболее часто используемыми настройками GPTQ. Модели AWQ в настоящее время поддерживаются в Linux и Windows только с графическими процессорами NVidia. Пользователи MacOS:…
Модальности:
Генерация текста
Области применения:
Диалог / чат
Задача: Генерация текста
Автор: TheBloke
Теги: mixtral, conversational, en, text-generation-inference, 4-bit, awq
Лайков: 23 | Загрузок: 2,923
Описание основано на материалах HuggingFace. Перевод выполнен автоматически.