— Создатель модели: CognitiveComputations. — Исходная модель: dolphin-2.9.4-llama3.1-8b. Курирует и обучает Эрик Хартфорд и Cognitive Computations. Эта модель основана на Meta Llama 3.1 8b и регулируется лицензией Llama 3.1. Базовая модель имеет контекст 128 КБ, а в нашей точной настройке использовалась длина последовательности 8192. AWQ — это эффективный, точный и невероятно быстрый метод квантования с низким весом, который в настоящее время поддерживает 4-битное квантование. По сравнению с GPTQ он обеспечивает более быстрый вывод на основе преобразователей с эквивалентным или лучшим качеством по сравнению с наиболее часто используемыми настройками GPTQ. Модели AWQ в настоящее время поддерживаются в Linux и Windows только с графическими процессорами NVidia. Пользователи macOS: вместо этого используйте модели GGUF. — Генерация текста Webui — с использованием загрузчика: AutoAWQ — vLLM — версия 0.2.2 или новее для поддержки всех типов моделей. — Вывод генерации текста обнимающего лица (TGI) — Трансформеры версии 4.35.0 и более поздних версий из любого кода или клиента, поддерживающего Трансформеры — AutoAWQ — для использования из кода Python
Модальности:
Генерация текста
Области применения:
Диалог / чат
Языки программирования:
Rust
Задача: Генерация текста
Автор: solidrust
Теги: llama, 4-bit, AWQ, autotrain_compatible, endpoints_compatible, generated_from_trainer, conversational, text-generation-inference
Лайков: 4 | Загрузок: 256
Описание основано на материалах HuggingFace. Перевод выполнен автоматически.