Чат Это экспериментальный новый GPTQ, который предлагает контекст размером до 8K. Увеличенный контекст тестируется для работы с ExLlama с помощью последней версии text-generation-webui. Он также был протестирован из кода Python с использованием AutoGPTQ, и trustremotecode=True. Code credits: — Original concept and code for increasing context length: kaiokendev — Updated Llama modelling code that includes this automatically via trustremotecode: emozilla. 4-разрядные модели GPTQ для вывода GPU 2, 3, 4, 5, 6 и 8-разрядных моделей GGML для вывода CPU Неколичественная модель SuperHOT fp16 в формате pytorch, для вывода GPU и для дальнейших преобразований Неколичественная базовая модель fp16 в формате pytorch, для вывода GPU и для дальнейших преобразований Пожалуйста, убедитесь, что вы используете последнюю версию text-generation-webui 1. Перейдите на вкладку Model (Модель). 2. В разделе Загрузить пользовательскую модель или LoRA введите…
Модальности:
Генерация текста
Задача: Генерация текста
Автор: TheBloke
Теги: llama, custom_code, text-generation-inference, 4-bit, gptq
Лайков: 3 | Загрузок: 13
Описание основано на материалах HuggingFace. Перевод выполнен автоматически.