Чат 4-разрядные модели GPTQ для вывода GPU 2, 3, 4, 5, 6 и 8-разрядных моделей GGML для вывода CPU Неколичественная модель SuperHOT fp16 в формате pytorch, для вывода GPU и для дальнейших преобразований Неколичественная базовая модель fp16 в формате pytorch, для вывода GPU и для дальнейших преобразований Затем запустите следующий код. config.json по умолчанию имеет длину последовательности 8192, но вы также можете настроить это в своем коде Python. Предоставленный код моделирования, активированный с помощьюtrustremotecode =True, автоматически установит параметр масштаба из настроенных maxpositionembeddings. Например, для 8192 шкала установлена на 4. В репозитории указан llamaropescaledmonkeypatch.py, написанный @kaiokendev. Теоретически его можно добавить к…
Модальности:
Генерация текста
Задача: Генерация текста
Автор: TheBloke
Теги: llama, custom_code, text-generation-inference
Лайков: 3 | Загрузок: 13
Описание основано на материалах HuggingFace. Перевод выполнен автоматически.