Чат и поддержка: мой новый сервер Discord Хотите внести свой вклад? Страница TheBloke на Patreon. Этот репозиторий содержит файлы моделей формата GGML для Meta’s Llama 2 70B. 1. llama.cpp от коммита e76d630 или более поздней версии. — Для пользователей, которые не хотят компилировать из исходного кода, вы можете использовать двоичные файлы из выпуска master-e76d630. 2. Чтобы добавить новый параметр командной строки -gqa. 8. В настоящее время поддержки CUDA нет, но она должна появиться в ближайшее время. Пока нет поддержки в сторонних пользовательских интерфейсах (например, text-generation-webui, KoboldCpp) или библиотеках Python (llama-cpp-python, ctransformers). Это придет со временем. Модели GPTQ для вывода графического процессора с несколькими вариантами параметров квантования. 2, 3, 4, 5, 6 и 8-битные модели GGML для вывода CPU+GPU * Оригинальная неквантованная модель fp16 Meta в формате pytorch, для вывода GPU и для дальнейших преобразований. Помните, что это базовая модель, а не точно настроенная. Возможно, он не умеет отвечать на вопросы или следовать инструкциям. Для предварительно скомпилированной версии используйте Release master-e76d630 или более позднюю версию. Доступны следующие новые методы: GGMLTYPEQ2K — 2-битное квантование «типа 1» в суперблоках, содержащих 16 блоков, каждый блок имеет вес 16. Блочные масштабы и минуты квантуются…
Модальности:
Генерация текста
Задача: Генерация текста
Автор: TheBloke
Теги: llama, facebook, meta, llama-2, en
Лайков: 74 | Загрузок: 9
Описание основано на материалах HuggingFace. Перевод выполнен автоматически.