amirMohammadi/Dorna-Llama3-8B-Instruct-Quantized4Bit - Каталог нейросетей
Генерация текста

amirMohammadi/Dorna-Llama3-8B-Instruct-Quantized4Bit

Добавлено:
amirMohammadi/Dorna-Llama3-8B-Instruct-Quantized4Bit

Этот репозиторий представляет собой 4-битную квантованную версию модели Dorna-Llama3-8B-Instruct для эффективного использования памяти. Модель Дорны — это модель, предназначенная только для декодера, специально обученная/настроенная на персидских данных. Flash Attention 2 также интегрирован для более быстрого вывода. — Сокращение использования памяти: 4-битное квантование снижает требования к памяти. — Более быстрый вывод: Flash Attention 2 ускоряет обработку. — Простое развертывание: нет необходимости в дополнительных библиотеках, таких как LlamaCPP или Candle. — Готов к использованию: совместим с Langchain, Haystack, LlamaIndex 2 и другими. — Поддержка Google Colab: может работать на уровне бесплатного пользования Google Colab с графическим процессором T4 (менее 15 ГБ оперативной памяти графического процессора). Вы можете запустить диалоговый вывод, используя классы Transformers Auto с функциейgenerate(). Давайте посмотрим на пример. Эта модель оценивается по вопросам, связанным с различными задачами, включая логические вопросы, генерацию кода, развернутый ответ, математику, контроль качества новостей, перефразирование, общие знания и обобщение. Большинство категорий обычно имеют два основных уровня сложности: сложный и легкий. Выполняется как человеческая оценка, так и автоматическая оценка (с GPT-4 в качестве судьи). В обеих таблицах Дорна-8Б – используется как сокращенная форма…

Модальности:
Генерация текста

Области применения:
Диалог / чат Следование инструкциям


Задача: Генерация текста
Автор: amirMohammadi
Теги: llama, conversational, en, fa, text-generation-inference, endpoints_compatible, 8-bit
Лайков: 11  |  Загрузок: 9

Открыть на HuggingFace →

Описание основано на материалах HuggingFace. Перевод выполнен автоматически.