Этот репозиторий представляет собой 4-битную квантованную версию модели Dorna-Llama3-8B-Instruct для эффективного использования памяти. Модель Дорны — это модель, предназначенная только для декодера, специально обученная/настроенная на персидских данных. Flash Attention 2 также интегрирован для более быстрого вывода. — Сокращение использования памяти: 4-битное квантование снижает требования к памяти. — Более быстрый вывод: Flash Attention 2 ускоряет обработку. — Простое развертывание: нет необходимости в дополнительных библиотеках, таких как LlamaCPP или Candle. — Готов к использованию: совместим с Langchain, Haystack, LlamaIndex 2 и другими. — Поддержка Google Colab: может работать на уровне бесплатного пользования Google Colab с графическим процессором T4 (менее 15 ГБ оперативной памяти графического процессора). Вы можете запустить диалоговый вывод, используя классы Transformers Auto с функциейgenerate(). Давайте посмотрим на пример. Эта модель оценивается по вопросам, связанным с различными задачами, включая логические вопросы, генерацию кода, развернутый ответ, математику, контроль качества новостей, перефразирование, общие знания и обобщение. Большинство категорий обычно имеют два основных уровня сложности: сложный и легкий. Выполняется как человеческая оценка, так и автоматическая оценка (с GPT-4 в качестве судьи). В обеих таблицах Дорна-8Б – используется как сокращенная форма…
Модальности:
Генерация текста
Области применения:
Диалог / чат Следование инструкциям
Задача: Генерация текста
Автор: amirMohammadi
Теги: llama, conversational, en, fa, text-generation-inference, endpoints_compatible, 8-bit
Лайков: 11 | Загрузок: 9
Описание основано на материалах HuggingFace. Перевод выполнен автоматически.