Это альфа-версия для тестирования и отзывов. Имеются известные проблемы. (см. известные проблемы ниже). Я уже тренирую следующую версию, но из-за длительного времени обучения я буду признателен за любые отзывы в промежуточный период. Базовая модель: llama270blonglorafp1632kROPE8 (без настройки базовых инструкций). Точная настройка с использованием формата чата Llama-2. Системная подсказка: взаимодействие между пользователем, дающим инструкции, и творческим помощником, дающим ответы. Длина контекста 32 КБ, используйте линейное масштабирование веревки = 8 (ВАЖНО: используйте коэффициент 8, даже если вы не используете полную длину контекста 32 КБ). Не уверен, насколько хорошо модель работает в режиме записной книжки/завершениях. По крайней мере, для первых подсказок разговора формат чата и системное сообщение, похоже, имеют значение. Эта модель не подвергается цензуре и способна создавать оскорбительный и NSFW-контент. Пожалуйста, используйте эту модель с осторожностью и не используйте ее, если вас обидел такой контент.** bfloat16 EXL2 2,4 бита (экспериментальный новый квант) помещается в 1×24 ГБ с использованием Exllamav2 и 8-битный кэш с контекстом 10 КБ. EXL2 4 бита помещается в 2×24 ГБ (19/24) с использованием Exllamav2 с контекстом 16 КБ. EXL2 6 бит подходит. 48 ГБ+24 ГБ (разделение 36/24) или 3×24 ГБ (разделение 16/17/20) с использованием Exllamav2 @ 32 КБ…
Модальности:
Генерация текста
Задача: Генерация текста
Автор: grimulkan
Теги: llama, text-generation-inference, endpoints_compatible
Лайков: 9 | Загрузок: 14
Описание основано на материалах HuggingFace. Перевод выполнен автоматически.