Веса fp16 можно найти здесь: https://huggingface.co/bhenrym14/airophin-13b-pntk-16k-fp16 Это тонкая настройка Llama-2-13b, предназначенная для расширения полезного контекстного окна до 16384 токенов. Существует два этапа обучения: 1. Сначала он обучается на подмножестве дельфинов с длинным контекстом (7000–8192 токенов), наборе данных, подобном косатке (только разделение GPT4). Это составляет примерно 110 мм жетонов. Вместо системной подсказки «Дельфин» использовалась тренировочная подсказка в стиле «Айробороса». Обучение проводилось с применением частичного масштабирования NTK (масштабный коэффициент 4). Это заняло ~20 часов. 2. Затем модель была доработана на Airoboros GPT4 1.4.1 Джона Дурбина с тем же подходом масштабирования для двух эпох. Это заняло ~15 часов. Для модели длины контекста 4096 с использованием airoboros-gpt4-1.4.1 см.: airoboros-l2-13b-gpt4-1.4.1 Джона Дурбина. В этой модели используется частичное масштабирование веревки NTK. Эта методология еще не реализована изначально в Transformers или Exllama (по состоянию на 21 июля). Есть три варианта запустить это. 1. Трансформаторы (используйте bnb для квантования). Используйте веса fp16. Для этого потребуется заменить LlamaEmbedding на LlamaPartNTKScaledRotaryEmbedding с maxpositionembeddings=16384 и originalmaxpositionembeddings=4096. Обезьяний патч…
Модальности:
Генерация текста
Задача: Генерация текста
Автор: bhenrym14
Теги: llama, endpoints_compatible
Лайков: 4 | Загрузок: 9
Описание основано на материалах HuggingFace. Перевод выполнен автоматически.