Базовая модель Yi-34B 200K настроена на наборе данных RAWrr v2 через DPO, затем настроена на наборе данных AEZAKMI v3-3 через SFT, затем DPO настроена на unalignment/токсичный-dpo-v0.1. Я думаю, общее время вычислений на графическом процессоре составляет 40-50 часов. Это похоже на airoboros/capybara, но с меньшим gptslop, без отказов и менее типичным языком, используемым моделями OpenAI RLHFed. Попрощайтесь с «Важно помнить»! Формат подсказки — стандартный чат. Не ожидайте, что он будет хорош в обучении, математике, разгадывает загадки или будет безумно умен. Моя конечная цель с AEZAKMI — создать уютного бесплатного чат-бота. Базовой моделью, использованной для тонкой настройки, была модель 200k context Yi-34B-Llama, предоставленная larryvrh. Обучение проводилось с параметром maxpositionembeddings, установленным на уровне 4096. Затем после применения LoRA оно было возвращено обратно к 200 КБ. Я рекомендую использовать формат ChatML, так как он использовался при тонкой настройке. Вот формат подсказки, который вам следует использовать: вы можете установить другое системное сообщение, модель, похоже, это учитывает, поэтому оно не было перенастроено. Оба Чат. и Чат с помощником без цензуры. Системные подсказки работают нормально и практически не вызывают отказов. Температура в районе 0,3-0,5 кажется работает хорошо, при 1,2 она несколько нестабильна, что зачастую нежелательно. Это модель чата, а не базовая модель, предназначенная только для завершения.…
Модальности:
Генерация текста
Задача: Генерация текста
Автор: adamo1139
Теги: llama, uncensored, text-generation-inference, endpoints_compatible
Лайков: 4 | Загрузок: 52
Описание основано на материалах HuggingFace. Перевод выполнен автоматически.