Memphis-scribe 3B — это доработка Memphis-CoT 3B для более творческих данных, которая сама по себе является доработкой StableLM 3B 4e1t. Далее он обучается на TinyCoT, а также на — 5000 комментариев от Reddit-instruct-cured — 20000 комментариев от Writeprompts-cured — 2000 примеров преобразования задач MathQA во фрагменты Python — 2000 примеров более коротких случаев booksum (как главы->сводка, так и резюме->главы) — 2000 примеров из комментариев, принятых mathoverflow с >10 Upvotes — 2000 примеров из coedit-reworded-deduped — 500 примеров из SQuAD для генерации пар QA с учетом контекста — 500 примеров из ROPES для генерации сценариев+триплетов QA с учетом контекста — conala — 500 примеров из Logician — 500 примеров из Goodwiki для генерации статей с учетом названия и описания — 2000 примеров из rpguild — Кураторское подмножество oasst2 — LimaRP I начал с Memphis-CoT 3B, в котором использовалась новая итеративная контрастивная процедура точной настройки для улучшения способности к рассуждению. Сначала я генерировал завершения, как и в каждом из циклов Мемфис-ЦТ. Затем для каждого примера в наборе данных я выбрал правильное и неправильное завершение. Я применил ту же потерю рейтинга к этим…
Модальности:
Генерация текста
Области применения:
Диалог / чат
Задача: Генерация текста
Автор: euclaise
Теги: stablelm_epoch, supertrainer2000, not-for-all-audiences, writing, roleplay, conversational, custom_code, en
Лайков: 6 | Загрузок: 3
Описание основано на материалах HuggingFace. Перевод выполнен автоматически.