Это модель TrainRound5, следующая за Solshine/reflection-llama-3.1-8B-Solshine-trainround4-16bit в итеративном процессе тонкой настройки. Официально еще не проверена! (Пожалуйста, отправляйте любые результаты тестирования или оценки через вкладку «Сообщество».) – Разработчик: Solshine (Калеб ДеЛеу) – Лицензия: llama 3.1 – Точная настройка на основе модели: Solshine/reflection-llama-3.1-8B-Solshine-trainround4-16bit Эта модель, обученная на цепочке мыслей в рамках обучения с подкреплением, предшествует модели OpenAI o1. Вдохновленный и использующий технику настройки отражения, впервые разработанную Мэттом Шумером (возможно, ранее разработанную командой Anthropic и Mlabbone’ Hermes). Насколько известно авторам, это пятая версия первого Llama 3.1 8B LLM с «настроенным на отражение» согласно вдохновляющей модели «mattshumer/Reflection-Llama-3.1-70B» (этот режим не использовался в процессе обучения). ни в качестве основополагающей модели, а только послужило вдохновением): Во время выборки модель начнет с вывода рассуждений внутри и тегов, а затем, как только она будет удовлетворена своими рассуждениями, она выведет окончательный ответ внутри и тегов. Каждый из этих тегов представляет собой специальные токены, встроенные в модель. Это позволяет модели отделить свои…
Модальности:
Генерация текста
Области применения:
Диалог / чат
Задача: Генерация текста
Автор: Solshine
Теги: llama, text-generation-inference, unsloth, trl, sft, reflection, reflection-tuning, conversational
Лайков: 4 | Загрузок: 21
Описание основано на материалах HuggingFace. Перевод выполнен автоматически.