Reflection 70B (в настоящее время) является лучшим в мире LLM с открытым исходным кодом, обученным с использованием новой методики под названием Reflection-Tuning, которая учит LLM обнаруживать ошибки в своих рассуждениях и корректировать курс. Модель была обучена на синтетических данных, сгенерированных Glaive. Если вы тренируете модель, Glaive невероятен — используйте их. Все протестированные тесты были проверены на наличие загрязнений с помощью LLM Decontaminator от LMSys. При бенчмаркинге мы изолируем и сравниваем только этот раздел. Обучившись на Llama 3.1 70B Instruct, вы можете выполнять выборку из Reflection 70B, используя тот же код, конвейеры и т. д., что и любая другая модель Llama. Он даже использует стандартный формат шаблона чата Llama 3.1 (хотя мы обучили его нескольким новым специальным токенам, помогающим в рассуждениях и размышлениях). Во время выборки модель начнет с вывода рассуждений внутри и тегов, а затем, как только она будет удовлетворена своими рассуждениями, она выведет окончательный ответ внутри и тегов. Каждый из этих тегов представляет собой специальные токены, встроенные в модель. Это позволяет модели отделить свои внутренние мысли и рассуждения от окончательного ответа, улучшая взаимодействие с пользователем. Внутри раздела модель может выводить один или несколько тегов,…
Модальности:
Генерация текста
Области применения:
Диалог / чат
Задача: Генерация текста
Автор: mattshumer
Теги: llama, conversational
Лайков: 4 | Загрузок: 16
Описание основано на материалах HuggingFace. Перевод выполнен автоматически.