Веб-сайт: https://dphn.ai Twitter: https://x.com/dphnAI Веб-чат: https://chat.dphn.ai В нашем блоге, посвященном обучению Dphn 405B, мы заявили, что решающее значение будет иметь усиление внимания к RL для разрегулирования. Мы сделали шаг в этом направлении, создав простую среду обучения с подкреплением для LLM как судьи. Во время экспериментов с инструкцией Xgen 9B мы заметили, что тон и ориентация модели отличались от того, что мы обычно ожидали. Модель была усовершенствована с помощью вознаграждения. Мы выпускаем эту модель как исследовательский артефакт, поскольку это не децензурированная модель. Модель работает лучше всего, когда ей разрешено решать проблемы. Предварительное заполнение раскрывает его самые сильные стороны, хотя оно может работать и без этой подсказки. В ходе тестирования мы обнаружили, что выходные токены 16 КБ с температурой 0,5 и 0,05 мин-п дали наилучшие ответы. Подробности обучения можно найти в нашем блоге: https://blog.dphn.ai/xgen-rl/ – Lium – по запросу предоставляются 8x B200 для тестирования и оценки. — Андреессен Горовиц — предоставил грант, который сделал возможным создание Dolphin 1.0 и позволил нам запустить нашу лабораторию. Dolphin стремится стать моделью общего назначения, аналогичной моделям ChatGPT, Claude, Gemini. Но…
Модальности:
Генерация текста
Области применения:
Диалог / чат
Задача: Генерация текста
Автор: dphn
Теги: llama, conversational, text-generation-inference, endpoints_compatible
Лайков: 5 | Загрузок: 41
Описание основано на материалах HuggingFace. Перевод выполнен автоматически.