Серия LION обучается с использованием эмпирически оптимизированного конвейера, который состоит из трех этапов: SFT, DPO и онлайн-обучение предпочтениям (онлайн-DPO). Мы обнаружили, что простые методы, такие как упаковка последовательностей, маскирование потерь в SFT, увеличение размера набора данных предпочтений в DPO и онлайн-обучение DPO, могут значительно улучшить производительность языковых моделей. Наши лучшие модели (серия LION) превосходят по производительности официальные модели инструкций, настроенные с использованием данных и алгоритмов с закрытым исходным кодом. Наборы обучающих данных, код и сценарии оценки можно найти в нашем документе и базе кода. Эта модель точно настроена на основе Columbia-NLP/LION-Gemma-2b-dpo-v1.0 с использованием онлайн-DPO из конвейера LION. — Тип модели: gemma-2b — Язык(и) (NLP): преимущественно английский — Лицензия: Условия использования Gemma — Доработано на основе модели: Columbia-NLP/LION-Gemma-2b-dpo-v1.0. Чтобы обеспечить воспроизводимость, используйте следующие шаблоны чата: Если вы считаете эту модель полезной в своей работе, рассмотрите возможность цитирования нашей статьи: Мы благодарим группу Columbia-NLP и article.ai за предоставление кредитов OpenAI API и вычислительных ресурсов для провести наши эксперименты.
Модальности:
Генерация текста
Области применения:
Диалог / чат
Задача: Генерация текста
Автор: Columbia-NLP
Теги: gemma, conversational, text-generation-inference, endpoints_compatible
Лайков: 4 | Загрузок: 27
Описание основано на материалах HuggingFace. Перевод выполнен автоматически.