Метка: DPO - Страница 16 - Каталог нейросетей

Метка: DPO

Генерация текста

ContextualAI/Contextual_KTO_Mistral_PairRM

Этот репозиторий содержит контрольные точки модели и токенизатора для: — семейства моделей mistralai/Mistral-7B-Instruct-v0.2 — оптимизировано с потерей KTO...

Генерация текста

ytu-ce-cosmos/Turkish-Gemma-9b-v0.1

Это Турецкая-Gemma-9b-v0.1. Эта модель основана на Gemma-2-9b и была разработана посредством сочетания непрерывного предварительного обучения, контролируемой точной настройки...

Генерация текста

mlabonne/NeuralMarcoro14-7B

Это доработанная версия mlabonne/Marcoro14-7B-slerp DPO с использованием набора данных предпочтений Chatmldpopairs. Это улучшает производительность модели в наборе тестов...

Генерация текста

mlabonne/NeuralDaredevil-7B

NeuralDaredevil-7B — это тонкая настройка DPO для mlabonne/Daredevil-7B с использованием набора данных предпочтений argilla/distilabel-intel-orca-dpo-pairs и моего блокнота DPO...

Генерация текста

Shekswess/trlm-135m

1. Краткое описание модели 2. Конвейер постобучения 3. Как использовать 4. Обучение 5. Оценка 6. Ограничения 7. Благодарности...

Генерация текста

VAGOsolutions/SauerkrautLM-SOLAR-Instruct

Представляем SauerkrautLM-SOLAR-Instruct — нашу версию мощного upstage/SOLAR-10.7B-Instruct-v1.0 для квашеной капусты! Согласовано с DPO 1. Обзор всех моделей SauerkrautLM-SOLAR-Instruct...