Метка: DPO - Страница 18 - Каталог нейросетей

Метка: DPO

Генерация текста

HuggingFaceH4/zephyr-7b-gemma-v0.1

Zephyr — это серия языковых моделей, которые обучены выступать в роли полезных помощников. Zephyr 7B Gemma — третья...

Генерация текста

mlabonne/AlphaMonarch-7B

tl;dr: AlphaMonarch-7B — это новое слияние DPO, которое сохраняет все мыслительные способности самых лучших слияний и значительно улучшает...

Генерация текста

mlabonne/NeuralHermes-2.5-Mistral-7B

NeuralHermes основан на модели teknium/OpenHermes-2.5-Mistral-7B, которая была дополнительно доработана с помощью оптимизации прямых предпочтений (DPO) с использованием набора...

Генерация текста

mlabonne/NeuralBeagle14-7B

Обновление от 16.01.24: NeuralBeagle14-7B — (вероятно) лучшая модель 7B, которую вы можете найти! 🎉 NeuralBeagle14-7B is a DPO...

Генерация текста

ytu-ce-cosmos/Turkish-Gemma-9b-T1

Turkish-Gemma-9b-T1 основан на ytu-ce-cosmos/Turkish-Gemma-9b-v0.1, адаптированном специально для многоэтапного рассуждения («мышления») на турецком языке. Модель предназначена для лучшего решения...

Генерация текста

argilla/notux-8x7b-v1

Эта модель представляет собой настроенную по предпочтениям версию mistralai/Mixtral-8x7B-Instruct-v0.1 на наборе данных argilla/ultrafeedback-binarized-preferences, очищенном с использованием DPO (прямая...

Генерация текста

NousResearch/Hermes-2-Theta-Llama-3-8B

Hermes-2 Θ (Theta) — первая экспериментальная объединенная модель, выпущенная Nous Research в сотрудничестве с Чарльзом Годдардом из Arcee,...

Генерация текста

aaditya/Llama3-OpenBioLLM-8B

Развитие моделей большого языка с открытым исходным кодом в медицинской сфере Представляем OpenBioLLM-8B: современную биомедицинскую модель большого языка...

Генерация текста

mlabonne/NeuralDaredevil-8B-abliterated

Это доработанная версия DPO mlabonne/Daredevil-8, обученная на одной эпохе mlabonne/orpo-dpo-mix-40k. Точная настройка DPO успешно компенсирует потерю производительности из-за...