Метка: DPO - Страница 11 - Каталог нейросетей

Метка: DPO

Генерация текста

MaziyarPanahi/calme-2.3-phi3-4b

Эта модель представляет собой усовершенствованную версию (DPO) модели microsoft/Phi-3-mini-4k-instruct. Все модели GGUF доступны здесь: MaziyarPanahi/calme-2.3-phi3-4b-GGUF MaziyarPanahi/calme-2.3-phi3-4b — самая...

Генерация текста

bartowski/Hermes-2-Pro-Mistral-10.7B-GGUF

Оригинальная модель: https://huggingface.co/Joseph717171/Hermes-2-Pro-Mistral-10.7B Хотите поддержать мою работу? Посетите мою страницу ко-фи здесь: https://ko-fi.com/bartowski Модальности:Генерация текста Области применения:Следование инструкциям...

Генерация текста

suayptalha/Sungur-9B

Sungur-9B — это специализированная на турецком языке модель большого языка, полученная из ytu-ce-cosmos/Turkish-Gemma-9b-v0.1, которая сама основана на Gemma-2-9b....

Генерация текста

tanliboy/lambda-qwen2.5-14b-dpo-test

Эта модель представляет собой доработанную версию Qwen/Qwen2.5-14B-Instruct для набора данных HuggingFaceH4/ultrafeedback_binarized. Он достигает следующих результатов в наборе оценок:...

Генерация текста

Magpie-Align/Llama-3-8B-Magpie-Align-v0.1

Демо-версия онлайн-модели: https://huggingface.co/spaces/flydust/Chat-with-Magpie. Эта модель представляет собой согласованную версию мета-llama/Meta-Llama-3-8B. Мы применяем следующий конвейер: — Сначала мы используем...

Генерация текста

VAGOsolutions/SauerkrautLM-1.5b

ДЕМО-модель — чтобы продемонстрировать потенциал ресурсоэффективного непрерывного предварительного обучения больших языковых моделей с использованием Spectrum CPT*** Представляем SauerkrautLM-1.5b...

Генерация текста

MaziyarPanahi/Llama-3-8B-Instruct-DPO-v0.3

Эта модель представляет собой доработанную (DPO) модель мета-ламы/Мета-ламы-3-8B-Instruct. Я использовалroptheta`, чтобы безопасно увеличить длину контекста до 32 КБ....

Генерация текста

Muhammad2003/Llama3-8B-OpenHermes-DPO

Llama3-8B-OpenHermes-DPO — это модель Llama3-8B с точной настройкой DPO, основанная на наборе данных предпочтений OpenHermes-2.5 с использованием QLoRA....

Генерация текста

tanamettpk/TC-instruct-DPO

TC инструктирует DPO, настроенный Тайфун 7B и SCB 10X, Mistral 7B — v0.1 อีกที TC инструктирует DPO Данные...