Метка: DPO - Страница 7 - Каталог нейросетей

Метка: DPO

Генерация текста

cloudyu/Pluto_13B_DPO

Модель генерации текста Модальности:Генерация текста Задача: Генерация текста Автор: cloudyu Теги: mixtral, moe, dpo, text-generation-inference, endpoints_compatibleЛайков: 4  | ...

Генерация текста

TheBloke/TenyxChat-7B-v1-AWQ

Чат и поддержка: сервер Discord TheBloke Хотите внести свой вклад? Страница TheBloke на Patreon Работа TheBloke в области...

Генерация текста

alvarobartt/UltraCM-13B-GGUF

UltraCM-13B — это тонко настроенный LLM для критики завершения, позволяющий оценить результаты LLM на предмет полезности, правдивости, честности...

Генерация текста

UVLabs/HyperLLM-4b

Специализированная языковая модель параметров 4B, настроенная для помощи в бессрочной торговле DEX Hyperliquid. Построен на базе Qwen3-4B-Instruct с...

Генерация текста

suayptalha/EmojiLlama-3.1-8B

Эта модель представляет собой доработанную версию Llama-3.1-8B с использованием техники RL DPO (прямая оптимизация предпочтений), разработанную для того,...

Генерация текста

sapienzanlp/Minerva-7B-instruct-v1.0-GGUF

Minerva — это первое семейство LLM, прошедших предварительное обучение с нуля итальянскому языку, разработанное Sapienza NLP в контексте...

Генерация текста

tanliboy/lambda-qwen2.5-32b-dpo-test

Эта модель представляет собой доработанную версию Qwen/Qwen2.5-32B-Instruct для набора данных tanliboy/orcadpopairs. Он достигает следующих результатов в наборе оценок:...