Метка: DPO - Страница 10 - Каталог нейросетей

Метка: DPO

Генерация текста

argilla/notus-7b-v1-lora

Notus — это набор точно настроенных моделей, использующих прямую оптимизацию предпочтений (DPO) и связанные с ней методы RLHF....

Генерация текста

jpacifico/Chocolatine-2-4B-Instruct-DPO-v2.1

Chocolatine-2-4B-Instruct-DPO-v2.1 — это версия Qwen/Qwen3-4B-Instruct-2507 после обучения, предназначенная для улучшения выполнения инструкций, рассуждения и общей производительности на французском...

Генерация текста

bartowski/Hermes-2-Pro-Llama-3-8B-GGUF

Исходная модель: https://huggingface.co/NousResearch/Hermes-2-Pro-Llama-3-8B Все количественные расчеты выполнены с использованием опции imatrix с набором данных, предоставленным Kalomaze здесь. Отличная...

Генерация текста

InferenceIllusionist/Excalibur-7b-DPO

Первый шаг в мир тонкой настройки. Целью этого выпуска было повышение качества ответов исходной модели, в частности для...

Генерация текста

fblgit/LUNA-SOLARkrautLM-Instruct

Представляем LUNA-SOLARkrautLM-Instruct — версию мощного upstage/SOLAR-10.7B-Instruct-v1.0 для UNA-Sauerkraut! Выровнен с DPO и приручен UNA. 1. Обзор всех моделей...

Генерация текста

danielcherubini/Qwen3.5-DeltaCoder-9B

> Надежный вызов инструментов для агентного кодирования — точная настройка LoRA Qwen3.5-9B > Выпущена версия v1.1-DPO — Согласование...

Генерация текста

OpenPipe/Hermes-2-Theta-Llama-3-8B-32k

Hermes-2 Θ (Theta) — первая экспериментальная объединенная модель, выпущенная Nous Research в сотрудничестве с Чарльзом Годдардом из Arcee,...