Метка: DPO - Страница 5 - Каталог нейросетей

Метка: DPO

Генерация текста

trl-lib/Qwen2-0.5B-DPO

Эта модель представляет собой доработанную версию Qwen/Qwen2-0.5B-Instruct для набора данных trl-lib/Capybara-Preferences. Он был обучен с использованием TRL. Эта...

Генерация текста

v000000/Qwen2.5-14B-Gutenberg-1e-Delta

Это «Qwen2.5-14B-Instruct», обученный на jondubin/gutenberg-dpo-v0.1 для эпохи 1,25 (DPO). Модальности:Генерация текста Области применения:Диалог / чат Задача: Генерация текста...

Генерация текста

bartowski/Palmyra-Med-70B-32K-GGUF

Исходная модель: https://huggingface.co/Writer/Palmyra-Med-70B-32K Некоторые из этих квантов (Q3KXL, Q4KL и т. д.) представляют собой стандартный метод квантования с встраиваниями...

Генерация текста

Magpie-Align/Llama-3.1-8B-Magpie-Align-v0.1

Демо-версия онлайн-модели: https://huggingface.co/spaces/flydust/Chat-with-Magpie. Эта модель представляет собой согласованную версию мета-llama/Meta-Llama-3.1-8B. Мы применяем следующий конвейер: Сначала мы выполняем SFT,...

Генерация текста

dmis-lab/biomistral-7b-olaph

Эта модель представляет собой доработанную версию Minbyul/biomistral-7b-wo-kqolden-iter-dpo-step2 в бинаризованном наборе данных HuggingFaceH4/ultrafeedback. Он достигает следующих результатов в наборе...

Генерация текста

dmis-lab/self-biorag-7b-olaph

Эта модель представляет собой доработанную версию Minbyul/selfbiorag-7b-wo-kqagolden-iter-dpo-step3, отфильтрованную по набору данных HuggingFace MedLFQA (без kqolden). В наборе оценок...

Генерация текста

MaziyarPanahi/calme-2.3-llama3-70b

Эта модель представляет собой доработанную (DPO) модель мета-ламы/Мета-ламы-3-70B-Instruct. Все модели GGUF доступны здесь: MaziyarPanahi/calme-2.3-llama3-70b-GGUF Вы можете использовать эту...

Генерация текста

VAGOsolutions/SauerkrautLM-Qwen-32b

Представляем SauerkrautLM-Qwen-32b — нашу версию мощного Qwen/Qwen1.5-32B для квашеной капусты! Модель SauerkrautLM-Qwen-32b — совместная разработка VAGO Solutions и...