Метка: DPO - Страница 17 - Каталог нейросетей

Метка: DPO

Генерация текста

BramVanroy/GEITje-7B-ultra

GEITje 7B ultra Диалоговая модель для голландского языка, согласованная с помощью обратной связи с искусственным интеллектом. Эта модель...

Генерация текста

yunconglong/Truthful_DPO_TomGrc_FusionNet_7Bx2_MoE_13B

Тренажер DPO с набором данных jondurbin/truthy-dpo-v0.1 для улучшения [TomGrc/FusionNet7Bx2MoE14B] Модальности:Генерация текста Задача: Генерация текста Автор: yunconglong Теги: mixtral,...

Генерация текста

VAGOsolutions/Llama-3-SauerkrautLM-8b-Instruct

Представляем Llama-3-SauerkrautLM-8b-Instruct — нашу версию мощной мета-ламы/Мета-Llama-3-8B-Instruct из квашеной капусты! Модель Llama-3-SauerkrautLM-8b-Instruct — совместная работа VAGO Solutions и...

Генерация текста

xDAN-AI/xDAN-L1-Chat-RL-v1

Первая топ-модель, показывающая успеваемость по гуманитарным наукам, программированию и письму на 7б. Вы полезный помощник по имени ДЭН....

Генерация текста

tenyx/Llama3-TenyxChat-70B

Представляем Llama-3-TenyxChat-70B, часть нашей серии TenyxChat, обученную работать в качестве полезных помощников посредством настройки предпочтений с использованием передовой...

Генерация текста

Writer/Palmyra-Med-70B

— Разработчик: Writer — Язык(и) (NLP): Английский — Лицензия: Лицензия на открытую модель Writer — Доработано на основе...

Генерация текста

QuantFactory/NeuralDaredevil-8B-abliterated-GGUF

Это квантованная версия mlabonne/NeuralDaredevil-8B-abliterated, созданная с использованием llama.cpp. Это тонкая настройка DPO mlabonne/Daredevil-8-abliterated, обученная на одной эпохе mlabonne/orpo-dpo-mix-40k....

Генерация текста

Writer/Palmyra-Med-70B-32K

— Разработано: Writer — Язык(и) (NLP): английский — Лицензия: открытая модель Writer — Контекстное окно: 32768 — Palmyra-Med-70b-32k,...

Генерация текста

argilla/notus-7b-v1

Notus — это набор точно настроенных моделей, использующих прямую оптимизацию предпочтений (DPO) и связанные с ней методы RLHF....