Pluto_13B_DPO
Модель генерации текста Модальности:Генерация текста Задача: Генерация текста Автор: cloudyu Теги: mixtral, moe, dpo, text-generation-inference, endpoints_compatibleЛайков: 4 | ...
Модель генерации текста Модальности:Генерация текста Задача: Генерация текста Автор: cloudyu Теги: mixtral, moe, dpo, text-generation-inference, endpoints_compatibleЛайков: 4 | ...
Квантовано с использованием 200 выборок 8192 токенов из набора данных PIPPA, ориентированного на RP. Для целей, отличных от...
Чат и поддержка: сервер Discord TheBloke Хотите внести свой вклад? Страница TheBloke на Patreon Работа TheBloke в области...
Чат и поддержка: сервер Discord TheBloke Хотите внести свой вклад? Страница TheBloke на Patreon Работа TheBloke в области...
UltraCM-13B — это тонко настроенный LLM для критики завершения, позволяющий оценить результаты LLM на предмет полезности, правдивости, честности...
Адаптер LoRA настроен с помощью DPO на Qwen3.5-9B для гуманизации текста на китайском языке. Это последняя и наиболее...
Специализированная языковая модель параметров 4B, настроенная для помощи в бессрочной торговле DEX Hyperliquid. Построен на базе Qwen3-4B-Instruct с...
Эта модель представляет собой доработанную версию Llama-3.1-8B с использованием техники RL DPO (прямая оптимизация предпочтений), разработанную для того,...
Minerva — это первое семейство LLM, прошедших предварительное обучение с нуля итальянскому языку, разработанное Sapienza NLP в контексте...
Эта модель представляет собой доработанную версию Qwen/Qwen2.5-32B-Instruct для набора данных tanliboy/orcadpopairs. Он достигает следующих результатов в наборе оценок:...