archangel_sft-kto_llama13b
This repo contains the model checkpoints for: — model family llama13b — optimized with the loss SFT+KTO —...
This repo contains the model checkpoints for: — model family llama13b — optimized with the loss SFT+KTO —...
Модель генерации текста Модальности:Генерация текста Области применения:Диалог / чат Задача: Генерация текста Автор: second-state Теги: gguf, mistral, reward...
Instead of training an additional reward model that is likely to be gamed, we directly train the model...
We thank the following papers and open-source repositories. We especially thank DeepSpeed for their frameworks as well. [1]...
This is a GPT2-Large model fine-tuned for rewriting prompts for Stable Diffusion v1.5 through RLHF. The model takes...
RewardAnything: Generalizable Principle-Following Reward Models Zhuohao Yu1,§ Jiali Zeng2 Weizheng Gu1 Yidong Wang1 Jindong Wang3 Fandong Meng2 Jie...
— AWQ 4bit version of Nexusflow/Athene-V2-Chat — Quantization code — This model fits only to 1 gpu. Используйте...
Эта модель представляет собой доработанную версию Qwen/Qwen2-72B-Instruct на 1,5 тыс. рядов mlabonne/orpo-dpo-mix-40k. Он был обучен как универсальная языковая...
Исходная модель: https://huggingface.co/mlabonne/OrpoLlama-3-8B Все количественные расчеты сделаны с использованием опции imatrix с набором данных, предоставленным Kalomaze здесь. Отличная...
MaziyarPanahi/Starling-LM-7B-beta-GPTQ — это квантованная (GPTQ) версия Nexusflow/Starling-LM-7B-beta. Модальности:Генерация текста Области применения:Диалог / чат Задача: Генерация текста Автор: MaziyarPanahi...