Метка: reward model - Страница 2 - Каталог нейросетей

Метка: reward model

Генерация текста

iwalton3/sycofact

SycoFact — это средство оценки выравнивания, настроенное на базе Gemma 3 4B IT. Он предназначен для обнаружения подхалима...

Генерация текста

launch/ThinkPRM-14B

ThinkPRM-14B — это модель вознаграждения генеративного процесса (PRM), основанная на архитектуре R1-Distill-Qwen-14B. Он настроен для выполнения пошаговой проверки...

Генерация текста

lmstudio-community/Starling-LM-7B-beta-GGUF

👾 Программа хайлайтов моделей LM Studio Community. Выделение новых и заслуживающих внимания моделей сообществом. Присоединяйтесь к обсуждению в...

Генерация текста

ContextualAI/ctx-bird-reward-250121

Модель вознаграждения Contextual-SQL — это оценочный компонент системы Contextual-SQL, которая заняла первое место в таблице лидеров тестов BIRD...

Генерация текста

AdamG012/chat-opt-350m-reward-deepspeed

Мы благодарим следующие документы и репозитории с открытым исходным кодом. Мы особенно благодарим DeepSpeed ​​за их фреймворки. [1]...

Генерация текста

ChengyuDu0123/HER-RM-32B

HER представляет двухуровневое мышление, которое отличает мышление персонажей от первого лица от мышления третьего лица LLM для моделирования...

Генерация текста

nvidia/Llama2-13B-SteerLM-RM

Использование этой модели регулируется Лицензионным соглашением сообщества Llama 2. Llama2-13B-SteerLM-RM — это языковая модель с 13 миллиардами параметров...