GestaltLabs/Ornstein-3.5-9B-V2 - Каталог нейросетей
Генерация текста

GestaltLabs/Ornstein-3.5-9B-V2

Добавлено:
GestaltLabs/Ornstein-3.5-9B-V2

Пост-тренинг с подкреплением Ornstein 3.5 9B V1.5 — обещанная карта V2 V1.5. Начиная с контролируемой тонкой настройки версии 1.5, в версии 2 добавлена ​​оптимизация предпочтений (DPO) и обучение с подкреплением с проверяемым вознаграждением (GRPO по математике RLVR). Базовая модель содержит знания; Версия 1.5 сформировала образ мышления; V2 оттачивает его за счет вознаграждения, доводя уровень научных знаний (GPQA) и многоэтапное рассуждение до потолка GBS-200. Как и V1.5, V2 сохраняет встроенную башню Vision (ввод изображения/видео через встроенный mmproj) и головку прогнозирования нескольких токенов (MTP) для спекулятивного декодирования. Оценивается с помощью Gestalt Benchmark Suite (GBS, STANDARD-200) — длительного, контролируемого набора рассуждений + кодирования, сочетающего идентичные элементы с жадным декодированием. Колонки Qwen3.5-9B-Base и Ornstein V1.5 являются опубликованными ссылками. В новом прогоне GBS-200 с тем же семенем V2 в целом соответствовал V1.5 (0,825 против 0,825), при этом уровень рассуждения поднялся до 1,00, а GPQA — до 1,00 — как на потолке набора, так и намного выше Qwen3.5-9B-Base (0,68 рассуждения, 0,36 GPQA). При прогоне RL было изменено некоторое кодирование (0,80 → 0,65); В качестве продолжения планируется вариант, ориентированный на кодирование. — V1 — доработка первоначальных рассуждений. — V1.5 —…

Модальности:
Генерация текста

Области применения:
Логика и рассуждение Диалог / чат


Задача: Генерация текста
Автор: GestaltLabs
Теги: gguf, qwen3_5, image-text-to-text, reasoning, ai-research, qwen3.5, conversational, rlvr
Лайков: 5  |  Загрузок: 91

Открыть на HuggingFace →

Описание основано на материалах HuggingFace. Перевод выполнен автоматически.