Virtuoso-Medium-v2 (32B) — это наша языковая модель следующего поколения с 32 миллиардами параметров, основанная на исходной архитектуре Virtuoso-Medium. Эта версия основана на Deepseek-v3 и использует расширенный набор данных, состоящий из 5 миллиардов токенов логитов. Он получил более высокие баллы в тестах, чем наш предыдущий выпуск (включая превосходство Arcee-Nova 2024 в некоторых задачах). — Базовая архитектура: Qwen-2.5-32B — Число параметров: 32B — Токенизатор: — Первоначально интегрирован с токенизатором Deepseek-v3 для извлечения логитов. — Для окончательного согласования используется токенизатор Qwen, использующий специальную «хирургию токенизатора» для обеспечения межархитектурной совместимости. — Данные дистилляции: — ~1,1 млрд токенов/логитов из обучающих данных Deepseek-v3. — Дистилляция на логит-уровне с использованием запатентованного подхода «слияния слияний» для максимальной точности. — Лицензия: Apache-2.0 Deepseek-v3 служит обучающей моделью, из которой мы получаем логиты по миллиардам токенов. Вместо стандартной контролируемой тонкой настройки мы применяем полную репликацию на уровне логита. Это обеспечивает более точную передачу знаний, включая расширенные рассуждения в: — Технические и научные запросы — Генерация сложного кода — Решение математических задач -…
Модальности:
Генерация текста
Области применения:
Диалог / чат
Задача: Генерация текста
Автор: arcee-ai
Теги: qwen2, mergekit, merge, conversational, text-generation-inference, endpoints_compatible
Лайков: 58 | Загрузок: 28
Описание основано на материалах HuggingFace. Перевод выполнен автоматически.