Это модель 4x8b Llama Mixture of Experts (MoE). Обучался на OpenHermes Resort из набора данных Dolphin-2.9. Модель представляет собой комбинацию 4 тонких настроек Llama с использованием архитектуры DeepSpeed-MoE. Все эксперты активны для каждого токена. Это ОЧЕНЬ хорошая модель, где-то между 8B и LLAMA 70B. Наслаждайтесь! CrusoeEnergy за спонсирование вычислений для этого проекта Мои сотрудники Эрик Хартфорд и Фернандо (имеет слишком много имен) Neto
Модальности:
Генерация текста
Области применения:
Диалог / чат
Задача: Генерация текста
Автор: Crystalcareai
Теги: deepseek, conversational, custom_code
Лайков: 3 | Загрузок: 38
Описание основано на материалах HuggingFace. Перевод выполнен автоматически.